Skip to Content
L’échange d’apprentissage de HIC débute le 13 Juillet 2026. Voir le programme
AnalytiqueSparkAperçu

Spark — Traitement distribué

Apache Spark 3.5.1 assure le traitement distribué des données pour les charges analytiques à grande échelle. Il fonctionne aux côtés d’un serveur Livy, qui expose une API REST pour la soumission de jobs Spark — permettant aux workflows Prefect de déclencher des jobs Spark sans accès direct au cluster.

Calcul distribuéLes jobs PySpark s’exécutent sur un cluster Spark pour le traitement de données à grande échelle.
API REST LivySoumettez et surveillez des jobs Spark via HTTP — aucun accès direct au cluster n’est requis.
Intégration PrefectLes jobs Spark sont orchestrés via Prefect et héritent des mêmes sémantiques de planification, de supervision et de reprise.
Natif KubernetesDéployé via le chart Helm `spark` dans `infra/kube-cluster/`.

Référence rapide

AttributValeur
Version de Spark3.5.1
Python3.9
PySpark3.5.1
LivyPasserelle API REST
Emplacementapps/analytics/spark/
Chart Helminfra/kube-cluster/charts/spark/
Dernière mise à jour le