Spark — Traitement distribué
Apache Spark 3.5.1 assure le traitement distribué des données pour les charges analytiques à grande échelle. Il fonctionne aux côtés d’un serveur Livy, qui expose une API REST pour la soumission de jobs Spark — permettant aux workflows Prefect de déclencher des jobs Spark sans accès direct au cluster.
Calcul distribuéLes jobs PySpark s’exécutent sur un cluster Spark pour le traitement de données à grande échelle.
API REST LivySoumettez et surveillez des jobs Spark via HTTP — aucun accès direct au cluster n’est requis.
Intégration PrefectLes jobs Spark sont orchestrés via Prefect et héritent des mêmes sémantiques de planification, de supervision et de reprise.
Natif KubernetesDéployé via le chart Helm `spark` dans `infra/kube-cluster/`.
Référence rapide
| Attribut | Valeur |
|---|---|
| Version de Spark | 3.5.1 |
| Python | 3.9 |
| PySpark | 3.5.1 |
| Livy | Passerelle API REST |
| Emplacement | apps/analytics/spark/ |
| Chart Helm | infra/kube-cluster/charts/spark/ |
Dernière mise à jour le