Post #2491126
2026-05-04 21:21 UTC
https://luminousmen.com/post/the-apache-spark-optimization-checklist/ (en)
Comment optimiser Apache Spark ?
1. Utiliser les API DataFrame / Dataset, pas RDD.
2. Filtrer tôt, filtrer fort.
3. Trouver le data skew.
4. Connaitre AQE, DPP, SPJ.
5. Regarder l'UI.
#dataengineering #apachespark
Replies (1)
-
@ronan@mastodon.ronandev.ovh 2026-05-04 21:30
AQE (Adaptive Query Execution) : adapte le plan d'exécution en temps réel DPP (Dynamic Partition Pruning) : ne lit que les partitions utiles pendant une jointure SPJ (Storage Partition Join) : évite le shuffle en utilisant le partitionnement existant #dataengineering #apachespark