Elektrine lite

← Feed

@ronan@mastodon.ronandev.ovh

Post #2491126

2026-05-04 21:21 UTC

https://luminousmen.com/post/the-apache-spark-optimization-checklist/ (en) Comment optimiser Apache Spark ? 1. Utiliser les API DataFrame / Dataset, pas RDD. 2. Filtrer tôt, filtrer fort. 3. Trouver le data skew. 4. Connaitre AQE, DPP, SPJ. 5. Regarder l'UI. #dataengineering #apachespark

Replies (1)

  • @ronan@mastodon.ronandev.ovh 2026-05-04 21:30

    AQE (Adaptive Query Execution) : adapte le plan d'exécution en temps réel DPP (Dynamic Partition Pruning) : ne lit que les partitions utiles pendant une jointure SPJ (Storage Partition Join) : évite le shuffle en utilisant le partitionnement existant #dataengineering #apachespark

    Open ##2822107