Pipeline data engineering sur le jeu de données DPE (ADEME)
Architecture medallion complète sur AWS S3 pour le jeu de données ouvert des Diagnostics de Performance Énergétique. Le projet part de deux sources hétérogènes (logements neufs et logements existants) qu'il faut ingérer, nettoyer puis harmoniser — un vrai cas de figure de terrain plutôt qu'un tutoriel.
- Ingestion S3 en upload multipart avec compression gzip, couche bronze immuable pour garantir la reproductibilité du pipeline
- Schémas PySpark (StructType) construits à la main pour les deux sources, en conservant les noms de colonnes bruts et leurs incohérences (espaces, casse, colonnes dupliquées)
- Harmonisation des deux sources hétérogènes vers un schéma silver commun, avec sélection des colonnes utiles pour l'analytics et les cas d'usage ML/GenAI
- Partitionnement de la couche silver par région et par année de DPE pour optimiser les requêtes Athena
- Orchestration prévue avec Airflow, infrastructure as code avec Terraform, déploiement via GitHub Actions