Logo Natchia — Build data system natchia.data

portfolio

Projets

Des projets construits pour apprendre en faisant, avec les décisions techniques documentées — pas seulement le résultat final. Quatre axes : data engineering, data architecture, ML/MLOps, IA/GenAI.

Data Engineering

en cours

Pipeline data engineering sur le jeu de données DPE (ADEME)

Architecture medallion complète sur AWS S3 pour le jeu de données ouvert des Diagnostics de Performance Énergétique. Le projet part de deux sources hétérogènes (logements neufs et logements existants) qu'il faut ingérer, nettoyer puis harmoniser — un vrai cas de figure de terrain plutôt qu'un tutoriel.

  • Ingestion S3 en upload multipart avec compression gzip, couche bronze immuable pour garantir la reproductibilité du pipeline
  • Schémas PySpark (StructType) construits à la main pour les deux sources, en conservant les noms de colonnes bruts et leurs incohérences (espaces, casse, colonnes dupliquées)
  • Harmonisation des deux sources hétérogènes vers un schéma silver commun, avec sélection des colonnes utiles pour l'analytics et les cas d'usage ML/GenAI
  • Partitionnement de la couche silver par région et par année de DPE pour optimiser les requêtes Athena
  • Orchestration prévue avec Airflow, infrastructure as code avec Terraform, déploiement via GitHub Actions
Pythonboto3AWS Glue (PySpark)AthenaAirflowTerraformGitHub Actions

Data Architecture

à venir

Projet de data architecture — définition d'un modèle et de patterns

Un projet dédié aux choix d'architecture : modélisation dimensionnelle vs. medallion, arbitrages lakehouse, gouvernance des données. À construire en parallèle du pipeline DPE.

ML / MLOps

à venir

Projet ML/MLOps — de l'entraînement au déploiement

Mettre en production un modèle ML avec du versioning de données et de modèle, du monitoring et un pipeline CI/CD dédié au ML.

IA / GenAI

à venir

Projet IA / GenAI

Un projet appliquant des concepts de GenAI (RAG, agents, évaluation) à des données réelles, dans la continuité des pipelines construits côté data engineering.