Pipeline de données ETL/ELT — du CSV au Data Warehouse moderne.
-
EXTRAIRE : c'est le scraping. Cette étape a pour objectif d'aller chercher des données sur internet à l'aide des API ou dans une base de données. Les données extraites sont désordonnées et ne sont pas uniformes.
-
TRANSFORMER : c'est le nettoyage. Elle a pour but de supprimer les champs inutiles, remplacer les valeurs manquantes par des zéros.
-
CHARGER : mettre les données à disposition de l'équipe Data Analyst/Scientist pour l'analyse, sous forme de fichier CSV ou dans un Data Warehouse.
| Projet | Description |
|---|---|
01-csv-to-postgres |
Charger un CSV dans PostgreSQL |
02-api-to-database |
Ingérer une API dans une base de données |
03-incremental-load |
Chargement incrémental de données |
04-full-etl-project |
Pipeline ETL complet de bout en bout |
05-elt-with-dbt |
Pipeline ELT moderne avec dbt |
| Compétence | Ce que je sais faire | Valeur professionnelle |
|---|---|---|
| Ingestion de données | Lire et charger des fichiers CSV, JSON dans une base de données | Je sais collecter des données brutes depuis différentes sources |
| Connexion API | Appeler une API REST et stocker les données récupérées | Je sais automatiser la collecte de données depuis des services externes |
| Chargement incrémental | Ne charger que les nouvelles données sans écraser les anciennes | Je sais optimiser les pipelines pour éviter les doublons et réduire les coûts |
| Pipeline ETL complet | Extraire, transformer et charger des données de bout en bout | Je sais construire un pipeline production-ready de A à Z |
| ELT moderne avec dbt | Charger les données brutes puis les transformer directement en base | Je maîtrise l'approche moderne utilisée par les entreprises data-driven |
| PostgreSQL | Créer des tables, insérer et requêter des données | Je sais travailler avec les bases de données relationnelles |