Apprenez à concevoir, construire, automatiser et déployer des pipelines de données modernes. Beaucoup de pratique, peu de théorie : un travail pratique à chaque module, sur des données proches de situations réelles.
Des notions de programmation aident, mais le parcours construit les compétences progressivement. Python ou SQL sont un plus, pas une condition.
Chaque module se termine par un travail pratique. On apprend en construisant, pas en écoutant.
Rôle du Data Engineer, cycle de vie de la donnée, batch et streaming, ETL et ELT, Data Lake, Warehouse et Lakehouse.
TP : Concevoir l'architecture Data d'une entreprise
Jointures, sous-requêtes, CTE, window functions, agrégations avancées, index, optimisation et modélisation relationnelle.
TP : Analyser et transformer une base de plusieurs millions de lignes
Structures de données, CSV, JSON et Parquet, Pandas, gestion des erreurs, logging et traitement de fichiers volumineux.
TP : Construire un pipeline de traitement de données en Python
PostgreSQL, MySQL, MongoDB, schémas, clés, index, transactions, connexion depuis Python, sécurité et accès.
TP : Construire la base de données d'une application métier
REST, authentification, pagination, rate limits, webhooks, ingestion automatisée et web scraping responsable.
TP : Collecter automatiquement des données depuis plusieurs APIs
Extraction, transformation, chargement, qualité et validation, doublons, valeurs manquantes, pipelines incrémentaux et idempotence.
TP : Pipeline ETL complet : API → Python → PostgreSQL
OLTP et OLAP, modélisation dimensionnelle, tables de faits et de dimensions, Star et Snowflake Schema, SCD, dbt.
TP : Construire un Data Warehouse pour une entreprise e-commerce
Douze étapes, de la collecte jusqu'à la consommation, en combinant les technologies vues pendant le bootcamp.
À l'issue du bootcamp, chaque participant repart avec des réalisations concrètes à présenter.
Les technologies réellement utilisées en entreprise, pas des jouets pédagogiques.
Python · SQL · Bash
PostgreSQL · Pandas · PySpark · Parquet · dbt
Apache Spark · Databricks · Delta Lake
Apache Airflow
Apache Kafka
AWS · Azure · Google Cloud
Git · GitHub · Docker · CI/CD
ETL · ELT · Data Lake · Warehouse · Lakehouse · Medallion
14 semaines, un module par semaine. Environ 14 à 18 heures hebdomadaires, dont les deux tiers en pratique.
4 niveaux d'accompagnement pour s'adapter à votre rythme et vos objectifs.
Tarifs de lancement réservés à la liste d'attente. Ils seront garantis aux pré-inscrits à l'ouverture de la cohorte, sans paiement avant.
Rejoignez la prochaine cohorte et construisez une plateforme Data complète.