12 Documents
Panorama du métier de data engineer : rôle, cycle de vie de la donnée, écosystème d'outils et repères pour un développeur backend qui découvre le domaine.
Faits, dimensions, schéma en étoile, SCD et opposition Kimball/Inmon : les fondamentaux de la modélisation analytique.
Row vs columnar, formats texte vs binaires, schéma embarqué et compression : bien choisir le format d'un fichier de données.
Pourquoi une base applicative et un entrepôt analytique répondent à des besoins opposés, et ce que cela implique sur leur modélisation et leur stockage.
Compromis latence/débit, fenêtrage et architectures Lambda et Kappa pour choisir le bon mode de traitement.
MapReduce, partitionnement, data locality et tolérance aux pannes : comprendre ce que fait un moteur comme Spark avant d'en écrire une ligne.
Change Data Capture, journal de transactions et sémantique de livraison : capter les changements d'une source sans la surcharger.
Dimensions de la qualité, data contracts, tests de données et observabilité pour détecter les anomalies avant l'utilisateur métier.
Data catalog, data lineage et rôles de gouvernance (owner, steward, CDO) : rendre la donnée d'une organisation découvrable et fiable.
Les quatre piliers du data mesh face au modèle centralisé classique, et quand chaque approche a réellement du sens.
Atomicité, cohérence, isolation, durabilité : ce que garantit vraiment une transaction, et pourquoi le lakehouse a dû réinventer ces garanties pour le data lake.
Ingestion, orchestration, traitement distribué, entrepôts, lakehouse, qualité, gouvernance, BI : panorama détaillé des outils de référence par catégorie.