Skip to Content
L’échange d’apprentissage de HIC débute le 13 Juillet 2026. Voir le programme
LectureÉlément 7 sur 22 · 10 min

Aperçu de la modélisation : l’architecture Medallion

Dans ce sous-module, le Groupe I met en place l’architecture Medallion sur l’entrepôt et l’utilise pour modéliser deux jeux de données réels : les indicateurs agrégés DHIS2 et les données d’audit maternel. Le travail de transformation se fait avec dbt pour les modèles SQL et Python pour les parties qui exigent de la logique procédurale — profilage des sources, utilitaires d’ingestion, et contrôles de qualité des données allant au-delà des tests déclaratifs.

À la fin, vous disposerez d’un entrepôt organisé en trois couches — Bronze, Silver et Gold — avec des modèles dbt testés et documentés circulant entre elles, prêts à alimenter les travaux d’analytique et de ML plus loin dans le parcours.

Les trois couches

L’architecture Medallion organise l’entrepôt par niveau de raffinement plutôt que par système source ou par équipe. Les données ne circulent que dans un seul sens — chaque couche est reconstruite à partir de celle du dessous.

CoucheContenuGarantie
BronzeLes données brutes exactement telles qu’ingérées depuis DHIS2 et le système d’audit maternelRien n’est modifié — une copie intacte et rejouable de chaque source
SilverDes modèles nettoyés, typés, dédupliqués, conformésUne ligne fiable par entité, des noms et des types cohérents entre les sources
GoldDes modèles dimensionnels et des agrégats construits pour les consommateursLa logique métier appliquée une seule fois ; prêt pour la BI, le ML et les applications

Correspondance entre Medallion et landing, staging et marts

Si vous avez déjà travaillé avec une organisation ELT classique, les couches Medallion sont la même idée sous d’autres noms, et le projet dbt de ce sous-module utilise les deux vocabulaires de manière interchangeable :

  • Bronze correspond à raw / landing. L’ingestion extrait depuis DHIS2 et la base d’audit et charge tel quel. Aucun modèle dbt ne vit ici ; c’est l’entrée de tout le reste.
  • Silver correspond à staging et intermediate. Les modèles stg_* typent, renomment et dédupliquent chaque source ; les modèles int_* joignent les sources et appliquent les règles métier partagées.
  • Gold correspond aux marts. Les modèles dim_* et fct_* exposent des dimensions d’établissements et des faits d’indicateurs que les analystes interrogent directement, avec tests et documentation à l’appui.

Parce que chaque couche est dérivée de la précédente, n’importe quel modèle peut être supprimé et reconstruit depuis Bronze à tout moment — la reproductibilité est une propriété de l’architecture, pas une discipline dont il faut se souvenir.

Ce que vous allez construire

  1. Créer les schémas Bronze, Silver et Gold sur l’entrepôt et brancher le projet dbt qui les cible.
  2. Déposer les extraits agrégés DHIS2 et les tables d’audit maternel dans Bronze, puis les profiler avec Python avant de modéliser quoi que ce soit.
  3. Construire les modèles Silver de staging et intermediate, puis les marts Gold, en ajoutant les tests dbt et la documentation au fil de l’eau.

Avant l’atelier, suivez le cours Introduction à la modélisation des données — il explique pourquoi les données brutes sont déposées d’abord, à quoi sert l’étape de transformation, et les cinq activités que vous mènerez pendant l’atelier. Installez ensuite dbt avec la formation dbt puis construisez les couches de bout en bout dans le Lab 3 : Modélisation dbt Medallion — cas DHIS2.