Aperçu du parcours Ingénierie système
Ce module est le parcours pratique destiné aux ingénieurs système et architectes de données — le volet Groupe I de l’Échange HIC. Au fil de la semaine, vous construisez la plateforme de bout en bout : provisionner l’infrastructure, monter l’entrepôt de données, modéliser ses données, puis terminer en entraînant un véritable pipeline d’apprentissage automatique sur de l’imagerie médicale.
Ce que vous allez travailler
| Sous-module | Objet | Stack |
|---|---|---|
| Infrastructure | Mise en place du serveur et de l’environnement, configuration et optimisation, mise en place de l’entrepôt de données, ingestion centralisée des données des établissements de santé, déploiement | KVM, Ansible, Docker, Postgres |
| Modélisation des données | Architecture Medallion (Bronze / Silver / Gold), modélisation des agrégats DHIS2 et des données d’audit maternel | dbt, Python |
| IA et apprentissage automatique | Traitement des données et modélisation ML sur un vrai jeu de données d’imagerie | Python, PyTorch |
Un quatrième parcours — Ingestion de données (éléments de données DHIS2, DHIS2 Tracker, données individuelles, et sources climatiques et de réseaux sociaux collectées par web scraping, orchestrées avec Prefect) — se déroule lors de l’événement ; son matériel de tutoriel sera publié ici dès qu’il sera prêt.
Correspondance entre le module et l’événement
Chaque sous-module reflète une journée du Groupe I du programme de l’Échange : Mise en place de l’environnement et de l’infrastructure (jour 8), Atelier 3 : Mise en place de l’infrastructure Medallion (jour 10) et Atelier 4 : IA — traitement des données, modélisation ML (jour 11).
Parcourez les éléments dans l’ordre — les ateliers supposent que l’environnement construit dans le sous-module Infrastructure est en place. Commencez par Mise en place de l’environnement et de l’infrastructure.