Data Science
Intelligence artificielle au service de la santé publique
Une solution IA pour transformer les données médicales en outil d’aide à la décision
afin de contribuer à améliorer la prise de décision médicale, prioriser les patients à risque et optimiser l’allocation des ressources de santé.
Projet Data Science en Santé publique > Machine Learning > Aide au diagnostic
Executive Summary
Objectif
Détecter les patients à risque
Solution
Modèle de Machine Learning
Résultat
Régression logistique la plus performante
Impact
Aide à la décision médicale
1. Les défis actuels
Patient → Analyse clinique→ Diagnostic→ Décision médicale
| Défi | Impact |
|---|---|
| Diagnostic parfois tardif | Risque de complications |
| Ressources médicales limitées | Priorisation difficile |
| Volume important de patients | Temps d’analyse élevé |
| Décisions basées sur de nombreuses variables | Risques d’erreurs humaines |
2. Ma solution
Patient→ Modèle IA→ Probabilité de risque→ Aide au diagnostic
Ma démarche :
Collecte des données
↓
Analyse exploratoire
↓
Préparation des données
↓
Machine Learning
↓
Évaluation des modèles
↓
Aide à la décision
Architecture du projet :
Données source
↓
Analyse exploratoire (Pandas, NumPy, seaborn, matplotlib,)
↓
Traitement (Nettoyage des données, valeurs manquantes)
↓
Preprocessing (StandardScaler, OneHotEncoder, SMOTE)
↓
Modèles de Machine Learning implémentés (XGBoost, Logistic Regression)
↓
Aide au diagnostic
Impact :
Avantage : plus rapide
Résultat : plus objectif
3. Les insight clés
Risk Score : principal facteur prédictif de l’infection

Profil des patients :
Les patients atteints sont globalement plus jeunes

Il y a davantage d’hommes infectés que de femmes

Symptômes dominants : Fièvre, vomissements, vertiges et maux de tête sont les plus représentés

Répartition géographiques : Certaines régions concentrent davantage de cas

4. Résultats des prédictions
Classification Report :
| Critères | Logistic Regression | XGBoost | Explication |
|---|---|---|---|
| Accuracy | 87 % | 86 % | Pourcentage total de bonnes prédictions |
| F1-score global | 88 % | 86 % | Équilibre entre précision et rappel |
| Recall classe positive | 87 % | 87 % | Capacité à détecter les vrais malades |
| Précision classe positive | 94 % | 91 % | Qualité des prédictions des malades |
Matrice de confusion :
| Critères | Logistic Regression | XGBoost |
|---|---|---|
| Accuracy score on train set | 87 % | 88,2 % |
| Accuracy score on test set | 87,4 % | 85, 7 % |
Modèle retenu présentant de meilleures performances : Logistic Regression
5. Perspective d’intégration
Les prédictions du modèle peuvent être exploitées au sein d’un tableau de bord décisionnel afin de prioriser les patients, suivre les indicateurs épidémiologiques et soutenir les décisions des professionnels de santé.
