Chapitre 5 — Protocoles d'évaluation et métriques de classification
- Distinguer Hold-out, validation croisée K-fold et LOOCV.
- Construire une matrice de confusion et calculer les métriques dérivées.
- Interpréter une courbe ROC et l'AUROC.
- Choisir la métrique pertinente selon le contexte (médical, fraude, etc.).
5.1 — Le problème à résoudre
Comment mesurer de manière objective la performance d'un classifieur ? L'Accuracy globale peut être trompeuse sur des données déséquilibrées (par exemple, 99 % de patients sains et 1 % de malades).
Imaginez un test de dépistage d'une maladie grave. S'il dit que tout le monde est sain, il aura 99 % de réussite globale mais ratera tous les malades (Rappel faible). S'il alerte à la moindre anomalie, il trouvera tous les malades mais accusera à tort plein de gens sains (Précision faible). La matrice de confusion est le tableau de compte-rendu médical qui détaille toutes les erreurs et réussites.
5.2 — Stratégies de découpage des données
Hold-out
On découpe l'ensemble de données D = {(x, y)i=1…n} en trois parties :
- Entraînement E : entraîner les K algorithmes.
- Validation V : évaluer et sélectionner le modèle définitif.
- Test T : évaluer l'erreur de généralisation du modèle choisi.
Répartition typique : 50 % / 25 % / 25 %. Pas de découpage optimal en théorie.
main_3.pdf, p. 46–47Validation croisée K-fold
Étant donné un jeu D de n observations et un nombre K :
- Partitionner D en K parties de tailles sensiblement similaires D1, …, DK.
- Pour chaque valeur de k = 1, …, K :
- entraîner un modèle sur ∪j≠k Dj ;
- évaluer ce modèle sur Dk.
- Moyenner les K mesures d'erreur.
Si K = n, on parle de leave-one-out cross validation (LOOCV) : on apprend sur n − 1 individus et on teste sur 1 individu, répété n fois.
5.3 — Matrice de confusion
Pour un problème de classification binaire 𝒴 = {C1, C2}, la matrice de confusion prend la forme suivante :
| Prédit | ||
|---|---|---|
| C1 | C2 | |
| Réel C1 | a = TP | b = FN |
| Réel C2 | c = FP | d = TN |
- TP (True Positive) : vrais positifs correctement identifiés.
- FN (False Negative) : positifs manqués (erreur critique).
- FP (False Positive) : fausses alarmes.
- TN (True Negative) : vrais négatifs correctement identifiés.
5.4 — Métriques de classification
| Métrique | Formule | Interprétation |
|---|---|---|
| Rappel (Sensibilité) | TP / (TP + FN) | Proportion d'exemples positifs correctement identifiés |
| Précision (PPV) | TP / (TP + FP) | Proportion de prédictions positives correctes |
| Spécificité | TN / (FP + TN) | Proportion d'exemples négatifs correctement identifiés |
| F1-score | 2 · Précision · Rappel / (Précision + Rappel) = 2TP / (2TP + FP + FN) | Moyenne harmonique de la précision et du rappel |
| Accuracy | (TP + TN) / n | Taux de réussite global |
| Taux d'erreur | (FP + FN) / n = 1 − Accuracy | Taux de mauvaise classification |
Soit n = 114 patients : M = 43 malins, B = 71 bénins.
- Le modèle a prédit 40 patients comme malins, dont 38 réellement malins → TP = 38, FP = 2.
- Le modèle a prédit 74 patients comme bénins → FN = 43 − 38 = 5, TN = 71 − 2 = 69.
| Prédit | ||
|---|---|---|
| Malin | Bénin | |
| Réel Malin | 38 (TP) | 5 (FN) |
| Réel Bénin | 2 (FP) | 69 (TN) |
- Rappel = 38 / (38 + 5) = 38 / 43 ≈ 0,8837 (88,37 %)
- Précision = 38 / (38 + 2) = 38 / 40 = 0,95 (95,00 %)
- Spécificité = 69 / (2 + 69) = 69 / 71 ≈ 0,9718 (97,18 %)
- F1 = 2 · 38 / (2 · 38 + 2 + 5) = 76 / 83 ≈ 0,9157
- Accuracy = (38 + 69) / 114 = 107 / 114 ≈ 0,9386 (93,86 %)
Interprétation : excellente précision (95 %) mais on manque 11,63 % des cas malins (5 FN), rappel de 88,37 %. En contexte médical, ce compromis doit être évalué attentivement.
Atelier_2.pdf, Cas 45.5 — Courbe ROC et AUROC
On appelle courbe ROC (Receiver-Operator Characteristic) la courbe décrivant l'évolution de la sensibilité (en ordonnée) en fonction du complémentaire à 1 de la spécificité (appelé antispécificité, en abscisse) lorsque le seuil de décision change.
main_3.pdf, p. 56Construction
- On prend pour seuil les valeurs successives de la fonction de décision sur le jeu de données.
- À chaque nouvelle valeur de seuil, une observation précédemment prédite négative change d'étiquette :
- si elle est effectivement positive, la sensibilité augmente de 1 / np ;
- sinon, c'est l'antispécificité qui augmente de 1 / nn.
- La courbe ROC est donc une courbe en escaliers.
Interprétation
- Classifieur idéal (aucune erreur) : courbe qui suit le coin supérieur gauche, AUROC = 1.
- Classifieur aléatoire : suit la diagonale, AUROC = 0,5.
- Pour qu'un modèle soit intéressant, sa courbe ROC doit être au-dessus de la diagonale.
- Pour comparer deux modèles : celui dont la courbe est au-dessus est le meilleur.
L'axe X de la courbe ROC n'est pas la spécificité mais l'antispécificité : 1 − Spécificité = FP / (FP + TN).
5.6 — Choix de la métrique selon le contexte
| Contexte | Métrique prioritaire | Justification |
|---|---|---|
| Dépistage médical | Rappel | On préfère des fausses alarmes (FP) à des cas manqués (FN) |
| Détection de fraude | F1-score | Compromis entre précision et rappel |
| Filtre anti-spam | Précision | Il ne faut pas bloquer les e-mails légitimes (FP coûteux) |
| Données équilibrées | Accuracy | Mesure simple, valide si les classes sont équilibrées |
- Hold-out : 50/25/25. K-fold : K folds, moyenne des erreurs. LOOCV : K = n.
- Matrice de confusion : TP, FP, FN, TN.
- Rappel = TP / (TP+FN) ; Précision = TP / (TP+FP) ; F1 = 2TP / (2TP+FP+FN).
- ROC = sensibilité vs antispécificité ; AUROC idéal = 1, aléatoire = 0,5.
- Ne jamais se fier uniquement à l'Accuracy sur des données déséquilibrées.
- Soit la matrice TP=50, FP=10, FN=5, TN=135. Calculez la Précision, le Rappel et le F1-score.
- Qu'est-ce qu'une validation croisée K-fold et quel est son avantage sur le Hold-out ?
- Que signifie une courbe ROC située en dessous de la diagonale ?
- Dans un système de détection de transactions frauduleuses, quelle métrique prioriseriez-vous entre Précision et Rappel ?
- Que devient la validation croisée K-fold lorsque K = n ?