Chapitre 5 — Protocoles d'évaluation et métriques de classification

🎯 Objectifs d'apprentissage
  • Distinguer Hold-out, validation croisée K-fold et LOOCV.
  • Construire une matrice de confusion et calculer les métriques dérivées.
  • Interpréter une courbe ROC et l'AUROC.
  • Choisir la métrique pertinente selon le contexte (médical, fraude, etc.).

5.1 — Le problème à résoudre

Comment mesurer de manière objective la performance d'un classifieur ? L'Accuracy globale peut être trompeuse sur des données déséquilibrées (par exemple, 99 % de patients sains et 1 % de malades).

💡 Intuition

Imaginez un test de dépistage d'une maladie grave. S'il dit que tout le monde est sain, il aura 99 % de réussite globale mais ratera tous les malades (Rappel faible). S'il alerte à la moindre anomalie, il trouvera tous les malades mais accusera à tort plein de gens sains (Précision faible). La matrice de confusion est le tableau de compte-rendu médical qui détaille toutes les erreurs et réussites.

5.2 — Stratégies de découpage des données

Hold-out

On découpe l'ensemble de données D = {(x, y)i=1…n} en trois parties :

  • Entraînement E : entraîner les K algorithmes.
  • Validation V : évaluer et sélectionner le modèle définitif.
  • Test T : évaluer l'erreur de généralisation du modèle choisi.

Répartition typique : 50 % / 25 % / 25 %. Pas de découpage optimal en théorie.

main_3.pdf, p. 46–47

Validation croisée K-fold

Étant donné un jeu D de n observations et un nombre K :

  1. Partitionner D en K parties de tailles sensiblement similaires D1, …, DK.
  2. Pour chaque valeur de k = 1, …, K :
    • entraîner un modèle sur ∪j≠k Dj ;
    • évaluer ce modèle sur Dk.
  3. Moyenner les K mesures d'erreur.
main_3.pdf, p. 48–49
⚠️ Attention — cas particulier

Si K = n, on parle de leave-one-out cross validation (LOOCV) : on apprend sur n − 1 individus et on teste sur 1 individu, répété n fois.

5.3 — Matrice de confusion

Pour un problème de classification binaire 𝒴 = {C1, C2}, la matrice de confusion prend la forme suivante :

Prédit
C1C2
Réel C1 a = TP b = FN
Réel C2 c = FP d = TN
Source : main_3.pdf, p. 52
  • TP (True Positive) : vrais positifs correctement identifiés.
  • FN (False Negative) : positifs manqués (erreur critique).
  • FP (False Positive) : fausses alarmes.
  • TN (True Negative) : vrais négatifs correctement identifiés.

5.4 — Métriques de classification

MétriqueFormuleInterprétation
Rappel (Sensibilité) TP / (TP + FN) Proportion d'exemples positifs correctement identifiés
Précision (PPV) TP / (TP + FP) Proportion de prédictions positives correctes
Spécificité TN / (FP + TN) Proportion d'exemples négatifs correctement identifiés
F1-score 2 · Précision · Rappel / (Précision + Rappel) = 2TP / (2TP + FP + FN) Moyenne harmonique de la précision et du rappel
Accuracy (TP + TN) / n Taux de réussite global
Taux d'erreur (FP + FN) / n = 1 − Accuracy Taux de mauvaise classification
main_3.pdf, p. 54–55
✏️ Exemple guidé — Cancer du sein (Atelier 2, Cas 4)

Soit n = 114 patients : M = 43 malins, B = 71 bénins.

  • Le modèle a prédit 40 patients comme malins, dont 38 réellement malins → TP = 38, FP = 2.
  • Le modèle a prédit 74 patients comme bénins → FN = 43 − 38 = 5, TN = 71 − 2 = 69.
Prédit
MalinBénin
Réel Malin38 (TP)5 (FN)
Réel Bénin2 (FP)69 (TN)
  • Rappel = 38 / (38 + 5) = 38 / 43 ≈ 0,8837 (88,37 %)
  • Précision = 38 / (38 + 2) = 38 / 40 = 0,95 (95,00 %)
  • Spécificité = 69 / (2 + 69) = 69 / 71 ≈ 0,9718 (97,18 %)
  • F1 = 2 · 38 / (2 · 38 + 2 + 5) = 76 / 83 ≈ 0,9157
  • Accuracy = (38 + 69) / 114 = 107 / 114 ≈ 0,9386 (93,86 %)

Interprétation : excellente précision (95 %) mais on manque 11,63 % des cas malins (5 FN), rappel de 88,37 %. En contexte médical, ce compromis doit être évalué attentivement.

Atelier_2.pdf, Cas 4

5.5 — Courbe ROC et AUROC

📘 Définition à connaître

On appelle courbe ROC (Receiver-Operator Characteristic) la courbe décrivant l'évolution de la sensibilité (en ordonnée) en fonction du complémentaire à 1 de la spécificité (appelé antispécificité, en abscisse) lorsque le seuil de décision change.

main_3.pdf, p. 56

Construction

  • On prend pour seuil les valeurs successives de la fonction de décision sur le jeu de données.
  • À chaque nouvelle valeur de seuil, une observation précédemment prédite négative change d'étiquette :
    • si elle est effectivement positive, la sensibilité augmente de 1 / np ;
    • sinon, c'est l'antispécificité qui augmente de 1 / nn.
  • La courbe ROC est donc une courbe en escaliers.

Interprétation

  • Classifieur idéal (aucune erreur) : courbe qui suit le coin supérieur gauche, AUROC = 1.
  • Classifieur aléatoire : suit la diagonale, AUROC = 0,5.
  • Pour qu'un modèle soit intéressant, sa courbe ROC doit être au-dessus de la diagonale.
  • Pour comparer deux modèles : celui dont la courbe est au-dessus est le meilleur.
main_3.pdf, p. 57–59
⚠️ Attention — axe X

L'axe X de la courbe ROC n'est pas la spécificité mais l'antispécificité : 1 − Spécificité = FP / (FP + TN).

5.6 — Choix de la métrique selon le contexte

ContexteMétrique prioritaireJustification
Dépistage médical Rappel On préfère des fausses alarmes (FP) à des cas manqués (FN)
Détection de fraude F1-score Compromis entre précision et rappel
Filtre anti-spam Précision Il ne faut pas bloquer les e-mails légitimes (FP coûteux)
Données équilibrées Accuracy Mesure simple, valide si les classes sont équilibrées
📌 À retenir
  • Hold-out : 50/25/25. K-fold : K folds, moyenne des erreurs. LOOCV : K = n.
  • Matrice de confusion : TP, FP, FN, TN.
  • Rappel = TP / (TP+FN) ; Précision = TP / (TP+FP) ; F1 = 2TP / (2TP+FP+FN).
  • ROC = sensibilité vs antispécificité ; AUROC idéal = 1, aléatoire = 0,5.
  • Ne jamais se fier uniquement à l'Accuracy sur des données déséquilibrées.
🎯 À l'examen
  1. Soit la matrice TP=50, FP=10, FN=5, TN=135. Calculez la Précision, le Rappel et le F1-score.
  2. Qu'est-ce qu'une validation croisée K-fold et quel est son avantage sur le Hold-out ?
  3. Que signifie une courbe ROC située en dessous de la diagonale ?
  4. Dans un système de détection de transactions frauduleuses, quelle métrique prioriseriez-vous entre Précision et Rappel ?
  5. Que devient la validation croisée K-fold lorsque K = n ?