Chapitre 3 — Cadre de l'apprentissage supervisé

🎯 Objectifs d'apprentissage
  • Définir l'apprentissage supervisé et sa formalisation f(x) = y + ε.
  • Distinguer classification binaire, classification multi-classe et régression.
  • Définir une fonction de décision g(x) et les régions de décision Rc.
  • Reconnaître le sous-apprentissage, l'ajustement approprié et le sur-apprentissage sur un graphique.

3.1 — Le problème à résoudre

En classification, il ne suffit pas d'attribuer une classe au hasard. Comment construire une frontière mathématique capable d'isoler les différentes catégories dans l'espace des données, tout en évitant d'apprendre le bruit aléatoire ?

💡 Intuition

Imaginez qu'on trace une frontière entre deux pays sur une carte. Si la frontière est une ligne droite trop rigide, des villes seront du mauvais côté : c'est le sous-apprentissage. Si la frontière fait des zigzags complexes pour contourner chaque maison isolée, elle devient absurde et inutilisable sur une nouvelle carte : c'est le sur-apprentissage. Une bonne frontière est une courbe lisse qui sépare globalement bien les deux groupes.

3.2 — Définition et formalisation

📘 Définition à connaître

Apprentissage supervisé : but est d'apprendre à faire des prédictions à partir d'une liste d'exemples étiquetés, c'est-à-dire accompagnés de la valeur à prédire. Les étiquettes servent de « professeur » et supervisent l'apprentissage.

main_3.pdf, p. 3

Formalisation du problème

Étant donné un ensemble d'entraînement :

𝔼 = { (x→1,y1) ,…, (x→i,yi) ,…, (x→n,yn) }
  • n observations x⃗i décrites dans un espace 𝒳.
  • Leurs étiquettes yi décrites dans un espace 𝒴.

Objectif : déterminer une fonction f : 𝒳 → 𝒴 modélisant la relation entre les x⃗ et la variable cible y ∈ 𝒴 :

f(x→) = y+ε

où ε est l'erreur ou bruit aléatoire. Cette relation est la même que celle des paires observées.

main_3.pdf, p. 4

3.3 — Classification binaire, multi-classe, régression

Type de problèmeEspace des étiquettesExemples
Classification binaire 𝒴 = {0, 1} Spam / non-spam, tumeur maligne / bénigne, transaction frauduleuse ou non
Classification multi-classe 𝒴 = {1, 2, …, C} Reconnaissance de chiffres, d'objets, expression faciale
Régression 𝒴 = ℝ Prix d'une action, âge d'une personne, rendement d'un plant
main_3.pdf, p. 6
⚠️ Attention — évolution des étiquettes

Les étiquettes de classification binaire sont notées {0, 1} tout au long du traitement général et de la régression logistique. En revanche, lors du développement de la SVM (chapitre 4), le professeur utilise la convention {−1, +1}. Les deux notations sont équivalentes : il suffit de faire correspondre 0 ↔ −1 et 1 ↔ +1.

3.4 — Fonctions de décision et régions de décision

Dans le cas d'un problème de classification, le modèle prédictif peut prendre directement la forme d'une fonction f à valeurs dans {0, 1}, ou utiliser une fonction intermédiaire g à valeurs réelles, qui associe à une observation un score d'autant plus élevé qu'elle est susceptible d'être positive.

📘 Définition à connaître

Fonction de décision (ou fonction discriminante) : dans le cadre d'un problème de classification binaire, fonction g : 𝒳 → ℝ telle que :

  • f(X) = 0 si et seulement si g(X) ≤ 0
  • f(X) = 1 si et seulement si g(X) > 0

Généralisation multi-classe : on a C fonctions de décision gc : 𝒳 → ℝ telles que :

f(X) = arg⁡maxc=1,…,C gc(X)
main_3.pdf, p. 8

Régions de décision

La fonction discriminante partitionne l'espace des observations 𝒳 en régions :

  • Cas binaire : R0 = {X ∈ 𝒳 | g(X) ≤ 0} et R1 = {X ∈ 𝒳 | g(X) > 0}.
  • Cas multi-classe : Rc = {X ∈ 𝒳 | gc(X) = maxk gk(X)}.
main_3.pdf, p. 9
✏️ Exemple — Classification binaire dans ℝ²

Considérons 𝒴 = {0, 1} et |𝒳| = 2. On observe un nuage de points étiquetés (bleus et rouges) dans le plan. La fonction de décision g(X) attribue un score à chaque point. Le seuil g(X) = 0 définit une frontière qui sépare l'espace en deux régions R0 (où f = 0) et R1 (où f = 1).

main_3.pdf, p. 10

3.5 — Généralisation, sous-apprentissage, sur-apprentissage

📘 Définitions à connaître

Généralisation : capacité d'un modèle à faire des prédictions correctes sur de nouvelles données, qui n'ont pas été utilisées pour le construire.

Sur-apprentissage (overfitting) : modèle qui, plutôt que de capturer la nature des objets à étiqueter, modélise aussi le bruit et ne sera pas en mesure de généraliser.

Sous-apprentissage (underfitting) : modèle trop simple pour avoir de bonnes performances même sur les données utilisées pour le construire.

main_3.pdf, p. 11
PhénomèneCausePerformance entraînementPerformance test
Sous-apprentissageModèle trop simpleFaibleFaible
Ajustement appropriéBonne complexitéBonneBonne
Sur-apprentissageModèle trop complexeExcellenteFaible
⚠️ Attention

Un modèle qui sur-apprend est généralement trop complexe, qui « colle » trop aux données et capture donc aussi leur bruit. À l'inverse, un modèle trop simple n'aura de bonnes performances ni sur les données d'entraînement, ni en généralisation.

3.6 — Liens avec les autres notions

Ce chapitre pose la bifurcation majeure du cours : la branche supervisée est développée dans les chapitres 4 (classification) et 7 (régression), tandis que la branche non supervisée est traitée au chapitre 9. Les cinq algorithmes du chapitre 4 (régression logistique, KNN, SVM, arbres, forêts aléatoires) sont tous des réalisations spécifiques de la fonction de décision g(x⃗) introduite ici.

📌 À retenir
  • Apprentissage supervisé : f(x⃗) = y + ε, avec étiquettes y connues.
  • Classification binaire (𝒴 = {0,1}), multi-classe (𝒴 = {1,…,C}), régression (𝒴 = ℝ).
  • Fonction de décision g(X) et régions Rc partitionnent l'espace.
  • Sous-apprentissage = trop simple ; sur-apprentissage = trop complexe.
  • Score g(x⃗) continu vs prédiction f(x⃗) catégorielle après seuillage.
🎯 À l'examen
  1. Définissez une fonction de décision g(x⃗) en classification binaire.
  2. Expliquez comment gc(x⃗) définit les régions Rc en multi-classe.
  3. Décrivez la différence visuelle entre frontières sous-ajustée, appropriée et sur-ajustée.
  4. Quel est l'effet d'une augmentation de la complexité du modèle sur l'erreur d'entraînement et l'erreur de test ?
  5. Que représente le terme ε dans la formule f(x⃗) = y + ε ?