Chapitre 3 — Cadre de l'apprentissage supervisé
- Définir l'apprentissage supervisé et sa formalisation f(x) = y + ε.
- Distinguer classification binaire, classification multi-classe et régression.
- Définir une fonction de décision g(x) et les régions de décision Rc.
- Reconnaître le sous-apprentissage, l'ajustement approprié et le sur-apprentissage sur un graphique.
3.1 — Le problème à résoudre
En classification, il ne suffit pas d'attribuer une classe au hasard. Comment construire une frontière mathématique capable d'isoler les différentes catégories dans l'espace des données, tout en évitant d'apprendre le bruit aléatoire ?
Imaginez qu'on trace une frontière entre deux pays sur une carte. Si la frontière est une ligne droite trop rigide, des villes seront du mauvais côté : c'est le sous-apprentissage. Si la frontière fait des zigzags complexes pour contourner chaque maison isolée, elle devient absurde et inutilisable sur une nouvelle carte : c'est le sur-apprentissage. Une bonne frontière est une courbe lisse qui sépare globalement bien les deux groupes.
3.2 — Définition et formalisation
Apprentissage supervisé : but est d'apprendre à faire des prédictions à partir d'une liste d'exemples étiquetés, c'est-à-dire accompagnés de la valeur à prédire. Les étiquettes servent de « professeur » et supervisent l'apprentissage.
main_3.pdf, p. 3Formalisation du problème
Étant donné un ensemble d'entraînement :
- n observations x⃗i décrites dans un espace 𝒳.
- Leurs étiquettes yi décrites dans un espace 𝒴.
Objectif : déterminer une fonction f : 𝒳 → 𝒴 modélisant la relation entre les x⃗ et la variable cible y ∈ 𝒴 :
où ε est l'erreur ou bruit aléatoire. Cette relation est la même que celle des paires observées.
main_3.pdf, p. 43.3 — Classification binaire, multi-classe, régression
| Type de problème | Espace des étiquettes | Exemples |
|---|---|---|
| Classification binaire | 𝒴 = {0, 1} | Spam / non-spam, tumeur maligne / bénigne, transaction frauduleuse ou non |
| Classification multi-classe | 𝒴 = {1, 2, …, C} | Reconnaissance de chiffres, d'objets, expression faciale |
| Régression | 𝒴 = ℝ | Prix d'une action, âge d'une personne, rendement d'un plant |
Les étiquettes de classification binaire sont notées {0, 1} tout au long du traitement général et de la régression logistique. En revanche, lors du développement de la SVM (chapitre 4), le professeur utilise la convention {−1, +1}. Les deux notations sont équivalentes : il suffit de faire correspondre 0 ↔ −1 et 1 ↔ +1.
3.4 — Fonctions de décision et régions de décision
Dans le cas d'un problème de classification, le modèle prédictif peut prendre directement la forme d'une fonction f à valeurs dans {0, 1}, ou utiliser une fonction intermédiaire g à valeurs réelles, qui associe à une observation un score d'autant plus élevé qu'elle est susceptible d'être positive.
Fonction de décision (ou fonction discriminante) : dans le cadre d'un problème de classification binaire, fonction g : 𝒳 → ℝ telle que :
- f(X) = 0 si et seulement si g(X) ≤ 0
- f(X) = 1 si et seulement si g(X) > 0
Généralisation multi-classe : on a C fonctions de décision gc : 𝒳 → ℝ telles que :
Régions de décision
La fonction discriminante partitionne l'espace des observations 𝒳 en régions :
- Cas binaire : R0 = {X ∈ 𝒳 | g(X) ≤ 0} et R1 = {X ∈ 𝒳 | g(X) > 0}.
- Cas multi-classe : Rc = {X ∈ 𝒳 | gc(X) = maxk gk(X)}.
Considérons 𝒴 = {0, 1} et |𝒳| = 2. On observe un nuage de points étiquetés (bleus et rouges) dans le plan. La fonction de décision g(X) attribue un score à chaque point. Le seuil g(X) = 0 définit une frontière qui sépare l'espace en deux régions R0 (où f = 0) et R1 (où f = 1).
main_3.pdf, p. 103.5 — Généralisation, sous-apprentissage, sur-apprentissage
Généralisation : capacité d'un modèle à faire des prédictions correctes sur de nouvelles données, qui n'ont pas été utilisées pour le construire.
Sur-apprentissage (overfitting) : modèle qui, plutôt que de capturer la nature des objets à étiqueter, modélise aussi le bruit et ne sera pas en mesure de généraliser.
Sous-apprentissage (underfitting) : modèle trop simple pour avoir de bonnes performances même sur les données utilisées pour le construire.
main_3.pdf, p. 11| Phénomène | Cause | Performance entraînement | Performance test |
|---|---|---|---|
| Sous-apprentissage | Modèle trop simple | Faible | Faible |
| Ajustement approprié | Bonne complexité | Bonne | Bonne |
| Sur-apprentissage | Modèle trop complexe | Excellente | Faible |
Un modèle qui sur-apprend est généralement trop complexe, qui « colle » trop aux données et capture donc aussi leur bruit. À l'inverse, un modèle trop simple n'aura de bonnes performances ni sur les données d'entraînement, ni en généralisation.
3.6 — Liens avec les autres notions
Ce chapitre pose la bifurcation majeure du cours : la branche supervisée est développée dans les chapitres 4 (classification) et 7 (régression), tandis que la branche non supervisée est traitée au chapitre 9. Les cinq algorithmes du chapitre 4 (régression logistique, KNN, SVM, arbres, forêts aléatoires) sont tous des réalisations spécifiques de la fonction de décision g(x⃗) introduite ici.
- Apprentissage supervisé : f(x⃗) = y + ε, avec étiquettes y connues.
- Classification binaire (𝒴 = {0,1}), multi-classe (𝒴 = {1,…,C}), régression (𝒴 = ℝ).
- Fonction de décision g(X) et régions Rc partitionnent l'espace.
- Sous-apprentissage = trop simple ; sur-apprentissage = trop complexe.
- Score g(x⃗) continu vs prédiction f(x⃗) catégorielle après seuillage.
- Définissez une fonction de décision g(x⃗) en classification binaire.
- Expliquez comment gc(x⃗) définit les régions Rc en multi-classe.
- Décrivez la différence visuelle entre frontières sous-ajustée, appropriée et sur-ajustée.
- Quel est l'effet d'une augmentation de la complexité du modèle sur l'erreur d'entraînement et l'erreur de test ?
- Que représente le terme ε dans la formule f(x⃗) = y + ε ?