Chapitre 7 — Régression et Moindres Carrés Ordinaires
- Formaliser un problème de régression : 𝒴 = ℝ et prédicteur f̂.
- Dériver et appliquer les formules analytiques de la régression linéaire simple (â et b̂).
- Écrire la régression linéaire multiple sous forme vectorielle/matricielle.
- Écrire et utiliser la solution fermée β̂ = (XTX)−1XTY.
- Comprendre la régression polynomiale comme une régression linéaire sur des variables transformées.
7.1 — Le problème à résoudre
Contrairement à la classification, où la cible est discrète (y ∈ {0, 1} ou {1, …, C}), la régression traite d'une cible continue y ∈ ℝ. L'objectif est de déterminer une fonction f qui représente la relation entre les variables explicatives X et la cible y, en se trompant le moins possible en généralisation. main_4.pdf, p. 4
Imaginez qu'on plante des clous sur une planche de bois (les points de données). On tend un élastique droit au milieu de ces clous. L'élastique va naturellement se positionner là où la tension globale (la somme des distances au carré) est la plus faible possible. Cette droite d'équilibre est la droite de régression par les Moindres Carrés Ordinaires (MCO).
7.2 — Formalisation
Étant donné un jeu de données de n observations :
avec xi ∈ ℝp et yi ∈ ℝ. On cherche à exprimer la dépendance entre x et y par une fonction f :
L'objectif est de déterminer f afin de prédire correctement ŷ = f(x) pour un vecteur x quelconque. On parle également de prédicteur pour la fonction f̂.
On fait l'hypothèse que les erreurs (différence entre les étiquettes réelles et les valeurs de f) sont normalement distribuées, centrées en 0 :
Les observations x sont la réalisation de p variables aléatoires réelles, et les étiquettes y sont la réalisation d'une variable aléatoire réelle Y telle que P(Y=y | X=x) ∼ 𝒩(f(x), σ²).
main_4.pdf, p. 67.3 — Classes de fonctions f
| Type | Forme | Complexité |
|---|---|---|
| Régression linéaire simple | f(x) = ax + b | Faible (2 paramètres) |
| Polynôme de degré d | f(x) = adxd + … + a1x + a0 | Croît avec d |
| Autres fonctions | Exponentielles, logarithmes, etc. | Variable |
7.4 — Risque empirique et MCO
Le risque empirique Remp(f) de f est la moyenne des carrés des erreurs de prédiction faites par f, calculée sur E :
Trouver le bon prédicteur revient à minimiser Remp(f) :
C'est ce qu'on appelle la Minimisation des Moindres Carrés Ordinaires (MCO), ou Residual Sum of Squares.
main_4.pdf, p. 87.5 — Régression linéaire simple
On suppose f(X) = aX + b. On cherche à minimiser :
Solution analytique
En annulant les dérivées partielles (points critiques), on obtient :
où les moyennes empiriques sont : x̄ = (1/n) ∑ xi et ȳ = (1/n) ∑ yi.
main_4.pdf, p. 10Soit le jeu de données E = {(1, 2), (2, 3), (3, 7)} avec n = 3.
Étape 1 — Moyennes empiriques :
- x̄ = (1 + 2 + 3) / 3 = 2,0
- ȳ = (2 + 3 + 7) / 3 = 4,0
Étape 2 — Tableau de travail :
| i | xi | yi | xi − x̄ | yi − ȳ | (xi − x̄)² | (xi−x̄)(yi−ȳ) |
|---|---|---|---|---|---|---|
| 1 | 1 | 2 | −1 | −2 | 1 | 2 |
| 2 | 2 | 3 | 0 | −1 | 0 | 0 |
| 3 | 3 | 7 | 1 | 3 | 1 | 3 |
| Σ | 2 | 5 |
Étape 3 — Pente : â = 5 / 2 = 2,5
Étape 4 — Ordonnée à l'origine : b̂ = 4,0 − 2,5 × 2,0 = −1,0
Étape 5 — Droite finale : f̂(x) = 2,5x − 1,0
Interprétation : chaque augmentation d'une unité de x entraîne une hausse estimée de 2,5 unités de y. Pour x = 4, la prédiction sera ŷ = 2,5 × 4 − 1 = 9,0.
- Inversion des termes dans la formule de â : mettre les écarts de y au dénominateur au lieu des écarts de x.
- Oubli du terme de biais b̂ : forcer la droite à passer par l'origine (b = 0) fausse les prédictions.
7.6 — Régression linéaire multiple
On suppose que f est un polynôme multivarié sur X (c'est-à-dire x ∈ ℝp avec p > 1). Les paramètres sont : β1 = (a1, …, ap) ∈ ℝp et β0 = ap+1 ∈ ℝ. La fonction s'écrit :
Formulation matricielle
On ajoute à la matrice de design X ∈ ℝn×p une colonne de 1 à droite :
La somme des moindres carrés s'écrit alors :
Si le rang de X est égal à son nombre de colonnes, alors la somme des moindres carrés est minimisée pour :
où XT est la transposée de X. La matrice XTX doit être inversible (pas de colinéarité parfaite entre variables).
main_4.pdf, p. 13Reprenons l'exemple de la section 7.5 avec n = 3, p = 1. Ajoutons la colonne de 1 :
Étape 1 — Transposée :
Étape 2 — Produit XTX :
Étape 3 — Inverse : déterminant det = 14 × 3 − 6 × 6 = 42 − 36 = 6.
Étape 4 — Vecteur XTY :
Étape 5 — Estimation :
Les résultats sont identiques à ceux obtenus par la méthode scalaire : â = 2,5 et b̂ = −1,0.
7.7 — Régression polynomiale
En régression polynomiale de degré d, on cherche une fonction :
Il s'agit en fait d'une régression linéaire sur p × d variables : x1, …, xp, x1², …, xpd.
On parle de modèle linéaire car f est linéaire en les paramètres β, même si les variables d'entrée sont au carré ou au cube. C'est une nuance cruciale : le modèle reste un modèle linéaire au sens statistique du terme.
7.8 — Liens avec les autres chapitres
La régression réutilise la matrice de design X du chapitre 2 et sert de base linéaire avant la transformation sigmoïde de la régression logistique du chapitre 4. Les métriques d'évaluation (MSE, MAE, RMSE, RMSLE) font l'objet du chapitre 8.
- Régression : y = f(x) + ε, avec ε ∼ 𝒩(0, σ²).
- Risque empirique : Remp = ∑ (yi − f(xi))².
- Simple : â = Cov(x, y) / Var(x), b̂ = ȳ − âx̄.
- Multiple : β̂ = (XTX)−1XTY (si XTX inversible).
- Polynomiale : régression linéaire sur variables transformées.
- Écrivez la formule fermée matricielle de l'estimateur des MCO.
- Que se passe-t-il si XTX n'est pas inversible ?
- Soit trois erreurs de prédiction +2, −2, +4. Calculez la MAE et la MSE.
- Pourquoi utilise-t-on la métrique RMSLE au lieu de la RMSE lorsque les données couvrent plusieurs ordres de grandeur ?
- Quelle est l'hypothèse faite sur la distribution des erreurs ε en régression linéaire ?