Chapitre 7 — Régression et Moindres Carrés Ordinaires

🎯 Objectifs d'apprentissage
  • Formaliser un problème de régression : 𝒴 = ℝ et prédicteur f̂.
  • Dériver et appliquer les formules analytiques de la régression linéaire simple (â et b̂).
  • Écrire la régression linéaire multiple sous forme vectorielle/matricielle.
  • Écrire et utiliser la solution fermée β̂ = (XTX)−1XTY.
  • Comprendre la régression polynomiale comme une régression linéaire sur des variables transformées.

7.1 — Le problème à résoudre

Contrairement à la classification, où la cible est discrète (y ∈ {0, 1} ou {1, …, C}), la régression traite d'une cible continue y ∈ ℝ. L'objectif est de déterminer une fonction f qui représente la relation entre les variables explicatives X et la cible y, en se trompant le moins possible en généralisation. main_4.pdf, p. 4

💡 Intuition

Imaginez qu'on plante des clous sur une planche de bois (les points de données). On tend un élastique droit au milieu de ces clous. L'élastique va naturellement se positionner là où la tension globale (la somme des distances au carré) est la plus faible possible. Cette droite d'équilibre est la droite de régression par les Moindres Carrés Ordinaires (MCO).

7.2 — Formalisation

Étant donné un jeu de données de n observations :

E= { (x1,y1) ,…, (xi,yi) ,…, (xn,yn) }

avec xi ∈ ℝp et yi ∈ ℝ. On cherche à exprimer la dépendance entre x et y par une fonction f :

y=f(X)+ε

L'objectif est de déterminer f afin de prédire correctement ŷ = f(x) pour un vecteur x quelconque. On parle également de prédicteur pour la fonction f̂.

🔗 Lien mathématique — hypothèse de bruit gaussien

On fait l'hypothèse que les erreurs (différence entre les étiquettes réelles et les valeurs de f) sont normalement distribuées, centrées en 0 :

ε∼ 𝒩(0,σ2)

Les observations x sont la réalisation de p variables aléatoires réelles, et les étiquettes y sont la réalisation d'une variable aléatoire réelle Y telle que P(Y=y | X=x) ∼ 𝒩(f(x), σ²).

main_4.pdf, p. 6

7.3 — Classes de fonctions f

TypeFormeComplexité
Régression linéaire simplef(x) = ax + bFaible (2 paramètres)
Polynôme de degré df(x) = adxd + … + a1x + a0Croît avec d
Autres fonctionsExponentielles, logarithmes, etc.Variable
main_4.pdf, p. 5

7.4 — Risque empirique et MCO

📘 Définition à connaître

Le risque empirique Remp(f) de f est la moyenne des carrés des erreurs de prédiction faites par f, calculée sur E :

Remp(f) = ∑i=1n (yi−f(xi))2 = ∑i=1n εi2

Trouver le bon prédicteur revient à minimiser Remp(f) :

arg⁡minfβ Remp(fβ)

C'est ce qu'on appelle la Minimisation des Moindres Carrés Ordinaires (MCO), ou Residual Sum of Squares.

main_4.pdf, p. 8

7.5 — Régression linéaire simple

On suppose f(X) = aX + b. On cherche à minimiser :

Remp(a,b) = ∑i=1n (yi−(axi+b))2

Solution analytique

En annulant les dérivées partielles (points critiques), on obtient :

a^ = ∑i=1n (xi−x¯) (yi−y¯) ∑i=1n (xi−x¯)2
b^ = y¯ − a^ x¯

où les moyennes empiriques sont : x̄ = (1/n) ∑ xi et ȳ = (1/n) ∑ yi.

main_4.pdf, p. 10
✏️ Exemple guidé — Régression linéaire simple

Soit le jeu de données E = {(1, 2), (2, 3), (3, 7)} avec n = 3.

Étape 1 — Moyennes empiriques :

  • x̄ = (1 + 2 + 3) / 3 = 2,0
  • ȳ = (2 + 3 + 7) / 3 = 4,0

Étape 2 — Tableau de travail :

ixiyixi − x̄yi − ȳ(xi − x̄)²(xi−x̄)(yi−ȳ)
112−1−212
2230−100
3371313
Σ25

Étape 3 — Pente : â = 5 / 2 = 2,5

Étape 4 — Ordonnée à l'origine : b̂ = 4,0 − 2,5 × 2,0 = −1,0

Étape 5 — Droite finale : f̂(x) = 2,5x − 1,0

Interprétation : chaque augmentation d'une unité de x entraîne une hausse estimée de 2,5 unités de y. Pour x = 4, la prédiction sera ŷ = 2,5 × 4 − 1 = 9,0.

⚠️ Attention — pièges classiques
  • Inversion des termes dans la formule de â : mettre les écarts de y au dénominateur au lieu des écarts de x.
  • Oubli du terme de biais b̂ : forcer la droite à passer par l'origine (b = 0) fausse les prédictions.

7.6 — Régression linéaire multiple

On suppose que f est un polynôme multivarié sur X (c'est-à-dire x ∈ ℝp avec p > 1). Les paramètres sont : β1 = (a1, …, ap) ∈ ℝp et β0 = ap+1 ∈ ℝ. La fonction s'écrit :

f(x) = β1T x + β0 = ∑j=1p ajxj + ap+1

Formulation matricielle

On ajoute à la matrice de design X ∈ ℝn×p une colonne de 1 à droite :

X = ( x11⋯x1p1 ⋮⋱⋮⋮ xn1⋯xnp1 ) , Y = ( y1 ⋮ yn ) , β = ( a1 ⋮ ap+1 )

La somme des moindres carrés s'écrit alors :

Remp(β) = (Y−Xβ)T (Y−Xβ)
📘 Solution analytique matricielle (MCO)

Si le rang de X est égal à son nombre de colonnes, alors la somme des moindres carrés est minimisée pour :

β^ = (XTX)−1 XT Y

où XT est la transposée de X. La matrice XTX doit être inversible (pas de colinéarité parfaite entre variables).

main_4.pdf, p. 13
✏️ Exemple guidé — Régression linéaire multiple (matriciel)

Reprenons l'exemple de la section 7.5 avec n = 3, p = 1. Ajoutons la colonne de 1 :

X= ( 11 21 31 ) , Y= ( 2 3 7 )

Étape 1 — Transposée :

XT = ( 123 111 )

Étape 2 — Produit XTX :

XTX = ( 146 63 )

Étape 3 — Inverse : déterminant det = 14 × 3 − 6 × 6 = 42 − 36 = 6.

(XTX)−1 = 16 ( 3−6 −614 )

Étape 4 — Vecteur XTY :

XTY = ( 29 12 )

Étape 5 — Estimation :

β^ = 16 ( 3−6 −614 ) ( 29 12 ) = ( 2,5 −1,0 )

Les résultats sont identiques à ceux obtenus par la méthode scalaire : â = 2,5 et b̂ = −1,0.

7.7 — Régression polynomiale

En régression polynomiale de degré d, on cherche une fonction :

f(x) = β0 + β1Tx + β2Tx2 +⋯+ βdTxd

Il s'agit en fait d'une régression linéaire sur p × d variables : x1, …, xp, x1², …, xpd.

⚠️ Attention — « modèle linéaire » ne signifie pas « fonction linéaire »

On parle de modèle linéaire car f est linéaire en les paramètres β, même si les variables d'entrée sont au carré ou au cube. C'est une nuance cruciale : le modèle reste un modèle linéaire au sens statistique du terme.

7.8 — Liens avec les autres chapitres

La régression réutilise la matrice de design X du chapitre 2 et sert de base linéaire avant la transformation sigmoïde de la régression logistique du chapitre 4. Les métriques d'évaluation (MSE, MAE, RMSE, RMSLE) font l'objet du chapitre 8.

📌 À retenir
  • Régression : y = f(x) + ε, avec ε ∼ 𝒩(0, σ²).
  • Risque empirique : Remp = ∑ (yi − f(xi))².
  • Simple : â = Cov(x, y) / Var(x), b̂ = ȳ − âx̄.
  • Multiple : β̂ = (XTX)−1XTY (si XTX inversible).
  • Polynomiale : régression linéaire sur variables transformées.
🎯 À l'examen
  1. Écrivez la formule fermée matricielle de l'estimateur des MCO.
  2. Que se passe-t-il si XTX n'est pas inversible ?
  3. Soit trois erreurs de prédiction +2, −2, +4. Calculez la MAE et la MSE.
  4. Pourquoi utilise-t-on la métrique RMSLE au lieu de la RMSE lorsque les données couvrent plusieurs ordres de grandeur ?
  5. Quelle est l'hypothèse faite sur la distribution des erreurs ε en régression linéaire ?