Fondements mathématiques
Cette page rassemble les prérequis mathématiques mobilisés dans le cours. Elle ne remplace pas les chapitres : elle explique les outils qui reviennent à plusieurs endroits, avec des mini-leçons courtes et concrètes. Pour chaque prérequis, l'objectif est une compréhension intuitive et opérationnelle, pas un apprentissage par cœur.
- Identifier les cinq domaines mathématiques mobilisés par le cours.
- Distinguer les prérequis bloquants, utiles et optionnels.
- Maîtriser les 5 mini-leçons : vecteurs, distances, sigmoïde, moyenne/sommation, dérivées.
- Savoir dans quel chapitre chaque prérequis est utilisé.
1. Les cinq domaines mathématiques mobilisés
Pour appréhender le cours dans sa totalité, cinq domaines mathématiques et statistiques sont sollicités à des degrés divers. Les connaître permet de savoir où porter son effort.
| Domaine | Éléments mobilisés dans le cours |
|---|---|
| Algèbre linéaire et géométrie vectorielle |
|
| Analyse et fonctions |
|
| Statistiques et probabilités |
|
| Optimisation et calcul différentiel |
|
| Théorie des graphes (bases) |
|
2. Priorisation des prérequis
Tous les prérequis n'ont pas la même importance pour réussir l'examen. Voici un classement en trois niveaux, fondé sur la nécessité effective dans le cours.
Prérequis bloquants
Leur non-maîtrise bloque la compréhension des chapitres concernés.
- Vecteurs et matrice de design (algèbre linéaire) — Chapitre 2.
- Distances et normes (Euclidienne, Manhattan) — Chapitre 4 (KNN) et Chapitre 5 (clustering).
- Fonction exponentielle et sigmoïde (analyse) — Chapitre 4 (régression logistique).
- Moyenne empirique et opérateur de sommation (statistiques) — Chapitre 7 (MCO) et Chapitre 8 (métriques).
- Dérivées et points critiques / minimisation (optimisation) — Chapitre 7 (MCO).
Prérequis utiles
Ils facilitent la compréhension mais ne sont pas immédiatement bloquants.
- Écriture matricielle et inversion (XTX)−1XTY — Chapitre 7.
- Distribution normale / bruit gaussien ε ∼ 𝒩(0, σ²) — Chapitre 7.
- Logarithme naturel — Chapitre 8 (RMSLE).
- Probabilités conditionnelles et seuillage — Chapitre 4 (régression logistique).
Prérequis optionnels
Contexte théorique avancé non évalué directement.
- Géométrie des hyperplans et optimisation duale sous contraintes (SVM).
- Entropie / théorie de l'information (arbres C4.5 / CART).
Mini-Leçon 1 — Vecteurs et matrice de design
Un vecteur est une liste ordonnée de nombres décrivant une seule observation (une fiche profil). Une matrice est un tableau réunissant plusieurs profils sous forme de grille : chaque ligne représente une personne ou un objet, chaque colonne représente une caractéristique mesurée.
Problème résolu : comment représenter numériquement des objets du monde réel décrits par plusieurs mesures distinctes (âge, poids, pression artérielle, etc.) afin qu'un ordinateur puisse les traiter de manière unifiée et simultanée.
Considérons 2 patients décrits par 2 mesures (âge en années, tension artérielle en mmHg) :
- Patient 1 : 30 ans, 120 mmHg.
- Patient 2 : 50 ans, 140 mmHg.
Chaque patient est représenté par son vecteur d'attributs :
La matrice de design X rassemble l'ensemble de ces données :
- x⃗i ∈ ℝp : vecteur colonne de la i-ième observation contenant p variables.
- X ∈ ℝn×p : matrice de données de n lignes (observations) et p colonnes (variables).
- xij : valeur numérique située à la i-ième ligne et j-ième colonne.
Connexion directe avec le cours : c'est le format d'entrée universel requis par tous les algorithmes (chapitres 2, 3, 7 et 10).
Question de vérification : si une étude botanique mesure 4 caractéristiques sur 150 fleurs d'Iris, quelles sont les dimensions n et p de X ? (Réponse : n = 150, p = 4, donc X ∈ ℝ150 × 4.)
Mini-Leçon 2 — Distances Euclidienne et Manhattan
- La distance euclidienne correspond à la trajectoire la plus courte à vol d'oiseau (hypoténuse du théorème de Pythagore).
- La distance de Manhattan mesure le déplacement le long d'une grille orthogonale (comme un taxi évoluant dans les rues à angles droits).
Problème résolu : quantifier la « ressemblance » ou la « proximité » entre deux objets décrits par plusieurs variables numériques.
Pour deux vecteurs u⃗ = (u1, …, up) et v⃗ = (v1, …, vp) dans ℝp :
Soit deux clients décrits par (âge, salaire en k€) : A = (23, 34) et B = (20, 30).
Écarts par variable : ΔÂge = 3, ΔSalaire = 4.
- Distance Euclidienne : √(3² + 4²) = √(9 + 16) = √25 = 5.
- Distance de Manhattan : |3| + |4| = 3 + 4 = 7.
Connexion directe avec le cours : indispensable pour KNN (chapitre 4), pour attribuer un point au centroïde le plus proche dans K-Means (chapitre 10), et pour construire les matrices de distance en clustering hiérarchique (chapitre 11).
Question de vérification : soit deux points u⃗ = (3, 0) et v⃗ = (0, 4). Quelle est la distance de Manhattan entre u⃗ et v⃗ ? (Réponse : |3−0| + |0−4| = 3 + 4 = 7.)
Mini-Leçon 3 — Fonction exponentielle et sigmoïde
La fonction sigmoïde est un « écraseur » en forme de S. Si le score z est très grand positif, elle le compresse près de 1. S'il est très grand négatif, elle le compresse près de 0. Si z = 0, elle renvoie exactement 0,5 (incertitude totale).
Problème résolu : une combinaison linéaire de variables z = w1x1 + w2x2 + b produit un score continu allant de −∞ à +∞. Comment convertir ce score en une probabilité valide, c'est-à-dire un nombre strictement borné entre 0 et 1 ?
- Score neutre z = 0 (sachant que e⁰ = 1) :
σ(0) = 1 / (1 + 1) = 1/2 = 0,5 (50 %). - Score positif z = 2,197 (où e−2,197 ≈ 0,111) :
σ(2,197) = 1 / (1 + 0,111) ≈ 1/1,111 ≈ 0,90 (90 %). - Score négatif z = −6 :
σ(−6) = 1 / (1 + e⁶) ≈ 1 / (1 + 403,4) ≈ 0,0025 (0,25 %).
- z ∈ ℝ : le score intermédiaire (combinaison linéaire des caractéristiques).
- σ(z) ∈ ]0, 1[ : la probabilité prédite d'appartenir à la classe positive.
- e ≈ 2,71828 : la base du logarithme népérien.
Connexion directe avec le cours : cœur algorithmique de la régression logistique (chapitre 4) : transformation du score continu en probabilité, puis seuillage à 0,5.
Question de vérification : si le calcul de la combinaison linéaire d'un patient donne z = −6, sa probabilité prédite sera-t-elle plus proche de 0, de 0,5 ou de 1 ? (Réponse : très proche de 0.)
Mini-Leçon 4 — Moyenne empirique et opérateur de sommation
La moyenne empirique est le centre de gravité d'un ensemble de nombres : on additionne toutes les valeurs puis on divise par le nombre total. Le symbole de sommation ∑ est simplement une consigne qui dit : « additionne tous les termes qui suivent ».
Problème résolu : résumer une série d'observations en une valeur centrale représentative, ou mesurer l'erreur moyenne commise par un modèle.
Lecture de la notation : ∑i=1n xi signifie « somme de x1 jusqu'à xn ».
Un modèle de régression prédit le prix de 3 pizzas. Les erreurs commises (écart = prédiction − prix réel) sont : ε1 = −2 €, ε2 = +3 €, ε3 = +5 €.
- Erreur moyenne simple : ε̄ = (−2 + 3 + 5) / 3 = 6/3 = 2 €.
- Erreur quadratique moyenne (MSE) — on élève au carré pour éliminer les signes négatifs : MSE = ((−2)² + 3² + 5²) / 3 = (4 + 9 + 25) / 3 = 38/3 ≈ 12,67 €².
Connexion directe avec le cours : nécessaire pour le calcul des centroïdes μk dans K-Means (chapitre 10), pour les moyennes empiriques dans les MCO (chapitre 7), et pour toutes les métriques d'erreur de régression (MSE, MAE, RMSE — chapitre 8).
Question de vérification : soit deux erreurs de prédiction ε1 = 4 et ε2 = −4. Quelle est la MSE ? (Réponse : MSE = (4² + (−4)²) / 2 = (16 + 16) / 2 = 16.)
Mini-Leçon 5 — Dérivées et points critiques / Minimisation
Imaginez la fonction d'erreur sous la forme d'une courbe en U (une parabole). Le point le plus bas de la courbe représente l'erreur minimale. Tout au fond du creux, la pente de la tangente est parfaitement horizontale (sa dérivée est nulle). Trouver le minimum consiste donc à chercher l'endroit où la dérivée s'annule.
Problème résolu : déterminer automatiquement les meilleurs paramètres d'un modèle (par exemple, la pente a et l'ordonnée à l'origine b d'une droite de régression) afin que l'erreur globale soit la plus faible possible.
Soit la fonction d'erreur simple dépendant d'un paramètre a : E(a) = a² − 6a + 11.
- Calcul de la dérivée par rapport à a : E′(a) = 2a − 6.
- Recherche du point critique (annulation de la dérivée) : 2a − 6 = 0 ⟹ 2a = 6 ⟹ a = 3.
- Erreur minimale : E(3) = 3² − 6 × 3 + 11 = 9 − 18 + 11 = 2.
Le paramètre optimal est â = 3, donnant une erreur minimale de 2.
- dE/da ou E′(a) : dérivée de la fonction d'erreur E par rapport au paramètre a.
- Équation normale / stationnaire : dE/da = 0.
- arg mina E(a) : la valeur de a qui rend E(a) minimale.
Connexion directe avec le cours : principe fondateur de la Minimisation du Risque Empirique (MRE) par la méthode des Moindres Carrés Ordinaires (MCO) en régression linéaire (chapitre 7). C'est cette démarche qui conduit aux formules analytiques de â et b̂.
Question de vérification : soit la fonction de coût f(w) = w² − 8w + 20. Pour quelle valeur du poids w la dérivée f′(w) s'annule-t-elle ? (Réponse : f′(w) = 2w − 8 = 0 ⟹ w = 4.)
3. Ordre d'apprentissage optimal
Pour optimiser votre temps de révision avant chaque chapitre, voici le chemin le plus court et le plus efficace. Étudiez le prérequis juste avant d'aborder le chapitre correspondant.
| Avant le chapitre… | Prérequis à maîtriser |
|---|---|
| Chapitres 1 & 2 (Introduction, Données) |
|
| Chapitre 3 (Classification & évaluation) |
|
| Chapitre 4 (Régression) |
|
| Chapitre 5 (Non supervisé — Clustering) |
|
4. Tableau de correspondance prérequis × chapitre
Vue synthétique : quel prérequis est utilisé dans quel chapitre du cours.
| Prérequis | Ch. 1 | Ch. 2 | Ch. 3 | Ch. 4 | Ch. 5 | Ch. 6 | Ch. 7 | Ch. 8 | Ch. 9 | Ch. 10 | Ch. 11 |
|---|---|---|---|---|---|---|---|---|---|---|---|
| Vecteurs et matrice X | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ||
| Distances Euclidienne & Manhattan | ✅ | ✅ | ✅ | ✅ | |||||||
| Exponentielle & sigmoïde | ✅ | ✅ | |||||||||
| Sommation & moyenne empirique | ✅ | ✅ | ✅ | ||||||||
| Dérivées & points critiques | ✅ | ||||||||||
| Inversion matricielle (XTX)−1 | ✅ | ||||||||||
| Bruit gaussien ε ∼ 𝒩(0, σ²) | ✅ | ||||||||||
| Logarithme naturel | ✅ | ||||||||||
| Théorie des graphes (bases, MST) | ✅ |
- Cinq domaines mathématiques : algèbre linéaire, analyse, statistiques/probabilités, optimisation, graphes.
- Cinq prérequis bloquants : vecteurs/matrice, distances, sigmoïde, sommation/moyenne, dérivées.
- Mini-Leçon 1 : X ∈ ℝn×p, xij.
- Mini-Leçon 2 : Euclidienne √∑(ui−vi)², Manhattan ∑|ui−vi|.
- Mini-Leçon 3 : σ(z) = 1/(1+e−z), σ(0) = 0,5.
- Mini-Leçon 4 : x̄ = (1/n) ∑ xi, MSE = (1/n) ∑ (f(xi) − yi)².
- Mini-Leçon 5 : chercher E′(a) = 0 pour minimiser une fonction d'erreur.
- Écrire les dimensions X ∈ ℝn×p pour un jeu de données donné.
- Calculer une distance Euclidienne ou Manhattan entre deux points dans ℝ2 ou ℝ3.
- Calculer σ(z) pour z = 0, z = 1, z = −2.
- Calculer x̄ et ȳ d'un petit jeu de données.
- Trouver le minimum d'une fonction du type E(a) = a² − 6a + 11.