Corrigés et barèmes
Solutions détaillées des exercices et de l'examen blanc. Pour les calculs, chaque corrigé présente la formule appliquée, les étapes intermédiaires, le résultat et son interprétation. Pour les questions conceptuelles, les critères d'une réponse correcte et les erreurs courantes sont précisés.
Essayez chaque exercice par écrit avant de consulter le corrigé. Le corrigé est un outil de vérification, pas un substitut à l'entraînement.
Thème 1 — Fondements
Réponse attendue :
Soit E l'ensemble de toutes les tâches possibles, S un système, T ⊂ E l'ensemble des tâches d'entraînement, P : S × E → ℝ une mesure de performance, et Exp une expérience. Le système S apprend lors de l'expérience Exp si :
Éléments à mentionner obligatoirement (barème indicatif /6) :
- Formule correcte : 3 pts
- Définition de S, E, T, P, Exp : 2 pts
- Exemple concret cohérent : 1 pt
Erreurs courantes : utiliser < au lieu de ≤ ; évaluer la performance sur deux ensembles différents ; oublier de définir un symbole.
Réponse :
- Identifier et comprendre le besoin métier
- Localiser et récupérer les données
- Explorer et préparer les données
- Construire le modèle
- Évaluer et valider le modèle
- Déployer le modèle
Barème indicatif : 1 pt par étape dans le bon ordre.
Réponse attendue :
- Tâche T : détecter les piétons dans une image ou un flux vidéo.
- Performance P : taux de détection correcte (par exemple, précision/rappel moyens, ou proportion d'images où tous les piétons sont correctement identifiés).
- Expérience Exp : exposition à un grand nombre d'images annotées (piéton / non-piéton) pendant la phase d'entraînement.
Erreurs courantes : confondre T (tâche) et Exp (expérience) ; donner une mesure de performance vague.
Réponse attendue (éléments à mentionner) :
- Statistiques : inférence de modèles à partir des données (estimation de paramètres, tests d'hypothèses).
- Probabilités : modélisation de l'aléatoire (bruit ε, distributions).
- Optimisation : minimisation d'un critère (par exemple, risque empirique) pour estimer les paramètres d'un modèle.
- Informatique : implémentation d'algorithmes efficaces, gestion de grandes quantités de données.
Critère de réussite : au moins trois disciplines citées avec un apport concret.
Réponse attendue :
| Mode | Étiquettes | Objectif | Exemple |
|---|---|---|---|
| Supervisé | Oui, pour tous les exemples | Prédire la cible d'un nouvel exemple | Classification d'e-mails spam / non-spam |
| Non supervisé | Non | Extraire des régularités | Segmentation de clientèle |
| Semi-supervisé | Quelques exemples étiquetés | Combiner étiqueté et non étiqueté | Classification d'images avec peu d'annotations |
Thème 2 — Données et variables
| Variable | Type |
|---|---|
| Température en °C | Quantitative continue |
| Code postal | Qualitative nominale |
| Mention au BAC | Qualitative ordinale |
| Nombre de clics | Quantitative discrète |
| Couleur des yeux | Qualitative nominale |
| Nombre de pièces | Quantitative discrète |
- (a) Faux. Une variable nominale codée 1, 2, 3 reste qualitative ; la moyenne n'a pas de sens numérique.
- (b) Vrai. L'ordre logique autorise les comparaisons d'infériorité / supériorité.
- (c) Faux. Un fichier JSON est semi-structuré : il a une structure reconnue mais sans indexation propre aux bases de données.
X ∈ ℝ250 × 6 : 250 lignes (clients), 6 colonnes (variables).
Thème 3 — Cadre supervisé
g : 𝒳 → ℝ telle que f(X) = 0 ⟺ g(X) ≤ 0 et f(X) = 1 ⟺ g(X) > 0. Les régions sont R0 = {X | g(X) ≤ 0} et R1 = {X | g(X) > 0}.
Sur-apprentissage. Le modèle a appris le bruit du jeu d'entraînement. Remèdes : réduire la complexité du modèle, augmenter les données, utiliser la régularisation, faire de la validation croisée, utiliser un ensemble de validation.
- (a) Régression
- (b) Classification binaire
- (c) Clustering (non supervisé)
- (d) Classification multi-classe
- (e) Classification binaire
Thème 4 — Algorithmes de classification
σ(z) = 1 / (1 + e−z). σ(0) = 1 / (1 + 1) = 0,5. σ(2) = 1 / (1 + e−2) ≈ 1 / (1 + 0,1353) ≈ 0,881.
Euclidienne : √((4−1)² + (6−2)²) = √(9 + 16) = √25 = 5. Manhattan : |4−1| + |6−2| = 3 + 4 = 7.
(a) z = 0,5 × 2 + (−2,0) × 1 + 1,0 = 1 − 2 + 1 = 0.
(b) σ(0) = 0,5.
(c) σ(z) = 0,5 n'est pas strictement supérieur à 0,5 : la règle stricte donne f(x⃗) = 0. (Certains manuels acceptent le seuil « ≥ » et prédiraient 1 ; la convention du cours est > 0,5 → 1.)
| Critère | KNN | K-Means |
|---|---|---|
| Objectif | Classer une nouvelle observation | Partitionner en K clusters |
| Type | Supervisé | Non supervisé |
| Entrée | Données étiquetées + nouvelle observation | Données non étiquetées |
| Sortie | Classe ou valeur prédite | Partition en K clusters |
| Hyperparamètre | k (nombre de voisins) | K (nombre de clusters) |
Les vecteurs de support sont situés exactement sur les hyperplans H+ ou H−. Ils « soutiennent » ces hyperplans : tout déplacement les déplace et déplace donc l'hyperplan séparateur. Un point non-vecteur de support est situé strictement à l'intérieur de sa région, à une distance de l'hyperplan supérieure à la marge : il n'affecte pas les équations des hyperplans support, donc pas le classifieur.
(a) Classification : q = √100 = 10.
(b) Régression : q = p / 3 ≈ 33.
Thème 5 — Évaluation en classification
n = 50 + 10 + 5 + 135 = 200.
- Précision = 50 / (50 + 10) = 50/60 ≈ 0,8333 (83,33 %)
- Rappel = 50 / (50 + 5) = 50/55 ≈ 0,9091 (90,91 %)
- Spécificité = 135 / (10 + 135) = 135/145 ≈ 0,9310 (93,10 %)
- F1 = 2 × 50 / (2 × 50 + 10 + 5) = 100 / 115 ≈ 0,8696 (86,96 %)
- Accuracy = (50 + 135) / 200 = 185/200 = 0,9250 (92,50 %)
Sur un jeu déséquilibré (par exemple 1 % de positifs), un classifieur qui prédit toujours « négatif » obtient 99 % d'accuracy mais 0 % de rappel. L'accuracy ne reflète donc pas la performance réelle sur la classe minoritaire. Alternatives : Rappel (taux de vrais positifs, crucial en médical) et F1-score (compromis précision-rappel, utile en fraude).
En fraude, les FN coûtent très cher (fraude non détectée), donc on privilégie le Rappel. Les FP (fausses alertes) coûtent du temps d'investigation mais restent supportables. Si les FP deviennent trop coûteux, on peut basculer vers le F1-score.
Matrice de confusion :
| Prédit Malin | Prédit Bénin | |
|---|---|---|
| Réel Malin | 38 (TP) | 5 (FN) |
| Réel Bénin | 2 (FP) | 69 (TN) |
- Accuracy = (38 + 69) / 114 = 107/114 ≈ 0,9386 (93,86 %)
- Rappel = 38 / 43 ≈ 0,8837 (88,37 %)
- Précision = 38 / 40 = 0,9500 (95,00 %)
- Spécificité = 69 / 71 ≈ 0,9718 (97,18 %)
- F1 = 2 × 38 / (2 × 38 + 2 + 5) = 76 / 83 ≈ 0,9157
Thème 6 — Régression
x̄ = (0 + 2 + 4) / 3 = 2 ; ȳ = (1 + 5 + 9) / 3 = 5.
| i | xi | yi | xi−x̄ | yi−ȳ | (xi−x̄)² | (xi−x̄)(yi−ȳ) |
|---|---|---|---|---|---|---|
| 1 | 0 | 1 | −2 | −4 | 4 | 8 |
| 2 | 2 | 5 | 0 | 0 | 0 | 0 |
| 3 | 4 | 9 | 2 | 4 | 4 | 8 |
| Σ | 8 | 16 |
â = 16 / 8 = 2 ; b̂ = 5 − 2 × 2 = 1.
f̂(x) = 2x + 1.
β̂ = (XTX)−1XTY. Condition : XTX inversible, c'est-à-dire rg(X) = p + 1 (pas de colinéarité parfaite entre variables).
Oui, la régression polynomiale est un modèle linéaire au sens statistique : elle est linéaire en les paramètres β, même si elle est non linéaire en les variables x. C'est cette linéarité en les paramètres qui permet d'appliquer les formules MCO standard.
Écarts : ε1 = 6 − 7 = −1, ε2 = 8 − 9 = −1, ε3 = 11 − 13 = −2.
- MAE = (1 + 1 + 2) / 3 = 4/3 ≈ 1,333
- MSE = (1 + 1 + 4) / 3 = 6/3 = 2,000
- RMSE = √2 ≈ 1,414
- RMSLE = √[ (1/3) × ((log 7 − log 8)² + (log 9 − log 10)² + (log 12 − log 14)²) ] ≈ 0,116
Thème 7 — Non supervisé
Les 4 étapes de l'algorithme de Lloyd :
- Initialisation : choisir K observations comme centroïdes initiaux.
- Affectation : assigner chaque point au centroïde le plus proche.
- Mise à jour : recalculer chaque centroïde comme moyenne des points de son cluster.
- Convergence : répéter 2 et 3 jusqu'à ce que les affectations ne changent plus.
Mise à jour : μk = (1/|Ck|) ∑xi ∈ Ck xi.
μ1 = ((0, 0) + (4, 4)) / 2 = (2, 2).
Inertie = ‖(0,0) − (2,2)‖² + ‖(4,4) − (2,2)‖² = (4 + 4) + (4 + 4) = 16.
Distances individuelles :
- d((0,0), (0,3)) = 3,000
- d((1,0), (0,3)) = √(1 + 9) = √10 ≈ 3,162
- Lien simple : min = 3,000
- Lien complet : max = 3,162
- Lien moyen : (3,000 + 3,162) / 2 ≈ 3,081
Complexité en θ(n²) car il faut calculer et mettre à jour une matrice de distances entre toutes les paires de clusters. Pour n = 10⁵, cela représente 10¹⁰ distances, ce qui est prohibitif en mémoire et en temps.
| Critère | K-Means | Hiérarchique agglomératif |
|---|---|---|
| K fixé à l'avance | Oui | Non (choisi après coup) |
| Complexité | θ(tKn) | θ(n²) |
| Sensible à l'initialisation | Oui | Non |
| Forme des clusters | Sphérique / convexe | Flexible selon le lien |
Il n'y a pas de vérité terrain. Critères : distances intra / extra clusters, jugement expert, données étiquetées (si disponibles), comparaison avec une segmentation de référence.
Thème 8 — Transversal
Réponse libre. Éléments attendus :
- Besoin métier : prédiction du risque cardiaque, avec un objectif médical clair (ne pas manquer un patient à risque).
- Variables : âge (continue), sexe (nominale), fumeur (nominale), corpulence (ordinale ou continue), etc.
- Matrice X : chaque patient en ligne, chaque variable en colonne.
- Mode : supervisé, classification binaire.
- Algorithmes : régression logistique, arbres, forêts, SVM.
- Métriques : Rappel en priorité (cas manqués critiques), F1-score, courbe ROC / AUROC.
Compromis biais-variance :
- KNN : petit k → variance élevée, biais faible (sur-apprentissage) ; grand k → biais élevé, variance faible (sous-apprentissage).
- Arbre : profondeur élevée → variance élevée ; profondeur faible → biais élevé.
- Régression polynomiale : degré élevé → variance élevée ; degré faible → biais élevé.
Configuration : rappel faible (60 %), précision élevée (98 %), accuracy élevée (95 %). Le modèle est conservateur : il ne prédit positif que lorsqu'il est très sûr, mais rate de nombreux positifs. Acceptable si les FP coûtent très cher (par exemple, alerte de sécurité). Non acceptable si les FN sont critiques (dépistage médical). Compromis typique : précision vs rappel.
Corrigé de l'examen blanc
Partie A — Questions de cours (30 points)
Formule : 3 pts. Définitions : 2 pts. Exemple concret : 1 pt. Voir Exercice 1.1 pour la réponse complète.
6 étapes : 3 pts (0,5 pt par étape). Différence préparation/modélisation : 3 pts. Voir Exercice 1.2 et chapitre 1 pour les réponses détaillées.
Définition de g(x) : 2 pts. Régions binaires : 2 pts. Extension multi-classe : 2 pts.
Définitions des trois phénomènes : 3 pts. Détection expérimentale : 2 pts. Condition V ∩ T = ∅ : 1 pt.
1,5 pt par variable bien classée avec les opérations autorisées.
Partie B — Algorithmes (25 points)
Tableau complet correct : 8 pts. Pénalités : 1 pt par critère manquant ou incorrect.
Définitions (marge, H⁺, H⁻, zone d'indécision) : 3 pts. Vecteurs de support : 2 pts. Explication sur les perturbations : 3 pts.
KNN : 3 pts. Compromis biais-variance : 2 pts. Forêts aléatoires : 3 pts. Valeurs par défaut de q : 1 pt.
Partie C — Calculs (25 points)
(a) z = 0,5 × 2 − 2 × 1 + 1 = 0 (2 pts).
(b) σ(0) = 0,5 (2 pts).
(c) f(x⃗) = 0 (car 0,5 n'est pas strictement supérieur à 0,5) (2 pts).
(d) Interprétation : cas limite, le modèle est indécis (2 pts).
Précision ≈ 0,8333 (1,5 pt). Rappel ≈ 0,9091 (1,5 pt). Spécificité ≈ 0,9310 (1,5 pt). F1 ≈ 0,8696 (1,5 pt). Accuracy = 0,9250 (1,5 pt). Interprétation (1,5 pt).
(a) x̄ = 2, ȳ = 4 (1 pt).
(b) Tableau de travail (2 pts) ; â = 2,5 (2 pts) ;
b̂ = −1 (1 pt).
(c) f̂(x) = 2,5x − 1 (1 pt).
(d) ŷ = 9 (1 pt).
Partie D — Non supervisé (20 points)
4 étapes (0,75 pt chacune) : 3 pts. Inertie (formule) : 2 pts. Mise à jour centroïde : 2 pts.
Centroïde μ = (2, 2) (2 pts). Inertie = 16 (3 pts). Interprétation (1 pt).
Distances individuelles : 2 pts. Lien simple = 3 (1 pt). Lien complet = √10 ≈ 3,162 (1 pt). Lien moyen ≈ 3,081 (1 pt). Interprétation sur les structures (2 pts).
Grille de notation globale
| Partie | Thème | Points |
|---|---|---|
| A | Questions de cours | 30 |
| B | Algorithmes | 25 |
| C | Calculs | 25 |
| D | Non supervisé | 20 |
| Total | 100 | |