Corrigés et barèmes

Solutions détaillées des exercices et de l'examen blanc. Pour les calculs, chaque corrigé présente la formule appliquée, les étapes intermédiaires, le résultat et son interprétation. Pour les questions conceptuelles, les critères d'une réponse correcte et les erreurs courantes sont précisés.

⚠️ Conseil

Essayez chaque exercice par écrit avant de consulter le corrigé. Le corrigé est un outil de vérification, pas un substitut à l'entraînement.

Thème 1 — Fondements

Exercice 1.1

Réponse attendue :

Soit E l'ensemble de toutes les tâches possibles, S un système, T ⊂ E l'ensemble des tâches d'entraînement, P : S × E → ℝ une mesure de performance, et Exp une expérience. Le système S apprend lors de l'expérience Exp si :

P(Savant Exp,T) ≤ P(Saprès Exp,T)

Éléments à mentionner obligatoirement (barème indicatif /6) :

  • Formule correcte : 3 pts
  • Définition de S, E, T, P, Exp : 2 pts
  • Exemple concret cohérent : 1 pt

Erreurs courantes : utiliser < au lieu de ≤ ; évaluer la performance sur deux ensembles différents ; oublier de définir un symbole.

Exercice 1.2

Réponse :

  1. Identifier et comprendre le besoin métier
  2. Localiser et récupérer les données
  3. Explorer et préparer les données
  4. Construire le modèle
  5. Évaluer et valider le modèle
  6. Déployer le modèle

Barème indicatif : 1 pt par étape dans le bon ordre.

Exercice 1.3

Réponse attendue :

  • Tâche T : détecter les piétons dans une image ou un flux vidéo.
  • Performance P : taux de détection correcte (par exemple, précision/rappel moyens, ou proportion d'images où tous les piétons sont correctement identifiés).
  • Expérience Exp : exposition à un grand nombre d'images annotées (piéton / non-piéton) pendant la phase d'entraînement.

Erreurs courantes : confondre T (tâche) et Exp (expérience) ; donner une mesure de performance vague.

Exercice 1.4

Réponse attendue (éléments à mentionner) :

  • Statistiques : inférence de modèles à partir des données (estimation de paramètres, tests d'hypothèses).
  • Probabilités : modélisation de l'aléatoire (bruit ε, distributions).
  • Optimisation : minimisation d'un critère (par exemple, risque empirique) pour estimer les paramètres d'un modèle.
  • Informatique : implémentation d'algorithmes efficaces, gestion de grandes quantités de données.

Critère de réussite : au moins trois disciplines citées avec un apport concret.

Exercice 1.5

Réponse attendue :

ModeÉtiquettesObjectifExemple
SuperviséOui, pour tous les exemplesPrédire la cible d'un nouvel exempleClassification d'e-mails spam / non-spam
Non superviséNonExtraire des régularitésSegmentation de clientèle
Semi-superviséQuelques exemples étiquetésCombiner étiqueté et non étiquetéClassification d'images avec peu d'annotations

Thème 2 — Données et variables

Exercice 2.1
VariableType
Température en °CQuantitative continue
Code postalQualitative nominale
Mention au BACQualitative ordinale
Nombre de clicsQuantitative discrète
Couleur des yeuxQualitative nominale
Nombre de piècesQuantitative discrète
Exercice 2.2
  • (a) Faux. Une variable nominale codée 1, 2, 3 reste qualitative ; la moyenne n'a pas de sens numérique.
  • (b) Vrai. L'ordre logique autorise les comparaisons d'infériorité / supériorité.
  • (c) Faux. Un fichier JSON est semi-structuré : il a une structure reconnue mais sans indexation propre aux bases de données.
Exercice 2.3

X ∈ ℝ250 × 6 : 250 lignes (clients), 6 colonnes (variables).

Thème 3 — Cadre supervisé

Exercice 3.1

g : 𝒳 → ℝ telle que f(X) = 0 ⟺ g(X) ≤ 0 et f(X) = 1 ⟺ g(X) > 0. Les régions sont R0 = {X | g(X) ≤ 0} et R1 = {X | g(X) > 0}.

Exercice 3.2

Sur-apprentissage. Le modèle a appris le bruit du jeu d'entraînement. Remèdes : réduire la complexité du modèle, augmenter les données, utiliser la régularisation, faire de la validation croisée, utiliser un ensemble de validation.

Exercice 3.3
  • (a) Régression
  • (b) Classification binaire
  • (c) Clustering (non supervisé)
  • (d) Classification multi-classe
  • (e) Classification binaire

Thème 4 — Algorithmes de classification

Exercice 4.1

σ(z) = 1 / (1 + e−z). σ(0) = 1 / (1 + 1) = 0,5. σ(2) = 1 / (1 + e−2) ≈ 1 / (1 + 0,1353) ≈ 0,881.

Exercice 4.2

Euclidienne : √((4−1)² + (6−2)²) = √(9 + 16) = √25 = 5. Manhattan : |4−1| + |6−2| = 3 + 4 = 7.

Exercice 4.3

(a) z = 0,5 × 2 + (−2,0) × 1 + 1,0 = 1 − 2 + 1 = 0.

(b) σ(0) = 0,5.

(c) σ(z) = 0,5 n'est pas strictement supérieur à 0,5 : la règle stricte donne f(x⃗) = 0. (Certains manuels acceptent le seuil « ≥ » et prédiraient 1 ; la convention du cours est > 0,5 → 1.)

Exercice 4.4
CritèreKNNK-Means
ObjectifClasser une nouvelle observationPartitionner en K clusters
TypeSuperviséNon supervisé
EntréeDonnées étiquetées + nouvelle observationDonnées non étiquetées
SortieClasse ou valeur préditePartition en K clusters
Hyperparamètrek (nombre de voisins)K (nombre de clusters)
Exercice 4.5

Les vecteurs de support sont situés exactement sur les hyperplans H+ ou H−. Ils « soutiennent » ces hyperplans : tout déplacement les déplace et déplace donc l'hyperplan séparateur. Un point non-vecteur de support est situé strictement à l'intérieur de sa région, à une distance de l'hyperplan supérieure à la marge : il n'affecte pas les équations des hyperplans support, donc pas le classifieur.

Exercice 4.6

(a) Classification : q = √100 = 10.

(b) Régression : q = p / 3 ≈ 33.

Thème 5 — Évaluation en classification

Exercice 5.1

n = 50 + 10 + 5 + 135 = 200.

  • Précision = 50 / (50 + 10) = 50/60 ≈ 0,8333 (83,33 %)
  • Rappel = 50 / (50 + 5) = 50/55 ≈ 0,9091 (90,91 %)
  • Spécificité = 135 / (10 + 135) = 135/145 ≈ 0,9310 (93,10 %)
  • F1 = 2 × 50 / (2 × 50 + 10 + 5) = 100 / 115 ≈ 0,8696 (86,96 %)
  • Accuracy = (50 + 135) / 200 = 185/200 = 0,9250 (92,50 %)
Exercice 5.2

Sur un jeu déséquilibré (par exemple 1 % de positifs), un classifieur qui prédit toujours « négatif » obtient 99 % d'accuracy mais 0 % de rappel. L'accuracy ne reflète donc pas la performance réelle sur la classe minoritaire. Alternatives : Rappel (taux de vrais positifs, crucial en médical) et F1-score (compromis précision-rappel, utile en fraude).

Exercice 5.3

En fraude, les FN coûtent très cher (fraude non détectée), donc on privilégie le Rappel. Les FP (fausses alertes) coûtent du temps d'investigation mais restent supportables. Si les FP deviennent trop coûteux, on peut basculer vers le F1-score.

Exercice 5.4

Matrice de confusion :

Prédit MalinPrédit Bénin
Réel Malin38 (TP)5 (FN)
Réel Bénin2 (FP)69 (TN)
  • Accuracy = (38 + 69) / 114 = 107/114 ≈ 0,9386 (93,86 %)
  • Rappel = 38 / 43 ≈ 0,8837 (88,37 %)
  • Précision = 38 / 40 = 0,9500 (95,00 %)
  • Spécificité = 69 / 71 ≈ 0,9718 (97,18 %)
  • F1 = 2 × 38 / (2 × 38 + 2 + 5) = 76 / 83 ≈ 0,9157

Thème 6 — Régression

Exercice 6.1

x̄ = (0 + 2 + 4) / 3 = 2 ; ȳ = (1 + 5 + 9) / 3 = 5.

ixiyixi−x̄yi−ȳ(xi−x̄)²(xi−x̄)(yi−ȳ)
101−2−448
2250000
3492448
Σ816

â = 16 / 8 = 2 ; b̂ = 5 − 2 × 2 = 1.

f̂(x) = 2x + 1.

Exercice 6.2

β̂ = (XTX)−1XTY. Condition : XTX inversible, c'est-à-dire rg(X) = p + 1 (pas de colinéarité parfaite entre variables).

Exercice 6.3

Oui, la régression polynomiale est un modèle linéaire au sens statistique : elle est linéaire en les paramètres β, même si elle est non linéaire en les variables x. C'est cette linéarité en les paramètres qui permet d'appliquer les formules MCO standard.

Exercice 6.4

Écarts : ε1 = 6 − 7 = −1, ε2 = 8 − 9 = −1, ε3 = 11 − 13 = −2.

  • MAE = (1 + 1 + 2) / 3 = 4/3 ≈ 1,333
  • MSE = (1 + 1 + 4) / 3 = 6/3 = 2,000
  • RMSE = √2 ≈ 1,414
  • RMSLE = √[ (1/3) × ((log 7 − log 8)² + (log 9 − log 10)² + (log 12 − log 14)²) ] ≈ 0,116

Thème 7 — Non supervisé

Exercice 7.1

Les 4 étapes de l'algorithme de Lloyd :

  1. Initialisation : choisir K observations comme centroïdes initiaux.
  2. Affectation : assigner chaque point au centroïde le plus proche.
  3. Mise à jour : recalculer chaque centroïde comme moyenne des points de son cluster.
  4. Convergence : répéter 2 et 3 jusqu'à ce que les affectations ne changent plus.

Mise à jour : μk = (1/|Ck|) ∑xi ∈ Ck xi.

Exercice 7.2

μ1 = ((0, 0) + (4, 4)) / 2 = (2, 2).

Inertie = ‖(0,0) − (2,2)‖² + ‖(4,4) − (2,2)‖² = (4 + 4) + (4 + 4) = 16.

Exercice 7.3

Distances individuelles :

  • d((0,0), (0,3)) = 3,000
  • d((1,0), (0,3)) = √(1 + 9) = √10 ≈ 3,162
  • Lien simple : min = 3,000
  • Lien complet : max = 3,162
  • Lien moyen : (3,000 + 3,162) / 2 ≈ 3,081
Exercice 7.4

Complexité en θ(n²) car il faut calculer et mettre à jour une matrice de distances entre toutes les paires de clusters. Pour n = 10⁵, cela représente 10¹⁰ distances, ce qui est prohibitif en mémoire et en temps.

Exercice 7.5
CritèreK-MeansHiérarchique agglomératif
K fixé à l'avanceOuiNon (choisi après coup)
Complexitéθ(tKn)θ(n²)
Sensible à l'initialisationOuiNon
Forme des clustersSphérique / convexeFlexible selon le lien
Exercice 7.6

Il n'y a pas de vérité terrain. Critères : distances intra / extra clusters, jugement expert, données étiquetées (si disponibles), comparaison avec une segmentation de référence.

Thème 8 — Transversal

Exercice 8.1

Réponse libre. Éléments attendus :

  • Besoin métier : prédiction du risque cardiaque, avec un objectif médical clair (ne pas manquer un patient à risque).
  • Variables : âge (continue), sexe (nominale), fumeur (nominale), corpulence (ordinale ou continue), etc.
  • Matrice X : chaque patient en ligne, chaque variable en colonne.
  • Mode : supervisé, classification binaire.
  • Algorithmes : régression logistique, arbres, forêts, SVM.
  • Métriques : Rappel en priorité (cas manqués critiques), F1-score, courbe ROC / AUROC.
Exercice 8.2

Compromis biais-variance :

  • KNN : petit k → variance élevée, biais faible (sur-apprentissage) ; grand k → biais élevé, variance faible (sous-apprentissage).
  • Arbre : profondeur élevée → variance élevée ; profondeur faible → biais élevé.
  • Régression polynomiale : degré élevé → variance élevée ; degré faible → biais élevé.
Exercice 8.3

Configuration : rappel faible (60 %), précision élevée (98 %), accuracy élevée (95 %). Le modèle est conservateur : il ne prédit positif que lorsqu'il est très sûr, mais rate de nombreux positifs. Acceptable si les FP coûtent très cher (par exemple, alerte de sécurité). Non acceptable si les FN sont critiques (dépistage médical). Compromis typique : précision vs rappel.

Corrigé de l'examen blanc

Partie A — Questions de cours (30 points)

A.1/6

Formule : 3 pts. Définitions : 2 pts. Exemple concret : 1 pt. Voir Exercice 1.1 pour la réponse complète.

A.2/6

6 étapes : 3 pts (0,5 pt par étape). Différence préparation/modélisation : 3 pts. Voir Exercice 1.2 et chapitre 1 pour les réponses détaillées.

A.3/6

Définition de g(x) : 2 pts. Régions binaires : 2 pts. Extension multi-classe : 2 pts.

A.4/6

Définitions des trois phénomènes : 3 pts. Détection expérimentale : 2 pts. Condition V ∩ T = ∅ : 1 pt.

A.5/6

1,5 pt par variable bien classée avec les opérations autorisées.

Partie B — Algorithmes (25 points)

B.1/8

Tableau complet correct : 8 pts. Pénalités : 1 pt par critère manquant ou incorrect.

B.2/8

Définitions (marge, H⁺, H⁻, zone d'indécision) : 3 pts. Vecteurs de support : 2 pts. Explication sur les perturbations : 3 pts.

B.3/9

KNN : 3 pts. Compromis biais-variance : 2 pts. Forêts aléatoires : 3 pts. Valeurs par défaut de q : 1 pt.

Partie C — Calculs (25 points)

C.1/8

(a) z = 0,5 × 2 − 2 × 1 + 1 = 0 (2 pts).
(b) σ(0) = 0,5 (2 pts).
(c) f(x⃗) = 0 (car 0,5 n'est pas strictement supérieur à 0,5) (2 pts).
(d) Interprétation : cas limite, le modèle est indécis (2 pts).

C.2/9

Précision ≈ 0,8333 (1,5 pt). Rappel ≈ 0,9091 (1,5 pt). Spécificité ≈ 0,9310 (1,5 pt). F1 ≈ 0,8696 (1,5 pt). Accuracy = 0,9250 (1,5 pt). Interprétation (1,5 pt).

C.3/8

(a) x̄ = 2, ȳ = 4 (1 pt).
(b) Tableau de travail (2 pts) ; â = 2,5 (2 pts) ; b̂ = −1 (1 pt).
(c) f̂(x) = 2,5x − 1 (1 pt).
(d) ŷ = 9 (1 pt).

Partie D — Non supervisé (20 points)

D.1/7

4 étapes (0,75 pt chacune) : 3 pts. Inertie (formule) : 2 pts. Mise à jour centroïde : 2 pts.

D.2/6

Centroïde μ = (2, 2) (2 pts). Inertie = 16 (3 pts). Interprétation (1 pt).

D.3/7

Distances individuelles : 2 pts. Lien simple = 3 (1 pt). Lien complet = √10 ≈ 3,162 (1 pt). Lien moyen ≈ 3,081 (1 pt). Interprétation sur les structures (2 pts).

Grille de notation globale

PartieThèmePoints
AQuestions de cours30
BAlgorithmes25
CCalculs25
DNon supervisé20
Total100