Cahier d'exercices

Exercices par thème, sans corrigés visibles. Les corrigés détaillés se trouvent dans le document séparé. Les exercices marqués « Source : Atelier X » sont issus des TP fournis par le professeur ; les autres sont des exercices supplémentaires créés pour l'entraînement.

Thème 1 — Fondements et définitions

Exercice 1.1Restitution

Énoncez la définition formelle du Machine Learning selon Tom Mitchell (1997) et définissez chaque notation (S, E, T, P, Exp).

Exercice 1.2Restitution

Citez dans l'ordre les 6 étapes du cycle de vie d'un projet de Data Science.

Exercice 1.3Application

Un système de conduite autonome détecte les piétons sur des images. Identifiez clairement la tâche T, la mesure P et l'expérience Exp au sens de Mitchell.

Exercice 1.4Conceptuel

Pourquoi dit-on que le Machine Learning est à la croisée des statistiques et de l'optimisation ? Citez au moins trois disciplines contributrices et précisez l'apport de chacune.

Exercice 1.5Comparaison

Définissez et comparez l'apprentissage supervisé, non supervisé et semi-supervisé. Donnez un exemple concret pour chacun.

Thème 2 — Données et variables

Exercice 2.1Classification

Pour chacune des variables suivantes, donnez son type exact (quantitative continue, quantitative discrète, qualitative nominale, qualitative ordinale) :

  1. Température en °C
  2. Code postal
  3. Mention au BAC (Passable, Bien, Très Bien)
  4. Nombre de clics sur un site
  5. Couleur des yeux
  6. Nombre de pièces d'un logement
Exercice 2.2Vrai / Faux

Vrai ou Faux, avec justification :

  1. On peut calculer la moyenne arithmétique des valeurs d'une variable nominale codée 1, 2, 3.
  2. Une variable qualitative ordinale supporte l'opération d'infériorité/supériorité.
  3. Un fichier JSON est une donnée structurée.
Exercice 2.3Numérique

Un jeu de données contient 250 clients décrits par 6 variables. Donnez les dimensions de la matrice de design X. Précisez ce que représentent les lignes et les colonnes.

Thème 3 — Cadre supervisé

Exercice 3.1Conceptuel

Définissez une fonction de décision g(x) en classification binaire et expliquez comment elle définit les régions R0 et R1.

Exercice 3.2Interprétation

Un modèle atteint 99 % d'accuracy en entraînement et 55 % en test. Quel phénomène est en jeu ? Que conseilleriez-vous pour y remédier ?

Exercice 3.3Classification

Classez les tâches suivantes (Classification binaire / Classification multi-classe / Régression / Clustering) :

  1. Prédire le prix d'une maison
  2. Détecter la présence d'une tumeur sur une radio
  3. Segmenter les utilisateurs de réseaux sociaux
  4. Reconnaître un chiffre manuscrit (0–9)
  5. Prédire si un e-mail est un spam

Thème 4 — Algorithmes de classification

Exercice 4.1Numérique

Écrivez la fonction sigmoïde et donnez la valeur de σ(0). Calculez ensuite σ(2) (arrondir à 3 décimales).

Exercice 4.2Numérique

Soit u⃗ = (1, 2) et v⃗ = (4, 6). Calculez la distance euclidienne et la distance de Manhattan entre ces deux points.

Exercice 4.3Numérique

Un modèle de régression logistique binaire a pour poids w⃗ = (0,5 ; −2,0)T et biais b = 1,0. Pour l'observation x⃗ = (2, 1)T :

  1. Calculez le score z.
  2. Calculez la probabilité σ(z).
  3. Donnez la classe prédite f(x⃗).
Exercice 4.4Comparaison

Comparez KNN et K-Means : objectif, type d'apprentissage (supervisé/non supervisé), entrées, sorties, hyperparamètres.

Exercice 4.5Conceptuel

Expliquez pourquoi un déplacement d'un vecteur de support modifie l'hyperplan séparateur d'une SVM, tandis qu'un déplacement d'une observation non-vecteur de support ne le modifie pas.

Exercice 4.6Numérique

Pour une base avec p = 100 caractéristiques, combien de variables sont sélectionnées à chaque nœud dans une forêt aléatoire :

  1. pour la classification ?
  2. pour la régression ?

Thème 5 — Évaluation en classification

Exercice 5.1Numérique

Soit la matrice de confusion : TP = 50, FP = 10, FN = 5, TN = 135. Calculez : la Précision, le Rappel, la Spécificité, le F1-score et l'Accuracy.

Exercice 5.2Conceptuel

Expliquez pourquoi l'Accuracy seule peut être trompeuse sur un jeu de données déséquilibré. Proposez deux métriques alternatives et justifiez leur pertinence.

Exercice 5.3Application

Dans un système de détection de transactions frauduleuses (1 % de fraudes), quelle métrique entre Précision et Rappel prioriseriez-vous ? Justifiez votre réponse en termes de coût des erreurs.

Exercice 5.4Numérique

Source : Atelier 2, Cas 4. Un modèle est évalué sur 114 patients (43 malins, 71 bénins). Il prédit 40 patients comme malins dont 38 réellement malins, et 74 comme bénins. Construisez la matrice de confusion et calculez Accuracy, Rappel, Précision, Spécificité et F1-score.

Thème 6 — Régression

Exercice 6.1Numérique

Soit le jeu de données E = {(0, 1), (2, 5), (4, 9)}. Calculez x̄, ȳ, la pente â, l'ordonnée à l'origine b̂ et écrivez la fonction de prédiction f̂(x).

Exercice 6.2Restitution

Écrivez la formule fermée matricielle de l'estimateur des MCO pour la régression linéaire multiple. Sous quelle condition cette formule est-elle valide ?

Exercice 6.3Conceptuel

La régression polynomiale est-elle un modèle linéaire ? Justifiez votre réponse en distinguant linéarité en les variables et linéarité en les paramètres.

Exercice 6.4Numérique

Source : Atelier 2, Cas 1. Soit les prix réels y = (7, 9, 13)T et les prédictions ŷ = (6, 8, 11)T. Calculez MSE, MAE, RMSE et RMSLE (arrondir à 3 décimales).

Thème 7 — Non supervisé et clustering

Exercice 7.1Restitution

Citez les 4 étapes de l'algorithme de Lloyd (K-Means) et écrivez la formule de mise à jour d'un centroïde.

Exercice 7.2Numérique

Soient x1 = (0, 0) et x2 = (4, 4) dans le même cluster. Calculez le centroïde μ1 et l'inertie de ce cluster.

Exercice 7.3Numérique

Soient C1 = {(0, 0), (1, 0)} et C2 = {(0, 3)}. Calculez les distances individuelles, puis la distance en lien simple, en lien complet et en lien moyen entre C1 et C2.

Exercice 7.4Conceptuel

Pourquoi le clustering hiérarchique est-il difficilement applicable aux très grands jeux de données ? Quelle est sa complexité ?

Exercice 7.5Comparaison

Comparez K-Means et le clustering hiérarchique agglomératif : nombre de clusters fixé à l'avance, complexité, sensibilité à l'initialisation, forme des clusters.

Exercice 7.6Conceptuel

Pourquoi l'évaluation d'un clustering est-elle intrinsèquement difficile ? Citez au moins trois critères d'évaluation possibles.

Thème 8 — Exercices transversaux

Exercice 8.1Synthèse

Vous devez construire un système qui prédit si un patient est à risque cardiaque à partir de données médicales. Décrivez les étapes que vous suivriez en vous appuyant sur le cycle de vie Data Science, en précisant :

  1. Les types de variables que vous pourriez rencontrer.
  2. La structure de la matrice de design X.
  3. Le mode d'apprentissage (supervisé, non supervisé, etc.).
  4. Les algorithmes candidats.
  5. Les métriques d'évaluation que vous utiliseriez.
Exercice 8.2Synthèse

Expliquez le compromis biais-variance en vous appuyant sur trois exemples du cours : l'influence de k dans KNN, la profondeur d'un arbre de décision, et le degré d d'une régression polynomiale.

Exercice 8.3Synthèse

Un modèle de classification obtient 95 % d'accuracy, un rappel de 60 % et une précision de 98 %. Interprétez ces résultats. Quel type de compromis observe-t-on ? Dans quel contexte cette configuration serait-elle acceptable, et dans quel contexte ne le serait-elle pas ?