Cahier d'exercices
Exercices par thème, sans corrigés visibles. Les corrigés détaillés se trouvent dans le document séparé. Les exercices marqués « Source : Atelier X » sont issus des TP fournis par le professeur ; les autres sont des exercices supplémentaires créés pour l'entraînement.
Thème 1 — Fondements et définitions
Énoncez la définition formelle du Machine Learning selon Tom Mitchell (1997) et définissez chaque notation (S, E, T, P, Exp).
Citez dans l'ordre les 6 étapes du cycle de vie d'un projet de Data Science.
Un système de conduite autonome détecte les piétons sur des images. Identifiez clairement la tâche T, la mesure P et l'expérience Exp au sens de Mitchell.
Pourquoi dit-on que le Machine Learning est à la croisée des statistiques et de l'optimisation ? Citez au moins trois disciplines contributrices et précisez l'apport de chacune.
Définissez et comparez l'apprentissage supervisé, non supervisé et semi-supervisé. Donnez un exemple concret pour chacun.
Thème 2 — Données et variables
Pour chacune des variables suivantes, donnez son type exact (quantitative continue, quantitative discrète, qualitative nominale, qualitative ordinale) :
- Température en °C
- Code postal
- Mention au BAC (Passable, Bien, Très Bien)
- Nombre de clics sur un site
- Couleur des yeux
- Nombre de pièces d'un logement
Vrai ou Faux, avec justification :
- On peut calculer la moyenne arithmétique des valeurs d'une variable nominale codée 1, 2, 3.
- Une variable qualitative ordinale supporte l'opération d'infériorité/supériorité.
- Un fichier JSON est une donnée structurée.
Un jeu de données contient 250 clients décrits par 6 variables. Donnez les dimensions de la matrice de design X. Précisez ce que représentent les lignes et les colonnes.
Thème 3 — Cadre supervisé
Définissez une fonction de décision g(x) en classification binaire et expliquez comment elle définit les régions R0 et R1.
Un modèle atteint 99 % d'accuracy en entraînement et 55 % en test. Quel phénomène est en jeu ? Que conseilleriez-vous pour y remédier ?
Classez les tâches suivantes (Classification binaire / Classification multi-classe / Régression / Clustering) :
- Prédire le prix d'une maison
- Détecter la présence d'une tumeur sur une radio
- Segmenter les utilisateurs de réseaux sociaux
- Reconnaître un chiffre manuscrit (0–9)
- Prédire si un e-mail est un spam
Thème 4 — Algorithmes de classification
Écrivez la fonction sigmoïde et donnez la valeur de σ(0). Calculez ensuite σ(2) (arrondir à 3 décimales).
Soit u⃗ = (1, 2) et v⃗ = (4, 6). Calculez la distance euclidienne et la distance de Manhattan entre ces deux points.
Un modèle de régression logistique binaire a pour poids w⃗ = (0,5 ; −2,0)T et biais b = 1,0. Pour l'observation x⃗ = (2, 1)T :
- Calculez le score z.
- Calculez la probabilité σ(z).
- Donnez la classe prédite f(x⃗).
Comparez KNN et K-Means : objectif, type d'apprentissage (supervisé/non supervisé), entrées, sorties, hyperparamètres.
Expliquez pourquoi un déplacement d'un vecteur de support modifie l'hyperplan séparateur d'une SVM, tandis qu'un déplacement d'une observation non-vecteur de support ne le modifie pas.
Pour une base avec p = 100 caractéristiques, combien de variables sont sélectionnées à chaque nœud dans une forêt aléatoire :
- pour la classification ?
- pour la régression ?
Thème 5 — Évaluation en classification
Soit la matrice de confusion : TP = 50, FP = 10, FN = 5, TN = 135. Calculez : la Précision, le Rappel, la Spécificité, le F1-score et l'Accuracy.
Expliquez pourquoi l'Accuracy seule peut être trompeuse sur un jeu de données déséquilibré. Proposez deux métriques alternatives et justifiez leur pertinence.
Dans un système de détection de transactions frauduleuses (1 % de fraudes), quelle métrique entre Précision et Rappel prioriseriez-vous ? Justifiez votre réponse en termes de coût des erreurs.
Source : Atelier 2, Cas 4. Un modèle est évalué sur 114 patients (43 malins, 71 bénins). Il prédit 40 patients comme malins dont 38 réellement malins, et 74 comme bénins. Construisez la matrice de confusion et calculez Accuracy, Rappel, Précision, Spécificité et F1-score.
Thème 6 — Régression
Soit le jeu de données E = {(0, 1), (2, 5), (4, 9)}. Calculez x̄, ȳ, la pente â, l'ordonnée à l'origine b̂ et écrivez la fonction de prédiction f̂(x).
Écrivez la formule fermée matricielle de l'estimateur des MCO pour la régression linéaire multiple. Sous quelle condition cette formule est-elle valide ?
La régression polynomiale est-elle un modèle linéaire ? Justifiez votre réponse en distinguant linéarité en les variables et linéarité en les paramètres.
Source : Atelier 2, Cas 1. Soit les prix réels y = (7, 9, 13)T et les prédictions ŷ = (6, 8, 11)T. Calculez MSE, MAE, RMSE et RMSLE (arrondir à 3 décimales).
Thème 7 — Non supervisé et clustering
Citez les 4 étapes de l'algorithme de Lloyd (K-Means) et écrivez la formule de mise à jour d'un centroïde.
Soient x1 = (0, 0) et x2 = (4, 4) dans le même cluster. Calculez le centroïde μ1 et l'inertie de ce cluster.
Soient C1 = {(0, 0), (1, 0)} et C2 = {(0, 3)}. Calculez les distances individuelles, puis la distance en lien simple, en lien complet et en lien moyen entre C1 et C2.
Pourquoi le clustering hiérarchique est-il difficilement applicable aux très grands jeux de données ? Quelle est sa complexité ?
Comparez K-Means et le clustering hiérarchique agglomératif : nombre de clusters fixé à l'avance, complexité, sensibilité à l'initialisation, forme des clusters.
Pourquoi l'évaluation d'un clustering est-elle intrinsèquement difficile ? Citez au moins trois critères d'évaluation possibles.
Thème 8 — Exercices transversaux
Vous devez construire un système qui prédit si un patient est à risque cardiaque à partir de données médicales. Décrivez les étapes que vous suivriez en vous appuyant sur le cycle de vie Data Science, en précisant :
- Les types de variables que vous pourriez rencontrer.
- La structure de la matrice de design X.
- Le mode d'apprentissage (supervisé, non supervisé, etc.).
- Les algorithmes candidats.
- Les métriques d'évaluation que vous utiliseriez.
Expliquez le compromis biais-variance en vous appuyant sur trois exemples du cours : l'influence de k dans KNN, la profondeur d'un arbre de décision, et le degré d d'une régression polynomiale.
Un modèle de classification obtient 95 % d'accuracy, un rappel de 60 % et une précision de 98 %. Interprétez ces résultats. Quel type de compromis observe-t-on ? Dans quel contexte cette configuration serait-elle acceptable, et dans quel contexte ne le serait-elle pas ?