Chapitre 1 — Introduction au Machine Learning
À la fin de ce chapitre, vous devez pouvoir :
- Énoncer la définition formelle du Machine Learning selon Tom Mitchell (1997) et définir chaque notation.
- Citer dans l'ordre les 6 étapes du cycle de vie d'un projet de Data Science.
- Distinguer sous-apprentissage, ajustement approprié et sur-apprentissage.
- Distinguer IA, ML, Deep Learning et Data Science.
- Identifier le mode d'apprentissage (supervisé, non supervisé, semi-supervisé, renforcement) d'un problème donné.
1.1 — Le problème à résoudre
Nous vivons dans une « ère du numérique » où les données sont partout : sociales (sondages, indices de popularité), personnelles (photos, vidéos, messages), issues d'objets connectés (capteurs, caméras), scientifiques (astrophysique, biologie, santé, météo), commerciales (transactions, clients, bitcoin), web (recherches, traces, achats en ligne, réseaux sociaux) et robotiques (drones, transports autonomes).
Programmer à la main des règles logiques complexes (if/else) pour traiter chaque tâche — filtrer un spam,
prédire une panne, détecter une tumeur — est impossible en raison de la variabilité et de la quantité d'informations.
Sans le Machine Learning, les ordinateurs restent incapables de s'adapter automatiquement à de nouvelles données
sans réécriture du code.
main_1.pdf, p. 5–6, 11
Imaginez un joueur d'échecs débutant. Au lieu de lui apprendre par cœur toutes les combinaisons possibles du jeu (programmation traditionnelle), on le laisse jouer des milliers de parties. Au fur et à mesure qu'il accumule de l'expérience, il repère les stratégies gagnantes et commet de moins en moins d'erreurs. Le Machine Learning consiste exactement à fournir des données (l'expérience) à un algorithme pour qu'il améliore seul sa performance sur une tâche donnée.
1.2 — La Data Science comme démarche empirique
Science des données (Data Science) : démarche empirique qui se base sur des données pour apporter une réponse à des problèmes.
Data science : fondamentaux et études de cas, E. Biernat, M. Lutz, Eyrolles, 2015.
main_1.pdf, p. 7Un projet relevant des sciences des données vise généralement deux objectifs :
| Objectif | Description | Exemple |
|---|---|---|
| Compréhension | Expliquer le comportement actuel des données | Identifier les segments de clientèle d'un site e-commerce |
| Prédiction | Anticiper le comportement futur des données | Prédire quels clients vont résilier leur abonnement |
1.3 — Le cycle de vie d'un projet Data Science
Le cycle de vie d'un projet de Data Science se déroule en 6 étapes ordonnées :
- Identifier et comprendre le besoin métier — comprendre le besoin, les spécifications, exigences et priorités.
- Localiser et récupérer les données — identifier les données nécessaires, les récupérer et les stocker (bases de données, fichiers, web, etc.).
- Explorer et préparer les données — classement, nettoyage (données manquantes), recodage pour les rendre compatibles avec les algorithmes (Feature Engineering).
- Construire le modèle — cœur du projet : phase de modélisation dépendant de la question posée et de la nature des données.
- Évaluer et valider le modèle — vérifier que le modèle répond aux objectifs. Décider s'il est robuste et prêt au déploiement.
- Déployer le modèle — mise en production pour les utilisateurs finaux.
Ne confondez pas la phase de modélisation (étape 4) et la phase de préparation des données (étape 3). La préparation consiste à nettoyer, recoder et transformer les données brutes. La modélisation consiste à entraîner un algorithme sur ces données préparées. La préparation est souvent la phase la plus longue : de sa qualité dépend la performance du modèle.
1.4 — Définition formelle du Machine Learning (Mitchell, 1997)
Soit E l'ensemble de toutes les tâches possibles. Soit S un système (une machine). Soit T ⊂ E l'ensemble de tâches appelé training set (ensemble d'entraînement). Soit P : S × E → ℝ une mesure de performance.
Un système S apprend lors d'une expérience Exp si la performance de S sur les tâches T, mesurée par P, s'améliore :
Signification des symboles
| Symbole | Signification |
|---|---|
| S | Le système ou l'algorithme d'apprentissage |
| E | L'espace de toutes les tâches envisageables |
| T ⊂ E | L'ensemble des tâches spécifiques d'entraînement (training set) |
| P | La fonction de mesure de performance quantitative |
| Exp | L'expérience (période d'exposition aux données ou d'interaction) |
Considérons un filtre anti-spam pour messagerie électronique.
- Tâche T : classer les e-mails reçus en « Spam » ou « Non-Spam ».
- Performance P : taux de rejet correct des spams sans bloquer les e-mails légitimes.
- Expérience Exp : observation des e-mails reçus et annotés par l'utilisateur pendant une semaine.
Avant expérience : S identifie correctement 700 spams sur 1000, donc P(Savant, T) = 0,70 (70 %).
Après expérience : S identifie correctement 950 spams sur 1000, donc P(Saprès, T) = 0,95 (95 %).
Vérification : 0,70 ≤ 0,95. Le système a formellement appris.
Interprétation : le gain de performance ΔP = +0,25 (25 points de pourcentage) quantifie l'efficacité de l'algorithme.
main_1.pdf, p. 12- Statistiques : inférence de modèles à partir de données.
- Probabilités : modélisation de l'aspect aléatoire (bruit ε, incertitude).
- Optimisation : minimiser un critère de performance pour estimer les paramètres.
- Informatique : algorithmes efficaces, parfois gourmands en calcul et mémoire.
- Reconnaissance de formes : tâches simples (reconnaissance de chiffres) et branche symbolique du ML.
- Fouille de données (Data Mining) : analyse exploratoire et découverte de propriétés inconnues.
1.5 — Généralisation, sous-apprentissage, sur-apprentissage
Capacité de généralisation : capacité d'un système à fonctionner correctement sur de nouvelles tâches inconnues après avoir appris sur un ensemble d'apprentissage.
Sous-apprentissage (underfitting) : modèle trop simple qui ne parvient pas à capturer la structure des données, obtenant de faibles performances aussi bien en entraînement qu'en test.
Sur-apprentissage (overfitting) : modèle trop complexe qui apprend le bruit du jeu d'entraînement au lieu du motif réel, échouant à généraliser sur de nouvelles données.
main_1.pdf, p. 13 ; main_3.pdf, p. 11–12Formalisation
Soit T l'ensemble d'apprentissage et V l'ensemble de test/validation, avec :
Soient deux systèmes S₁ et S₂. Supposons que :
Interprétation : S₁ a mieux appris que S₂ sur T, mais généralise moins bien sur V. S₁ est donc en situation de sur-apprentissage.
Un modèle avec 99 % d'accuracy en entraînement et 55 % en test n'est pas un bon modèle : c'est un cas typique de sur-apprentissage. À l'inverse, un modèle avec 70 % en entraînement et 68 % en test est peut-être sous-appris, mais généralise correctement.
1.6 — IA, Machine Learning, Deep Learning, Data Science
| Discipline | Définition | Relation |
|---|---|---|
| Intelligence Artificielle (IA) | Domaine englobant visant à simuler l'intelligence humaine | Domaine le plus vaste |
| Machine Learning (ML) | Sous-branche de l'IA basée sur des approches statistiques | Sous-domaine de l'IA |
| Deep Learning (DL) | Sous-branche du ML utilisant des réseaux de neurones profonds | Sous-domaine du ML |
| Data Science | Discipline pluridisciplinaire englobant le ML, la collecte, le stockage et l'analyse métier | Discipline englobante, recouvrement partiel |
main_1.pdf, p. 15
1.7 — Typologie des problèmes d'apprentissage
| Mode | Description |
|---|---|
| Supervisé | On dispose d'objets avec une valeur cible associée. On apprend à prédire la cible d'un objet nouveau. |
| Non supervisé | On dispose d'objets sans valeur cible. On apprend à extraire les régularités présentes. |
| Semi-supervisé | Petit ensemble étiqueté + grand ensemble non étiqueté. |
| Par renforcement | Un agent apprend par interactions, récompenses et pénalités avec un environnement dynamique. |
main_1.pdf, p. 17–19, 24
L'apprentissage semi-supervisé et l'apprentissage par renforcement sont introduits dans la typologie mais ne sont pas développés ultérieurement dans le cours. Les chapitres suivants se concentrent sur le supervisé (classification et régression) et le non supervisé (clustering).
1.8 — Modèles prédictifs vs descriptifs
| Type | Description | Problèmes associés |
|---|---|---|
| Prédictif | Prédire une valeur cible inconnue | Classification, Régression |
| Descriptif | Explorer et résumer la structure des données | Clustering, Association |
main_1.pdf, p. 22
1.9 — Domaines d'application
| Domaine | Exemples |
|---|---|
| Webmarketing | Systèmes de recommandation (Amazon), ciblage publicitaire (Criteo) |
| Socio-économique | Contrôle des dépenses/recettes, prévention des risques, scoring clients |
| Détection d'anomalies | Transactions frauduleuses, lutte contre les trafics |
| Santé | Analyse d'images médicales, dépistage précoce, chatbots de soutien |
| Génétique et génomique | Impact de l'ADN, prédiction du risque génétique |
| Vision par ordinateur | Classification d'images, détection d'objets, segmentation, suivi |
| Agriculture | Surveillance des cultures, détection des maladies des plantes |
| Transports | Détection de piétons, systèmes anticollision, analyse du trafic |
| Biométrie | Reconnaissance de visage, d'empreintes, d'iris, de signature |
| NLP | OCR, classification de textes, traduction automatique, analyse des sentiments |
main_1.pdf, p. 25–37
- La Data Science est une démarche empirique visant compréhension ou prédiction.
- Le cycle de vie comporte 6 étapes : besoin métier → données → préparation → modèle → évaluation → déploiement.
- Mitchell (1997) : S apprend si P(Savant, T) ≤ P(Saprès, T).
- La généralisation est mesurée sur un jeu de test disjoint : V ∩ T = ∅.
- Sous-apprentissage = modèle trop simple ; sur-apprentissage = modèle trop complexe.
- IA ⊃ ML ⊃ DL ; Data Science englobe le ML mais inclut aussi collecte/stockage/analyse métier.
- Quatre modes : supervisé, non supervisé, semi-supervisé, renforcement.
- Énoncez la définition formelle du ML selon Mitchell (1997) et détaillez chaque notation.
- Citez dans l'ordre les 6 étapes du cycle de vie d'un projet Data Science.
- Pour un système de conduite autonome détectant les piétons, identifiez T, P et Exp.
- Quelle est la différence fondamentale entre la phase de modélisation et la phase de préparation des données ?
- Pourquoi dit-on que le ML est à la croisée des statistiques et de l'optimisation ?
Questions de vérification
- Énoncez la définition formelle du Machine Learning selon Tom Mitchell (1997).
- Que représentent S, E, T, P et Exp ?
- Définissez la capacité de généralisation.
- Si un algorithme obtient 99 % de précision en entraînement et 55 % en test, que concluez-vous ?
- Classez les tâches suivantes (Classification, Régression ou Clustering) : (a) prédire le prix d'une maison, (b) détecter une tumeur sur une radio, (c) segmenter les utilisateurs de réseaux sociaux.
- Pourquoi la condition V ∩ T = ∅ est-elle stricte pour mesurer la généralisation ?