Chapitre 1 — Introduction au Machine Learning

🎯 Objectifs d'apprentissage

À la fin de ce chapitre, vous devez pouvoir :

  • Énoncer la définition formelle du Machine Learning selon Tom Mitchell (1997) et définir chaque notation.
  • Citer dans l'ordre les 6 étapes du cycle de vie d'un projet de Data Science.
  • Distinguer sous-apprentissage, ajustement approprié et sur-apprentissage.
  • Distinguer IA, ML, Deep Learning et Data Science.
  • Identifier le mode d'apprentissage (supervisé, non supervisé, semi-supervisé, renforcement) d'un problème donné.

1.1 — Le problème à résoudre

Nous vivons dans une « ère du numérique » où les données sont partout : sociales (sondages, indices de popularité), personnelles (photos, vidéos, messages), issues d'objets connectés (capteurs, caméras), scientifiques (astrophysique, biologie, santé, météo), commerciales (transactions, clients, bitcoin), web (recherches, traces, achats en ligne, réseaux sociaux) et robotiques (drones, transports autonomes).

Programmer à la main des règles logiques complexes (if/else) pour traiter chaque tâche — filtrer un spam, prédire une panne, détecter une tumeur — est impossible en raison de la variabilité et de la quantité d'informations. Sans le Machine Learning, les ordinateurs restent incapables de s'adapter automatiquement à de nouvelles données sans réécriture du code. main_1.pdf, p. 5–6, 11

💡 Intuition

Imaginez un joueur d'échecs débutant. Au lieu de lui apprendre par cœur toutes les combinaisons possibles du jeu (programmation traditionnelle), on le laisse jouer des milliers de parties. Au fur et à mesure qu'il accumule de l'expérience, il repère les stratégies gagnantes et commet de moins en moins d'erreurs. Le Machine Learning consiste exactement à fournir des données (l'expérience) à un algorithme pour qu'il améliore seul sa performance sur une tâche donnée.

1.2 — La Data Science comme démarche empirique

📘 Définition à connaître

Science des données (Data Science) : démarche empirique qui se base sur des données pour apporter une réponse à des problèmes.

Data science : fondamentaux et études de cas, E. Biernat, M. Lutz, Eyrolles, 2015.

main_1.pdf, p. 7

Un projet relevant des sciences des données vise généralement deux objectifs :

ObjectifDescriptionExemple
CompréhensionExpliquer le comportement actuel des donnéesIdentifier les segments de clientèle d'un site e-commerce
PrédictionAnticiper le comportement futur des donnéesPrédire quels clients vont résilier leur abonnement

1.3 — Le cycle de vie d'un projet Data Science

Le cycle de vie d'un projet de Data Science se déroule en 6 étapes ordonnées :

✏️ Les 6 étapes du cycle de vie
  1. Identifier et comprendre le besoin métier — comprendre le besoin, les spécifications, exigences et priorités.
  2. Localiser et récupérer les données — identifier les données nécessaires, les récupérer et les stocker (bases de données, fichiers, web, etc.).
  3. Explorer et préparer les données — classement, nettoyage (données manquantes), recodage pour les rendre compatibles avec les algorithmes (Feature Engineering).
  4. Construire le modèle — cœur du projet : phase de modélisation dépendant de la question posée et de la nature des données.
  5. Évaluer et valider le modèle — vérifier que le modèle répond aux objectifs. Décider s'il est robuste et prêt au déploiement.
  6. Déployer le modèle — mise en production pour les utilisateurs finaux.
main_1.pdf, p. 8–10
⚠️ Attention

Ne confondez pas la phase de modélisation (étape 4) et la phase de préparation des données (étape 3). La préparation consiste à nettoyer, recoder et transformer les données brutes. La modélisation consiste à entraîner un algorithme sur ces données préparées. La préparation est souvent la phase la plus longue : de sa qualité dépend la performance du modèle.

1.4 — Définition formelle du Machine Learning (Mitchell, 1997)

📘 Définition à connaître

Soit E l'ensemble de toutes les tâches possibles. Soit S un système (une machine). Soit T ⊂ E l'ensemble de tâches appelé training set (ensemble d'entraînement). Soit P : S × E → ℝ une mesure de performance.

Un système S apprend lors d'une expérience Exp si la performance de S sur les tâches T, mesurée par P, s'améliore :

P(Savant Exp,T) ≤ P(Saprès Exp,T)
main_1.pdf, p. 12

Signification des symboles

SymboleSignification
SLe système ou l'algorithme d'apprentissage
EL'espace de toutes les tâches envisageables
T ⊂ EL'ensemble des tâches spécifiques d'entraînement (training set)
PLa fonction de mesure de performance quantitative
ExpL'expérience (période d'exposition aux données ou d'interaction)
✏️ Exemple guidé — Filtre anti-spam

Considérons un filtre anti-spam pour messagerie électronique.

  • Tâche T : classer les e-mails reçus en « Spam » ou « Non-Spam ».
  • Performance P : taux de rejet correct des spams sans bloquer les e-mails légitimes.
  • Expérience Exp : observation des e-mails reçus et annotés par l'utilisateur pendant une semaine.

Avant expérience : S identifie correctement 700 spams sur 1000, donc P(Savant, T) = 0,70 (70 %).

Après expérience : S identifie correctement 950 spams sur 1000, donc P(Saprès, T) = 0,95 (95 %).

Vérification : 0,70 ≤ 0,95. Le système a formellement appris.

Interprétation : le gain de performance ΔP = +0,25 (25 points de pourcentage) quantifie l'efficacité de l'algorithme.

main_1.pdf, p. 12
🔗 Lien mathématique — Le ML à la croisée des disciplines
  • Statistiques : inférence de modèles à partir de données.
  • Probabilités : modélisation de l'aspect aléatoire (bruit ε, incertitude).
  • Optimisation : minimiser un critère de performance pour estimer les paramètres.
  • Informatique : algorithmes efficaces, parfois gourmands en calcul et mémoire.
  • Reconnaissance de formes : tâches simples (reconnaissance de chiffres) et branche symbolique du ML.
  • Fouille de données (Data Mining) : analyse exploratoire et découverte de propriétés inconnues.
main_1.pdf, p. 16

1.5 — Généralisation, sous-apprentissage, sur-apprentissage

📘 Définitions à connaître

Capacité de généralisation : capacité d'un système à fonctionner correctement sur de nouvelles tâches inconnues après avoir appris sur un ensemble d'apprentissage.

Sous-apprentissage (underfitting) : modèle trop simple qui ne parvient pas à capturer la structure des données, obtenant de faibles performances aussi bien en entraînement qu'en test.

Sur-apprentissage (overfitting) : modèle trop complexe qui apprend le bruit du jeu d'entraînement au lieu du motif réel, échouant à généraliser sur de nouvelles données.

main_1.pdf, p. 13 ; main_3.pdf, p. 11–12

Formalisation

Soit T l'ensemble d'apprentissage et V l'ensemble de test/validation, avec :

V∩T=∅

Soient deux systèmes S₁ et S₂. Supposons que :

P(S2,T) ≤ P(S1,T) et P(S1,V) ≤ P(S2,V)

Interprétation : S₁ a mieux appris que S₂ sur T, mais généralise moins bien sur V. S₁ est donc en situation de sur-apprentissage.

⚠️ Attention

Un modèle avec 99 % d'accuracy en entraînement et 55 % en test n'est pas un bon modèle : c'est un cas typique de sur-apprentissage. À l'inverse, un modèle avec 70 % en entraînement et 68 % en test est peut-être sous-appris, mais généralise correctement.

1.6 — IA, Machine Learning, Deep Learning, Data Science

DisciplineDéfinitionRelation
Intelligence Artificielle (IA)Domaine englobant visant à simuler l'intelligence humaineDomaine le plus vaste
Machine Learning (ML)Sous-branche de l'IA basée sur des approches statistiquesSous-domaine de l'IA
Deep Learning (DL)Sous-branche du ML utilisant des réseaux de neurones profondsSous-domaine du ML
Data ScienceDiscipline pluridisciplinaire englobant le ML, la collecte, le stockage et l'analyse métierDiscipline englobante, recouvrement partiel

main_1.pdf, p. 15

1.7 — Typologie des problèmes d'apprentissage

ModeDescription
SuperviséOn dispose d'objets avec une valeur cible associée. On apprend à prédire la cible d'un objet nouveau.
Non superviséOn dispose d'objets sans valeur cible. On apprend à extraire les régularités présentes.
Semi-superviséPetit ensemble étiqueté + grand ensemble non étiqueté.
Par renforcementUn agent apprend par interactions, récompenses et pénalités avec un environnement dynamique.

main_1.pdf, p. 17–19, 24

⚠️ Attention — portée du cours

L'apprentissage semi-supervisé et l'apprentissage par renforcement sont introduits dans la typologie mais ne sont pas développés ultérieurement dans le cours. Les chapitres suivants se concentrent sur le supervisé (classification et régression) et le non supervisé (clustering).

1.8 — Modèles prédictifs vs descriptifs

TypeDescriptionProblèmes associés
PrédictifPrédire une valeur cible inconnueClassification, Régression
DescriptifExplorer et résumer la structure des donnéesClustering, Association

main_1.pdf, p. 22

1.9 — Domaines d'application

DomaineExemples
WebmarketingSystèmes de recommandation (Amazon), ciblage publicitaire (Criteo)
Socio-économiqueContrôle des dépenses/recettes, prévention des risques, scoring clients
Détection d'anomaliesTransactions frauduleuses, lutte contre les trafics
SantéAnalyse d'images médicales, dépistage précoce, chatbots de soutien
Génétique et génomiqueImpact de l'ADN, prédiction du risque génétique
Vision par ordinateurClassification d'images, détection d'objets, segmentation, suivi
AgricultureSurveillance des cultures, détection des maladies des plantes
TransportsDétection de piétons, systèmes anticollision, analyse du trafic
BiométrieReconnaissance de visage, d'empreintes, d'iris, de signature
NLPOCR, classification de textes, traduction automatique, analyse des sentiments

main_1.pdf, p. 25–37

📌 À retenir
  • La Data Science est une démarche empirique visant compréhension ou prédiction.
  • Le cycle de vie comporte 6 étapes : besoin métier → données → préparation → modèle → évaluation → déploiement.
  • Mitchell (1997) : S apprend si P(Savant, T) ≤ P(Saprès, T).
  • La généralisation est mesurée sur un jeu de test disjoint : V ∩ T = ∅.
  • Sous-apprentissage = modèle trop simple ; sur-apprentissage = modèle trop complexe.
  • IA ⊃ ML ⊃ DL ; Data Science englobe le ML mais inclut aussi collecte/stockage/analyse métier.
  • Quatre modes : supervisé, non supervisé, semi-supervisé, renforcement.
🎯 À l'examen
  1. Énoncez la définition formelle du ML selon Mitchell (1997) et détaillez chaque notation.
  2. Citez dans l'ordre les 6 étapes du cycle de vie d'un projet Data Science.
  3. Pour un système de conduite autonome détectant les piétons, identifiez T, P et Exp.
  4. Quelle est la différence fondamentale entre la phase de modélisation et la phase de préparation des données ?
  5. Pourquoi dit-on que le ML est à la croisée des statistiques et de l'optimisation ?

Questions de vérification

  1. Énoncez la définition formelle du Machine Learning selon Tom Mitchell (1997).
  2. Que représentent S, E, T, P et Exp ?
  3. Définissez la capacité de généralisation.
  4. Si un algorithme obtient 99 % de précision en entraînement et 55 % en test, que concluez-vous ?
  5. Classez les tâches suivantes (Classification, Régression ou Clustering) : (a) prédire le prix d'une maison, (b) détecter une tumeur sur une radio, (c) segmenter les utilisateurs de réseaux sociaux.
  6. Pourquoi la condition V ∩ T = ∅ est-elle stricte pour mesurer la généralisation ?