Chapitre 9 — Apprentissage non supervisé : vue d'ensemble

🎯 Objectifs d'apprentissage
  • Définir l'apprentissage non supervisé et sa formalisation.
  • Distinguer les trois grandes tâches non supervisées : clustering, réduction de dimension, règles d'association.
  • Connaître les cinq approches de clustering.
  • Comprendre la difficulté intrinsèque de l'évaluation d'un clustering.

9.1 — Le problème à résoudre

Comment découvrir automatiquement des sous-groupes homogènes (clusters) au sein d'une population de données sans aucune étiquette préalable y pour guider l'algorithme ? main_5.pdf, p. 3–4

💡 Intuition

Imaginez une bibliothèque sans classement : des milliers de livres posés en vrac. Personne ne vous a donné la liste des catégories (roman, science, histoire…). Votre tâche est de découvrir vous-même des groupes de livres qui se ressemblent, en vous basant uniquement sur leur contenu. C'est exactement ce que fait l'apprentissage non supervisé : il révèle des structures cachées dans les données sans qu'on lui ait fourni d'étiquettes.

9.2 — Formalisation

📘 Définition à connaître

On appelle apprentissage non supervisé la branche du Machine Learning qui s'intéresse aux problèmes pouvant être formalisés de la façon suivante :

  • Étant données n observations {Xi}i=1,…,n décrites dans un espace 𝒳.
  • Il s'agit d'apprendre une fonction sur 𝒳 qui vérifie certaines propriétés.

Contrairement à l'apprentissage supervisé, les données ne sont pas étiquetées. L'objectif est de modéliser les observations pour mieux les comprendre, ou de produire une représentation réduite.

main_5.pdf, p. 4

9.3 — Les trois grandes tâches non supervisées

TâcheDescriptionExemples d'application
Clustering Identifier des groupes homogènes dans les données, sans étiquettes préalables Segmentation de marché, regroupement de documents, segmentation d'image
Réduction de dimension Trouver une représentation dans un espace de dimension plus faible Compression, visualisation, accélération d'algorithmes supervisés
Règles d'association Découvrir et analyser les relations d'intérêt entre les données Analyse du panier d'achats, systèmes de recommandation
main_5.pdf, p. 5
⚠️ Remarque — périmètre du cours

Bien que la réduction de dimension et les règles d'association soient introduites, seul le clustering est développé en détail dans le cours. Les algorithmes associés (ACP/PCA, Apriori) ne sont pas traités dans les diapositives.

9.4 — Définition du clustering

📘 Définition à connaître

On appelle clustering (partitionnement, regroupement) un problème d'apprentissage non supervisé pouvant être formalisé comme la recherche d'une partition :

⋃k=1K Ck

de n observations {x⃗i}i=1,…,n. Il s'agit de séparer les données en sous-groupes Ck homogènes, appelés clusters, qui partagent des caractéristiques communes.

Cette partition doit être pertinente au vu de plusieurs critères à préciser. Les groupes Ck ne sont pas prédéfinis à l'avance, et on ne dispose pas explicitement d'exemples de chaque groupe.

main_5.pdf, p. 7

Exemples d'application

  • Segmentation de marché : identifier des groupes de clients ayant un comportement similaire.
  • Regroupement de documents : organiser de grandes banques de textes par sujet.
  • Compression d'image : regrouper des pixels similaires pour les représenter plus efficacement.
  • Segmentation d'image : identifier les pixels appartenant à la même région.
  • Médecine : identifier des sous-types d'une maladie à partir des symptômes.
main_5.pdf, p. 8

9.5 — Les cinq approches de clustering

ApprochePrincipe
Partitionnement Construire plusieurs partitions puis les évaluer selon certains critères (ex. K-Means)
Hiérarchique Créer une décomposition hiérarchique des objets selon certains critères (dendrogramme)
Densité Basé sur des notions de connectivité et de densité (ex. DBSCAN)
Grille Basé sur une structure à multi-niveaux de granularité
Modèles Un modèle est supposé pour chaque cluster, puis vérifié sur chaque groupe
main_5.pdf, p. 9

9.6 — Difficulté intrinsèque de l'évaluation

En l'absence d'étiquettes, la qualité d'un clustering est difficile à évaluer : les « bons clusters » ne sont pas connus. Les critères d'évaluation incluent :

  • Des indices reposant généralement sur des rapports de distances intra / extra clusters : séparabilité et homogénéité.
  • Le jugement d'un expert ou l'évaluation par un utilisateur.
  • L'utilisation de données étiquetées si elles existent.
  • La comparaison avec une segmentation de référence.
main_5.pdf, p. 33
⚠️ Attention — pas de vérité terrain

En clustering, il n'y a pas de vérité terrain à laquelle comparer les résultats. Deux clusterings différents peuvent tous deux être « corrects » selon le critère choisi. C'est pourquoi l'interprétation métier est souvent aussi importante que les indices numériques.

📌 À retenir
  • Non supervisé : pas d'étiquettes y ; on cherche des structures.
  • Trois tâches : clustering, réduction de dimension, règles d'association.
  • Cinq approches de clustering : partitionnement, hiérarchique, densité, grille, modèles.
  • Le cours se concentre sur le partitionnement (K-Means) et le hiérarchique.
  • Évaluation difficile en l'absence de vérité terrain.
🎯 À l'examen
  1. Définissez l'apprentissage non supervisé et donnez sa formalisation.
  2. Citez les trois grandes tâches non supervisées et un exemple pour chacune.
  3. Pourquoi l'évaluation d'un clustering est-elle intrinsèquement difficile ?
  4. Citez les cinq approches de clustering.