Chapitre 9 — Apprentissage non supervisé : vue d'ensemble
- Définir l'apprentissage non supervisé et sa formalisation.
- Distinguer les trois grandes tâches non supervisées : clustering, réduction de dimension, règles d'association.
- Connaître les cinq approches de clustering.
- Comprendre la difficulté intrinsèque de l'évaluation d'un clustering.
9.1 — Le problème à résoudre
Comment découvrir automatiquement des sous-groupes homogènes (clusters) au sein d'une population de données sans aucune étiquette préalable y pour guider l'algorithme ? main_5.pdf, p. 3–4
Imaginez une bibliothèque sans classement : des milliers de livres posés en vrac. Personne ne vous a donné la liste des catégories (roman, science, histoire…). Votre tâche est de découvrir vous-même des groupes de livres qui se ressemblent, en vous basant uniquement sur leur contenu. C'est exactement ce que fait l'apprentissage non supervisé : il révèle des structures cachées dans les données sans qu'on lui ait fourni d'étiquettes.
9.2 — Formalisation
On appelle apprentissage non supervisé la branche du Machine Learning qui s'intéresse aux problèmes pouvant être formalisés de la façon suivante :
- Étant données n observations {Xi}i=1,…,n décrites dans un espace 𝒳.
- Il s'agit d'apprendre une fonction sur 𝒳 qui vérifie certaines propriétés.
Contrairement à l'apprentissage supervisé, les données ne sont pas étiquetées. L'objectif est de modéliser les observations pour mieux les comprendre, ou de produire une représentation réduite.
main_5.pdf, p. 49.3 — Les trois grandes tâches non supervisées
| Tâche | Description | Exemples d'application |
|---|---|---|
| Clustering | Identifier des groupes homogènes dans les données, sans étiquettes préalables | Segmentation de marché, regroupement de documents, segmentation d'image |
| Réduction de dimension | Trouver une représentation dans un espace de dimension plus faible | Compression, visualisation, accélération d'algorithmes supervisés |
| Règles d'association | Découvrir et analyser les relations d'intérêt entre les données | Analyse du panier d'achats, systèmes de recommandation |
Bien que la réduction de dimension et les règles d'association soient introduites, seul le clustering est développé en détail dans le cours. Les algorithmes associés (ACP/PCA, Apriori) ne sont pas traités dans les diapositives.
9.4 — Définition du clustering
On appelle clustering (partitionnement, regroupement) un problème d'apprentissage non supervisé pouvant être formalisé comme la recherche d'une partition :
de n observations {x⃗i}i=1,…,n. Il s'agit de séparer les données en sous-groupes Ck homogènes, appelés clusters, qui partagent des caractéristiques communes.
Cette partition doit être pertinente au vu de plusieurs critères à préciser. Les groupes Ck ne sont pas prédéfinis à l'avance, et on ne dispose pas explicitement d'exemples de chaque groupe.
main_5.pdf, p. 7Exemples d'application
- Segmentation de marché : identifier des groupes de clients ayant un comportement similaire.
- Regroupement de documents : organiser de grandes banques de textes par sujet.
- Compression d'image : regrouper des pixels similaires pour les représenter plus efficacement.
- Segmentation d'image : identifier les pixels appartenant à la même région.
- Médecine : identifier des sous-types d'une maladie à partir des symptômes.
9.5 — Les cinq approches de clustering
| Approche | Principe |
|---|---|
| Partitionnement | Construire plusieurs partitions puis les évaluer selon certains critères (ex. K-Means) |
| Hiérarchique | Créer une décomposition hiérarchique des objets selon certains critères (dendrogramme) |
| Densité | Basé sur des notions de connectivité et de densité (ex. DBSCAN) |
| Grille | Basé sur une structure à multi-niveaux de granularité |
| Modèles | Un modèle est supposé pour chaque cluster, puis vérifié sur chaque groupe |
9.6 — Difficulté intrinsèque de l'évaluation
En l'absence d'étiquettes, la qualité d'un clustering est difficile à évaluer : les « bons clusters » ne sont pas connus. Les critères d'évaluation incluent :
- Des indices reposant généralement sur des rapports de distances intra / extra clusters : séparabilité et homogénéité.
- Le jugement d'un expert ou l'évaluation par un utilisateur.
- L'utilisation de données étiquetées si elles existent.
- La comparaison avec une segmentation de référence.
En clustering, il n'y a pas de vérité terrain à laquelle comparer les résultats. Deux clusterings différents peuvent tous deux être « corrects » selon le critère choisi. C'est pourquoi l'interprétation métier est souvent aussi importante que les indices numériques.
- Non supervisé : pas d'étiquettes y ; on cherche des structures.
- Trois tâches : clustering, réduction de dimension, règles d'association.
- Cinq approches de clustering : partitionnement, hiérarchique, densité, grille, modèles.
- Le cours se concentre sur le partitionnement (K-Means) et le hiérarchique.
- Évaluation difficile en l'absence de vérité terrain.
- Définissez l'apprentissage non supervisé et donnez sa formalisation.
- Citez les trois grandes tâches non supervisées et un exemple pour chacune.
- Pourquoi l'évaluation d'un clustering est-elle intrinsèquement difficile ?
- Citez les cinq approches de clustering.