Glossaire

Définitions et notation du cours, classées par thème. La colonne « équivalent anglais » indique le terme utilisé dans les diapositives lorsqu'il diffère.

Notation générale

NotationSignification
nNombre d'observations (lignes de la matrice X)
pNombre de variables / caractéristiques (colonnes de X)
xijValeur de la j-ième variable pour la i-ième observation
yiÉtiquette ou valeur cible de la i-ième observation
f, f̂Modèle / prédicteur
εBruit ou erreur aléatoire
𝒳, 𝒴Espaces des observations et des étiquettes

Concepts fondamentaux

TermeÉquivalent anglaisDéfinition
Data ScienceData ScienceDémarche empirique basée sur les données pour apporter une réponse à des problèmes.
Machine LearningMachine LearningChamp d'étude de l'IA qui se fonde sur des approches statistiques pour donner aux ordinateurs la capacité d'apprendre à partir de données.
Cycle de vieLifecycleProcessus en 6 étapes d'un projet Data Science : besoin métier, données, préparation, modèle, évaluation, déploiement.
ApprentissageLearningAmélioration de la performance P d'un système S sur des tâches T après une expérience Exp.
GénéralisationGeneralizationCapacité d'un modèle à prédire correctement sur de nouvelles données non vues à l'entraînement.
Sous-apprentissageUnderfittingModèle trop simple ; mauvaises performances en entraînement et en test.
Sur-apprentissageOverfittingModèle trop complexe qui capture le bruit ; bon en entraînement, mauvais en test.

Données et variables

TermeDéfinition
DonnéeRésultat d'une observation faite sur une population ou un échantillon (Dodge, 2007).
Variable quantitativeDécrit une quantité mesurable ; continue ou discrète.
Variable qualitativeDécrit une qualité ou caractéristique ; nominale (sans ordre) ou ordinale (avec ordre).
Matrice de designMatrice X ∈ ℝn×p rassemblant les observations et les variables.
Données structuréesDonnées indexées, prêtes à être traitées (bases de données).
Données semi-structuréesFichiers simples à traiter, sans indexation propre (XML, CSV, JSON).
Données non structuréesDonnées complexes à manipuler (images, texte, signaux).

Apprentissage supervisé — classification

TermeDéfinition
Classification binaireClassification où 𝒴 = {0, 1}.
Classification multi-classeClassification où 𝒴 = {1, …, C}.
Fonction de décisionFonction g : 𝒳 → ℝ dont le signe détermine la classe prédite.
Région de décisionSous-ensemble de l'espace où une même classe est prédite.
Régression logistiqueModèle linéaire dont la sortie est passée dans une sigmoïde, seuillée à 0,5.
KNNk-Plus Proches Voisins : vote de majorité (classification) ou moyenne (régression) sur les k voisins les plus proches.
SVMMachines à Vecteurs Supports : recherche de l'hyperplan séparateur qui maximise la marge.
MargeDistance entre l'hyperplan séparateur et l'observation la plus proche.
Vecteur de supportObservation située exactement à une distance γ de l'hyperplan séparateur.
Arbre de décisionModèle organisé en nœuds de test et feuilles de classe (ou valeur).
Forêt aléatoireEnsemble d'arbres entraînés sur des échantillons bootstrap, avec sous-espace aléatoire d'attributs.
BootstrapTirage aléatoire avec remise d'un échantillon de taille n.
BaggingBootstrap aggregating : entraînement de modèles indépendants sur des échantillons bootstrap, puis agrégation.

Évaluation en classification

TermeDéfinition
Hold-outDécoupage entraînement / validation / test (typiquement 50 / 25 / 25).
Validation croisée (K-fold)Découpage en K folds ; entraînement sur K−1, test sur 1 ; moyennage.
LOOCVLeave-One-Out Cross-Validation : cas particulier où K = n.
Matrice de confusionTableau croisant classes réelles et prédites, contenant TP, FP, FN, TN.
Rappel (Sensibilité)TP / (TP + FN) — taux de vrais positifs.
PrécisionTP / (TP + FP) — proportion de prédictions positives correctes.
SpécificitéTN / (FP + TN) — taux de vrais négatifs.
F1-scoreMoyenne harmonique de précision et rappel.
Accuracy(TP + TN) / n.
Courbe ROCSensibilité vs antispécificité (1 − Spécificité).
AUROCAire sous la courbe ROC ; 1 = parfait, 0,5 = aléatoire.

Apprentissage supervisé — régression

TermeDéfinition
RégressionPrédiction d'une cible continue 𝒴 = ℝ.
Risque empiriqueSomme (ou moyenne) des carrés des erreurs sur le jeu d'entraînement.
MCOMoindres Carrés Ordinaires : méthode de minimisation du risque empirique.
Régression polynomialeRégression linéaire sur des variables transformées (x², x³, …).
MSEErreur quadratique moyenne, unités².
MAEErreur absolue moyenne, unité native.
RMSERacine de la MSE, unité native.
RMSLERacine du log de l'erreur quadratique moyenne.

Apprentissage non supervisé

TermeDéfinition
ClusteringRecherche d'une partition en clusters homogènes, sans étiquettes.
Réduction de dimensionReprésentation des données dans un espace de dimension plus faible.
Règles d'associationDécouverte de relations d'intérêt entre les données.
K-MeansAlgorithme de partitionnement en K clusters par minimisation de l'inertie intra-cluster.
Algorithme de LloydHeuristique en 4 étapes (initialisation, affectation, mise à jour, convergence) pour K-Means.
CentroïdeCentre de gravité d'un cluster : moyenne vectorielle de ses points.
Inertie intra-clusterSomme des carrés des distances des points au centroïde de leur cluster.
Clustering hiérarchiqueConstruction d'une hiérarchie de clusters, visualisée par un dendrogramme.
Agglomératif (ascendant)Chaque point est initialement un cluster, fusionné successivement avec les plus proches.
Divisif (descendant)Un seul cluster initial, subdivisé successivement jusqu'à obtenir des singletons.
DendrogrammeArbre représentant la hiérarchie des fusions (ou divisions).
Fonction de lienRègle déterminant la distance entre deux clusters.
Lien simple (single)Distance minimale entre deux points des clusters.
Lien complet (complete)Distance maximale entre deux points des clusters.
Lien moyen (UPGMA)Moyenne de toutes les distances par paires.
Lien centroïdal (UPGMC)Distance entre les centroïdes des clusters.
MSTMinimal Spanning Tree — arbre couvrant minimum, utilisé pour le clustering divisif.