Définitions et notation du cours, classées par thème. La colonne « équivalent anglais » indique le terme utilisé dans les diapositives lorsqu'il diffère.
Notation générale
Notation
Signification
n
Nombre d'observations (lignes de la matrice X)
p
Nombre de variables / caractéristiques (colonnes de X)
xij
Valeur de la j-ième variable pour la i-ième observation
yi
Étiquette ou valeur cible de la i-ième observation
f, f̂
Modèle / prédicteur
ε
Bruit ou erreur aléatoire
𝒳, 𝒴
Espaces des observations et des étiquettes
Concepts fondamentaux
Terme
Équivalent anglais
Définition
Data Science
Data Science
Démarche empirique basée sur les données pour apporter une réponse à des problèmes.
Machine Learning
Machine Learning
Champ d'étude de l'IA qui se fonde sur des approches statistiques pour donner aux ordinateurs la capacité d'apprendre à partir de données.
Cycle de vie
Lifecycle
Processus en 6 étapes d'un projet Data Science : besoin métier, données, préparation, modèle, évaluation, déploiement.
Apprentissage
Learning
Amélioration de la performance P d'un système S sur des tâches T après une expérience Exp.
Généralisation
Generalization
Capacité d'un modèle à prédire correctement sur de nouvelles données non vues à l'entraînement.
Sous-apprentissage
Underfitting
Modèle trop simple ; mauvaises performances en entraînement et en test.
Sur-apprentissage
Overfitting
Modèle trop complexe qui capture le bruit ; bon en entraînement, mauvais en test.
Données et variables
Terme
Définition
Donnée
Résultat d'une observation faite sur une population ou un échantillon (Dodge, 2007).
Variable quantitative
Décrit une quantité mesurable ; continue ou discrète.
Variable qualitative
Décrit une qualité ou caractéristique ; nominale (sans ordre) ou ordinale (avec ordre).
Matrice de design
Matrice X ∈ ℝn×p rassemblant les observations et les variables.
Données structurées
Données indexées, prêtes à être traitées (bases de données).
Données semi-structurées
Fichiers simples à traiter, sans indexation propre (XML, CSV, JSON).
Données non structurées
Données complexes à manipuler (images, texte, signaux).
Apprentissage supervisé — classification
Terme
Définition
Classification binaire
Classification où 𝒴 = {0, 1}.
Classification multi-classe
Classification où 𝒴 = {1, …, C}.
Fonction de décision
Fonction g : 𝒳 → ℝ dont le signe détermine la classe prédite.
Région de décision
Sous-ensemble de l'espace où une même classe est prédite.
Régression logistique
Modèle linéaire dont la sortie est passée dans une sigmoïde, seuillée à 0,5.
KNN
k-Plus Proches Voisins : vote de majorité (classification) ou moyenne (régression) sur les k voisins les plus proches.
SVM
Machines à Vecteurs Supports : recherche de l'hyperplan séparateur qui maximise la marge.
Marge
Distance entre l'hyperplan séparateur et l'observation la plus proche.
Vecteur de support
Observation située exactement à une distance γ de l'hyperplan séparateur.
Arbre de décision
Modèle organisé en nœuds de test et feuilles de classe (ou valeur).
Forêt aléatoire
Ensemble d'arbres entraînés sur des échantillons bootstrap, avec sous-espace aléatoire d'attributs.
Bootstrap
Tirage aléatoire avec remise d'un échantillon de taille n.
Bagging
Bootstrap aggregating : entraînement de modèles indépendants sur des échantillons bootstrap, puis agrégation.