Définition
Technique de compression de modèle dans laquelle un modèle plus petit dit « étudiant » est entraîné à reproduire le comportement ou les sorties assouplies d'un modèle plus grand dit « enseignant », afin que l'étudiant hérite de la structure prédictive utile tout en étant plus compact et efficace.
Principe
Principe
Transférer la structure prédictive en entraînant l'étudiant sur des cibles générées par l'enseignant (par ex. probabilités, logits, représentations intermédiaires), souvent en utilisant une mise à l'échelle de température et une fonction de perte combinant l'alignement sur l'enseignant et la supervision directe sur les étiquettes.
Démonstration
Démonstration
Entraîner un réseau neuronal compact à reproduire les probabilités de classe assouplies produites par un classifieur pré-entraîné plus grand sur les mêmes entrées ; l'étudiant atteint une précision proche de celle de l'enseignant tout en nécessitant moins de paramètres et de temps d'inférence.
Mauvaise application
Mauvaise application
Utiliser la distillation pour copier aveuglément les sorties de l'enseignant propage ses erreurs et biais ; distiller sur des données non représentatives ou sans équilibrer l'alignement enseignant et la perte basée sur la vérité terrain peut dégrader la généralisation.
Conséquence
Conséquence
Un étudiant correctement distillé fournit un modèle plus petit et plus rapide qui approxime le comportement de l'enseignant, permettant un déploiement sous contraintes de ressources, mais généralement au prix d'une perte de fidélité sur les décisions rares ou fines de l'enseignant.
Inversion
Inversion
Au lieu de distiller de l'enseignant vers l'étudiant, entraîner le petit modèle directement sur les données étiquetées d'origine (ou construire l'enseignant à partir d'ensembles de petits modèles) — cela privilégie la fidélité à la vérité terrain plutôt que l'imitation de l'enseignant.
Limite
Limite
S'applique lorsqu'un modèle à grande capacité existe et qu'on souhaite un modèle plus léger ; ce n'est pas équivalent à l'élagage, la quantification ou la recherche d'architecture, qui modifient les internes du modèle plutôt que de transférer des motifs prédictifs ; ne garantit pas la suppression des propriétés indésirables de l'enseignant.
Tension sémantique
Tension sémantique
Concurrence avec l'apprentissage par transfert et l'ajustement fin : l'apprentissage par transfert réutilise des représentations apprises via l'initialisation des poids ou l'extraction de caractéristiques, tandis que la distillation vise à transférer explicitement un comportement prédictif via les sorties de l'enseignant.
Synthèse
Synthèse
La distillation de connaissances conçoit la compression comme un transfert comportemental : en entraînant un modèle plus petit à reproduire les sorties ou signaux internes d'un modèle plus grand, on obtient une approximation déployable qui préserve une grande partie de la structure prédictive de l'enseignant tout en échangeant une partie de la fidélité contre de l'efficacité.