Définition
Un paradigme d'apprentissage où un seul modèle est entraîné simultanément sur plusieurs tâches apparentées pour exploiter des représentations partagées et améliorer la généralisation entre tâches.
Principe
Principe
Optimiser conjointement un modèle de sorte que des paramètres partagés captent la structure commune aux tâches tandis que des composants spécifiques à chaque tâche gèrent les différences ; utiliser le transfert inductif pour réduire le surapprentissage et améliorer l'efficacité des données.
Démonstration
Démonstration
Entraîner un réseau de neurones unique avec des couches d'encodage partagées et des têtes de sortie séparées pour l'étiquetage des parties du discours, la reconnaissance d'entités nommées et le découpage syntaxique afin que l'encodeur apprenne des représentations linguistiques utiles aux trois tâches.
Mauvaise application
Mauvaise application
Forcer des tâches très dissemblables (par ex. segmentation d'images médicales et classification de genres musicaux) dans un même modèle partagé sans concevoir l'architecture ou les fonctions de perte appropriées, entraînant un transfert négatif où la performance se dégrade pour une ou plusieurs tâches.
Conséquence
Conséquence
Quand les tâches sont suffisamment apparentées et que les pertes sont équilibrées, les modèles montrent généralement une meilleure généralisation, nécessitent moins de paramètres que plusieurs modèles indépendants et peuvent apprendre des caractéristiques utiles à partir de jeux de données limités.
Inversion
Inversion
Modèles mono-tâche séparés entraînés indépendamment, chacun avec des paramètres dédiés et sans représentation partagée entre tâches.
Limite
Limite
S'applique lorsque les tâches partagent des besoins de représentation ou des modalités d'entrée ; moins approprié lorsque les tâches sont non apparentées, ont des objectifs d'optimisation conflictuels ou lorsque les données spécifiques à une tâche sont prédominantes. Nécessite un réglage des poids de tâche, une conception d'architecture et une validation attentifs pour éviter la domination d'une tâche.
Tension sémantique
Tension sémantique
Chevauchements avec le transfert d'apprentissage et l'optimisation multi-objectifs : le transfert porte sur la réutilisation séquentielle des paramètres ; le multi-objectifs traite les tâches comme des objectifs simultanés. L'apprentissage multitâche met l'accent sur l'apprentissage concurrent de représentations partagées entre tâches.
Synthèse
Synthèse
L'apprentissage multitâche unifie plusieurs objectifs prédictifs apparentés en un seul processus d'entraînement afin que les composants partagés apprennent la structure commune tandis que les parties spécifiques conservent les différences, produisant des modèles efficaces en paramètres et mieux généralisants lorsque les tâches sont compatibles et correctement équilibrées.