Definición
Un paradigma de aprendizaje en el que un único modelo se entrena simultáneamente en varias tareas relacionadas para explotar representaciones compartidas y mejorar la generalización entre tareas.

Principio

Principio
Optimizar conjuntamente un modelo de modo que parámetros compartidos capturen la estructura común entre tareas mientras componentes específicos de cada tarea manejan las diferencias; aprovechar la transferencia inductiva para reducir sobreajuste y mejorar la eficiencia de datos.

Demostración

Demostración
Entrenar una red neuronal con capas de codificador compartidas y salidas separadas para etiquetado de partes del habla, reconocimiento de entidades nombradas y segmentación sintáctica, de modo que el codificador aprenda representaciones lingüísticas útiles para las tres tareas.

Aplicación incorrecta

Aplicación incorrecta
Forzar tareas muy disímiles (por ejemplo, segmentación de imágenes médicas y clasificación de géneros musicales) en un mismo modelo compartido sin diseñar la arquitectura o las pérdidas adecuadas, provocando transferencia negativa donde empeora el rendimiento de una o más tareas.

Consecuencia

Consecuencia
Si las tareas son lo suficientemente relacionadas y las pérdidas están balanceadas, los modelos suelen mostrar mejor generalización, requieren menos parámetros que varios modelos independientes y pueden aprender características útiles con datos limitados.

Inversión

Inversión
Modelos independientes por tarea entrenados por separado, cada uno con parámetros dedicados y sin representación compartida entre tareas.

Límite

Límite
Aplica cuando las tareas comparten necesidades de representación o modalidades de entrada; es menos adecuado cuando las tareas no están relacionadas, tienen objetivos de optimización conflictivos o cuando los datos específicos de una tarea predominan. Requiere ponderación cuidadosa de tareas, diseño arquitectónico y validación para evitar que una tarea domine.

Tensión semántica

Tensión semántica
Se solapa con aprendizaje por transferencia y optimización multiobjetivo: el aprendizaje por transferencia enfatiza la reutilización secuencial de parámetros; la optimización multiobjetivo trata tareas como objetivos simultáneos. El aprendizaje multitarea enfatiza el aprendizaje concurrente de representaciones compartidas entre tareas.

Síntesis

Síntesis
El aprendizaje multitarea unifica varios objetivos predictivos relacionados en un solo proceso de entrenamiento para que los componentes compartidos aprendan la estructura común mientras las partes específicas conservan las diferencias, produciendo modelos eficientes en parámetros que pueden generalizar mejor cuando las tareas son compatibles y están bien balanceadas.