Definición
Un paradigma de aprendizaje en el que un único modelo se entrena simultáneamente en varias tareas relacionadas para explotar representaciones compartidas y mejorar la generalización entre tareas.
Principio
Principio
Optimizar conjuntamente un modelo de modo que parámetros compartidos capturen la estructura común entre tareas mientras componentes específicos de cada tarea manejan las diferencias; aprovechar la transferencia inductiva para reducir sobreajuste y mejorar la eficiencia de datos.
Demostración
Demostración
Entrenar una red neuronal con capas de codificador compartidas y salidas separadas para etiquetado de partes del habla, reconocimiento de entidades nombradas y segmentación sintáctica, de modo que el codificador aprenda representaciones lingüísticas útiles para las tres tareas.
Aplicación incorrecta
Aplicación incorrecta
Forzar tareas muy disímiles (por ejemplo, segmentación de imágenes médicas y clasificación de géneros musicales) en un mismo modelo compartido sin diseñar la arquitectura o las pérdidas adecuadas, provocando transferencia negativa donde empeora el rendimiento de una o más tareas.
Consecuencia
Consecuencia
Si las tareas son lo suficientemente relacionadas y las pérdidas están balanceadas, los modelos suelen mostrar mejor generalización, requieren menos parámetros que varios modelos independientes y pueden aprender características útiles con datos limitados.
Inversión
Inversión
Modelos independientes por tarea entrenados por separado, cada uno con parámetros dedicados y sin representación compartida entre tareas.
Límite
Límite
Aplica cuando las tareas comparten necesidades de representación o modalidades de entrada; es menos adecuado cuando las tareas no están relacionadas, tienen objetivos de optimización conflictivos o cuando los datos específicos de una tarea predominan. Requiere ponderación cuidadosa de tareas, diseño arquitectónico y validación para evitar que una tarea domine.
Tensión semántica
Tensión semántica
Se solapa con aprendizaje por transferencia y optimización multiobjetivo: el aprendizaje por transferencia enfatiza la reutilización secuencial de parámetros; la optimización multiobjetivo trata tareas como objetivos simultáneos. El aprendizaje multitarea enfatiza el aprendizaje concurrente de representaciones compartidas entre tareas.
Síntesis
Síntesis
El aprendizaje multitarea unifica varios objetivos predictivos relacionados en un solo proceso de entrenamiento para que los componentes compartidos aprendan la estructura común mientras las partes específicas conservan las diferencias, produciendo modelos eficientes en parámetros que pueden generalizar mejor cuando las tareas son compatibles y están bien balanceadas.