Definición
Técnica de compresión de modelos en la que un modelo más pequeño, llamado 'estudiante', se entrena para reproducir el comportamiento o las salidas suavizadas de un modelo mayor, llamado 'profesor', de modo que el estudiante herede estructura predictiva útil siendo más compacto y eficiente.

Principio

Principio
Transferir estructura predictiva entrenando al estudiante con objetivos generados por el profesor (p. ej. probabilidades, logits, representaciones intermedias), a menudo usando escalado de temperatura y pérdidas que combinan alineamiento con el profesor y supervisión directa sobre las etiquetas.

Demostración

Demostración
Entrenar una red neuronal compacta para igualar las probabilidades de clase suavizadas producidas por un clasificador grande preentrenado sobre las mismas entradas; el estudiante alcanza una precisión cercana a la del profesor usando menos parámetros y menos tiempo de inferencia.

Aplicación incorrecta

Aplicación incorrecta
Usar la distilación para copiar ciegamente las salidas del profesor propaga errores y sesgos del profesor; destilar con datos no representativos o sin equilibrar la alineación con el profesor y la pérdida de verdad puede empeorar la generalización.

Consecuencia

Consecuencia
Un estudiante correctamente destilado ofrece un modelo más pequeño y rápido que aproxima el comportamiento del profesor, permitiendo su despliegue con recursos limitados, pero suele conllevar pérdida de fidelidad en decisiones raras o muy finas del profesor.

Inversión

Inversión
En lugar de destilar del profesor al estudiante, entrenar el modelo pequeño directamente con los datos etiquetados originales (o construir el profesor a partir de ensamblajes de modelos pequeños); esto prioriza la fidelidad a la verdad terreno sobre la imitación del profesor.

Límite

Límite
Se aplica cuando existe un modelo de alta capacidad y se desea uno más liviano; no es equivalente a pruning, cuantización o búsqueda de arquitectura, que modifican los internos del modelo en vez de transferir patrones predictivos; no garantiza por sí solo la eliminación de propiedades indeseables del profesor.

Tensión semántica

Tensión semántica
Compite con el aprendizaje por transferencia y el fine-tuning: el aprendizaje por transferencia reutiliza representaciones aprendidas mediante inicialización de pesos o extracción de características, mientras que la destilación pretende transferir comportamiento predictivo explícitamente mediante las salidas del profesor.

Síntesis

Síntesis
La destilación de conocimiento plantea la compresión como una transferencia de comportamiento: al entrenar un modelo más pequeño para replicar las salidas suavizadas o las señales internas de uno mayor, se obtiene una aproximación desplegable que preserva gran parte de la estructura predictiva del profesor a cambio de mayor eficiencia.