Definición
Un principio de aprendizaje supervisado que selecciona un modelo predictivo de una clase de hipótesis minimizando la pérdida media calculada sobre una muestra de entrenamiento finita.
Principio
Principio
Sustituir el riesgo poblacional desconocido por su promedio muestral empírico y escoger la hipótesis que alcanza la menor pérdida empírica; normalmente se añade regularización o control de capacidad para gestionar la generalización.
Demostración
Demostración
Ajustar un predictor lineal minimizando el error cuadrático medio sobre pares entrada–salida observados es un ejemplo: los coeficientes elegidos minimizan la media muestral de los residuos cuadrados en el conjunto de datos.
Aplicación incorrecta
Aplicación incorrecta
Minimizar ciegamente la pérdida empírica sin restringir la complejidad del modelo ni validar, conduciendo a sobreajuste donde el modelo elegido ajusta el ruido de la muestra y rinde mal en datos nuevos.
Consecuencia
Consecuencia
Cuando la complejidad de la clase de hipótesis está controlada y el tamaño muestral es suficiente, los minimizadores empíricos convergen a bajo riesgo poblacional y producen predictores que generalizan; de lo contrario, las garantías fallan.
Inversión
Inversión
En lugar de minimizar la pérdida empírica, se pueden usar métodos que integren explicitamente la incertidumbre del modelo o penalizaciones de complejidad (por ejemplo seleccionando según riesgo en validación o incorporando regularizadores explícitos).
Límite
Límite
Se aplica a problemas con una función de pérdida definida y datos de entrenamiento etiquetados; no especifica por sí mismo cómo elegir la clase de hipótesis, cómo regularizar ni cómo evaluar el rendimiento fuera de muestra.
Tensión semántica
Tensión semántica
Estrechamente relacionado pero distinto de métodos de inferencia que optimizan objetivos posteriores: el riesgo empírico se centra en minimizar la pérdida promedio muestral, mientras que otros marcos enfatizan la modelización probabilística y la cuantificación de la incertidumbre.
Síntesis
Síntesis
La minimización del riesgo empírico es la regla algorítmica fundamental del aprendizaje supervisado: escoger el modelo que minimiza la pérdida media de entrenamiento, sujeto a controles adicionales para asegurar que el rendimiento empírico refleje la capacidad predictiva real.