Definición
Una medida dirigida de discrepancia entre dos distribuciones de probabilidad definida como la esperanza, bajo una distribución, del logaritmo del cociente de sus densidades; cuantifica la pérdida logarítmica esperada al aproximar una por otra.
Principio
Principio
No negatividad con igualdad solo cuando las dos distribuciones coinciden casi en todas partes; es asimétrica y aditiva para medidas producto independientes, capturando pérdida de información direccional.
Demostración
Demostración
Para dos normales con igual varianza σ^2 y medias μ1 y μ2, la divergencia de la primera respecto de la segunda es (μ1−μ2)^2/(2σ^2).
Aplicación incorrecta
Aplicación incorrecta
Interpretar la divergencia como una métrica es incorrecto porque es asimétrica y no satisface la desigualdad triangular; usarla a ciegas donde se necesita simetría conduce a comparaciones engañosas.
Consecuencia
Consecuencia
Usada como objetivo para ajustar modelos aproximados a una distribución objetivo, produce estimaciones de parámetros que minimizan la pérdida logarítmica esperada y da un criterio principado para aproximación informacional óptima unidireccional.
Inversión
Inversión
Alternativas simetrizadas (p. ej. divergencia de Jensen–Shannon) producen medidas acotadas y simétricas, más apropiadas cuando se requiere reciprocidad entre distribuciones.
Límite
Límite
Está definida solo cuando el soporte de la distribución de referencia está contenido en el soporte de la aproximante (continuidad absoluta); puede ser infinita cuando los soportes no coinciden.
Tensión semántica
Tensión semántica
Contrasta con nociones métricas como la variación total: Kullback–Leibler enfatiza la discrepancia media del log‑verosimilitud relevante para codificación e inferencia, mientras que las métricas capturan diferencias de probabilidad en el peor caso.
Síntesis
Síntesis
Una medida direccional de información que cuantifica la pérdida logarítmica esperada al aproximar una distribución por otra, fundacional en teoría de la información e inferencia.