Définition
Une mesure dirigée de divergence entre deux distributions de probabilité définie comme l'espérance selon la première distribution du logarithme du rapport de leurs densités ; quantifie la perte d'information logarithmique attendue lors de l'approximation d'une distribution par une autre.
Principe
Principe
Non‑négativité avec égalité uniquement lorsque les deux distributions coïncident presque partout ; elle est asymétrique et additive pour des mesures produit indépendantes, capturant la perte d'information directionnelle.
Démonstration
Démonstration
Pour deux lois normales de même variance σ^2 et de moyennes μ1 et μ2, la divergence de la première par rapport à la seconde vaut (μ1−μ2)^2/(2σ^2).
Mauvaise application
Mauvaise application
Interpréter la divergence comme une métrique est incorrect : elle est asymétrique et ne satisfait pas l'inégalité triangulaire ; l'utiliser là où la symétrie est requise conduit à des comparaisons trompeuses.
Conséquence
Conséquence
Utilisée comme critère pour ajuster des modèles approximatifs aux cibles, elle fournit des estimateurs de paramètres qui minimisent la perte logarithmique attendue et offre un critère principiel d'approximation informationnelle optimale à pondération unilatérale.
Inversion
Inversion
Des alternatives symétrisées (par exemple la divergence de Jensen–Shannon) donnent des mesures bornées et symétriques mieux adaptées lorsque la réciprocité entre distributions est requise.
Limite
Limite
Définie uniquement lorsque le support de la distribution de référence est inclus dans le support de la distribution approximante (continuité absolue) ; elle peut être infinie lorsque les supports ne coïncident pas.
Tension sémantique
Tension sémantique
Se distingue des notions métriques comme la variation totale : Kullback–Leibler met l'accent sur la divergence moyenne du logarithme de la vraisemblance pertinente pour le codage et l'inférence, tandis que les métriques saisissent des différences de probabilité au pire cas.
Synthèse
Synthèse
Une mesure d'information directionnelle qui quantifie la perte logarithmique moyenne subie en approchant une distribution de probabilité par une autre, fondamentale en théorie de l'information et en inférence.