Définition
Une méthode itérative pour estimer par maximum de vraisemblance les paramètres de modèles statistiques contenant des variables latentes (cachées) en alternant une étape d'espérance qui calcule les statistiques suffisantes attendues compte tenu des paramètres courants et une étape de maximisation qui met à jour les paramètres pour maximiser la vraisemblance attendue, répétée jusqu'à convergence.

Principe

Principe
Décomposer une vraisemblance intractable en une espérance de données complètes et maximiser ce substitut : l'étape E calcule l'espérance a posteriori des données cachées conditionnellement aux données observées et aux paramètres actuels ; l'étape M optimise les paramètres en traitant ces espérances comme si les données complètes étaient observées.

Démonstration

Démonstration
Ajustement d'un mélange gaussien : l'étape E calcule les responsabilités (probabilité que chaque composante ait généré chaque point) avec les moyennes et variances actuelles ; l'étape M met à jour moyennes, variances et poids de mélange par des moyennes pondérées utilisant ces responsabilités ; on itère jusqu'à stabilisation de la vraisemblance.

Mauvaise application

Mauvaise application
Utiliser EM sans vérifier la multimodalité de la vraisemblance, interpréter un maximum local comme optimum global, ne pas régulariser quand des composantes s'effondrent, ou appliquer EM avec de mauvaises hypothèses de modèle (p. ex. structure d'indépendance conditionnelle incorrecte).

Conséquence

Conséquence
Lorsqu'il est approprié, EM fournit des estimations de paramètres qui augmentent monotoniquement la vraisemblance des données observées et converge souvent vers un maximum local utile ; la convergence peut être lente et sensible à l'initialisation, et l'EM standard ne garantit pas de trouver le maximum global dans des paysages multimodaux.

Inversion

Inversion
Remplacer l'espérance–maximisation itérative par une optimisation directe de la vraisemblance marginale (lorsque cela est faisable) ou par des méthodes Monte Carlo (p. ex. MCMC) transforme l'approche en échantillonnage global ou en maximisation par gradient directe au lieu d'alterner des étapes substitutives.

Limite

Limite
S'applique aux modèles à variables latentes où les espérances conditionnelles sont calculables ou approximables ; exclut les modèles où l'étape E est intractable sans approximation, ou où les vraisemblances sont mal définies ; nécessite une gestion prudente des solutions dégénérées (p. ex. composantes de variance nulle).

Tension sémantique

Tension sémantique
Souvent confondu avec des heuristiques de type EM (p. ex. ascension par coordonnées ou inférence variationnelle) ; EM est spécifiquement le schéma itératif E‑step/M‑step qui maximise l'espérance du log‑vraisemblance des données complètes, tandis que les méthodes variationnelles optimisent une borne inférieure avec des propriétés de convergence différentes.

Synthèse

Synthèse
L'espérance–maximisation alterne le calcul des espérances des données manquantes compte tenu des paramètres courants et la maximisation des paramètres compte tenu de ces espérances : un cadre d'optimisation par substitut qui augmente la vraisemblance observée à chaque étape mais converge vers des optima locaux et dépend de l'accessibilité des espérances.