 ##  [Processus de Décision de Markov](/fr/node/58108) 

 Définition

Un modèle mathématique de prise de décision séquentielle sous incertitude défini par un quintuple (S, A, P, R, γ) : espace d'états S, ensemble d'actions A, noyau de transition P(s'|s,a), fonction de récompense R(s,a) et facteur d'actualisation γ ; les décisions (politiques) associent aux états des actions ou des lois sur les actions.

 

 

 

 

 

 





## Principe

Principe

Les décisions sont optimisées pour maximiser la récompense cumulative espérée (discountée ou horizon fini) sous l'hypothèse de Markov selon laquelle la distribution du prochain état dépend uniquement de l'état courant et de l'action choisie.

 

 

 

 

 





## Démonstration

Démonstration

Dans un MDP fini représentant un 'grid‑world', S est l'ensemble des cases, A = {haut,bas,gauche,droite}, P encode le mouvement stochastique, R attribue des récompenses aux cases but/obstacles, et les politiques optimales résolvent les équations de Bellman pour maximiser le gain actualisé.

 

 

 

 

## Mauvaise application

Mauvaise application

Modéliser un problème où l'historique contient des informations pertinentes comme un MDP sans étendre l'état viole l'hypothèse de Markov ; l'apprentissage ou la planification avec ce modèle erroné produit des politiques sous‑optimales ou inconsistantes.

 

 

 

 

 





## Conséquence

Conséquence

Pour les MDP finis et discountés il existe des politiques stationnaires déterministes optimales ; les algorithmes de programmation dynamique et d'itération de la valeur convergent vers les fonctions de valeur optimales sous des conditions standard.

 

 

 

 

## Inversion

Inversion

Si le processus n'est pas markovien ou est partiellement observable, la formalisation MDP échoue : le contrôle optimal exige des stratégies dépendantes de l'histoire ou le cadre plus riche des POMDP plutôt que des solutions MDP ordinaires.

 

 

 

 

 





## Limite

Limite

S'applique aux processus décisionnels en temps discret et totalement observables (fini, dénombrable, ou d'état/action continus avec structure mesurable) ; exclut les problèmes partiellement observables sauf si l'état est étendu de manière appropriée, et le continu en temps sauf reformulation.

 

 

 

 

 





## Tension sémantique

Tension sémantique

Souvent confondu avec l'apprentissage par renforcement : le MDP est le modèle formel (environnement et récompenses), tandis que l'apprentissage par renforcement regroupe les algorithmes pour découvrir des politiques lorsque P ou R sont inconnus.

 

 

 

 

 





## Synthèse

Synthèse

Un processus de décision de Markov est le cadre formel état‑action‑transition‑récompense pour le contrôle séquentiel stochastique où la propriété de Markov permet l'optimisation récursive de la récompense cumulée espérée via les relations de Bellman.