 ##  [Proceso de Decisión de Markov](/es/node/58108) 

 Definición

Un modelo matemático para la toma de decisiones secuencial bajo incertidumbre definido por el tuple (S, A, P, R, γ): espacio de estados S, conjunto de acciones A, kernel de transición P(s'|s,a), función de recompensa R(s,a) y factor de descuento γ; las decisiones (políticas) asignan a estados acciones o distribuciones sobre acciones.

 

 

 

 

 

 





## Principio

Principio

Las decisiones se optimizan para maximizar la recompensa acumulada esperada (descontada o en horizonte finito) dada la propiedad de Markov: la distribución del siguiente estado depende solo del estado actual y de la acción elegida.

 

 

 

 

 





## Demostración

Demostración

En un MDP finito que representa un grid‑world, S es el conjunto de casillas, A = {arriba, abajo, izquierda, derecha}, P codifica el movimiento estocástico, R da recompensas en casillas objetivo/obstáculo, y las políticas óptimas resuelven las ecuaciones de Bellman para maximizar el retorno descontado.

 

 

 

 

## Aplicación incorrecta

Aplicación incorrecta

Modelar un problema cuya historia contiene información relevante como un MDP sin ampliar el estado viola la suposición de Markov; aprender o planificar con este modelo defectuoso produce políticas subóptimas o inconsistentes.

 

 

 

 

 





## Consecuencia

Consecuencia

Para MDPs finitos y descontados existen políticas estacionarias deterministas óptimas; la programación dinámica y la iteración de valores convergen a funciones de valor óptimas bajo condiciones estándar.

 

 

 

 

## Inversión

Inversión

Si el proceso no es markoviano o es parcialmente observable, el formalismo MDP falla: el control óptimo requiere estrategias dependientes de la historia o el marco más amplio de POMDP en lugar de soluciones MDP ordinarias.

 

 

 

 

 





## Límite

Límite

Se aplica a procesos de decisión en tiempo discreto y totalmente observables (finitos, contables o de estado/acción continuos con estructura medible); excluye problemas con observabilidad parcial salvo que el estado se extienda adecuadamente, y tiempo continuo salvo reformulación.

 

 

 

 

 





## Tensión semántica

Tensión semántica

A menudo se confunde con el aprendizaje por refuerzo: MDP es el modelo formal (entorno más recompensas), mientras que el aprendizaje por refuerzo son los algoritmos para descubrir políticas cuando P o R son desconocidos.

 

 

 

 

 





## Síntesis

Síntesis

Un proceso de decisión de Markov es el marco formal estado‑acción‑transición‑recompensa para el control estocástico secuencial donde la propiedad de Markov permite la optimización recursiva de la recompensa acumulada esperada mediante las relaciones de Bellman.