Definición
Un modelo matemático para la toma de decisiones secuencial bajo incertidumbre definido por el tuple (S, A, P, R, γ): espacio de estados S, conjunto de acciones A, kernel de transición P(s'|s,a), función de recompensa R(s,a) y factor de descuento γ; las decisiones (políticas) asignan a estados acciones o distribuciones sobre acciones.

Principio

Principio
Las decisiones se optimizan para maximizar la recompensa acumulada esperada (descontada o en horizonte finito) dada la propiedad de Markov: la distribución del siguiente estado depende solo del estado actual y de la acción elegida.

Demostración

Demostración
En un MDP finito que representa un grid‑world, S es el conjunto de casillas, A = {arriba, abajo, izquierda, derecha}, P codifica el movimiento estocástico, R da recompensas en casillas objetivo/obstáculo, y las políticas óptimas resuelven las ecuaciones de Bellman para maximizar el retorno descontado.

Aplicación incorrecta

Aplicación incorrecta
Modelar un problema cuya historia contiene información relevante como un MDP sin ampliar el estado viola la suposición de Markov; aprender o planificar con este modelo defectuoso produce políticas subóptimas o inconsistentes.

Consecuencia

Consecuencia
Para MDPs finitos y descontados existen políticas estacionarias deterministas óptimas; la programación dinámica y la iteración de valores convergen a funciones de valor óptimas bajo condiciones estándar.

Inversión

Inversión
Si el proceso no es markoviano o es parcialmente observable, el formalismo MDP falla: el control óptimo requiere estrategias dependientes de la historia o el marco más amplio de POMDP en lugar de soluciones MDP ordinarias.

Límite

Límite
Se aplica a procesos de decisión en tiempo discreto y totalmente observables (finitos, contables o de estado/acción continuos con estructura medible); excluye problemas con observabilidad parcial salvo que el estado se extienda adecuadamente, y tiempo continuo salvo reformulación.

Tensión semántica

Tensión semántica
A menudo se confunde con el aprendizaje por refuerzo: MDP es el modelo formal (entorno más recompensas), mientras que el aprendizaje por refuerzo son los algoritmos para descubrir políticas cuando P o R son desconocidos.

Síntesis

Síntesis
Un proceso de decisión de Markov es el marco formal estado‑acción‑transición‑recompensa para el control estocástico secuencial donde la propiedad de Markov permite la optimización recursiva de la recompensa acumulada esperada mediante las relaciones de Bellman.