Definición
Un modelo matemático para la toma de decisiones secuencial bajo incertidumbre definido por el tuple (S, A, P, R, γ): espacio de estados S, conjunto de acciones A, kernel de transición P(s'|s,a), función de recompensa R(s,a) y factor de descuento γ; las decisiones (políticas) asignan a estados acciones o distribuciones sobre acciones.
Principio
Principio
Las decisiones se optimizan para maximizar la recompensa acumulada esperada (descontada o en horizonte finito) dada la propiedad de Markov: la distribución del siguiente estado depende solo del estado actual y de la acción elegida.
Demostración
Demostración
En un MDP finito que representa un grid‑world, S es el conjunto de casillas, A = {arriba, abajo, izquierda, derecha}, P codifica el movimiento estocástico, R da recompensas en casillas objetivo/obstáculo, y las políticas óptimas resuelven las ecuaciones de Bellman para maximizar el retorno descontado.
Aplicación incorrecta
Aplicación incorrecta
Modelar un problema cuya historia contiene información relevante como un MDP sin ampliar el estado viola la suposición de Markov; aprender o planificar con este modelo defectuoso produce políticas subóptimas o inconsistentes.
Consecuencia
Consecuencia
Para MDPs finitos y descontados existen políticas estacionarias deterministas óptimas; la programación dinámica y la iteración de valores convergen a funciones de valor óptimas bajo condiciones estándar.
Inversión
Inversión
Si el proceso no es markoviano o es parcialmente observable, el formalismo MDP falla: el control óptimo requiere estrategias dependientes de la historia o el marco más amplio de POMDP en lugar de soluciones MDP ordinarias.
Límite
Límite
Se aplica a procesos de decisión en tiempo discreto y totalmente observables (finitos, contables o de estado/acción continuos con estructura medible); excluye problemas con observabilidad parcial salvo que el estado se extienda adecuadamente, y tiempo continuo salvo reformulación.
Tensión semántica
Tensión semántica
A menudo se confunde con el aprendizaje por refuerzo: MDP es el modelo formal (entorno más recompensas), mientras que el aprendizaje por refuerzo son los algoritmos para descubrir políticas cuando P o R son desconocidos.
Síntesis
Síntesis
Un proceso de decisión de Markov es el marco formal estado‑acción‑transición‑recompensa para el control estocástico secuencial donde la propiedad de Markov permite la optimización recursiva de la recompensa acumulada esperada mediante las relaciones de Bellman.