Cada vez que alguien explica cómo "piensan" los agentes de IA basados en LLM, tarde o temprano aparecen tres palabras que suenan intimidantes: POMDP, belief state y regla de Bayes. La buena noticia es que, detrás de la notación, la idea es bastante simple. Vamos a desarmarla con una sola analogía.
La analogía: un detective que nunca ve la escena completa
Imagina un detective investigando un caso. Nunca puede ver la escena del crimen completa de una sola vez — solo va recibiendo pistas sueltas, una por una: un testimonio hoy, una huella mañana, una grabación borrosa la próxima semana. Nunca sabe con certeza absoluta quién es el culpable. Solo puede ir ajustando sus sospechas a medida que llegan nuevas pistas.
Ese es, casi exactamente, el problema que enfrenta cualquier agente de IA.
El problema de fondo: el mundo real está oculto
En la jerga formal, el estado real del mundo (llamémoslo s) — quién es el culpable, en nuestra analogía — está oculto. El agente nunca lo ve directamente. Lo único que recibe son observaciones parciales (o) — las pistas sueltas, incompletas y a veces ruidosas.
Este problema tiene nombre en teoría de decisiones: se llama POMDP (Partially Observable Markov Decision Process, o proceso de decisión de Markov parcialmente observable). Es, simplemente, el marco matemático formal para "tomar decisiones cuando no ves el mundo real, solo pistas parciales".
Formalmente, el mundo se comporta así:
s_{t+1} ~ T(s' | s_t, a_t)
o_{t+1} ~ O(o' | s_{t+1}, a_t)
Traducido: el mundo cambia de un estado oculto a otro (T, el "kernel de transición") como respuesta a la acción del agente, y luego genera una observación (O, el "kernel de observación") a partir de ese nuevo estado — nunca al revés, y nunca de forma perfecta. El símbolo ~ significa "se muestrea de", es decir, es un proceso con algo de azar, no una fórmula que siempre da el mismo resultado. En la analogía: el crimen ya ocurrió y dejó cierta escena (s), pero la pista que le llega al detective (o) es apenas un reflejo parcial y ruidoso de esa escena — nunca la escena completa.
Bayes: la herramienta para actualizar sospechas
Si el detective no puede ver la verdad directamente, ¿qué puede hacer? Mantener una sospecha — una estimación de qué tan probable es cada posible culpable — y ajustarla cada vez que llega una pista nueva. Eso es exactamente lo que hace la regla de Bayes:
Mi nueva sospecha es mi sospecha anterior, reajustada según qué tan bien la pista nueva encaja con cada sospechoso posible.
En la teoría del POMDP, esta sospecha se llama belief state (estado de creencia, b), y esa frase en español es, literalmente, esta fórmula:
b_{t+1}(s') ∝ O(o_{t+1} | s', a_t) · Σ_s T(s' | s, a_t) · b_t(s)
Se lee de derecha a izquierda: parte de la sospecha anterior (b_t), predice a dónde pudo haber llevado la última acción (la suma sobre T, recorriendo todos los sospechosos posibles), y luego reajusta esa predicción según qué tan bien la encaja la nueva pista (el factor O). Es la regla de Bayes, aplicada un paso a la vez, cada vez que llega una observación nueva.
Y una vez que el detective tiene una sospecha, todavía necesita decidir qué hacer con ella — interrogar al mayordomo, pedir una orden de cateo, esperar una pista más. Eso también tiene una fórmula, la ecuación de valor óptimo:
V*(b) = max_{a} [ Σ_s b(s)·R(s,a) + γ · Σ_o P(o|b,a)·V*(b') ]
En español: el valor de tener cierta sospecha (b) es el de la mejor acción disponible — el pago inmediato esperado de esa acción, más el valor de a dónde te lleve después (descontado por γ, porque el futuro vale un poco menos que el presente). Es una fórmula preciosa... y es exactamente la que hace que resolver un POMDP sea computacionalmente brutal: el espacio de posibles sospechas es continuo e infinito, y calcular esta ecuación de forma exacta es tan costoso que se vuelve inviable para cualquier problema del mundo real.
El giro: así NO funciona un agente LLM
Aquí está la parte que sorprende: un agente construido sobre un LLM no hace nada de esto. No calcula sospechas con fórmulas de Bayes. No mantiene una distribución de probabilidad formal sobre el estado del mundo.
En cambio, hace algo mucho más simple — y sorprendentemente efectivo:
a_t = π(h_t)
Traducido: la siguiente acción del agente (a_t) es simplemente el resultado de meterle todo el historial de mensajes (h_t) a la política (π, que en este caso es el LLM).
En otras palabras, el agente no calcula nada — simplemente guarda todas las pistas en un cuaderno de notas completo (el historial de la conversación) y le muestra ese cuaderno entero al LLM cada vez que necesita decidir algo. Confía en que el modelo, al leer todo de una vez, "entienda" la situación razonablemente bien, sin necesidad de un cálculo formal de probabilidades.
Por qué se usa el vocabulario del POMDP de todos modos
Si el agente LLM no ejecuta las matemáticas del POMDP, ¿por qué los libros y artículos técnicos siguen usando palabras como "creencia" u "observación parcial" para describirlo?
Porque son un préstamo útil de vocabulario, no una afirmación de que se estén haciendo los cálculos reales. Es parecido a decir "voy a hacer un backup mental de esto" — tomamos prestada una palabra técnica (backup) para describir algo mucho más simple (memorizar), sin ejecutar ningún proceso técnico real.
De la misma forma, decir que el historial de mensajes (h_t) "aproxima" el belief state (b_t) es una forma útil de explicar por qué guardar y mostrar todo el historial es una buena estrategia — sin necesidad de afirmar que el LLM está calculando probabilidades exactas por debajo.
El mapa completo, en una tabla
| Concepto | Qué es | En la analogía del detective |
|---|---|---|
| s (estado real) | La verdad oculta del mundo | Quién es realmente el culpable |
| o (observación) | Lo que el agente sí percibe | Cada pista suelta |
| POMDP | El problema formal completo | "Resolver el caso solo con pistas parciales" |
| b (belief state) | La sospecha calculada con Bayes | "70% creo que fue el mayordomo" (cálculo exacto) |
| h (historia) | Todas las pistas guardadas en crudo | El cuaderno de notas completo |
| π (política = LLM) | Quien decide la siguiente acción | El detective decidiendo qué hacer |
| a (acción) | Lo que el agente hace | "Voy a interrogar al mayordomo" |
La idea para llevarse
El POMDP y la regla de Bayes describen la forma ideal y matemáticamente perfecta de decidir bajo incertidumbre. Pero es tan costosa de calcular que ningún agente real la ejecuta tal cual.
Un agente LLM toma un atajo pragmático: en vez de calcular una creencia formal, simplemente lee todo el historial de golpe y confía en la capacidad del modelo de lenguaje para captar, de forma implícita, algo parecido a esa creencia — sin necesidad de una sola fórmula de probabilidad.
El vocabulario del POMDP no describe lo que el agente hace. Describe el problema que el agente está tratando de resolver, y por qué la estrategia de "meter todo el contexto al modelo" no es arbitraria — es, en el fondo, una aproximación honesta a un problema que sabemos, matemáticamente, que no se puede resolver de forma exacta.
Top comments (0)