GLM-5.2 resuelve el 99,2% de los problemas de AIME 2026 con apenas 40.000 millones de parámetros activos por token, una fracción de los cerca de 280.000 millones que se rumoreaba usaba GPT-4 en 2023 para apenas resolver algún problema de la misma prueba. El truco no es magia: los laboratorios están vaciando el conocimiento factual de los modelos para dejar espacio al razonamiento puro.
Preguntale a esos mismos modelos compactos un dato duro sin darles herramientas externas, y la ilusión se rompe. Qwen3.5 de 9.000 millones de parámetros alucina hasta el 82% de las veces cuando no sabe la respuesta, según Artificial Analysis. El conocimiento factual no desapareció: se movió fuera de los pesos.
TL;DR
- GLM-5.2 anota 99,2% en AIME 2026 con unos 40.000 millones de parámetros activos por token.- Qwen3.5 llega a 91,3% en AIME 2026 usando solo 17.000 millones de parámetros activos.- DeepSeek V4-Flash razona con unos 13.000 millones de parámetros activos por token.- GPT-4 (2023) usaba un estimado de 280.000 millones de parámetros activos y apenas resolvía AIME.- En SimpleQA, el líder Gemini 2.5 Pro acierta solo el 53% de preguntas factuales sin herramientas.- Qwen3.5 de 4B y 9B alucina entre 80% y 82% de las veces cuando no conoce un hecho, según Artificial Analysis.- La serie Physics of Language Models mide la capacidad factual en unos 2 bits de conocimiento por parámetro.- Phi-4 de Microsoft (14.000 millones de parámetros) es fuerte en matemática y débil en trivia por su entrenamiento sintético.
Introducción
Durante 2023 y 2024, la frontera de la IA avanzó a fuerza de más parámetros: cuantos más pesos, mejor el modelo. Ese supuesto se rompió. Hoy los laboratorios entrenan modelos más chicos y más capaces en razonamiento verificable, matemática y código, a costa de sacrificar deliberadamente cuánto saben de memoria sobre el mundo. No es un efecto secundario ni una limitación técnica: es una decisión de diseño.
Qué pasó con el conocimiento factual
El desarrollador Walter van der Giessen documentó el patrón en un análisis publicado en w4g1.dev: mientras los puntajes de razonamiento suben, el cómputo por token baja. GLM-5.2 llega al 99,2% en AIME 2026 con unos 40.000 millones de parámetros activos por token. Qwen3.5 anota 91,3% con solo 17.000 millones activos. DeepSeek V4-Flash razona con apenas 13.000 millones activos por token. Para dimensionar el salto: GPT-4 corría, según estimaciones que circularon en 2023, con cerca de 280.000 millones de parámetros activos y aun así apenas resolvía un problema de AIME.
En el otro extremo de la escala, Qwen3.5 de 9.000 millones de parámetros cuantizado cabe en 6 GB de VRAM (una GPU de laptop gamer) y duplica el puntaje del siguiente mejor modelo de menos de 10.000 millones de parámetros en el índice de inteligencia de Artificial Analysis. Si el único criterio fueran los benchmarks de matemática y código, la conclusión sería que los modelos se volvieron radicalmente más inteligentes por parámetro.
La foto cambia por completo con una pregunta factual simple, sin herramientas de búsqueda de por medio. En SimpleQA, el benchmark de recuerdo factual sin herramientas, el líder actual es Gemini 2.5 Pro con apenas 53% de aciertos. Los modelos chicos ni se acercan: Qwen3.5 de 4.000 y 9.000 millones de parámetros alucina entre el 80% y el 82% de las veces que no conoce la respuesta, según el benchmark de conocimiento de Artificial Analysis. Cuando no saben algo, que es la mayoría del tiempo, inventan una respuesta con total seguridad.
Contexto e historia
Los datos duros ocupan espacio físico dentro de una red neuronal. La serie de investigación Physics of Language Models midió esa capacidad y llegó a una cifra memorable: un modelo guarda, en promedio, unos 2 bits de conocimiento factual por parámetro. Si querés un modelo que sepa el año de nacimiento de cualquier matemático menor del siglo XIX, la población de cada municipio holandés y el orden exacto de los argumentos de cada función de cada paquete de npm, pagás ese conocimiento en pesos. Es buena parte de la razón por la que los modelos de frontera llegaron a tener billones de parámetros.
El razonamiento comprime mucho mejor que los hechos porque es, en esencia, un conjunto chico de procedimientos que se repiten: dividir un problema en partes, llevar un estado intermedio, revisar el propio trabajo, retroceder cuando un paso falla. La destilación y el aprendizaje por refuerzo sobre tareas verificables transfieren esos procedimientos a modelos chicos sorprendentemente bien. Phi-4, de Microsoft, tiene 14.000 millones de parámetros, se entrenó fuerte con datos sintéticos estilo libro de texto, y es bueno en matemática y malo en trivia: el resultado exacto de lo que había, y lo que no había, en sus datos de entrenamiento. Lo que antes se veía como una limitación del enfoque de datos sintéticos hoy se ve como el objetivo de diseño.
El conocimiento que sobrevive al recorte tiene una forma particular. Estos modelos son generalistas: saben un poco de casi todo y casi nada en profundidad. Preguntale a uno por PostgreSQL y te va a decir qué es, para qué sirve y a grandes rasgos cómo funciona MVCC, pero si le pedís qué versión agregó una función específica del planner, vuelve a inventar. Esa es la capa correcta para guardar en los pesos: la amplitud es lo que le permite al modelo entender de qué trata una pregunta, saber qué buscar y juzgar si una fuente es creíble. La profundidad es barata de buscar y cara de almacenar, así que es la parte que se recorta.
Detalles técnicos y rendimiento
ModeloParámetros activos por tokenPrecisión en AIME 2026DetalleGLM-5.2~40.000 millones99,2%Arquitectura MoE, mayoría de parámetros en expertos de conocimientoQwen3.517.000 millones91,3%Corre en hardware de gama mediaDeepSeek V4-Flash~13.000 millonesNo reportado en la fuente~284.000 millones de parámetros totales, la mayoría en expertosGPT-4 (2023, referencia)~280.000 millones (rumor)Baja, apenas resolvía AIMESin optimización dedicada a razonamiento verificable
La arquitectura que hace posible este recorte es mixture of experts (MoE): el modelo tiene muchos más parámetros totales que activos, y en cada token solo se activa un subconjunto de expertos. DeepSeek V4-Flash razona con unos 13.000 millones de parámetros activos, pero sus expertos suman cerca de 284.000 millones en total. La mayoría de esos expertos no son motores de razonamiento: son almacenamiento de hechos. Es justamente esa parte, los expertos de conocimiento, la que este cambio de diseño vuelve opcional.
Menos parámetros activos, igual o mejor puntaje en razonamiento verificable.
Hay una consecuencia práctica inmediata: si el conocimiento vive sobre todo en los expertos y el razonamiento cabe en 13.000 a 40.000 millones de parámetros activos, recortar los expertos de hechos hace que el tamaño total del modelo se acerque al tamaño activo. Un modelo de 20.000 a 40.000 millones de parámetros a 4 bits de cuantización entra en una tarjeta de 24 GB, la misma que viene en PCs gamer desde 2022. La contrapartida es que ese modelo compacto no va a saber, por ejemplo, un dato reciente si nadie se lo dice.
Cómo probarlo
El patrón se puede reproducir hoy con modelos reales que corren en tu propia máquina, sin depender de un laboratorio de frontera. La forma más simple es Ollama, que empaqueta el modelo y expone una API local.
Windows (PowerShell):
winget install Ollama.Ollama
ollama pull qwen2.5:7b
ollama run qwen2.5:7b "Resolve paso a paso: un tren sale a las 14:00 a 80 km/h y otro sale 30 minutos despues a 100 km/h por la misma ruta, en que momento se cruzan?"
macOS:
brew install ollama
ollama pull qwen2.5:7b
ollama run qwen2.5:7b "Resolve paso a paso el mismo problema del tren"
Linux:
curl -fsSL https://ollama.com/install.sh | sh
ollama pull qwen2.5:7b
ollama run qwen2.5:7b "Resolve paso a paso el mismo problema del tren"
Ese mismo modelo chico, sin contexto externo, va a fallar si le pedís un dato factual puntual que no memorizó. El patrón que documenta w4g1.dev con modelos de frontera se reproduce a escala chica: buen razonamiento, conocimiento factual pobre.
El complemento es un harness que le entregue el hecho en el momento de la consulta, en vez de esperar que lo tenga memorizado:
// harness.js: el modelo razona, la busqueda aporta el hecho actualizado
import ollama from 'ollama'
async function responderConHechos(pregunta, contextoFactual) {
const prompt = `Contexto verificado:\n${contextoFactual}\n\nPregunta: ${pregunta}\nRespondé usando solo el contexto de arriba.`
const respuesta = await ollama.chat({
model: 'qwen2.5:7b',
messages: [{ role: 'user', content: prompt }]
})
return respuesta.message.content
}
const release = await fetch('https://api.github.com/repos/ollama/ollama/releases/latest').then(r => r.json())
const texto = await responderConHechos('Cual es la ultima version de Ollama?', release.tag_name)
console.log(texto)
El modelo nunca memorizó la versión de Ollama: la recibe en el prompt en tiempo de consulta, así el dato no queda obsoleto aunque el modelo tenga meses de antigüedad.
Para confirmar qué modelo y qué cuantización tenés realmente cargados, ollama show qwen2.5:7b imprime el conteo de parámetros y el detalle de cuantización. Para medir la tasa de alucinación en tu propio caso de uso, pedile al modelo un dato verificable que no esté en el contexto que le diste (una fecha, una versión, un número concreto) y contrastá la respuesta contra la fuente real. Un modelo bien usado en este esquema debería decir que no lo sabe o pedir más contexto, no inventar un número con la misma confianza que si lo supiera.
Impacto y análisis
El desplazamiento tiene una lectura práctica para quien construye con agentes de código. Un agente que edita un repositorio no necesita haber memorizado la superficie de API de una dependencia: le alcanza con leer node_modules o la documentación antes de llamar a cualquier función, y su respuesta queda anclada a la versión instalada, no a la que dominaba el corpus de entrenamiento. El recuerdo que antes era un costo fijo en cada pase hacia adelante se convirtió en una consulta bajo demanda.
💭 Clave: la frontera técnica ya no es solo entrenar modelos más grandes, sino decidir qué conocimiento vive en los pesos y cuál se resuelve en tiempo de consulta contra una fuente externa.
Esto también cambia la economía del envejecimiento de un modelo. Una corrida de entrenamiento de frontera toma meses y cuesta cientos de millones de dólares, y en el momento en que termina, los hechos que memorizó empiezan a quedar viejos: las APIs cambian, los precios cambian, la gente cambia de trabajo. Un modelo cargado de hechos envejece junto con su corpus. Uno cargado sobre todo de procedimientos depende mucho menos de su fecha de corte, porque el estado actual del mundo nunca estuvo pensado para vivir en los pesos.
⚠️ Ojo: un modelo optimizado para razonar responde con la misma seguridad tanto si el dato es correcto como si lo inventó. La confianza del texto generado no es una señal de precisión factual, y confiar en el resultado de un modelo chico sin contexto externo es la forma más rápida de publicar un dato falso.
La limitación real es que este enfoque traslada la responsabilidad de la corrección al harness. Si la búsqueda devuelve una fuente vieja o un sistema de recuperación indexa mal un documento, un modelo que razona muy bien va a construir una respuesta igual de convincente sobre datos igual de incorrectos. Para tareas donde no hay una fuente externa confiable a mano, como opinión o síntesis de literatura dispersa, un modelo chico y sin memoria factual profunda sigue siendo peor que uno de frontera con más conocimiento propio.
Qué sigue
La lógica de esta tendencia, extrapolada un par de años, apunta a un modelo con razonamiento de frontera que corre en una sola GPU de consumo. La mitad del cómputo ya casi llegó ahí: DeepSeek V4-Flash razona con unos 13.000 millones de parámetros activos por token, dentro del rango de una GPU de consumo. Lo que no entra todavía son los otros cerca de 271.000 millones de parámetros que viven en sus expertos, y esos expertos son sobre todo almacenamiento de hechos.
El harness (búsqueda, RAG, herramientas) reemplaza al peso como fuente de hechos.
flowchart TD
A["Modelo: pesos con razonamiento"] --> B{"Necesita un hecho actual?"}
B -- "Si" --> C["Harness: busqueda o herramienta"]
C --> D["Hecho verificado y actualizado"]
D --> E["Respuesta final"]
B -- "No, es logica pura" --> E
Ese diagrama resume el cambio de fondo: el modelo aporta el razonamiento, y todo lo que razona se le entrega en el momento de la consulta. El costo de mantener actualizado un sistema así ya no está en reentrenar un modelo de billones de parámetros cada pocos meses, sino en mantener actualizado el harness (el índice de búsqueda, los documentos, las herramientas) que lo alimenta.
Probalo vos: corré ollama pull qwen2.5:7b y comparalo en tu propia terminal contra una pregunta de matemática y una de trivia sin contexto, vas a ver el mismo patrón que documenta w4g1.dev en modelos mucho más grandes.
📖 Resumen en Telegram: Ver resumen
Preguntas frecuentes
¿Por qué los modelos de IA memorizan menos hechos ahora?
Porque el razonamiento comprime mejor que el conocimiento factual: unos pocos procedimientos generales rinden en muchos problemas, mientras que cada hecho nuevo exige parámetros dedicados solo a guardarlo.
¿Qué es la tasa de alucinación y cómo se mide?
Es el porcentaje de respuestas incorrectas que un modelo entrega con apariencia de certeza cuando no conoce el dato real. Artificial Analysis la mide en su benchmark de conocimiento, y en Qwen3.5 de 4.000 y 9.000 millones de parámetros llega a 80-82%.
¿Un modelo chico sirve para programar si no sabe hechos?
Sí, si trabaja con un harness: documentación, el propio repositorio o herramientas de búsqueda. El razonamiento es la parte que un modelo chico retiene bien; los detalles específicos de una API se buscan en tiempo real.
¿Qué es la arquitectura mixture of experts (MoE)?
Es un diseño donde el modelo tiene muchos más parámetros totales que los que activa en cada token: solo un subconjunto de expertos se enciende por consulta, lo que permite guardar mucho conocimiento en el total sin pagar ese costo en cada cómputo.
¿Voy a poder correr un modelo de frontera en mi propia GPU?
La tendencia apunta a eso: si el conocimiento factual se recorta y el tamaño total se acerca al tamaño activo, un modelo de 20.000 a 40.000 millones de parámetros a 4 bits ya entra en una tarjeta de 24 GB, algo que muchas PCs gamer tienen desde 2022.
¿Cómo verifico si una respuesta del modelo es un hecho real o inventado?
Pedile la fuente y contrastala contra el harness: documentación oficial, una API o una búsqueda. Si el modelo no puede señalar de dónde sacó el dato o el contexto que le diste no lo contiene, tratá la respuesta como no verificada.
Referencias
- Models Are Getting Dumber on Purpose, Walter van der Giessen: el análisis original con los datos de GLM-5.2, Qwen3.5, DeepSeek V4-Flash y SimpleQA.- Physics of Language Models: la serie de investigación que mide la capacidad factual en bits por parámetro.- Phi-4 en Hugging Face: ficha del modelo de Microsoft entrenado con datos sintéticos.- Ollama: herramienta para correr modelos de lenguaje de forma local en Windows, macOS y Linux.- Mixture of experts, Wikipedia: explicación de la arquitectura MoE usada por los modelos mencionados.
📱 ¿Te gusta este contenido? Únete a nuestro canal de Telegram @programacion donde publicamos a diario lo más relevante de tecnología, IA y desarrollo. Resúmenes rápidos, contenido fresco todos los días.
Top comments (0)