DeepSeek V4 Flash 0731 anota 89,0% en ARC-AGI-1 y 61,4% en ARC-AGI-2, dos de los benchmarks de razonamiento abstracto más resistentes a los modelos de lenguaje, según los resultados que publicó ARC Prize Foundation el 31 de julio de 2026.
Lo que distingue este resultado no es solo el puntaje: es el costo. La variante de mayor esfuerzo de razonamiento llega a esas cifras por $0,02 y $0,04 por tarea respectivamente, un precio que ubica a DeepSeek V4 Flash entre los modelos más económicos en superar el 60% en ARC-AGI-2.
TL;DR
- DeepSeek V4 Flash 0731, en su variante Max, anota 89,0% en ARC-AGI-1 Semi-Private a $0,02 por tarea.
- La misma variante Max llega a 61,4% en ARC-AGI-2 Semi-Private a $0,04 por tarea, su mejor marca publicada.
- ARC Prize evaluó tres variantes de razonamiento: Max, High y Low, cada una con distinto balance entre costo y precisión.
- La variante High anota 87,0% en ARC-AGI-1 y 56,0% en ARC-AGI-2, un escalón por debajo de Max.
- La variante Low, la más económica, llega a 84,0% en ARC-AGI-1 y 46,0% en ARC-AGI-2.
- Los resultados fueron verificados de forma independiente por ARC Prize Foundation y publicados el 31 de julio de 2026.
- La brecha entre ARC-AGI-1 y ARC-AGI-2 ronda los 27,6 puntos porcentuales en la variante Max, evidencia de que el segundo benchmark sigue sin saturarse.
Introducción
ARC-AGI no es un benchmark más de trivia o código: mide si un sistema puede resolver problemas de razonamiento abstracto que nunca vio durante el entrenamiento. Cada tarea presenta una grilla de colores como ejemplo de entrada y salida, y el modelo tiene que inferir la regla de transformación y aplicarla a un caso nuevo. Ningún patrón memorizado de internet sirve ahí: la tarea exige generalización real.
El benchmark original, ARC-AGI-1, lleva años siendo un techo difícil de romper para los LLM sin herramientas externas. ARC-AGI-2, su sucesor, subió la dificultad a propósito: incorpora tareas que requieren combinar varias reglas a la vez y descarta los patrones que los modelos grandes habían aprendido a explotar en la primera versión. Que un modelo llegue a 61,4% en ARC-AGI-2 sin ajuste específico para el benchmark es, en ese contexto, una marca relevante.
Qué pasó: DeepSeek V4 Flash entra al leaderboard de ARC-AGI
El 31 de julio de 2026, ARC Prize Foundation publicó la página de resultados verificados de DeepSeek V4 Flash 0731. El proceso de verificación de ARC Prize corre el modelo contra el set de evaluación semi-privado del benchmark, que no está expuesto públicamente para evitar contaminación de datos de entrenamiento: nadie puede memorizar respuestas de un set que no puede ver.
DeepSeek presentó tres variantes de razonamiento para la evaluación: Low, High y Max. Es el mismo patrón que usan otros laboratorios con modelos de razonamiento extendido: el usuario elige cuánto cómputo invertir por respuesta, y esa decisión se refleja directamente en el costo por tarea. En Max, DeepSeek V4 Flash 0731 anotó 89,0% en ARC-AGI-1 Semi-Private y 61,4% en ARC-AGI-2 Semi-Private.
El detalle del costo es lo que hace circular esta noticia entre desarrolladores: ARC Prize reporta $0,02 por tarea para el resultado de ARC-AGI-1 y $0,04 por tarea para el de ARC-AGI-2, ambos en la variante Max. Son cifras bajas comparadas con lo que suelen cobrar los modelos de razonamiento extendido más caros del mercado por resolver el mismo tipo de tarea.
Cada tarea de ARC-AGI presenta una grilla de entrada y salida que el modelo debe generalizar.
Contexto e historia
ARC-AGI nació en 2019 de la mano de François Chollet, creador de Keras, como una forma de medir algo distinto a la memorización: la capacidad de un sistema de adquirir habilidades nuevas frente a problemas que no había visto. Durante años, los modelos de lenguaje se estancaron muy por debajo del desempeño humano en ese benchmark, incluso cuando ya dominaban tareas de código, matemática o comprensión de texto.
La familia ARC-AGI-2 llegó para restaurar esa dificultad. Los primeros modelos que superaron el 80% en ARC-AGI-1 lo hicieron, en parte, explotando regularidades del propio set de tareas; ARC-AGI-2 quitó ese margen. Que la variante Max de DeepSeek V4 Flash 0731 llegue a 61,4% ahí, frente al 89,0% que logra en ARC-AGI-1, confirma que el segundo benchmark todavía no está resuelto: la brecha de 27,6 puntos porcentuales entre ambos es, hoy, la norma para cualquier modelo de frontera, no la excepción.
DeepSeek V4 Flash 0731 es la variante liviana y orientada a costo de la familia V4 de DeepSeek, pensada para correr con menor latencia y precio por token que las versiones completas del modelo. Ese posicionamiento (recorte de costo sin recorte proporcional de capacidad de razonamiento) es la misma estrategia que ya se vio con otros laboratorios de pesos abiertos que compiten directamente por precio contra los modelos cerrados de la competencia.
Detalles técnicos y rendimiento de DeepSeek V4 Flash
La tabla siguiente resume las tres variantes evaluadas por ARC Prize, con los puntajes y costos que sí publicó la fundación. Donde ARC Prize no publicó una cifra, la tabla lo indica de forma explícita en vez de estimarla.
VarianteARC-AGI-1 (Semi-Private)ARC-AGI-2 (Semi-Private)Costo por tareaCuándo usarla
Max89,0%61,4%$0,02 / $0,04Precisión máxima, presupuesto de evaluación acotado
High87,0%56,0%No publicado por ARC PrizeBalance entre costo y precisión
Low84,0%46,0%No publicado por ARC PrizeLotes grandes de tareas donde el costo domina la decisión
El patrón es consistente: cada salto de Low a High y de High a Max cuesta más cómputo a cambio de una mejora de entre 2,0 y 10,0 puntos porcentuales, según el escalón y el benchmark. La mejora es más pronunciada en ARC-AGI-2 (de 46,0% en Low a 61,4% en Max, 15,4 puntos) que en ARC-AGI-1 (de 84,0% a 89,0%, 5,0 puntos), lo que sugiere que las tareas más difíciles del benchmark sí se benefician de más pasos de razonamiento, mientras que las más simples ya las resuelve incluso la variante económica.
Cómo se distribuye el esfuerzo de razonamiento por tarea
flowchart TD
A["Tarea de ARC-AGI"] --> B["DeepSeek V4 Flash 0731"]
B --> C{"Variante elegida"}
C --> D["Low: 84.0% / 46.0%"]
C --> E["High: 87.0% / 56.0%"]
C --> F["Max: 89.0% / 61.4%"]
D --> G["Evaluación semi-privada de ARC Prize"]
E --> G
F --> G
G --> H[("Resultado verificado")]
💭 Clave: La mejora de Low a Max es algo más de 3 veces mayor en ARC-AGI-2 (15,4 puntos) que en ARC-AGI-1 (5,0 puntos): más cómputo de razonamiento rinde más cuando el problema es genuinamente más difícil, no cuando ya está resuelto.
Elegir la variante de razonamiento cambia el costo por tarea sin cambiar el endpoint.
Cómo probarlo: correr DeepSeek V4 Flash contra tus propias tareas
DeepSeek expone V4 Flash con una API compatible con el formato de OpenAI, lo que significa que cualquier SDK que ya uses para otro proveedor también sirve acá con solo cambiar la URL base y el nombre del modelo. Lo mínimo para hacer una llamada es esto:
Linux / macOS (curl)
curl https://api.deepseek.com/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $DEEPSEEK_API_KEY" \
-d '{
"model": "deepseek-v4-flash",
"reasoning_effort": "max",
"messages": [
{"role": "user", "content": "Resuelve esta tarea de razonamiento abstracto: describe el patron de transformacion entre la grilla de entrada y la de salida."}
]
}'
Windows (PowerShell)
curl.exe https://api.deepseek.com/chat/completions `
-H "Content-Type: application/json" `
-H "Authorization: Bearer $env:DEEPSEEK_API_KEY" `
-d '{\"model\": \"deepseek-v4-flash\", \"reasoning_effort\": \"max\", \"messages\": [{\"role\": \"user\", \"content\": \"Resuelve esta tarea de razonamiento abstracto.\"}]}'
Este llamado manda una tarea al modelo pidiendo esfuerzo de razonamiento máximo. La respuesta llega en el mismo formato de chat.completions que devuelven otros proveedores compatibles con OpenAI, así que no hace falta parsear nada nuevo. Un ejemplo más realista, integrando el SDK de Python en un flujo de evaluación tipo ARC-AGI:
from openai import OpenAI
client = OpenAI(
api_key="TU_DEEPSEEK_API_KEY",
base_url="https://api.deepseek.com"
)
respuesta = client.chat.completions.create(
model="deepseek-v4-flash",
reasoning_effort="high", # low | high | max
messages=[
{"role": "system", "content": "Sos un solucionador de puzzles ARC-AGI. Devolve solo la grilla de salida."},
{"role": "user", "content": grid_prompt}
]
)
print(respuesta.choices[0].message.content)
print(respuesta.usage) # confirma tokens consumidos y, si el proveedor lo expone, el nivel de esfuerzo usado
El campo reasoning_effort es el que selecciona la variante (low, high o max); revisá siempre la documentación oficial de la API antes de desplegar en producción, porque los nombres exactos de parámetro pueden cambiar entre versiones del modelo. Para confirmar qué variante procesó realmente tu pedido, inspeccioná el objeto usage de la respuesta: ahí es donde la mayoría de las APIs compatibles con el formato de OpenAI exponen el conteo de tokens de razonamiento consumidos, que varía según la variante usada.
⚠️ Ojo: El costo por tarea que publicó ARC Prize ($0,02 y $0,04) corresponde a las condiciones específicas de su evaluación, con prompts y reintentos definidos por su propio proceso de evaluación. Tu costo real en producción va a depender de la longitud de tus prompts, el número de reintentos que configures y el tráfico de tu aplicación.
Impacto y análisis
El resultado importa por dos motivos que no siempre van juntos: el puntaje y el precio. Modelos cerrados de frontera llevan meses reportando puntajes altos en ARC-AGI-2, pero casi siempre a un costo por tarea sensiblemente mayor. Que un modelo de pesos abiertos y orientado a costo como V4 Flash llegue a 61,4% cambia el cálculo para cualquier equipo que quiera correr evaluaciones de razonamiento a escala, o construir productos donde el modelo tenga que generalizar frente a inputs que no vio en entrenamiento.
También hay un límite claro que conviene no ignorar: 61,4% en ARC-AGI-2 sigue lejos del 100%, y bastante lejos del desempeño humano promedio en el mismo set de tareas. ARC-AGI-2 se diseñó justamente para no saturarse con la primera generación de modelos que lo intentara, y por ahora cumple ese objetivo: ningún modelo, DeepSeek incluido, resuelve la mayoría de las tareas más difíciles del set.
El otro punto es metodológico: ARC Prize corre la verificación de forma independiente sobre un set semi-privado, no acepta sin más el número que reporta el laboratorio que entrena el modelo. Eso importa en un momento donde cada vez más benchmarks de IA se cuestionan por posible contaminación de datos o por optimización específica para el test. Esa capa de verificación externa es la que le da peso real a la comparación entre DeepSeek V4 Flash y el resto del leaderboard.
Qué sigue
La página de resultados de DeepSeek V4 Flash 0731 todavía no muestra puntaje en ARC-AGI-3: la columna aparece vacía en la tabla de variantes verificadas. ARC Prize viene desarrollando esa tercera generación del benchmark con foco en tareas interactivas, un salto de dificultad distinto al que separó a ARC-AGI-1 de ARC-AGI-2.
A corto plazo, lo esperable es que el resto de los laboratorios que compiten por precio sometan sus propios modelos a la misma evaluación semi-privada de ARC Prize. El leaderboard se actualiza a medida que cada laboratorio publica una variante nueva, así que el ranking de agosto de 2026 puede verse distinto en pocas semanas.
📖 Resumen en Telegram: Ver resumen
Probalo vos: abrí la página de resultados de ARC Prize y revisá el detalle tarea por tarea de las 400 tareas públicas de ARC-AGI-1 y las 120 de ARC-AGI-2 antes de decidir si Max, High o Low se ajusta a tu caso de uso.
Preguntas frecuentes
¿Qué es ARC-AGI y en qué se diferencia de otros benchmarks de LLM?
ARC-AGI mide razonamiento abstracto con tareas de grillas de colores que el modelo nunca vio antes, en lugar de evaluar conocimiento memorizado o código. Lo creó François Chollet en 2019 para medir generalización real, no recuerdo de patrones de entrenamiento.
¿Qué significa que los resultados sean "Semi-Private"?
El set semi-privado de tareas no está expuesto públicamente, así que ningún modelo pudo haberlo visto durante su entrenamiento. Es la capa de evaluación que usa ARC Prize para verificar de forma independiente el puntaje que reporta cada laboratorio.
¿Cuál es la diferencia real entre las variantes Max, High y Low?
Las tres corren el mismo modelo, DeepSeek V4 Flash 0731, con distinto nivel de esfuerzo de razonamiento por tarea. Max invierte más cómputo y cuesta más por tarea a cambio de mayor precisión: 89,0% en ARC-AGI-1 y 61,4% en ARC-AGI-2, contra 84,0% y 46,0% de Low.
¿Por qué ARC-AGI-2 es tan difícil comparado con ARC-AGI-1?
ARC-AGI-2 elimina las regularidades que los modelos grandes habían aprendido a explotar en la primera versión del benchmark y agrega tareas que exigen combinar varias reglas a la vez. La brecha de 27,6 puntos que muestra DeepSeek V4 Flash entre ambos benchmarks es representativa de lo que le pasa a cualquier modelo de frontera hoy.
¿DeepSeek V4 Flash 0731 ya tiene puntaje en ARC-AGI-3?
No. La página de resultados de ARC Prize muestra la columna de ARC-AGI-3 vacía para este modelo al momento de la publicación, el 31 de julio de 2026.
¿Estos números los reportó DeepSeek o un tercero independiente?
Los verificó ARC Prize Foundation, la organización sin fines de lucro que mantiene el benchmark, corriendo el modelo contra su propio set de evaluación semi-privado en lugar de aceptar sin más el número que reporta el laboratorio.
Referencias
- Página oficial de resultados de DeepSeek V4 Flash 0731: puntajes verificados por variante y desglose tarea por tarea en ARC-AGI-1 y ARC-AGI-2.
- ARC Prize Foundation: organización que mantiene el benchmark ARC-AGI y publica el leaderboard verificado de forma independiente.
- Documentación oficial de la API de DeepSeek: referencia de endpoints, autenticación y parámetros del modelo.
- Repositorio oficial de DeepSeek en GitHub: código, papers y releases publicados por el equipo de DeepSeek.
📱 ¿Te gusta este contenido? Únete a nuestro canal de Telegram @programacion donde publicamos a diario lo más relevante de tecnología, IA y desarrollo. Resúmenes rápidos, contenido fresco todos los días.
Top comments (0)