TL;DR
- La familia Darwin-180B-RSI de VIDRAFT ocupa el primer lugar en 9 de los 48 benchmarks oficiales de Hugging Face. Ninguna de las 95 organizaciones participantes tiene más; detrás vienen Moonshot AI y Zhipu AI (Z.ai) con 4 cada una.
- Los dos primeros puestos más recientes son de trabajo real, no de examen: IFStruct 98.95 % (salida estructurada, 1.979 de 2.000 prompts) y ExtractBench 90.29 (extracción de datos de 370 PDF, versión R3).
- La receta se llama auto-mejora recursiva a nivel de modelo (Model-level RSI): el modelo resuelve problemas verificables, se queda solo con sus propias soluciones comprobadas como correctas y vuelve a entrenarse con ellas. Sin respuestas escritas por humanos.
- El mismo equipo desarrolló ZTC, un juez que decide sin generar un solo token: misma precisión que consultar una API externa (AUC 0.7289 frente a 0.7350) y unas 10 veces más rápido (0.0615 s frente a 0.591 s).
- Abajo tienes código Python para consultar la clasificación tú mismo, cómo servir el modelo con vLLM o Transformers, y un FAQ. Todas las cifras se volvieron a comprobar contra la API de Hugging Face el 5 de octubre de 2026.
¿Qué son exactamente los 9 primeros puestos en la clasificación de Hugging Face?
Hugging Face marca ciertos datasets como benchmarks oficiales (benchmark:official) y les añade una tabla de clasificación. Cada laboratorio publica sus resultados en su propio repositorio con archivos .eval_results/*.yaml, y Hugging Face los agrega en un ranking. Hoy hay 48 tableros oficiales y 95 organizaciones compitiendo.
Estos son los 9 tableros donde lidera Darwin-180B-RSI, con su perseguidor inmediato, según la API el 5 de octubre de 2026:
| Área | Benchmark (ID del dataset) | Darwin | 2.º lugar | Puntaje |
|---|---|---|---|---|
| Ciencia | GPQA Diamond (Idavidrein/gpqa) |
94.44 | moonshotai/Kimi-K3 | 93.5 |
| Conocimiento | MMLU-Pro (TIGER-Lab/MMLU-Pro) |
88.12 | MiniMaxAI/MiniMax-M2.1 | 88.0 |
| Matemáticas | AIME 2026 (MathArena/aime_2026) |
100 | thinkingmachines/Inkling | 97.1 |
| Matemáticas | HMMT Feb 2026 (MathArena/hmmt_feb_2026) |
100 | moonshotai/Kimi-K2.6 | 92.7 |
| Visión | MMMU-Pro (MMMU/MMMU_Pro) |
79.48 | moonshotai/Kimi-K2.6 | 79.4 |
| Derecho | LEXam (LEXam-Benchmark/LEXam) |
68.94 | deepseek-ai/DeepSeek-R1 | 52.41 |
| Derecho | LEXam-hard (joelniklaus/LEXam-hard) |
45.72 | thinkingmachines/Inkling | 40.82 |
| Trabajo real | ExtractBench (llamaindex/ExtractBench) |
90.29 (R3) | Qwen/Qwen3.8-Flash-Next | 89.88 |
| Trabajo real | IFStruct (LiquidAI/ifstruct-v1.0) |
98.95 | InternScience/Agents-A1 | 93.25 |
MMLU-Pro (unas 141 entradas) y GPQA (unas 111) son los tableros más concurridos, y ambos los encabeza este modelo. Lo interesante para quien desarrolla es la combinación: los rankings más disputados y, a la vez, las tareas que de verdad aparecen en producción.
Una aclaración honesta: todos estos puntajes son autorreportados, medidos por cada laboratorio con la herramienta oficial de evaluación, que es como funciona este sistema para todos. Los resultados por voto mayoritario (por ejemplo AIME maj@16) están etiquetados como tales en la ficha del modelo. Antes de comparar, revisa la configuración.
¿Cómo puedo verificar la clasificación con código?
No tienes que creerle a ningún artículo. La API pública de Hugging Face lo responde en segundos y no necesita token:
import requests
from collections import Counter
API = "https://huggingface.co/api"
# 1) Lista de benchmarks oficiales
boards = requests.get(f"{API}/datasets",
params={"filter": "benchmark:official", "limit": 200}).json()
print("Benchmarks oficiales:", len(boards))
# 2) Quién va primero en cada tablero
firsts = Counter()
for b in boards:
rows = requests.get(f"{API}/datasets/{b['id']}/leaderboard").json()
if not isinstance(rows, list) or not rows:
continue
top = rows[0] # rank 1
firsts[top["modelId"].split("/")[0]] += 1
if top["modelId"].startswith("FINAL-Bench/"):
r2 = rows[1] if len(rows) > 1 else {}
print(b["id"], top["value"], top["modelId"],
"| 2.º", r2.get("modelId"), r2.get("value"))
print(firsts.most_common(5))
# Resultado el 2026-10-05: FINAL-Bench 9, moonshotai 4, zai-org 4, XiaomiMiMo 3, deepseek-ai 3
Cada fila trae campos como rank, value, modelId, source (enlace a la ficha del modelo) y verified. Con esto puedes montar un panel interno para elegir modelos o una alerta que te avise cuando cambia el líder de un benchmark que te importa.
¿Por qué importa a un desarrollador el 98.95 % en IFStruct?
IFStruct, creado por Liquid AI, mide si un modelo devuelve JSON o YAML válido que respete un esquema pedido, con los requisitos redactados de las mil maneras en que los escriben los usuarios reales. Cada prompt se aprueba o se reprueba, y el criterio es estricto:
- cantidad exacta de elementos (o rango), clave contenedora, JSON frente a YAML
- bloque de código obligatorio o prohibido, nada de comentarios si así se pide
- tipo de cada campo, enums, límites numéricos y largo de listas anidadas
- cualquier campo que el esquema no pidió hace fallar la respuesta
No se usa decodificación restringida (constrained decoding), así que se mide solo la disciplina del propio modelo. Darwin-180B-RSI aprobó 1.979 de 2.000 prompts con los valores por defecto del harness oficial (temperatura 0, 16.000 tokens máximos, razonamiento activado). Un prompt superó el timeout de lectura de 120 segundos del harness y contó como fallo, así que la cifra es conservadora. Con el razonamiento apagado, el mismo modelo baja a 89.7 %: la fase de razonamiento es la que atrapa las últimas violaciones de formato.
En un pipeline de agentes o en un backoffice automatizado, la salida del modelo no la lee una persona: la parsea tu código. Un tipo equivocado o una clave inventada y json.loads o tu validador de esquema revientan. Pasar de 93.25 % a 98.95 % se traduce en menos reintentos, menos lógica de reparación y menos alertas a las tres de la mañana.
¿Cómo se logró el 90.29 en ExtractBench?
ExtractBench, de LlamaIndex, pide extraer campos estructurados de 370 documentos PDF, desde formularios cortos hasta archivos de casi 200 páginas. La segunda ronda de auto-mejora, Darwin-180B-RSI-R3, obtuvo 90.29 y superó a su propio modelo base, Qwen3.8-Flash-Next de Alibaba (89.88), y a Qwen3.8-27B (89.75). Esta corrida usó el harness oficial con el razonamiento desactivado, y así quedó declarado en la entrega.
Que la siguiente generación de un mismo linaje supere al modelo del que partió es la evidencia más directa de que el ciclo de auto-mejora funciona.
¿Cómo funciona la auto-mejora recursiva (Model-level RSI)?
Darwin-180B-RSI parte del modelo abierto Qwen3.8-Flash-Next de Alibaba y mejora mediante la auto-mejora recursiva a nivel de modelo de VIDRAFT. La idea cabe en tres pasos:
- El modelo resuelve por su cuenta problemas verificables.
- Se conservan solo sus propias soluciones comprobadas como correctas.
- El modelo se reentrena con ellas, y el ciclo se repite.
No se usan soluciones ni cadenas de razonamiento escritas por personas. Como lo no verificado nunca entra al entrenamiento, el modelo no refuerza sus propios errores. R3 es simplemente una vuelta más del ciclo.
Lo llamativo es que nunca se entrenó con textos jurídicos ni con extracción de documentos, y aun así lidera LEXam, LEXam-hard y ExtractBench. La lectura de la empresa: los hábitos de razonamiento cuidadoso y paso a paso que se aprenden resolviendo problemas verificables se transfieren a otros dominios.
¿Por qué "a nivel de modelo"? Para distinguirlo de los enfoques que mejoran el arnés (prompts, herramientas, flujos) alrededor de un modelo fijo. Aquí lo que cambia no es el manual, sino los pesos: el cerebro mismo.
¿Cómo ejecuto Darwin-180B-RSI en mi infraestructura?
El código siguiente viene tal cual de la sección Quickstart de la ficha del modelo. Primero, las especificaciones:
- Mixture-of-Experts con atención híbrida (36 capas de atención lineal + 12 de atención completa)
- 512 expertos enrutados, 10 activos por token, más un experto compartido
- Contexto de 262.144 tokens; entrada de imagen y texto, salida de texto
- Unos 336 GB en bf16
Servir con vLLM (8 × B200 o equivalente)
vllm serve FINAL-Bench/Darwin-180B-RSI \
--tensor-parallel-size 8 --enable-expert-parallel \
--max-model-len 135168 --trust-remote-code
Llamarlo con la API compatible con OpenAI
from openai import OpenAI
c = OpenAI(base_url="http://localhost:8000/v1", api_key="-")
r = c.chat.completions.create(model="FINAL-Bench/Darwin-180B-RSI",
messages=[{"role": "user", "content": "Explica en dos frases por qué el cielo es azul."}],
temperature=1.0, top_p=0.95, extra_body={"top_k": 20})
print(r.choices[0].message.content)
Cargarlo con Transformers
from transformers import AutoProcessor, AutoModelForImageTextToText
model_id = "FINAL-Bench/Darwin-180B-RSI"
processor = AutoProcessor.from_pretrained(model_id)
model = AutoModelForImageTextToText.from_pretrained(model_id, torch_dtype="auto", device_map="auto")
Dos consejos prácticos. Primero, es un modelo de razonamiento (thinking): para problemas difíciles la ficha recomienda un presupuesto de 32K a 131K tokens; si lo recortas, pierdes precisión. Segundo, la configuración de evaluación de la ficha es temperatura 1.0, top_p 0.95, top_k 20, aunque para tareas de formato estricto como IFStruct el harness oficial usó temperatura 0.
¿Qué es ZTC y en qué se diferencia de JEV?
Ahora que los agentes envían correos, hacen pagos y ejecutan código, filtrar una acción equivocada antes de ejecutarla se volvió un tema central. La API de decisión JEV, de Typesafe, definió el formato estándar del sector, y el ranking público Decision Index ya reúne más de 70 modelos. El 30 de septiembre Cloudflare publicó Clef, un modelo de decisión compatible con JEV.
ZTC (Zero-Token Confidence) de VIDRAFT toma otro camino. En lugar de preguntarle a otra IA "¿esta respuesta es correcta?" y esperar texto de vuelta, lee una sola vez el estado interno del modelo que generó la respuesta y calcula la probabilidad de que sea correcta. Tokens adicionales generados: cero.
Para verlo en acción está Gate Arcade, elegida como "Space of the Week" de Hugging Face la semana del 28 de septiembre. Un agente propone una acción y la compuerta decide ejecutar o retener: +1 por ejecutar una acción correcta, -1 por ejecutar una incorrecta, 0 por retener. Mediciones del 24 de septiembre de 2026, en despliegue aislado de internet:
| Sin compuerta | JEV (API externa) | ZTC (VIDRAFT) | |
|---|---|---|---|
| Precisión de decisión (AUC) | n/a | 0.7350 | 0.7289 |
| Tiempo por decisión | 0 s | 0.591 s | 0.0615 s |
| Decisiones en 300 s | n/a | 135 | 177 |
La precisión es estadísticamente equivalente y la velocidad es unas 10 veces mayor. En 2.000 partidas cara a cara, ZTC ganó el 73.7 %. Como no envía datos a ningún servicio externo, funciona en redes aisladas, algo clave para banca, defensa o sector público. Con el mismo enfoque, Darwin-397B-ZTC elevó de 0.76 a 0.88 la precisión con la que juzga si sus propias respuestas son correctas.
Los límites también son claros: hay que leer el interior del modelo, así que no sirve para modelos cerrados que solo se usan por API, y cada modelo necesita su propio lector calibrado. Lo sensato es usarlo como primer filtro rápido y barato, no como juez final. Además, el lector ZTC incluido en el repositorio de Darwin-180B-RSI está marcado en la ficha como "early release"; léela antes de usarlo en acciones de alto riesgo.
Preguntas frecuentes (FAQ)
1. ¿Dónde veo la clasificación de Hugging Face con los 9 primeros puestos?
En la pestaña de leaderboard de cada dataset (por ejemplo huggingface.co/datasets/LiquidAI/ifstruct-v1.0) o llamando a https://huggingface.co/api/datasets/{id}/leaderboard, como en el script de arriba.
2. ¿Quién midió los puntajes? ¿Están verificados?
Los tableros oficiales de Hugging Face funcionan con resultados que cada laboratorio mide con la herramienta oficial y publica vía .eval_results. Los de Darwin también son autorreportados, y la ficha del modelo documenta muestras por pregunta y presupuesto de razonamiento.
3. ¿De verdad la auto-mejora recursiva no usa respuestas humanas?
Así es. El modelo resuelve problemas verificables, conserva solo sus soluciones comprobadas y se reentrena con ellas. No se usan soluciones ni razonamientos escritos por personas.
4. ¿Puedo usar este modelo de lenguaje de código abierto ya mismo? ¿Qué hardware necesito?
Los pesos están publicados en Hugging Face. Ocupan unos 336 GB en bf16, por eso la ficha recomienda 8 × B200 (o equivalente) con vLLM, paralelismo tensorial 8 y paralelismo de expertos.
5. ¿Por qué elegirlo para generar JSON en producción?
Logró 98.95 % en IFStruct sin decodificación restringida, 5.7 puntos por encima del segundo (93.25 %). Eso significa menos reintentos y menos código de reparación.
6. ¿Cómo integro ZTC en mi servicio?
Necesitas un modelo de pesos abiertos cuyo estado interno puedas leer. Prueba primero Gate Arcade para entender el flujo y revisa los ejemplos de la carpeta ztc/ en la ficha del modelo.
Enlaces
- VIDRAFT: https://vidraft.net
- Modelo: https://huggingface.co/FINAL-Bench/Darwin-180B-RSI
- R3 (#1 en ExtractBench): https://huggingface.co/FINAL-Bench/Darwin-180B-RSI-R3
- Gate Arcade (Space of the Week): https://huggingface.co/spaces/FINAL-Bench/gate-tetris
De un modelo que aprueba exámenes a uno que trabaja respetando el formato que le pides, más una compuerta que detecta en 0.06 segundos cuándo no está seguro antes de actuar. Pruébalo y cuéntanos en los comentarios qué tal te fue.
Top comments (0)