<?xml version="1.0" encoding="UTF-8"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:dc="http://purl.org/dc/elements/1.1/">
  <channel>
    <title>DEV Community: 김민식/학생</title>
    <description>The latest articles on DEV Community by 김민식/학생 (@_0e3192755d4df45b92).</description>
    <link>https://dev.to/_0e3192755d4df45b92</link>
    <image>
      <url>https://media2.dev.to/dynamic/image/width=90,height=90,fit=cover,gravity=auto,format=auto/https:%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Fuser%2Fprofile_image%2F4163327%2Ff19c87e6-dc4d-41e0-ba4c-8eecf08a41f0.png</url>
      <title>DEV Community: 김민식/학생</title>
      <link>https://dev.to/_0e3192755d4df45b92</link>
    </image>
    <atom:link rel="self" type="application/rss+xml" href="https://dev.to/feed/_0e3192755d4df45b92"/>
    <language>en</language>
    <item>
      <title>Cómo correr un modelo de 180B sin GPU: POCKET-Darwin-180B en GGUF con llama.cpp</title>
      <dc:creator>김민식/학생</dc:creator>
      <pubDate>Tue, 06 Oct 2026 13:12:02 +0000</pubDate>
      <link>https://dev.to/_0e3192755d4df45b92/como-correr-un-modelo-de-180b-sin-gpu-pocket-darwin-180b-en-gguf-con-llamacpp-1m56</link>
      <guid>https://dev.to/_0e3192755d4df45b92/como-correr-un-modelo-de-180b-sin-gpu-pocket-darwin-180b-en-gguf-con-llamacpp-1m56</guid>
      <description>&lt;h2&gt;
  
  
  TL;DR
&lt;/h2&gt;

&lt;p&gt;POCKET-Darwin-180B-GGUF es la versión cuantizada del modelo abierto Darwin-180B-RSI, pensada para correr sin GPU. Puntos clave para quien va a desplegarlo:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;Pesa 111 GB&lt;/strong&gt; en GGUF (el original en BF16 ocupa 360 GB) y se ejecuta con &lt;strong&gt;llama.cpp&lt;/strong&gt;.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Hasta 21 tokens por segundo solo en CPU&lt;/strong&gt; (1 socket, 16 hilos, 78.8 GB de RAM usada). En un portátil con RTX 5060 de 8 GB y 32 GB de RAM: 4.17 tok/s.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Misma precisión que el original&lt;/strong&gt;: en MMLU-Pro (2,000 preguntas) ambos miden 87.65%, aunque el modelo esté en 4 bits.&lt;/li&gt;
&lt;li&gt;Arquitectura &lt;strong&gt;MoE&lt;/strong&gt;: 180B de parámetros totales, pero solo unos &lt;strong&gt;3B activos por token&lt;/strong&gt; (10 de 512 expertos).&lt;/li&gt;
&lt;li&gt;Se descargan &lt;strong&gt;4 archivos&lt;/strong&gt; y arranca con una sola línea de comando.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Este artículo explica por qué funciona y cómo ponerlo en marcha.&lt;/p&gt;

&lt;h2&gt;
  
  
  ¿Por qué un modelo de 180B cabe en un portátil?
&lt;/h2&gt;

&lt;p&gt;La respuesta corta: la mayor parte del modelo no se usa en cada paso.&lt;/p&gt;

&lt;p&gt;Darwin-180B-RSI es un modelo de mezcla de expertos (Mixture of Experts, MoE). Tiene 512 redes "expertas", pero para generar cada token un enrutador selecciona solo 10. De los 180,000 millones de parámetros, apenas unos 3,000 millones intervienen en el cálculo de cada token.&lt;/p&gt;

&lt;p&gt;Esto cambia por completo las cuentas de despliegue. En un modelo denso de 180B tendrías que mover los 180B de parámetros por la memoria en cada token. Con MoE, el trabajo aritmético por token se parece más al de un modelo de 3B, aunque la capacidad total siga siendo la de un modelo enorme. El cuello de botella deja de ser el cómputo y pasa a ser &lt;strong&gt;dónde guardas los pesos y a qué velocidad los lees&lt;/strong&gt;.&lt;/p&gt;

&lt;p&gt;Ahí entra la cuantización. El original en BF16 ocupa 360 GB. La versión POCKET se construye sobre una cuantización de 4 bits ya validada por la comunidad, y solo la parte que el entrenamiento de autosuperación de VIDRAFT realmente modificó (alrededor del 3% del volumen total) se mantiene en alta precisión. El resultado: 111 GB en disco, repartidos en 4 archivos GGUF.&lt;/p&gt;

&lt;p&gt;Con 111 GB tienes dos caminos:&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;
&lt;strong&gt;Mini PC con 128 GB de RAM&lt;/strong&gt;: el modelo entero entra en memoria y corre sin GPU.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Portátil con 32 GB de RAM&lt;/strong&gt;: no cabe entero, así que llama.cpp lee desde SSD mediante mapeo de memoria (mmap) los expertos que hace falta en cada momento. Más lento, pero funciona.&lt;/li&gt;
&lt;/ol&gt;

&lt;h2&gt;
  
  
  ¿Cómo lo ejecuto con llama.cpp? (paso a paso)
&lt;/h2&gt;

&lt;p&gt;GGUF es el formato que usa llama.cpp, el motor de inferencia de código abierto. No necesitas cuenta en la nube ni servidor con GPU. Necesitas una build reciente de llama.cpp (b11048 o posterior) y espacio en disco para los 111 GB.&lt;/p&gt;

&lt;p&gt;Primero, descarga los archivos del repositorio en Hugging Face:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight shell"&gt;&lt;code&gt;&lt;span class="c"&gt;# Instala el cliente de Hugging Face&lt;/span&gt;
pip &lt;span class="nb"&gt;install&lt;/span&gt; &lt;span class="nt"&gt;-U&lt;/span&gt; &lt;span class="s2"&gt;"huggingface_hub[cli]"&lt;/span&gt;

&lt;span class="c"&gt;# Descarga los 4 archivos GGUF (111 GB en total)&lt;/span&gt;
hf download FINAL-Bench/POCKET-Darwin-180B-GGUF &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;--local-dir&lt;/span&gt; ./pocket-darwin-180b &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;--include&lt;/span&gt; &lt;span class="s2"&gt;"*.gguf"&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Luego compila llama.cpp (si aún no la tienes) y lanza la inferencia:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight shell"&gt;&lt;code&gt;&lt;span class="c"&gt;# Compilar llama.cpp (build b11048 o superior)&lt;/span&gt;
git clone https://github.com/ggml-org/llama.cpp
&lt;span class="nb"&gt;cd &lt;/span&gt;llama.cpp &lt;span class="o"&gt;&amp;amp;&amp;amp;&lt;/span&gt; cmake &lt;span class="nt"&gt;-B&lt;/span&gt; build &lt;span class="o"&gt;&amp;amp;&amp;amp;&lt;/span&gt; cmake &lt;span class="nt"&gt;--build&lt;/span&gt; build &lt;span class="nt"&gt;--config&lt;/span&gt; Release

&lt;span class="c"&gt;# Ejecutar solo en CPU&lt;/span&gt;
./build/bin/llama-cli &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;--model&lt;/span&gt; ../pocket-darwin-180b/pocket-darwin-180b-Q4.gguf &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;--threads&lt;/span&gt; 16 &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;--ctx-size&lt;/span&gt; 8192 &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;--prompt&lt;/span&gt; &lt;span class="s2"&gt;"Explica en tres frases qué es una arquitectura MoE."&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Notas prácticas de ingeniería:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;&lt;code&gt;--threads&lt;/code&gt;&lt;/strong&gt;: ajusta al número de hilos físicos de tu CPU. En el servidor de prueba (16 hilos) se obtuvieron de 18.4 a 21.0 tok/s.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;mmap&lt;/strong&gt;: llama.cpp mapea el archivo por defecto, así que en máquinas con poca RAM los pesos se leen desde SSD bajo demanda. Un SSD NVMe rápido ayuda mucho aquí.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Servidor HTTP&lt;/strong&gt;: usa &lt;code&gt;llama-server&lt;/code&gt; en lugar de &lt;code&gt;llama-cli&lt;/code&gt; si quieres exponer un endpoint compatible con la API de chat.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Un apunte importante: este modelo se distribuye como GGUF para &lt;strong&gt;llama.cpp&lt;/strong&gt;. Verifica la compatibilidad de la versión del motor antes de integrarlo en otras herramientas de escritorio.&lt;/p&gt;

&lt;h2&gt;
  
  
  ¿Pierde precisión al comprimir a 4 bits?
&lt;/h2&gt;

&lt;p&gt;Esta es la pregunta que todo ingeniero hace antes de confiar en una versión cuantizada. La respuesta medida: no, al menos en el banco de pruebas principal.&lt;/p&gt;

&lt;p&gt;En MMLU-Pro, un examen de conocimiento general de 2,000 preguntas, comparando pregunta por pregunta:&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Versión&lt;/th&gt;
&lt;th&gt;MMLU-Pro&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Original (BF16)&lt;/td&gt;
&lt;td&gt;87.65%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;POCKET (4 bits)&lt;/td&gt;
&lt;td&gt;87.65%&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;Idéntico. La cuantización agresiva no degradó la tasa de acierto en ese conjunto.&lt;/p&gt;

&lt;p&gt;Además, hay una señal interesante sobre el efecto de la autosuperación (RSI). En SuperGPQA, un conjunto de 1,000 preguntas de ciencia de nivel de posgrado que no se usó en el entrenamiento, se comparó solo la parte modificada por RSI contra la misma versión de 4 bits del modelo base:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;Modelo base (4 bits): 59.10%&lt;/li&gt;
&lt;li&gt;POCKET (4 bits): 61.55%&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Una mejora de 2.45 puntos, estadísticamente significativa. Y lo hizo usando alrededor de &lt;strong&gt;13% menos tokens por pregunta&lt;/strong&gt;: razona de forma más concisa y deja de reverificar la respuesta una vez que ya la tiene. Un desarrollador externo verificó este resultado archivo por archivo en una discusión pública.&lt;/p&gt;

&lt;h2&gt;
  
  
  ¿Para qué casos sirve un modelo de alto nivel sin conexión?
&lt;/h2&gt;

&lt;p&gt;El caso de uso que ordena todo lo anterior es claro: &lt;strong&gt;entornos donde los datos no pueden salir a la nube&lt;/strong&gt;. Defensa, finanzas y sector público tienen reglas que prohíben enviar datos a servidores externos. POCKET-Darwin-180B corre dentro de un servidor local o un mini PC, sin conexión a internet, sin que ningún dato cruce la frontera de la organización.&lt;/p&gt;

&lt;p&gt;La comparación de coste también pesa. Un servidor con 8 GPU H100 ronda cifras de cientos de miles de dólares. Un portátil gamer de gama media con 8 GB de memoria gráfica y 32 GB de RAM cuesta una fracción mínima de eso. No es la misma velocidad, pero para cargas de trabajo por lotes o inferencia local, la ecuación cambia por completo.&lt;/p&gt;

&lt;h2&gt;
  
  
  Preguntas frecuentes (FAQ)
&lt;/h2&gt;

&lt;p&gt;&lt;strong&gt;¿Qué hardware mínimo necesito?&lt;/strong&gt;&lt;br&gt;
Para correr el modelo completo en memoria, un mini PC con 128 GB de RAM sin GPU. Con 32 GB de RAM funciona vía mmap desde SSD, a menor velocidad (4.17 tok/s medidos en un portátil con RTX 5060 de 8 GB). Un SSD NVMe rápido es muy recomendable.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;¿Cuánto espacio en disco ocupa?&lt;/strong&gt;&lt;br&gt;
Son 4 archivos GGUF que suman 111 GB. Deja margen adicional para la caché del sistema operativo.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;¿Por qué 180B de parámetros corren tan rápido en CPU?&lt;/strong&gt;&lt;br&gt;
Por la arquitectura MoE: solo 10 de 512 expertos se activan por token, lo que equivale a unos 3B de parámetros activos. El cómputo por token es bajo; el reto real es la lectura de pesos desde disco o RAM.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;¿Puedo usarlo con Ollama o LM Studio?&lt;/strong&gt;&lt;br&gt;
El modelo está publicado y probado para &lt;strong&gt;llama.cpp&lt;/strong&gt; (build b11048 o superior). Antes de usarlo con otras herramientas, confirma que su versión del motor soporta esta arquitectura y cuantización.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;¿La cuantización de 4 bits lo vuelve menos fiable?&lt;/strong&gt;&lt;br&gt;
En MMLU-Pro, la tasa de acierto es idéntica a la del original (87.65% en ambos). La parte modificada por el entrenamiento de autosuperación se conserva en alta precisión, lo que ayuda a preservar la calidad.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;¿Dónde lo descargo?&lt;/strong&gt;&lt;br&gt;
En Hugging Face (&lt;code&gt;huggingface.co/FINAL-Bench/POCKET-Darwin-180B-GGUF&lt;/code&gt;) y en ModelScope (&lt;code&gt;modelscope.cn/models/FINAL-Bench/POCKET-Darwin-180B-GGUF&lt;/code&gt;). El modelo original está en &lt;code&gt;huggingface.co/FINAL-Bench/Darwin-180B-RSI&lt;/code&gt;.&lt;/p&gt;

&lt;h2&gt;
  
  
  Cierre
&lt;/h2&gt;

&lt;p&gt;Lo interesante de POCKET-Darwin-180B no es solo que un modelo de 180B corra sin GPU, sino el conjunto de decisiones de ingeniería que lo hacen posible: MoE para reducir el cómputo por token, cuantización de 4 bits que preserva la precisión, y GGUF más llama.cpp para desplegar con una sola línea de comando. La combinación acerca un modelo de nivel puntero al hardware que ya tienes sobre la mesa.&lt;/p&gt;

</description>
      <category>ai</category>
      <category>llm</category>
      <category>opensource</category>
      <category>spanish</category>
    </item>
    <item>
      <title>De los exámenes al trabajo real: un modelo abierto de 180B lidera 10 clasificaciones oficiales de Hugging Face</title>
      <dc:creator>김민식/학생</dc:creator>
      <pubDate>Tue, 06 Oct 2026 00:43:23 +0000</pubDate>
      <link>https://dev.to/_0e3192755d4df45b92/de-los-examenes-al-trabajo-real-un-modelo-abierto-de-180b-lidera-10-clasificaciones-oficiales-de-389e</link>
      <guid>https://dev.to/_0e3192755d4df45b92/de-los-examenes-al-trabajo-real-un-modelo-abierto-de-180b-lidera-10-clasificaciones-oficiales-de-389e</guid>
      <description>&lt;h2&gt;
  
  
  TL;DR
&lt;/h2&gt;

&lt;ul&gt;
&lt;li&gt;Un modelo de código abierto, &lt;strong&gt;Darwin-180B-RSI&lt;/strong&gt;, ocupa ahora el &lt;strong&gt;puesto #1 en 10 de los 48 benchmarks oficiales de Hugging Face&lt;/strong&gt;, el mayor número entre las 95 organizaciones que compiten. La segunda posición es Z.ai, con 4.&lt;/li&gt;
&lt;li&gt;El décimo primer puesto es &lt;strong&gt;MDPBench&lt;/strong&gt; (parsing de documentos multilingües, 83.65). Se suma a los dos anteriores orientados al trabajo real: &lt;strong&gt;IFStruct&lt;/strong&gt; (salida estructurada, 98.95%) y &lt;strong&gt;ExtractBench&lt;/strong&gt; (extracción de documentos, 90.29).&lt;/li&gt;
&lt;li&gt;El modelo mejora solo con &lt;strong&gt;RSI a nivel de modelo&lt;/strong&gt; (auto mejora recursiva): resuelve problemas verificables, se queda únicamente con sus propias soluciones confirmadas como correctas y vuelve a entrenar con ellas.&lt;/li&gt;
&lt;li&gt;Al mismo tiempo, &lt;strong&gt;Gate Arcade&lt;/strong&gt;, una app para juzgar acciones de agentes, fue elegida &lt;strong&gt;Spaces of the Week&lt;/strong&gt; de Hugging Face. Dentro va &lt;strong&gt;ZTC&lt;/strong&gt;, una técnica que juzga leyendo el estado interno del modelo &lt;strong&gt;sin generar ni una sola letra&lt;/strong&gt;.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Este post está pensado para que lo pueda leer alguien de ingeniería: qué miden los benchmarks, cómo se logró y por qué ZTC es relevante para agentes en producción.&lt;/p&gt;

&lt;h2&gt;
  
  
  ¿Qué significa liderar 10 benchmarks oficiales de Hugging Face?
&lt;/h2&gt;

&lt;p&gt;Hugging Face mantiene un conjunto de benchmarks oficiales sobre los que cualquier organización puede registrar resultados medidos con el arnés de evaluación oficial de cada prueba. Hoy son 48 benchmarks y 95 organizaciones participantes. Que una misma familia de modelos encabece 10 de ellos no es un promedio alto: es haber ganado la prueba, una por una, en dominios muy distintos.&lt;/p&gt;

&lt;p&gt;Lo interesante no es solo la cantidad, sino el &lt;strong&gt;reparto&lt;/strong&gt;. Hasta hace poco, los primeros puestos estaban en pruebas tipo examen: ciencia de posgrado, olimpiadas de matemáticas, preguntas de estilo jurídico. Los tres añadidos recientes miden otra cosa: la capacidad de &lt;strong&gt;hacer el trabajo que una empresa realmente le encarga a un modelo&lt;/strong&gt;.&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Área&lt;/th&gt;
&lt;th&gt;Benchmark&lt;/th&gt;
&lt;th&gt;Puntuación&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Ciencia y conocimiento&lt;/td&gt;
&lt;td&gt;GPQA Diamond&lt;/td&gt;
&lt;td&gt;94.44&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Ciencia y conocimiento&lt;/td&gt;
&lt;td&gt;MMLU-Pro&lt;/td&gt;
&lt;td&gt;88.12&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Matemáticas&lt;/td&gt;
&lt;td&gt;AIME 2026&lt;/td&gt;
&lt;td&gt;100&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Matemáticas&lt;/td&gt;
&lt;td&gt;HMMT 2026&lt;/td&gt;
&lt;td&gt;100&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Razonamiento visual&lt;/td&gt;
&lt;td&gt;MMMU-Pro&lt;/td&gt;
&lt;td&gt;79.48&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Jurídico&lt;/td&gt;
&lt;td&gt;LEXam&lt;/td&gt;
&lt;td&gt;68.94&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Jurídico&lt;/td&gt;
&lt;td&gt;LEXam-hard&lt;/td&gt;
&lt;td&gt;45.72&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Trabajo de empresa&lt;/td&gt;
&lt;td&gt;ExtractBench&lt;/td&gt;
&lt;td&gt;90.29&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Trabajo de empresa&lt;/td&gt;
&lt;td&gt;IFStruct&lt;/td&gt;
&lt;td&gt;98.95&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Parsing de documentos&lt;/td&gt;
&lt;td&gt;MDPBench&lt;/td&gt;
&lt;td&gt;83.65&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;Conviene subrayar un detalle: en &lt;strong&gt;MMLU-Pro (141 modelos registrados)&lt;/strong&gt; y &lt;strong&gt;GPQA (111 modelos)&lt;/strong&gt;, los dos benchmarks con más competidores, el modelo sigue en primer lugar. Ganar donde hay más gente mirando es distinto a ganar en una prueba de nicho.&lt;/p&gt;

&lt;h2&gt;
  
  
  ¿Qué miden MDPBench, IFStruct y ExtractBench?
&lt;/h2&gt;

&lt;p&gt;&lt;strong&gt;MDPBench&lt;/strong&gt; evalúa el parsing de documentos multilingües: tomar un documento real, con sus tablas, encabezados y estructura, y convertirlo en una representación limpia y utilizable. Es el paso previo invisible de casi cualquier sistema RAG o de automatización documental. Si el parsing se equivoca, todo lo que viene después hereda el error. Aquí el modelo marcó &lt;strong&gt;83.65&lt;/strong&gt;.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;IFStruct&lt;/strong&gt;, de Liquid AI, comprueba si el modelo devuelve JSON o YAML válido que respeta un esquema pedido. La corrección es aprobado o suspenso por prompt, y es estricta:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;número exacto de elementos (o rango), clave envoltorio, JSON frente a YAML&lt;/li&gt;
&lt;li&gt;bloque de código requerido o prohibido, sin comentarios cuando se pide&lt;/li&gt;
&lt;li&gt;cada tipo de campo, enum, límite numérico y longitud de lista anidada&lt;/li&gt;
&lt;li&gt;cualquier campo que el esquema no pidió hace fallar la respuesta&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;No se usa decodificación restringida, así que solo se mide la disciplina propia del modelo. Darwin aprobó &lt;strong&gt;1.979 de 2.000&lt;/strong&gt; prompts con los valores por defecto del arnés oficial (temperatura 0, 16K tokens, razonamiento activado), para un &lt;strong&gt;98.95%&lt;/strong&gt;. Un prompt agotó el tiempo de lectura de 120 segundos del arnés y se contó como fallo, así que la cifra es conservadora.&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Modelo&lt;/th&gt;
&lt;th&gt;IFStruct&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Darwin-180B-RSI&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;98.95&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Agents-A1&lt;/td&gt;
&lt;td&gt;93.25&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;gpt-oss-20b&lt;/td&gt;
&lt;td&gt;91.95&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Nemotron-3-Nano-30B&lt;/td&gt;
&lt;td&gt;86.80&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Granite 4.1 8B&lt;/td&gt;
&lt;td&gt;68.45&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;&lt;strong&gt;ExtractBench&lt;/strong&gt;, de LlamaIndex, pide extraer campos estructurados de 370 documentos PDF, desde formularios cortos hasta archivos cercanos a 200 páginas. La segunda ronda de auto mejora, &lt;strong&gt;Darwin-180B-RSI-R3&lt;/strong&gt;, obtuvo &lt;strong&gt;90.29&lt;/strong&gt;, por delante de su propio modelo base Qwen3.8-Flash-Next (89.88).&lt;/p&gt;

&lt;p&gt;Por qué importan los tres juntos: en una tubería de agentes, la salida del modelo la lee &lt;strong&gt;código&lt;/strong&gt;, no una persona. Un tipo de dato mal puesto, una clave inventada o una tabla mal parseada, y el proceso se detiene. Estas pruebas miden exactamente la parte que decide si un piloto llega a producción.&lt;/p&gt;

&lt;h2&gt;
  
  
  ¿Cómo mejora el modelo sin datos etiquetados por humanos?
&lt;/h2&gt;

&lt;p&gt;Darwin-180B-RSI parte del modelo abierto Qwen3.8-Flash-Next de Alibaba y sube su rendimiento con la técnica propia de &lt;strong&gt;RSI a nivel de modelo&lt;/strong&gt; (Model-level RSI, auto mejora recursiva). La idea, en una frase: el modelo aprende de sus propios aciertos verificados.&lt;/p&gt;

&lt;p&gt;El bucle, sin recetas internas ni hiperparámetros:&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;El modelo resuelve problemas cuya respuesta se puede &lt;strong&gt;verificar&lt;/strong&gt; de forma automática.&lt;/li&gt;
&lt;li&gt;Se conservan solo las soluciones confirmadas como correctas.&lt;/li&gt;
&lt;li&gt;Se vuelve a entrenar con ese conjunto depurado.&lt;/li&gt;
&lt;li&gt;Se repite.&lt;/li&gt;
&lt;/ol&gt;

&lt;p&gt;Como nunca aprende de soluciones sin verificar, los errores no se refuerzan. Un detalle llamativo: &lt;strong&gt;nadie le enseñó explícitamente derecho ni extracción documental&lt;/strong&gt;, y aun así encabeza esas áreas. La lectura del equipo es que el hábito de razonar con cuidado, adquirido al resolver problemas verificables, se transfiere a dominios nuevos.&lt;/p&gt;

&lt;h2&gt;
  
  
  ¿Qué es ZTC y por qué es Spaces of the Week?
&lt;/h2&gt;

&lt;p&gt;Mientras los agentes de IA empiezan a enviar correos, pagar y ejecutar código en nuestro nombre, el nuevo terreno de disputa es el &lt;strong&gt;juicio&lt;/strong&gt; (decision): filtrar la acción equivocada &lt;strong&gt;antes&lt;/strong&gt; de ejecutarla. La API JEV de Typesafe fijó un formato de referencia, y en la clasificación abierta Decision Index ya hay más de 70 modelos. El 30 de septiembre, Cloudflare publicó un modelo juez compatible con ese formato, y equipos de Stanford y NVIDIA presentaron modelos de la misma familia.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;ZTC&lt;/strong&gt; (Zero-Token Confidence, confianza sin tokens) propone otra dirección. En lugar de preguntar a otra IA "¿esta respuesta es correcta?" y recibir texto de vuelta, &lt;strong&gt;lee una vez el estado interno&lt;/strong&gt; del modelo que ya produjo la respuesta y calcula la probabilidad de que sea correcta. Los tokens adicionales generados son &lt;strong&gt;cero&lt;/strong&gt;.&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;Misma precisión, 10 veces más rápido.&lt;/strong&gt; La precisión de juicio (AUC) es ZTC 0.7289 frente a la API externa (JEV) 0.7350, estadísticamente equivalentes. El tiempo por juicio es ZTC 0.06 s frente a JEV 0.59 s. En los mismos 300 segundos, ZTC procesó 177 casos y JEV 135; en un duelo de 2.000 rondas, ZTC ganó el 73.7%.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Los datos no salen.&lt;/strong&gt; ZTC corre en la misma GPU junto al modelo, sin ida y vuelta a una API externa. Funciona en redes aisladas, lo que encaja con defensa, banca y sector público.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Coste adicional casi nulo.&lt;/strong&gt; Solo lee el interior de un modelo que ya generó su respuesta. Con este método, Darwin-397B-ZTC subió la precisión al juzgar sus propias respuestas de 0.76 a 0.88.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Spaces of the Week es la curación con la que Hugging Face destaca 8 apps por semana entre cerca de 1,5 millones. &lt;strong&gt;Gate Arcade&lt;/strong&gt;, que muestra como un juego cuándo una acción de agente se ejecuta o se retiene, fue seleccionada en la semana del 28 de septiembre. Suma la acción correcta (+1), penaliza la equivocada (−1) y deja en 0 la retención, y enfrenta tres estrategias: ejecutar todo sin juzgar, preguntar a una API externa (JEV) y ZTC.&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;&lt;/th&gt;
&lt;th&gt;Plano&lt;/th&gt;
&lt;th&gt;JEV (API externa)&lt;/th&gt;
&lt;th&gt;ZTC&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Precisión de juicio (AUC)&lt;/td&gt;
&lt;td&gt;sin dato&lt;/td&gt;
&lt;td&gt;0.7350&lt;/td&gt;
&lt;td&gt;0.7289&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Tiempo por juicio&lt;/td&gt;
&lt;td&gt;0 s&lt;/td&gt;
&lt;td&gt;0.591 s&lt;/td&gt;
&lt;td&gt;0.0615 s&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Casos en 300 s&lt;/td&gt;
&lt;td&gt;no aplica&lt;/td&gt;
&lt;td&gt;135&lt;/td&gt;
&lt;td&gt;177&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;h2&gt;
  
  
  Preguntas frecuentes
&lt;/h2&gt;

&lt;p&gt;&lt;strong&gt;¿El modelo es realmente de código abierto?&lt;/strong&gt;&lt;br&gt;
Darwin-180B-RSI parte de Qwen3.8-Flash-Next de Alibaba y está publicado en Hugging Face como &lt;code&gt;FINAL-Bench/Darwin-180B-RSI&lt;/code&gt;. La variante usada en ExtractBench es &lt;code&gt;FINAL-Bench/Darwin-180B-RSI-R3&lt;/code&gt;.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;¿Quién mide y registra las puntuaciones?&lt;/strong&gt;&lt;br&gt;
Cada organización mide con la herramienta de evaluación oficial de cada benchmark y registra el valor. Los resultados aquí citados corresponden a ese registro oficial en Hugging Face a octubre de 2026.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;¿Por qué un 98.95% y no un 100% en IFStruct?&lt;/strong&gt;&lt;br&gt;
De 2.000 prompts, uno agotó el límite de lectura de 120 segundos del arnés y se contabilizó como fallo. La cifra es, por tanto, conservadora. Con el razonamiento desactivado, el mismo modelo baja a 89.7%: la fase de razonamiento es la que cierra las últimas violaciones de restricciones.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;¿ZTC sustituye a las APIs de juicio como JEV?&lt;/strong&gt;&lt;br&gt;
No necesariamente. ZTC alcanza una precisión equivalente a JEV con unas 10 veces menos de latencia y sin enviar datos fuera, lo que lo hace idóneo en redes aisladas y cargas de alto volumen. JEV sigue siendo útil cuando se prefiere un juez externo e independiente del modelo.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;¿Esto sirve para mi tubería de agentes?&lt;/strong&gt;&lt;br&gt;
Si su salida la consume código (JSON, YAML, extracción de PDF), IFStruct, ExtractBench y MDPBench miden justo esa fiabilidad. Y si necesita decidir si una acción se ejecuta o se retiene con baja latencia, ese es el caso de uso de ZTC.&lt;/p&gt;

&lt;h2&gt;
  
  
  Further reading
&lt;/h2&gt;

&lt;ul&gt;
&lt;li&gt;&lt;a href="https://dev.to/_0e3192755d4df45b92"&gt;Darwin-180B-RSI: el modelo de lenguaje de código abierto #1 en 9 clasificaciones oficiales de Hugging Face&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;Modelos: &lt;code&gt;huggingface.co/FINAL-Bench/Darwin-180B-RSI&lt;/code&gt; y &lt;code&gt;huggingface.co/FINAL-Bench/Darwin-180B-RSI-R3&lt;/code&gt;
&lt;/li&gt;
&lt;/ul&gt;

</description>
      <category>ai</category>
      <category>llm</category>
      <category>opensource</category>
      <category>spanish</category>
    </item>
    <item>
      <title>Darwin-180B-RSI: el modelo de lenguaje de código abierto #1 en 9 clasificaciones oficiales de Hugging Face</title>
      <dc:creator>김민식/학생</dc:creator>
      <pubDate>Mon, 05 Oct 2026 08:58:49 +0000</pubDate>
      <link>https://dev.to/_0e3192755d4df45b92/darwin-180b-rsi-el-modelo-de-lenguaje-de-codigo-abierto-1-en-9-clasificaciones-oficiales-de-2d46</link>
      <guid>https://dev.to/_0e3192755d4df45b92/darwin-180b-rsi-el-modelo-de-lenguaje-de-codigo-abierto-1-en-9-clasificaciones-oficiales-de-2d46</guid>
      <description>&lt;h2&gt;
  
  
  TL;DR
&lt;/h2&gt;

&lt;ul&gt;
&lt;li&gt;La familia &lt;strong&gt;Darwin-180B-RSI&lt;/strong&gt; de VIDRAFT ocupa el &lt;strong&gt;primer lugar en 9 de los 48 benchmarks oficiales&lt;/strong&gt; de Hugging Face. Ninguna de las 95 organizaciones participantes tiene más; detrás vienen Moonshot AI y Zhipu AI (Z.ai) con 4 cada una.&lt;/li&gt;
&lt;li&gt;Los dos primeros puestos más recientes son de trabajo real, no de examen: &lt;strong&gt;IFStruct 98.95 %&lt;/strong&gt; (salida estructurada, 1.979 de 2.000 prompts) y &lt;strong&gt;ExtractBench 90.29&lt;/strong&gt; (extracción de datos de 370 PDF, versión R3).&lt;/li&gt;
&lt;li&gt;La receta se llama &lt;strong&gt;auto-mejora recursiva a nivel de modelo (Model-level RSI)&lt;/strong&gt;: el modelo resuelve problemas verificables, se queda solo con sus propias soluciones comprobadas como correctas y vuelve a entrenarse con ellas. Sin respuestas escritas por humanos.&lt;/li&gt;
&lt;li&gt;El mismo equipo desarrolló &lt;strong&gt;ZTC&lt;/strong&gt;, un juez que decide sin generar un solo token: misma precisión que consultar una API externa (AUC 0.7289 frente a 0.7350) y unas 10 veces más rápido (0.0615 s frente a 0.591 s).&lt;/li&gt;
&lt;li&gt;Abajo tienes código Python para consultar la clasificación tú mismo, cómo servir el modelo con vLLM o Transformers, y un FAQ. Todas las cifras se volvieron a comprobar contra la API de Hugging Face el 5 de octubre de 2026.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;&lt;a href="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fquickchart.io%2Fchart%3Fw%3D800%26h%3D420%26bkg%3Dwhite%26c%3D%257B%2522type%2522%253A%2522bar%2522%252C%2522data%2522%253A%257B%2522labels%2522%253A%255B%2522VIDRAFT%2522%252C%2522Moonshot%2520AI%2522%252C%2522Zhipu%2520AI%2520%2528Z.ai%2529%2522%252C%2522DeepSeek%2522%252C%2522Xiaomi%2522%255D%252C%2522datasets%2522%253A%255B%257B%2522label%2522%253A%2522%2522%252C%2522data%2522%253A%255B9%252C4%252C4%252C3%252C3%255D%252C%2522backgroundColor%2522%253A%255B%2522%25234F46E5%2522%252C%2522%25239CA3AF%2522%252C%2522%25239CA3AF%2522%252C%2522%25239CA3AF%2522%252C%2522%25239CA3AF%2522%255D%257D%255D%257D%252C%2522options%2522%253A%257B%2522legend%2522%253A%257B%2522display%2522%253Afalse%257D%252C%2522title%2522%253A%257B%2522display%2522%253Atrue%252C%2522text%2522%253A%2522Primeros%2520puestos%2520por%2520organizaci%25C3%25B3n%2520%252805-10-2026%2529%2522%252C%2522fontSize%2522%253A20%257D%252C%2522plugins%2522%253A%257B%2522datalabels%2522%253A%257B%2522display%2522%253Atrue%252C%2522anchor%2522%253A%2522end%2522%252C%2522align%2522%253A%2522end%2522%252C%2522font%2522%253A%257B%2522weight%2522%253A%2522bold%2522%257D%257D%257D%257D%257D" class="article-body-image-wrapper"&gt;&lt;img src="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fquickchart.io%2Fchart%3Fw%3D800%26h%3D420%26bkg%3Dwhite%26c%3D%257B%2522type%2522%253A%2522bar%2522%252C%2522data%2522%253A%257B%2522labels%2522%253A%255B%2522VIDRAFT%2522%252C%2522Moonshot%2520AI%2522%252C%2522Zhipu%2520AI%2520%2528Z.ai%2529%2522%252C%2522DeepSeek%2522%252C%2522Xiaomi%2522%255D%252C%2522datasets%2522%253A%255B%257B%2522label%2522%253A%2522%2522%252C%2522data%2522%253A%255B9%252C4%252C4%252C3%252C3%255D%252C%2522backgroundColor%2522%253A%255B%2522%25234F46E5%2522%252C%2522%25239CA3AF%2522%252C%2522%25239CA3AF%2522%252C%2522%25239CA3AF%2522%252C%2522%25239CA3AF%2522%255D%257D%255D%257D%252C%2522options%2522%253A%257B%2522legend%2522%253A%257B%2522display%2522%253Afalse%257D%252C%2522title%2522%253A%257B%2522display%2522%253Atrue%252C%2522text%2522%253A%2522Primeros%2520puestos%2520por%2520organizaci%25C3%25B3n%2520%252805-10-2026%2529%2522%252C%2522fontSize%2522%253A20%257D%252C%2522plugins%2522%253A%257B%2522datalabels%2522%253A%257B%2522display%2522%253Atrue%252C%2522anchor%2522%253A%2522end%2522%252C%2522align%2522%253A%2522end%2522%252C%2522font%2522%253A%257B%2522weight%2522%253A%2522bold%2522%257D%257D%257D%257D%257D" alt="Primeros puestos por organización en Hugging Face" width="1600" height="840"&gt;&lt;/a&gt;&lt;/p&gt;

&lt;h2&gt;
  
  
  ¿Qué son exactamente los 9 primeros puestos en la clasificación de Hugging Face?
&lt;/h2&gt;

&lt;p&gt;Hugging Face marca ciertos datasets como &lt;strong&gt;benchmarks oficiales&lt;/strong&gt; (&lt;code&gt;benchmark:official&lt;/code&gt;) y les añade una tabla de clasificación. Cada laboratorio publica sus resultados en su propio repositorio con archivos &lt;code&gt;.eval_results/*.yaml&lt;/code&gt;, y Hugging Face los agrega en un ranking. Hoy hay 48 tableros oficiales y 95 organizaciones compitiendo.&lt;/p&gt;

&lt;p&gt;Estos son los 9 tableros donde lidera Darwin-180B-RSI, con su perseguidor inmediato, según la API el 5 de octubre de 2026:&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Área&lt;/th&gt;
&lt;th&gt;Benchmark (ID del dataset)&lt;/th&gt;
&lt;th&gt;Darwin&lt;/th&gt;
&lt;th&gt;2.º lugar&lt;/th&gt;
&lt;th&gt;Puntaje&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Ciencia&lt;/td&gt;
&lt;td&gt;GPQA Diamond (&lt;code&gt;Idavidrein/gpqa&lt;/code&gt;)&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;94.44&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;moonshotai/Kimi-K3&lt;/td&gt;
&lt;td&gt;93.5&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Conocimiento&lt;/td&gt;
&lt;td&gt;MMLU-Pro (&lt;code&gt;TIGER-Lab/MMLU-Pro&lt;/code&gt;)&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;88.12&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;MiniMaxAI/MiniMax-M2.1&lt;/td&gt;
&lt;td&gt;88.0&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Matemáticas&lt;/td&gt;
&lt;td&gt;AIME 2026 (&lt;code&gt;MathArena/aime_2026&lt;/code&gt;)&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;100&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;thinkingmachines/Inkling&lt;/td&gt;
&lt;td&gt;97.1&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Matemáticas&lt;/td&gt;
&lt;td&gt;HMMT Feb 2026 (&lt;code&gt;MathArena/hmmt_feb_2026&lt;/code&gt;)&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;100&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;moonshotai/Kimi-K2.6&lt;/td&gt;
&lt;td&gt;92.7&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Visión&lt;/td&gt;
&lt;td&gt;MMMU-Pro (&lt;code&gt;MMMU/MMMU_Pro&lt;/code&gt;)&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;79.48&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;moonshotai/Kimi-K2.6&lt;/td&gt;
&lt;td&gt;79.4&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Derecho&lt;/td&gt;
&lt;td&gt;LEXam (&lt;code&gt;LEXam-Benchmark/LEXam&lt;/code&gt;)&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;68.94&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;deepseek-ai/DeepSeek-R1&lt;/td&gt;
&lt;td&gt;52.41&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Derecho&lt;/td&gt;
&lt;td&gt;LEXam-hard (&lt;code&gt;joelniklaus/LEXam-hard&lt;/code&gt;)&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;45.72&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;thinkingmachines/Inkling&lt;/td&gt;
&lt;td&gt;40.82&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Trabajo real&lt;/td&gt;
&lt;td&gt;ExtractBench (&lt;code&gt;llamaindex/ExtractBench&lt;/code&gt;)&lt;/td&gt;
&lt;td&gt;
&lt;strong&gt;90.29&lt;/strong&gt; (R3)&lt;/td&gt;
&lt;td&gt;Qwen/Qwen3.8-Flash-Next&lt;/td&gt;
&lt;td&gt;89.88&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Trabajo real&lt;/td&gt;
&lt;td&gt;IFStruct (&lt;code&gt;LiquidAI/ifstruct-v1.0&lt;/code&gt;)&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;98.95&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;InternScience/Agents-A1&lt;/td&gt;
&lt;td&gt;93.25&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;MMLU-Pro (unas 141 entradas) y GPQA (unas 111) son los tableros más concurridos, y ambos los encabeza este modelo. Lo interesante para quien desarrolla es la combinación: los rankings más disputados y, a la vez, las tareas que de verdad aparecen en producción.&lt;/p&gt;

&lt;p&gt;Una aclaración honesta: todos estos puntajes son &lt;strong&gt;autorreportados&lt;/strong&gt;, medidos por cada laboratorio con la herramienta oficial de evaluación, que es como funciona este sistema para todos. Los resultados por voto mayoritario (por ejemplo AIME maj@16) están etiquetados como tales en la ficha del modelo. Antes de comparar, revisa la configuración.&lt;/p&gt;

&lt;h2&gt;
  
  
  ¿Cómo puedo verificar la clasificación con código?
&lt;/h2&gt;

&lt;p&gt;No tienes que creerle a ningún artículo. La API pública de Hugging Face lo responde en segundos y no necesita token:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight python"&gt;&lt;code&gt;&lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;requests&lt;/span&gt;
&lt;span class="kn"&gt;from&lt;/span&gt; &lt;span class="n"&gt;collections&lt;/span&gt; &lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;Counter&lt;/span&gt;

&lt;span class="n"&gt;API&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;https://huggingface.co/api&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;

&lt;span class="c1"&gt;# 1) Lista de benchmarks oficiales
&lt;/span&gt;&lt;span class="n"&gt;boards&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;requests&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;get&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sa"&gt;f&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="si"&gt;{&lt;/span&gt;&lt;span class="n"&gt;API&lt;/span&gt;&lt;span class="si"&gt;}&lt;/span&gt;&lt;span class="s"&gt;/datasets&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
                      &lt;span class="n"&gt;params&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;filter&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;benchmark:official&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;limit&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="mi"&gt;200&lt;/span&gt;&lt;span class="p"&gt;}).&lt;/span&gt;&lt;span class="nf"&gt;json&lt;/span&gt;&lt;span class="p"&gt;()&lt;/span&gt;
&lt;span class="nf"&gt;print&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;Benchmarks oficiales:&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="nf"&gt;len&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;boards&lt;/span&gt;&lt;span class="p"&gt;))&lt;/span&gt;

&lt;span class="c1"&gt;# 2) Quién va primero en cada tablero
&lt;/span&gt;&lt;span class="n"&gt;firsts&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="nc"&gt;Counter&lt;/span&gt;&lt;span class="p"&gt;()&lt;/span&gt;
&lt;span class="k"&gt;for&lt;/span&gt; &lt;span class="n"&gt;b&lt;/span&gt; &lt;span class="ow"&gt;in&lt;/span&gt; &lt;span class="n"&gt;boards&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;
    &lt;span class="n"&gt;rows&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;requests&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;get&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sa"&gt;f&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="si"&gt;{&lt;/span&gt;&lt;span class="n"&gt;API&lt;/span&gt;&lt;span class="si"&gt;}&lt;/span&gt;&lt;span class="s"&gt;/datasets/&lt;/span&gt;&lt;span class="si"&gt;{&lt;/span&gt;&lt;span class="n"&gt;b&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="sh"&gt;'&lt;/span&gt;&lt;span class="s"&gt;id&lt;/span&gt;&lt;span class="sh"&gt;'&lt;/span&gt;&lt;span class="p"&gt;]&lt;/span&gt;&lt;span class="si"&gt;}&lt;/span&gt;&lt;span class="s"&gt;/leaderboard&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;).&lt;/span&gt;&lt;span class="nf"&gt;json&lt;/span&gt;&lt;span class="p"&gt;()&lt;/span&gt;
    &lt;span class="k"&gt;if&lt;/span&gt; &lt;span class="ow"&gt;not&lt;/span&gt; &lt;span class="nf"&gt;isinstance&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;rows&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="nb"&gt;list&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt; &lt;span class="ow"&gt;or&lt;/span&gt; &lt;span class="ow"&gt;not&lt;/span&gt; &lt;span class="n"&gt;rows&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;
        &lt;span class="k"&gt;continue&lt;/span&gt;
    &lt;span class="n"&gt;top&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;rows&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="mi"&gt;0&lt;/span&gt;&lt;span class="p"&gt;]&lt;/span&gt;                      &lt;span class="c1"&gt;# rank 1
&lt;/span&gt;    &lt;span class="n"&gt;firsts&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="n"&gt;top&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;modelId&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;].&lt;/span&gt;&lt;span class="nf"&gt;split&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;/&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;)[&lt;/span&gt;&lt;span class="mi"&gt;0&lt;/span&gt;&lt;span class="p"&gt;]]&lt;/span&gt; &lt;span class="o"&gt;+=&lt;/span&gt; &lt;span class="mi"&gt;1&lt;/span&gt;
    &lt;span class="k"&gt;if&lt;/span&gt; &lt;span class="n"&gt;top&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;modelId&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;].&lt;/span&gt;&lt;span class="nf"&gt;startswith&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;FINAL-Bench/&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;):&lt;/span&gt;
        &lt;span class="n"&gt;r2&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;rows&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="mi"&gt;1&lt;/span&gt;&lt;span class="p"&gt;]&lt;/span&gt; &lt;span class="k"&gt;if&lt;/span&gt; &lt;span class="nf"&gt;len&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;rows&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt; &lt;span class="o"&gt;&amp;gt;&lt;/span&gt; &lt;span class="mi"&gt;1&lt;/span&gt; &lt;span class="k"&gt;else&lt;/span&gt; &lt;span class="p"&gt;{}&lt;/span&gt;
        &lt;span class="nf"&gt;print&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;b&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;id&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;],&lt;/span&gt; &lt;span class="n"&gt;top&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;value&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;],&lt;/span&gt; &lt;span class="n"&gt;top&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;modelId&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;],&lt;/span&gt;
              &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;| 2.º&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;r2&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;get&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;modelId&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;),&lt;/span&gt; &lt;span class="n"&gt;r2&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;get&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;value&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;))&lt;/span&gt;

&lt;span class="nf"&gt;print&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;firsts&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;most_common&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="mi"&gt;5&lt;/span&gt;&lt;span class="p"&gt;))&lt;/span&gt;
&lt;span class="c1"&gt;# Resultado el 2026-10-05: FINAL-Bench 9, moonshotai 4, zai-org 4, XiaomiMiMo 3, deepseek-ai 3
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Cada fila trae campos como &lt;code&gt;rank&lt;/code&gt;, &lt;code&gt;value&lt;/code&gt;, &lt;code&gt;modelId&lt;/code&gt;, &lt;code&gt;source&lt;/code&gt; (enlace a la ficha del modelo) y &lt;code&gt;verified&lt;/code&gt;. Con esto puedes montar un panel interno para elegir modelos o una alerta que te avise cuando cambia el líder de un benchmark que te importa.&lt;/p&gt;

&lt;h2&gt;
  
  
  ¿Por qué importa a un desarrollador el 98.95 % en IFStruct?
&lt;/h2&gt;

&lt;p&gt;IFStruct, creado por Liquid AI, mide si un modelo devuelve JSON o YAML válido que respete un esquema pedido, con los requisitos redactados de las mil maneras en que los escriben los usuarios reales. Cada prompt se aprueba o se reprueba, y el criterio es estricto:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;cantidad exacta de elementos (o rango), clave contenedora, JSON frente a YAML&lt;/li&gt;
&lt;li&gt;bloque de código obligatorio o prohibido, nada de comentarios si así se pide&lt;/li&gt;
&lt;li&gt;tipo de cada campo, enums, límites numéricos y largo de listas anidadas&lt;/li&gt;
&lt;li&gt;cualquier campo que el esquema no pidió hace fallar la respuesta&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;No se usa decodificación restringida (constrained decoding), así que se mide solo la disciplina del propio modelo. Darwin-180B-RSI aprobó 1.979 de 2.000 prompts con los valores por defecto del harness oficial (temperatura 0, 16.000 tokens máximos, razonamiento activado). Un prompt superó el timeout de lectura de 120 segundos del harness y contó como fallo, así que la cifra es conservadora. Con el razonamiento apagado, el mismo modelo baja a 89.7 %: la fase de razonamiento es la que atrapa las últimas violaciones de formato.&lt;/p&gt;

&lt;p&gt;&lt;a href="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fquickchart.io%2Fchart%3Fw%3D800%26h%3D420%26bkg%3Dwhite%26c%3D%257B%2522type%2522%253A%2522horizontalBar%2522%252C%2522data%2522%253A%257B%2522labels%2522%253A%255B%2522Darwin-180B-RSI%2522%252C%2522Agents-A1%2522%252C%2522gpt-oss-20b%2522%252C%2522Nemotron-3-Nano-30B%2522%252C%2522Granite%25204.1%25208B%2522%255D%252C%2522datasets%2522%253A%255B%257B%2522label%2522%253A%2522%2522%252C%2522data%2522%253A%255B98.95%252C93.25%252C91.95%252C86.8%252C68.45%255D%252C%2522backgroundColor%2522%253A%255B%2522%25234F46E5%2522%252C%2522%25239CA3AF%2522%252C%2522%25239CA3AF%2522%252C%2522%25239CA3AF%2522%252C%2522%25239CA3AF%2522%255D%257D%255D%257D%252C%2522options%2522%253A%257B%2522legend%2522%253A%257B%2522display%2522%253Afalse%257D%252C%2522title%2522%253A%257B%2522display%2522%253Atrue%252C%2522text%2522%253A%2522IFStruct%253A%2520precisi%25C3%25B3n%2520en%2520salida%2520estructurada%2520%2528%2525%2529%2522%252C%2522fontSize%2522%253A20%257D%252C%2522plugins%2522%253A%257B%2522datalabels%2522%253A%257B%2522display%2522%253Atrue%252C%2522anchor%2522%253A%2522end%2522%252C%2522align%2522%253A%2522end%2522%252C%2522font%2522%253A%257B%2522weight%2522%253A%2522bold%2522%257D%257D%257D%257D%257D" class="article-body-image-wrapper"&gt;&lt;img src="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fquickchart.io%2Fchart%3Fw%3D800%26h%3D420%26bkg%3Dwhite%26c%3D%257B%2522type%2522%253A%2522horizontalBar%2522%252C%2522data%2522%253A%257B%2522labels%2522%253A%255B%2522Darwin-180B-RSI%2522%252C%2522Agents-A1%2522%252C%2522gpt-oss-20b%2522%252C%2522Nemotron-3-Nano-30B%2522%252C%2522Granite%25204.1%25208B%2522%255D%252C%2522datasets%2522%253A%255B%257B%2522label%2522%253A%2522%2522%252C%2522data%2522%253A%255B98.95%252C93.25%252C91.95%252C86.8%252C68.45%255D%252C%2522backgroundColor%2522%253A%255B%2522%25234F46E5%2522%252C%2522%25239CA3AF%2522%252C%2522%25239CA3AF%2522%252C%2522%25239CA3AF%2522%252C%2522%25239CA3AF%2522%255D%257D%255D%257D%252C%2522options%2522%253A%257B%2522legend%2522%253A%257B%2522display%2522%253Afalse%257D%252C%2522title%2522%253A%257B%2522display%2522%253Atrue%252C%2522text%2522%253A%2522IFStruct%253A%2520precisi%25C3%25B3n%2520en%2520salida%2520estructurada%2520%2528%2525%2529%2522%252C%2522fontSize%2522%253A20%257D%252C%2522plugins%2522%253A%257B%2522datalabels%2522%253A%257B%2522display%2522%253Atrue%252C%2522anchor%2522%253A%2522end%2522%252C%2522align%2522%253A%2522end%2522%252C%2522font%2522%253A%257B%2522weight%2522%253A%2522bold%2522%257D%257D%257D%257D%257D" alt="Ranking de IFStruct" width="1600" height="840"&gt;&lt;/a&gt;&lt;/p&gt;

&lt;p&gt;En un pipeline de agentes o en un backoffice automatizado, la salida del modelo no la lee una persona: la parsea tu código. Un tipo equivocado o una clave inventada y &lt;code&gt;json.loads&lt;/code&gt; o tu validador de esquema revientan. Pasar de 93.25 % a 98.95 % se traduce en menos reintentos, menos lógica de reparación y menos alertas a las tres de la mañana.&lt;/p&gt;

&lt;h2&gt;
  
  
  ¿Cómo se logró el 90.29 en ExtractBench?
&lt;/h2&gt;

&lt;p&gt;ExtractBench, de LlamaIndex, pide extraer campos estructurados de 370 documentos PDF, desde formularios cortos hasta archivos de casi 200 páginas. La segunda ronda de auto-mejora, &lt;strong&gt;Darwin-180B-RSI-R3&lt;/strong&gt;, obtuvo &lt;strong&gt;90.29&lt;/strong&gt; y superó a su propio modelo base, Qwen3.8-Flash-Next de Alibaba (89.88), y a Qwen3.8-27B (89.75). Esta corrida usó el harness oficial con el razonamiento desactivado, y así quedó declarado en la entrega.&lt;/p&gt;

&lt;p&gt;Que la siguiente generación de un mismo linaje supere al modelo del que partió es la evidencia más directa de que el ciclo de auto-mejora funciona.&lt;/p&gt;

&lt;h2&gt;
  
  
  ¿Cómo funciona la auto-mejora recursiva (Model-level RSI)?
&lt;/h2&gt;

&lt;p&gt;Darwin-180B-RSI parte del modelo abierto &lt;strong&gt;Qwen3.8-Flash-Next&lt;/strong&gt; de Alibaba y mejora mediante la &lt;strong&gt;auto-mejora recursiva a nivel de modelo&lt;/strong&gt; de VIDRAFT. La idea cabe en tres pasos:&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;El modelo resuelve por su cuenta &lt;strong&gt;problemas verificables&lt;/strong&gt;.&lt;/li&gt;
&lt;li&gt;Se conservan &lt;strong&gt;solo sus propias soluciones comprobadas como correctas&lt;/strong&gt;.&lt;/li&gt;
&lt;li&gt;El modelo &lt;strong&gt;se reentrena&lt;/strong&gt; con ellas, y el ciclo se repite.&lt;/li&gt;
&lt;/ol&gt;

&lt;p&gt;No se usan soluciones ni cadenas de razonamiento escritas por personas. Como lo no verificado nunca entra al entrenamiento, el modelo no refuerza sus propios errores. R3 es simplemente una vuelta más del ciclo.&lt;/p&gt;

&lt;p&gt;Lo llamativo es que nunca se entrenó con textos jurídicos ni con extracción de documentos, y aun así lidera LEXam, LEXam-hard y ExtractBench. La lectura de la empresa: los hábitos de razonamiento cuidadoso y paso a paso que se aprenden resolviendo problemas verificables se transfieren a otros dominios.&lt;/p&gt;

&lt;p&gt;¿Por qué "a nivel de modelo"? Para distinguirlo de los enfoques que mejoran el arnés (prompts, herramientas, flujos) alrededor de un modelo fijo. Aquí lo que cambia no es el manual, sino los pesos: el cerebro mismo.&lt;/p&gt;

&lt;h2&gt;
  
  
  ¿Cómo ejecuto Darwin-180B-RSI en mi infraestructura?
&lt;/h2&gt;

&lt;p&gt;El código siguiente viene tal cual de la sección Quickstart de la &lt;a href="https://huggingface.co/FINAL-Bench/Darwin-180B-RSI" rel="noopener noreferrer"&gt;ficha del modelo&lt;/a&gt;. Primero, las especificaciones:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;Mixture-of-Experts con atención híbrida (36 capas de atención lineal + 12 de atención completa)&lt;/li&gt;
&lt;li&gt;512 expertos enrutados, 10 activos por token, más un experto compartido&lt;/li&gt;
&lt;li&gt;Contexto de 262.144 tokens; entrada de imagen y texto, salida de texto&lt;/li&gt;
&lt;li&gt;Unos 336 GB en bf16&lt;/li&gt;
&lt;/ul&gt;

&lt;h3&gt;
  
  
  Servir con vLLM (8 × B200 o equivalente)
&lt;/h3&gt;



&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight shell"&gt;&lt;code&gt;vllm serve FINAL-Bench/Darwin-180B-RSI &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;--tensor-parallel-size&lt;/span&gt; 8 &lt;span class="nt"&gt;--enable-expert-parallel&lt;/span&gt; &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;--max-model-len&lt;/span&gt; 135168 &lt;span class="nt"&gt;--trust-remote-code&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;h3&gt;
  
  
  Llamarlo con la API compatible con OpenAI
&lt;/h3&gt;



&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight python"&gt;&lt;code&gt;&lt;span class="kn"&gt;from&lt;/span&gt; &lt;span class="n"&gt;openai&lt;/span&gt; &lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;OpenAI&lt;/span&gt;
&lt;span class="n"&gt;c&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="nc"&gt;OpenAI&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;base_url&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;http://localhost:8000/v1&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;api_key&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;-&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;span class="n"&gt;r&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;c&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;chat&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;completions&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;create&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;model&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;FINAL-Bench/Darwin-180B-RSI&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="n"&gt;messages&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="p"&gt;[{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;role&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;user&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;content&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;Explica en dos frases por qué el cielo es azul.&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;}],&lt;/span&gt;
    &lt;span class="n"&gt;temperature&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="mf"&gt;1.0&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;top_p&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="mf"&gt;0.95&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;extra_body&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;top_k&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="mi"&gt;20&lt;/span&gt;&lt;span class="p"&gt;})&lt;/span&gt;
&lt;span class="nf"&gt;print&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;r&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;choices&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="mi"&gt;0&lt;/span&gt;&lt;span class="p"&gt;].&lt;/span&gt;&lt;span class="n"&gt;message&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;content&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;h3&gt;
  
  
  Cargarlo con Transformers
&lt;/h3&gt;



&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight python"&gt;&lt;code&gt;&lt;span class="kn"&gt;from&lt;/span&gt; &lt;span class="n"&gt;transformers&lt;/span&gt; &lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;AutoProcessor&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;AutoModelForImageTextToText&lt;/span&gt;
&lt;span class="n"&gt;model_id&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;FINAL-Bench/Darwin-180B-RSI&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;
&lt;span class="n"&gt;processor&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;AutoProcessor&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;from_pretrained&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;model_id&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;span class="n"&gt;model&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;AutoModelForImageTextToText&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;from_pretrained&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;model_id&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;torch_dtype&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;auto&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;device_map&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;auto&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Dos consejos prácticos. Primero, es un modelo de razonamiento (thinking): para problemas difíciles la ficha recomienda un presupuesto de 32K a 131K tokens; si lo recortas, pierdes precisión. Segundo, la configuración de evaluación de la ficha es temperatura 1.0, top_p 0.95, top_k 20, aunque para tareas de formato estricto como IFStruct el harness oficial usó temperatura 0.&lt;/p&gt;

&lt;h2&gt;
  
  
  ¿Qué es ZTC y en qué se diferencia de JEV?
&lt;/h2&gt;

&lt;p&gt;Ahora que los agentes envían correos, hacen pagos y ejecutan código, filtrar una acción equivocada &lt;strong&gt;antes&lt;/strong&gt; de ejecutarla se volvió un tema central. La API de decisión &lt;strong&gt;JEV&lt;/strong&gt;, de Typesafe, definió el formato estándar del sector, y el ranking público Decision Index ya reúne más de 70 modelos. El 30 de septiembre Cloudflare publicó Clef, un modelo de decisión compatible con JEV.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;ZTC (Zero-Token Confidence)&lt;/strong&gt; de VIDRAFT toma otro camino. En lugar de preguntarle a otra IA "¿esta respuesta es correcta?" y esperar texto de vuelta, lee una sola vez el estado interno del modelo que generó la respuesta y calcula la probabilidad de que sea correcta. Tokens adicionales generados: cero.&lt;/p&gt;

&lt;p&gt;Para verlo en acción está &lt;strong&gt;Gate Arcade&lt;/strong&gt;, elegida como "Space of the Week" de Hugging Face la semana del 28 de septiembre. Un agente propone una acción y la compuerta decide ejecutar o retener: +1 por ejecutar una acción correcta, -1 por ejecutar una incorrecta, 0 por retener. Mediciones del 24 de septiembre de 2026, en despliegue aislado de internet:&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;&lt;/th&gt;
&lt;th&gt;Sin compuerta&lt;/th&gt;
&lt;th&gt;JEV (API externa)&lt;/th&gt;
&lt;th&gt;ZTC (VIDRAFT)&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Precisión de decisión (AUC)&lt;/td&gt;
&lt;td&gt;n/a&lt;/td&gt;
&lt;td&gt;0.7350&lt;/td&gt;
&lt;td&gt;0.7289&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Tiempo por decisión&lt;/td&gt;
&lt;td&gt;0 s&lt;/td&gt;
&lt;td&gt;0.591 s&lt;/td&gt;
&lt;td&gt;0.0615 s&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Decisiones en 300 s&lt;/td&gt;
&lt;td&gt;n/a&lt;/td&gt;
&lt;td&gt;135&lt;/td&gt;
&lt;td&gt;177&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;&lt;a href="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fquickchart.io%2Fchart%3Fw%3D800%26h%3D420%26bkg%3Dwhite%26c%3D%257B%2522type%2522%253A%2522bar%2522%252C%2522data%2522%253A%257B%2522labels%2522%253A%255B%2522JEV%2520%2528API%2520externa%2529%2522%252C%2522ZTC%2520%2528VIDRAFT%2529%2522%255D%252C%2522datasets%2522%253A%255B%257B%2522label%2522%253A%2522%2522%252C%2522data%2522%253A%255B0.591%252C0.0615%255D%252C%2522backgroundColor%2522%253A%255B%2522%25239CA3AF%2522%252C%2522%25234F46E5%2522%255D%257D%255D%257D%252C%2522options%2522%253A%257B%2522legend%2522%253A%257B%2522display%2522%253Afalse%257D%252C%2522title%2522%253A%257B%2522display%2522%253Atrue%252C%2522text%2522%253A%2522Tiempo%2520por%2520decisi%25C3%25B3n%2520%2528s%2529%252C%2520menos%2520es%2520mejor%2522%252C%2522fontSize%2522%253A20%257D%252C%2522plugins%2522%253A%257B%2522datalabels%2522%253A%257B%2522display%2522%253Atrue%252C%2522anchor%2522%253A%2522end%2522%252C%2522align%2522%253A%2522end%2522%252C%2522font%2522%253A%257B%2522weight%2522%253A%2522bold%2522%257D%257D%257D%257D%257D" class="article-body-image-wrapper"&gt;&lt;img src="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fquickchart.io%2Fchart%3Fw%3D800%26h%3D420%26bkg%3Dwhite%26c%3D%257B%2522type%2522%253A%2522bar%2522%252C%2522data%2522%253A%257B%2522labels%2522%253A%255B%2522JEV%2520%2528API%2520externa%2529%2522%252C%2522ZTC%2520%2528VIDRAFT%2529%2522%255D%252C%2522datasets%2522%253A%255B%257B%2522label%2522%253A%2522%2522%252C%2522data%2522%253A%255B0.591%252C0.0615%255D%252C%2522backgroundColor%2522%253A%255B%2522%25239CA3AF%2522%252C%2522%25234F46E5%2522%255D%257D%255D%257D%252C%2522options%2522%253A%257B%2522legend%2522%253A%257B%2522display%2522%253Afalse%257D%252C%2522title%2522%253A%257B%2522display%2522%253Atrue%252C%2522text%2522%253A%2522Tiempo%2520por%2520decisi%25C3%25B3n%2520%2528s%2529%252C%2520menos%2520es%2520mejor%2522%252C%2522fontSize%2522%253A20%257D%252C%2522plugins%2522%253A%257B%2522datalabels%2522%253A%257B%2522display%2522%253Atrue%252C%2522anchor%2522%253A%2522end%2522%252C%2522align%2522%253A%2522end%2522%252C%2522font%2522%253A%257B%2522weight%2522%253A%2522bold%2522%257D%257D%257D%257D%257D" alt="Latencia de ZTC frente a JEV" width="1600" height="840"&gt;&lt;/a&gt;&lt;/p&gt;

&lt;p&gt;La precisión es estadísticamente equivalente y la velocidad es unas 10 veces mayor. En 2.000 partidas cara a cara, ZTC ganó el 73.7 %. Como no envía datos a ningún servicio externo, funciona en redes aisladas, algo clave para banca, defensa o sector público. Con el mismo enfoque, Darwin-397B-ZTC elevó de 0.76 a 0.88 la precisión con la que juzga si sus propias respuestas son correctas.&lt;/p&gt;

&lt;p&gt;Los límites también son claros: hay que leer el interior del modelo, así que no sirve para modelos cerrados que solo se usan por API, y cada modelo necesita su propio lector calibrado. Lo sensato es usarlo como primer filtro rápido y barato, no como juez final. Además, el lector ZTC incluido en el repositorio de Darwin-180B-RSI está marcado en la ficha como "early release"; léela antes de usarlo en acciones de alto riesgo.&lt;/p&gt;

&lt;h2&gt;
  
  
  Preguntas frecuentes (FAQ)
&lt;/h2&gt;

&lt;p&gt;&lt;strong&gt;1. ¿Dónde veo la clasificación de Hugging Face con los 9 primeros puestos?&lt;/strong&gt;&lt;br&gt;
En la pestaña de leaderboard de cada dataset (por ejemplo &lt;code&gt;huggingface.co/datasets/LiquidAI/ifstruct-v1.0&lt;/code&gt;) o llamando a &lt;code&gt;https://huggingface.co/api/datasets/{id}/leaderboard&lt;/code&gt;, como en el script de arriba.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;2. ¿Quién midió los puntajes? ¿Están verificados?&lt;/strong&gt;&lt;br&gt;
Los tableros oficiales de Hugging Face funcionan con resultados que cada laboratorio mide con la herramienta oficial y publica vía &lt;code&gt;.eval_results&lt;/code&gt;. Los de Darwin también son autorreportados, y la ficha del modelo documenta muestras por pregunta y presupuesto de razonamiento.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;3. ¿De verdad la auto-mejora recursiva no usa respuestas humanas?&lt;/strong&gt;&lt;br&gt;
Así es. El modelo resuelve problemas verificables, conserva solo sus soluciones comprobadas y se reentrena con ellas. No se usan soluciones ni razonamientos escritos por personas.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;4. ¿Puedo usar este modelo de lenguaje de código abierto ya mismo? ¿Qué hardware necesito?&lt;/strong&gt;&lt;br&gt;
Los pesos están publicados en Hugging Face. Ocupan unos 336 GB en bf16, por eso la ficha recomienda 8 × B200 (o equivalente) con vLLM, paralelismo tensorial 8 y paralelismo de expertos.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;5. ¿Por qué elegirlo para generar JSON en producción?&lt;/strong&gt;&lt;br&gt;
Logró 98.95 % en IFStruct sin decodificación restringida, 5.7 puntos por encima del segundo (93.25 %). Eso significa menos reintentos y menos código de reparación.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;6. ¿Cómo integro ZTC en mi servicio?&lt;/strong&gt;&lt;br&gt;
Necesitas un modelo de pesos abiertos cuyo estado interno puedas leer. Prueba primero Gate Arcade para entender el flujo y revisa los ejemplos de la carpeta &lt;code&gt;ztc/&lt;/code&gt; en la ficha del modelo.&lt;/p&gt;

&lt;h2&gt;
  
  
  Enlaces
&lt;/h2&gt;

&lt;ul&gt;
&lt;li&gt;VIDRAFT: &lt;a href="https://vidraft.net" rel="noopener noreferrer"&gt;https://vidraft.net&lt;/a&gt;
&lt;/li&gt;
&lt;li&gt;Modelo: &lt;a href="https://huggingface.co/FINAL-Bench/Darwin-180B-RSI" rel="noopener noreferrer"&gt;https://huggingface.co/FINAL-Bench/Darwin-180B-RSI&lt;/a&gt;
&lt;/li&gt;
&lt;li&gt;R3 (#1 en ExtractBench): &lt;a href="https://huggingface.co/FINAL-Bench/Darwin-180B-RSI-R3" rel="noopener noreferrer"&gt;https://huggingface.co/FINAL-Bench/Darwin-180B-RSI-R3&lt;/a&gt;
&lt;/li&gt;
&lt;li&gt;Gate Arcade (Space of the Week): &lt;a href="https://huggingface.co/spaces/FINAL-Bench/gate-tetris" rel="noopener noreferrer"&gt;https://huggingface.co/spaces/FINAL-Bench/gate-tetris&lt;/a&gt;
&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;De un modelo que aprueba exámenes a uno que trabaja respetando el formato que le pides, más una compuerta que detecta en 0.06 segundos cuándo no está seguro antes de actuar. Pruébalo y cuéntanos en los comentarios qué tal te fue.&lt;/p&gt;

</description>
      <category>ai</category>
      <category>llm</category>
      <category>opensource</category>
      <category>spanish</category>
    </item>
  </channel>
</rss>
