DEV Community

Cover image for Claude Opus 5 frente a GPT-5.6 Luna: 18 pruebas verificables, sin ranking de velocidad
Jenny Met
Jenny Met

Posted on • Originally published at crazyrouter.com

Claude Opus 5 frente a GPT-5.6 Luna: 18 pruebas verificables, sin ranking de velocidad

Claude Opus 5 frente a GPT-5.6 Luna: 18 pruebas verificables, sin ranking de velocidad

Respuesta rápida

En la ronda difícil, Claude Opus 5 obtuvo 17/18 (94,4%) y GPT-5.6 Luna 16/18 (88,9%). Es una ventaja de una tarea en esta muestra, no una prueba de superioridad universal. Lo importante es el tipo de fallo: Opus entregó correctamente los tres archivos algorítmicos, pero rompió un contrato de JSON estricto; Luna cumplió las tres instrucciones de formato, aunque dos archivos de Python fallaron al importarse.

Por qué fue necesario subir la dificultad

La primera ronda de ocho tareas fue demasiado sencilla para separar a los modelos: ambos consiguieron 8/8. La segunda pasó a 18 tareas, con variantes hard, harder y extreme en seis categorías. Se exigieron fracciones exactas, modelos físicos por etapas, archivos ejecutables completos, rechazo de premisas engañosas, soluciones lógicas únicas y disciplina de salida carácter por carácter. Una explicación convincente no bastaba: cada afirmación decisiva debía poder verificarse con cálculo, parsing de JSON o ejecución de Python.

Cómo se puntuaron las 18 tareas

Los dos modelos recibieron el mismo enunciado, instrucción de sistema, temperature y presupuesto por tarea. Matemáticas y física se validaron contra valores exactos o tolerancias numéricas. El código se guardó tal como llegó y se importó en el mismo harness de pruebas ocultas. JSON y CSV se evaluaron como artefactos para máquinas. Que un archivo funcione después de borrar sus propios assert ayuda a diagnosticar el fallo, pero no convierte la entrega original en un aprobado. La latencia de ruta se conserva solo en el JSON original y no participa en ninguna decisión de ganador.

Resultados en seis dimensiones

Precisión en seis dimensiones

Dimensión Opus 5 GPT-5.6 Luna
Razonamiento matemático 3/3 3/3
Física compleja 3/3 3/3
Entrega de algoritmos 3/3 1/3
Rechazo de premisas falsas 3/3 3/3
Razonamiento con restricciones 3/3 3/3
Seguimiento de instrucciones 2/3 3/3
Total 17/18 (94.4%) 16/18 (88.9%)

La diferencia algorítmica fue una diferencia de entrega

En los dos fallos de Luna, las funciones principales superaron las pruebas ocultas después de eliminar los assert del final. El problema era que esos assert contenían resultados esperados incorrectos y el archivo original lanzaba AssertionError durante el import. Bajo un contrato de “archivo Python completo”, son fallos reales. Los tres archivos originales de Opus se importaron y superaron el mismo harness. En producción, una función plausible no equivale a un artefacto listo para integrar.

En JSON estricto, la ventaja cambió de lado

Fallos distintos implican riesgos distintos

El único fallo de Opus fue casi el reflejo contrario. Las claves y los valores eran correctos, pero el modelo envolvió el objeto en un bloque Markdown pese a que se pedía exactamente un objeto JSON, sin nada más. El comportamiento se repitió en un segundo intento independiente. Luna aprobó las tres pruebas de instrucciones. Cuando la salida entra directamente en un parser, el envoltorio también forma parte de la corrección.

El presupuesto de salida se separó de los errores de inteligencia

Algunos intentos iniciales terminaron con finish_reason=length porque el razonamiento oculto consumió el presupuesto de salida. Se conservaron como evidencia, pero no se contaron como errores de inteligencia. Antes de puntuar se aumentó de forma equivalente el presupuesto efectivo de ambos modelos. Así se evita confundir configuración con razonamiento, sin ocultar el riesgo de integración de una respuesta que deja poco espacio al artefacto visible.

Cómo convertir los resultados en reglas de routing

Empieza con Luna para JSON estricto, CSV, extracción corta y trabajo estructurado de gran volumen, manteniendo siempre validación de esquema. Empieza con Opus para archivos algorítmicos largos, casos límite e ingeniería defensiva. En matemáticas, física compleja, rechazo de premisas falsas y restricciones hubo empate; en esas áreas, coste, compatibilidad y estilo de salida son mejores criterios. Con ambos modelos hay que validar el artefacto: parsear JSON, comprobar números clave y ejecutar el código sin limpiarlo a mano.

Reproducción y evidencia original

El runner es scripts/opus5_vs_luna_hard_benchmark.py. El resultado completo está en .tmp/opus5-vs-luna-hard-benchmark-results.json; los reintentos independientes están en .tmp/opus5-hard-failure-retry.json y .tmp/luna-hard-failure-retry.json. Se usó el endpoint limpio https://cn.crazyrouter.com/v1/chat/completions. Las latencias permanecen únicamente en los archivos de evidencia.

Preguntas frecuentes

¿17/18 convierte a Opus 5 en ganador absoluto?

No. Solo significa que lideró por una tarea en este conjunto. No se evaluaron visión, herramientas, contexto ultralargo ni agentes de varios turnos.

¿Por qué cuentan como fallo unas autopruebas incorrectas?

Porque se pidió un archivo Python completo. Si el original falla al importarse, un sistema posterior no puede usarlo sin reparación manual.

¿Por qué la latencia no aparece en el veredicto?

Depende del modelo, el gateway, la carga upstream y el estado de la ruta. Es evidencia operativa útil, pero no mide la precisión intelectual.

Veredicto final

En esta prueba centrada en precisión verificable, Opus 5 lideró 17/18 a 16/18 gracias a la entrega completa de los tres algoritmos. Luna fue mejor en cumplimiento estricto de formato. La conclusión práctica no es un campeón universal, sino una regla de routing basada en fallos reproducibles.

Prueba ambos modelos en Crazyrouter con tus propios prompts de producción

Top comments (1)

Collapse
 
topstar_ai profile image
Luis Cruz

Me parece interesante que Claude Opus 5 y GPT-5.6 Luna hayan mostrado fortalezas y debilidades diferentes en las distintas categorías de pruebas, como se ve en la matriz de resultados. La capacidad de Opus 5 para entregar algoritmos correctos es notable, pero el fallo en el contrato de JSON estricto es un recordatorio de que la precisión en la salida es crucial. Por otro lado, GPT-5.6 Luna mostró una mayor disciplina en el seguimiento de instrucciones, lo que sugiere que su arquitectura puede ser más adecuada para tareas que requieren una salida muy específica. Me pregunto si se han explorado técnicas de ensemble o híbridas que combinen las fortalezas de ambos modelos para mejorar la precisión general.