DEV Community

Cover image for Evaluaciones comparativas de Claude Haiku 5.5
Roobia
Roobia

Posted on Originally published at apidog.com

Evaluaciones comparativas de Claude Haiku 5.5

Claude Haiku 5.5 obtiene un 72.4% en OSWorld 2.1, 1620 en GDPval-AA v2.1, 46.4% en FrontierCode 1.1 y 39.2% en Terminal-Bench 4.0. Haiku 4.5 obtuvo 15.7%, 735 y 0.0% en tres de esos benchmarks. Todos son resultados con esfuerzo máximo; con el valor predeterminado medium, GDPval-AA baja a 1277. Ningún laboratorio independiente ha publicado resultados de Haiku 5.5 todavía.

Prueba Apidog hoy

A continuación verás cada benchmark de Claude Haiku 5.5, quién lo ejecutó, cómo el esfuerzo modifica la puntuación y el costo, y cómo validar el modelo con tu propio tráfico en Apidog. Para especificaciones y precios, empieza por qué es Claude Haiku 5.5.

La tabla de lanzamiento

Cada resultado de Haiku 5.5 usa pensamiento adaptativo y esfuerzo máximo, normalmente promediado sobre cinco ejecuciones. Terminal-Bench utilizó diez ejecuciones por tarea. n/r significa que no se publicó ningún resultado.

Benchmark Haiku 5.5 Haiku 4.5 GPT-6 Luna Sonnet 5.5
GDPval-AA v2.1 (Elo) 1620 735 1437 1840
AA-Briefcase v1.1 (Elo) 1578 614 1336 1824
OSWorld 2.1, subconjunto offline 72.4% 15.7% 48.9% 83.9%
Humanity’s Last Exam, sin herramientas 45.9% 10.2% n/r 56.9%
Humanity’s Last Exam, con herramientas 57.4% 18.7% n/r 64.5%
Terminal-Bench 4.0 39.2% 0.0% 16.4% 70.6%
FrontierCode 1.1 (Principal) 46.4% n/r 42.4% 52.1% (xhigh)
Chartography, sin herramientas 46.4% 6.4% 29.1% 61.6%

Quién ejecutó cada benchmark

Anthropic ejecutó la mayoría de las pruebas. Que dos modelos compartan el mismo benchmark no implica necesariamente que usaran el mismo arnés, configuración o nivel de esfuerzo.

Benchmark Quién lo ejecutó Condiciones
GDPval-AA v2.1, AA-Briefcase v1.1 Artificial Analysis, independientemente GDPval-AA: 220 tareas, 44 ocupaciones, Elo anclado a DeepSeek V4.1 Flash (máximo) en 1600; Briefcase: proyectos de varias semanas
FrontierCode 1.1 Cognition Claude en Claude Code, GPT en Codex; Principal = las 100 tareas más difíciles de 150
Chartography Anthropic, en el benchmark de Surge AI Evaluador Gemini 3.5 Flash; puntuación de Luna de Surge AI
Terminal-Bench 4.0 Anthropic Claude Code --bare, 66 tareas, 10 pruebas por tarea, salvaguardas activas
OSWorld 2.1 Anthropic 82 de 108 tareas, 1080p, hasta 500 pasos
Humanity’s Last Exam Anthropic Presupuesto de 980K tokens por tarea, evaluador Opus 4.6

Dos resultados de GPT-6 Luna requieren contexto:

  • Anthropic ejecutó OSWorld de Luna mediante la API de OpenAI sobre las mismas 82 tareas.
  • El 16.4% de Terminal-Bench de Luna proviene de la tabla de clasificación pública con Codex CLI y esfuerzo máximo.
  • Las salvaguardas detuvieron el 1.8% de las ejecuciones de Haiku 5.5 en Terminal-Bench: 12 de 660. Cada una contó como fallo.

La trampa de FrontierCode

La tabla de lanzamiento compara Haiku 5.5 con esfuerzo máximo (46.4%) contra Sonnet 5.5 con xhigh (52.1%), que es la mejor puntuación de Sonnet. La tarjeta del sistema incluye una comparación equivalente:

FrontierCode 1.1 Principal Extendido
Haiku 5.5, máximo 46.4% 58.4%
Haiku 5.5, xhigh 45.8% n/r
Sonnet 5.5, máximo 46.2% 59.1%
Sonnet 5.5, xhigh 52.1% 64.4%

Con ambos modelos en esfuerzo máximo, Haiku 5.5 supera ligeramente a Sonnet 5.5 en Principal: 46.4% frente a 46.2%. Sin embargo, al comparar la mejor configuración de cada modelo, Sonnet lidera por 5.7 puntos.

Al citar FrontierCode, indica siempre el nivel de esfuerzo.

Extras de la tarjeta del sistema

La tarjeta del sistema añade resultados que no aparecieron en la publicación de lanzamiento. Todos usan esfuerzo máximo, salvo que se indique lo contrario.

Benchmark Haiku 5.5 Haiku 4.5 Sonnet 5.5
SWE-Bench Pro 64.8 n/r 81.3
SWE-bench Multilingual 83.7 67.4 90.3
SWE-bench Multimodal 30.7 19.8 54.3
OSWorld 2.1, tasa de aprobación estricta 37.1% n/r 48.8%
Chartography, con herramientas 86.2% 8.8% 90.2%
OfficeQA / OfficeQA Pro 73.5% / 60.3% 63.0% / 47.1% 76.9% / 65.6%
HealthBench Professional, ajustado por longitud 64.8% 32.2% 69.2%

El 72.4% de OSWorld representa crédito parcial: solo el 37.1% de las tareas pasa de forma estricta.

Chartography casi duplica su puntuación al habilitar herramientas, de 46.4% a 86.2%. Si tu caso de uso incluye gráficos, proporciona herramientas a Haiku 5.5.

El esfuerzo predeterminado puntúa más bajo

Haiku 5.5 usa medium por defecto en la API de Claude y en Claude Code. La tarjeta del sistema publica estos resultados para el nivel predeterminado:

Benchmark Medio, predeterminado Máximo Nota
GDPval-AA v2.1 1277 1620 Medio usó aproximadamente una décima parte de los tokens de salida del máximo
AA-Briefcase v1.1 1372 1578 Medio usó menos de un cuarto de los tokens de salida del máximo
HealthBench Professional 59.9% 64.8% Bajo: 57.9%; alto: 61.3%

Si llamas a la API sin output_config.effort, espera los resultados de la columna medium. Los documentos de esfuerzo cubren los cinco niveles.

Puntuación y costo por esfuerzo

Los siguientes valores proceden de los gráficos de lanzamiento. El costo de OSWorld y Terminal-Bench es por intento; GDPval-AA es por tarea.

Modelo Bajo Medio Alto Xalto Máximo
OSWorld 2.1
Haiku 5.5 42.0% ($0.07) 53.3% ($0.13) 61.3% ($0.18) 67.6% ($0.28) 72.4% ($0.61)
Sonnet 5.5 57.9% ($0.68) 66.0% ($0.93) 73.2% ($1.38) 81.1% ($2.22) 83.9% ($5.73)
GPT-6 Luna 19.2% ($0.04) 37.5% ($0.13) 42.3% ($0.14) 44.8% ($0.17) 48.9% ($0.21)
GDPval-AA v2.1
Haiku 5.5 1125 ($0.012) 1277 ($0.030) 1420 ($0.089) 1513 ($0.27) 1620 ($0.87)
Sonnet 5.5 1179 ($0.22) 1324 ($0.27) 1551 ($0.62) 1731 ($1.88) 1840 ($6.78)
GPT-6 Luna 1036 ($0.004) 1262 ($0.02) 1344 ($0.03) 1364 ($0.05) 1437 ($0.09)
Terminal-Bench 4.0
Haiku 5.5 12.7% ($0.42) 20.3% ($0.68) 24.8% ($1.04) 31.5% ($1.75) 39.2% ($2.64)
Sonnet 5.5 20.0% ($0.62) 28.8% ($0.68) 43.0% ($1.46) 61.5% ($4.34) 70.6% ($10.44)

Conclusiones prácticas:

  • El salto a máximo es caro. En GDPval-AA, máximo cuesta aproximadamente 28 veces más que medio para sumar 343 puntos Elo. En OSWorld, máximo cuesta más del doble que xhigh por 4.8 puntos adicionales.
  • Haiku 5.5 en medio supera a Luna en máximo en OSWorld: 53.3% por $0.13 frente a 48.9% por $0.21.
  • Haiku 5.5 en máximo supera a Sonnet 5.5 en medio en OSWorld: 72.4% por $0.61 frente a 66.0% por $0.93.
  • Terminal-Bench es la excepción: Sonnet 5.5 en alto logra 43.0% por $1.46, mejor que Haiku 5.5 en máximo con 39.2% por $2.64.

Luna es más barata en los demás niveles equivalentes. Consulta la comparación Haiku 5.5 vs GPT-6 Luna.

Los costos usan precios de lista: $0.10/$0.50 por millón de tokens para prompts de hasta 100K tokens, con precios más altos para contextos mayores. Consulta el desglose de precios.

Dónde Haiku 5.5 aún se queda atrás

Sonnet 5.5 lidera todas las filas de la tabla de lanzamiento. La única victoria directa de Haiku aparece en FrontierCode con ambos modelos en esfuerzo máximo.

Las diferencias más importantes son:

  • Terminal-Bench 4.0: 39.2% frente a 70.6%.
  • SWE-Bench Pro: 64.8 frente a 81.3.
  • SWE-bench Multimodal: 30.7 frente a 54.3.

Anthropic indica que Sonnet 5.5 y Opus 5.5 siguen siendo mejores opciones para tareas de codificación agéntica complejas.

Haiku 5.5 encaja mejor en tareas acotadas:

  • Compactación y resumen.
  • Clasificación.
  • Automatización de navegador.
  • Subagentes ejecutados bajo un modelo principal más capaz.

Para implementarlo como subagente, consulta Haiku 5.5 en Claude Code.

Resultados independientes: ninguno todavía

Hasta el 8 de octubre de 2026, ningún laboratorio independiente ha publicado resultados de Haiku 5.5.

La página de Haiku 5.5 en Artificial Analysis devuelve un error 404, y su tabla de clasificación solo enumera Claude 4.5 Haiku. Vals, LMArena, SWE-bench y Aider tampoco muestran resultados.

No existen cifras de velocidad de terceros. Anthropic describe Haiku 5.5 como su modelo más rápido hasta la fecha a velocidad estándar, aunque más lento que Opus en modo rápido.

El dato externo más cercano proviene de Cursor. Sus documentos del modelo indican:

  • 48.4% en CursorBench con esfuerzo máximo.
  • 30.9% con esfuerzo bajo.
  • Con pensamiento desactivado: entre 22.1% y 26.2%.
  • Con pensamiento activado: entre 30.9% y 42.3% en los mismos niveles de esfuerzo.

Lo que informan los clientes

Estos datos proceden de la publicación de lanzamiento de Anthropic y no fueron verificados de forma independiente:

  • HubSpot: 92.8% de promedio en tres ejecuciones de su suite de portal CRM simulada.
  • AlphaSense: 0.84 frente a 0.76 de Haiku 4.5 en 400 consultas de “Preguntar en Documento”.
  • Box: 11 puntos más que Haiku 4.5 y aproximadamente la mitad de latencia en pruebas iniciales.
  • Asana: más de un 30% menos de latencia para completar tareas frente a su modelo actual.
  • Cognition: Devin Fusion mantiene 66.2 en FrontierCode con Haiku 5.5 como compañero y Opus 5.5 como líder. Es un sistema de dos modelos, no Haiku por sí solo.

Ejecuta tu propia evaluación

Los benchmarks no representan necesariamente tu tráfico. La guía de prompting de Anthropic recomienda usar xhigh o max solo cuando tus propias evaluaciones demuestren una mejora.

Sigue este proceso en Apidog:

  1. Guarda ANTHROPIC_API_KEY como variable de entorno.
  2. Crea entre 20 y 50 solicitudes de Messages con prompts reales y representativos.
  3. Añade aserciones para:
    • Estado HTTP 200.
    • stop_reason distinto de "max_tokens" y "refusal".
    • Contenido esperado para considerar correcta una respuesta.
  4. Ejecuta el conjunto con low, medium y high.
  5. Registra la tasa de aprobación y los campos de usage.
  6. Duplica la colección, cambia el modelo a claude-sonnet-5-5 y compara ambos en el mismo proyecto.

Cambiar el esfuerzo invalida la caché de prompts. Además, el nuevo tokenizador genera aproximadamente un 30% más tokens que Haiku 4.5 para el mismo texto.

Ejemplo de solicitud:

curl https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-haiku-5-5",
    "max_tokens": 8000,
    "thinking": {"type": "adaptive"},
    "output_config": {"effort": "medium"},
    "messages": [
      {
        "role": "user",
        "content": "Clasifica este ticket de soporte como facturación, error o solicitud de función: ..."
      }
    ]
  }'
Enter fullscreen mode Exit fullscreen mode

No envíes estos parámetros a Haiku 5.5:

  • temperature
  • top_p
  • top_k
  • Prefill de asistente

Cada uno devuelve un error 400.

Al procesar la respuesta, selecciona los bloques mediante su campo type, porque un bloque thinking puede aparecer antes que el bloque de contenido final.

Consulta la guía de la API y esta guía para probar aplicaciones LLM.

Preguntas frecuentes

¿Es Claude Haiku 5.5 mejor que Sonnet 5.5?

No según los resultados de Anthropic. Sonnet 5.5 lidera cada fila de la tabla de lanzamiento. Haiku solo lo supera ligeramente en FrontierCode cuando ambos usan esfuerzo máximo: 46.4% frente a 46.2%.

Consulta Haiku 5.5 vs Haiku 4.5 para evaluar la actualización.

¿Cuál es la puntuación de Haiku 5.5 en SWE-bench?

Con esfuerzo máximo:

  • 64.8 en SWE-Bench Pro.
  • 83.7 en SWE-bench Multilingual.
  • 30.7 en SWE-bench Multimodal.

¿Con qué esfuerzo se ejecutaron los benchmarks?

Con esfuerzo máximo, normalmente promediado en cinco pruebas. La API usa medium por defecto, donde GDPval-AA obtiene 1277 en lugar de 1620.

¿Existen benchmarks independientes de Haiku 5.5?

Todavía no. Artificial Analysis ejecutó GDPval-AA y AA-Briefcase de forma independiente, pero Anthropic publicó esas puntuaciones. Artificial Analysis no tiene actualmente una página para Haiku 5.5.

¿Es GPT-6 Luna más barato?

Generalmente sí. Luna cuesta menos en todos los niveles de GDPval-AA y en todos los de OSWorld, excepto en medium, donde el costo es aproximadamente el mismo. Haiku 5.5 obtiene una puntuación más alta en ambos benchmarks.

Siguiente paso

Empieza con medium y aumenta el esfuerzo solo cuando la mejora en tu tasa de aprobación justifique el costo adicional.

Descarga Apidog, crea una colección de evaluación con tus casos reales y guarda los resultados en Apidog junto a la línea base de Sonnet 5.5 antes de mover tráfico de producción.

Top comments (0)