Claude Haiku 5.5 obtiene un 72.4% en OSWorld 2.1, 1620 en GDPval-AA v2.1, 46.4% en FrontierCode 1.1 y 39.2% en Terminal-Bench 4.0. Haiku 4.5 obtuvo 15.7%, 735 y 0.0% en tres de esos benchmarks. Todos son resultados con esfuerzo máximo; con el valor predeterminado medium, GDPval-AA baja a 1277. Ningún laboratorio independiente ha publicado resultados de Haiku 5.5 todavía.
A continuación verás cada benchmark de Claude Haiku 5.5, quién lo ejecutó, cómo el esfuerzo modifica la puntuación y el costo, y cómo validar el modelo con tu propio tráfico en Apidog. Para especificaciones y precios, empieza por qué es Claude Haiku 5.5.
La tabla de lanzamiento
Cada resultado de Haiku 5.5 usa pensamiento adaptativo y esfuerzo máximo, normalmente promediado sobre cinco ejecuciones. Terminal-Bench utilizó diez ejecuciones por tarea. n/r significa que no se publicó ningún resultado.
| Benchmark | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 |
|---|---|---|---|---|
| GDPval-AA v2.1 (Elo) | 1620 | 735 | 1437 | 1840 |
| AA-Briefcase v1.1 (Elo) | 1578 | 614 | 1336 | 1824 |
| OSWorld 2.1, subconjunto offline | 72.4% | 15.7% | 48.9% | 83.9% |
| Humanity’s Last Exam, sin herramientas | 45.9% | 10.2% | n/r | 56.9% |
| Humanity’s Last Exam, con herramientas | 57.4% | 18.7% | n/r | 64.5% |
| Terminal-Bench 4.0 | 39.2% | 0.0% | 16.4% | 70.6% |
| FrontierCode 1.1 (Principal) | 46.4% | n/r | 42.4% | 52.1% (xhigh) |
| Chartography, sin herramientas | 46.4% | 6.4% | 29.1% | 61.6% |
Quién ejecutó cada benchmark
Anthropic ejecutó la mayoría de las pruebas. Que dos modelos compartan el mismo benchmark no implica necesariamente que usaran el mismo arnés, configuración o nivel de esfuerzo.
| Benchmark | Quién lo ejecutó | Condiciones |
|---|---|---|
| GDPval-AA v2.1, AA-Briefcase v1.1 | Artificial Analysis, independientemente | GDPval-AA: 220 tareas, 44 ocupaciones, Elo anclado a DeepSeek V4.1 Flash (máximo) en 1600; Briefcase: proyectos de varias semanas |
| FrontierCode 1.1 | Cognition | Claude en Claude Code, GPT en Codex; Principal = las 100 tareas más difíciles de 150 |
| Chartography | Anthropic, en el benchmark de Surge AI | Evaluador Gemini 3.5 Flash; puntuación de Luna de Surge AI |
| Terminal-Bench 4.0 | Anthropic | Claude Code --bare, 66 tareas, 10 pruebas por tarea, salvaguardas activas |
| OSWorld 2.1 | Anthropic | 82 de 108 tareas, 1080p, hasta 500 pasos |
| Humanity’s Last Exam | Anthropic | Presupuesto de 980K tokens por tarea, evaluador Opus 4.6 |
Dos resultados de GPT-6 Luna requieren contexto:
- Anthropic ejecutó OSWorld de Luna mediante la API de OpenAI sobre las mismas 82 tareas.
- El 16.4% de Terminal-Bench de Luna proviene de la tabla de clasificación pública con Codex CLI y esfuerzo máximo.
- Las salvaguardas detuvieron el 1.8% de las ejecuciones de Haiku 5.5 en Terminal-Bench: 12 de 660. Cada una contó como fallo.
La trampa de FrontierCode
La tabla de lanzamiento compara Haiku 5.5 con esfuerzo máximo (46.4%) contra Sonnet 5.5 con xhigh (52.1%), que es la mejor puntuación de Sonnet. La tarjeta del sistema incluye una comparación equivalente:
| FrontierCode 1.1 | Principal | Extendido |
|---|---|---|
| Haiku 5.5, máximo | 46.4% | 58.4% |
| Haiku 5.5, xhigh | 45.8% | n/r |
| Sonnet 5.5, máximo | 46.2% | 59.1% |
| Sonnet 5.5, xhigh | 52.1% | 64.4% |
Con ambos modelos en esfuerzo máximo, Haiku 5.5 supera ligeramente a Sonnet 5.5 en Principal: 46.4% frente a 46.2%. Sin embargo, al comparar la mejor configuración de cada modelo, Sonnet lidera por 5.7 puntos.
Al citar FrontierCode, indica siempre el nivel de esfuerzo.
Extras de la tarjeta del sistema
La tarjeta del sistema añade resultados que no aparecieron en la publicación de lanzamiento. Todos usan esfuerzo máximo, salvo que se indique lo contrario.
| Benchmark | Haiku 5.5 | Haiku 4.5 | Sonnet 5.5 |
|---|---|---|---|
| SWE-Bench Pro | 64.8 | n/r | 81.3 |
| SWE-bench Multilingual | 83.7 | 67.4 | 90.3 |
| SWE-bench Multimodal | 30.7 | 19.8 | 54.3 |
| OSWorld 2.1, tasa de aprobación estricta | 37.1% | n/r | 48.8% |
| Chartography, con herramientas | 86.2% | 8.8% | 90.2% |
| OfficeQA / OfficeQA Pro | 73.5% / 60.3% | 63.0% / 47.1% | 76.9% / 65.6% |
| HealthBench Professional, ajustado por longitud | 64.8% | 32.2% | 69.2% |
El 72.4% de OSWorld representa crédito parcial: solo el 37.1% de las tareas pasa de forma estricta.
Chartography casi duplica su puntuación al habilitar herramientas, de 46.4% a 86.2%. Si tu caso de uso incluye gráficos, proporciona herramientas a Haiku 5.5.
El esfuerzo predeterminado puntúa más bajo
Haiku 5.5 usa medium por defecto en la API de Claude y en Claude Code. La tarjeta del sistema publica estos resultados para el nivel predeterminado:
| Benchmark | Medio, predeterminado | Máximo | Nota |
|---|---|---|---|
| GDPval-AA v2.1 | 1277 | 1620 | Medio usó aproximadamente una décima parte de los tokens de salida del máximo |
| AA-Briefcase v1.1 | 1372 | 1578 | Medio usó menos de un cuarto de los tokens de salida del máximo |
| HealthBench Professional | 59.9% | 64.8% | Bajo: 57.9%; alto: 61.3% |
Si llamas a la API sin output_config.effort, espera los resultados de la columna medium. Los documentos de esfuerzo cubren los cinco niveles.
Puntuación y costo por esfuerzo
Los siguientes valores proceden de los gráficos de lanzamiento. El costo de OSWorld y Terminal-Bench es por intento; GDPval-AA es por tarea.
| Modelo | Bajo | Medio | Alto | Xalto | Máximo |
|---|---|---|---|---|---|
| OSWorld 2.1 | |||||
| Haiku 5.5 | 42.0% ($0.07) | 53.3% ($0.13) | 61.3% ($0.18) | 67.6% ($0.28) | 72.4% ($0.61) |
| Sonnet 5.5 | 57.9% ($0.68) | 66.0% ($0.93) | 73.2% ($1.38) | 81.1% ($2.22) | 83.9% ($5.73) |
| GPT-6 Luna | 19.2% ($0.04) | 37.5% ($0.13) | 42.3% ($0.14) | 44.8% ($0.17) | 48.9% ($0.21) |
| GDPval-AA v2.1 | |||||
| Haiku 5.5 | 1125 ($0.012) | 1277 ($0.030) | 1420 ($0.089) | 1513 ($0.27) | 1620 ($0.87) |
| Sonnet 5.5 | 1179 ($0.22) | 1324 ($0.27) | 1551 ($0.62) | 1731 ($1.88) | 1840 ($6.78) |
| GPT-6 Luna | 1036 ($0.004) | 1262 ($0.02) | 1344 ($0.03) | 1364 ($0.05) | 1437 ($0.09) |
| Terminal-Bench 4.0 | |||||
| Haiku 5.5 | 12.7% ($0.42) | 20.3% ($0.68) | 24.8% ($1.04) | 31.5% ($1.75) | 39.2% ($2.64) |
| Sonnet 5.5 | 20.0% ($0.62) | 28.8% ($0.68) | 43.0% ($1.46) | 61.5% ($4.34) | 70.6% ($10.44) |
Conclusiones prácticas:
-
El salto a máximo es caro. En GDPval-AA, máximo cuesta aproximadamente 28 veces más que medio para sumar 343 puntos Elo. En OSWorld, máximo cuesta más del doble que
xhighpor 4.8 puntos adicionales. - Haiku 5.5 en medio supera a Luna en máximo en OSWorld: 53.3% por $0.13 frente a 48.9% por $0.21.
- Haiku 5.5 en máximo supera a Sonnet 5.5 en medio en OSWorld: 72.4% por $0.61 frente a 66.0% por $0.93.
- Terminal-Bench es la excepción: Sonnet 5.5 en alto logra 43.0% por $1.46, mejor que Haiku 5.5 en máximo con 39.2% por $2.64.
Luna es más barata en los demás niveles equivalentes. Consulta la comparación Haiku 5.5 vs GPT-6 Luna.
Los costos usan precios de lista: $0.10/$0.50 por millón de tokens para prompts de hasta 100K tokens, con precios más altos para contextos mayores. Consulta el desglose de precios.
Dónde Haiku 5.5 aún se queda atrás
Sonnet 5.5 lidera todas las filas de la tabla de lanzamiento. La única victoria directa de Haiku aparece en FrontierCode con ambos modelos en esfuerzo máximo.
Las diferencias más importantes son:
- Terminal-Bench 4.0: 39.2% frente a 70.6%.
- SWE-Bench Pro: 64.8 frente a 81.3.
- SWE-bench Multimodal: 30.7 frente a 54.3.
Anthropic indica que Sonnet 5.5 y Opus 5.5 siguen siendo mejores opciones para tareas de codificación agéntica complejas.
Haiku 5.5 encaja mejor en tareas acotadas:
- Compactación y resumen.
- Clasificación.
- Automatización de navegador.
- Subagentes ejecutados bajo un modelo principal más capaz.
Para implementarlo como subagente, consulta Haiku 5.5 en Claude Code.
Resultados independientes: ninguno todavía
Hasta el 8 de octubre de 2026, ningún laboratorio independiente ha publicado resultados de Haiku 5.5.
La página de Haiku 5.5 en Artificial Analysis devuelve un error 404, y su tabla de clasificación solo enumera Claude 4.5 Haiku. Vals, LMArena, SWE-bench y Aider tampoco muestran resultados.
No existen cifras de velocidad de terceros. Anthropic describe Haiku 5.5 como su modelo más rápido hasta la fecha a velocidad estándar, aunque más lento que Opus en modo rápido.
El dato externo más cercano proviene de Cursor. Sus documentos del modelo indican:
- 48.4% en CursorBench con esfuerzo máximo.
- 30.9% con esfuerzo bajo.
- Con pensamiento desactivado: entre 22.1% y 26.2%.
- Con pensamiento activado: entre 30.9% y 42.3% en los mismos niveles de esfuerzo.
Lo que informan los clientes
Estos datos proceden de la publicación de lanzamiento de Anthropic y no fueron verificados de forma independiente:
- HubSpot: 92.8% de promedio en tres ejecuciones de su suite de portal CRM simulada.
- AlphaSense: 0.84 frente a 0.76 de Haiku 4.5 en 400 consultas de “Preguntar en Documento”.
- Box: 11 puntos más que Haiku 4.5 y aproximadamente la mitad de latencia en pruebas iniciales.
- Asana: más de un 30% menos de latencia para completar tareas frente a su modelo actual.
- Cognition: Devin Fusion mantiene 66.2 en FrontierCode con Haiku 5.5 como compañero y Opus 5.5 como líder. Es un sistema de dos modelos, no Haiku por sí solo.
Ejecuta tu propia evaluación
Los benchmarks no representan necesariamente tu tráfico. La guía de prompting de Anthropic recomienda usar xhigh o max solo cuando tus propias evaluaciones demuestren una mejora.
Sigue este proceso en Apidog:
- Guarda
ANTHROPIC_API_KEYcomo variable de entorno. - Crea entre 20 y 50 solicitudes de Messages con prompts reales y representativos.
- Añade aserciones para:
- Estado HTTP
200. -
stop_reasondistinto de"max_tokens"y"refusal". - Contenido esperado para considerar correcta una respuesta.
- Estado HTTP
- Ejecuta el conjunto con
low,mediumyhigh. - Registra la tasa de aprobación y los campos de
usage. - Duplica la colección, cambia el modelo a
claude-sonnet-5-5y compara ambos en el mismo proyecto.
Cambiar el esfuerzo invalida la caché de prompts. Además, el nuevo tokenizador genera aproximadamente un 30% más tokens que Haiku 4.5 para el mismo texto.
Ejemplo de solicitud:
curl https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-haiku-5-5",
"max_tokens": 8000,
"thinking": {"type": "adaptive"},
"output_config": {"effort": "medium"},
"messages": [
{
"role": "user",
"content": "Clasifica este ticket de soporte como facturación, error o solicitud de función: ..."
}
]
}'
No envíes estos parámetros a Haiku 5.5:
temperaturetop_ptop_k- Prefill de asistente
Cada uno devuelve un error 400.
Al procesar la respuesta, selecciona los bloques mediante su campo type, porque un bloque thinking puede aparecer antes que el bloque de contenido final.
Consulta la guía de la API y esta guía para probar aplicaciones LLM.
Preguntas frecuentes
¿Es Claude Haiku 5.5 mejor que Sonnet 5.5?
No según los resultados de Anthropic. Sonnet 5.5 lidera cada fila de la tabla de lanzamiento. Haiku solo lo supera ligeramente en FrontierCode cuando ambos usan esfuerzo máximo: 46.4% frente a 46.2%.
Consulta Haiku 5.5 vs Haiku 4.5 para evaluar la actualización.
¿Cuál es la puntuación de Haiku 5.5 en SWE-bench?
Con esfuerzo máximo:
- 64.8 en SWE-Bench Pro.
- 83.7 en SWE-bench Multilingual.
- 30.7 en SWE-bench Multimodal.
¿Con qué esfuerzo se ejecutaron los benchmarks?
Con esfuerzo máximo, normalmente promediado en cinco pruebas. La API usa medium por defecto, donde GDPval-AA obtiene 1277 en lugar de 1620.
¿Existen benchmarks independientes de Haiku 5.5?
Todavía no. Artificial Analysis ejecutó GDPval-AA y AA-Briefcase de forma independiente, pero Anthropic publicó esas puntuaciones. Artificial Analysis no tiene actualmente una página para Haiku 5.5.
¿Es GPT-6 Luna más barato?
Generalmente sí. Luna cuesta menos en todos los niveles de GDPval-AA y en todos los de OSWorld, excepto en medium, donde el costo es aproximadamente el mismo. Haiku 5.5 obtiene una puntuación más alta en ambos benchmarks.
Siguiente paso
Empieza con medium y aumenta el esfuerzo solo cuando la mejora en tu tasa de aprobación justifique el costo adicional.
Descarga Apidog, crea una colección de evaluación con tus casos reales y guarda los resultados en Apidog junto a la línea base de Sonnet 5.5 antes de mover tráfico de producción.
Top comments (0)