Claude Opus 5 se lanzó el 24 de julio de 2026 a $5 por millón de tokens de entrada y $25 por millón de tokens de salida. Esa es la misma tarifa que Anthropic cobraba por Opus 4.8 y exactamente la mitad de lo que cuesta Fable 5. El titular es correcto, pero no basta para estimar una factura.
Lo que suele faltar en los resúmenes de precios es lo que realmente determina el gasto: escrituras y lecturas de caché, descuentos por lotes, modo rápido, multiplicador regional y cambios de comportamiento que modifican el volumen de tokens. Esta guía reúne las tarifas y las aplica a solicitudes reales. Para verificar los cálculos con su tráfico, envíe solicitudes desde Apidog y revise el bloque usage de cada respuesta.
La tabla de precios completa de Claude Opus 5
Cada tarifa procede de la documentación de precios de Anthropic y se aplica al ID de modelo claude-opus-5.
| Categoría de token | Precio por millón de tokens |
|---|---|
| Entrada estándar | $5.00 |
| Salida estándar | $25.00 |
| Escritura en caché de prompt, TTL de 5 minutos | $6.25 |
| Escritura en caché de prompt, TTL de 1 hora | $10.00 |
| Aciertos y actualizaciones de caché | $0.50 |
| Entrada de API por lotes | $2.50 |
| Salida de API por lotes | $12.50 |
| Entrada en modo rápido | $10.00 |
| Salida en modo rápido | $50.00 |
Puntos clave para implementar:
- Los aciertos de caché cuestan una décima parte de la entrada estándar. Es la palanca de ahorro más importante.
- La escritura de caché con TTL de 5 minutos cuesta 1.25x la entrada estándar; el TTL de 1 hora cuesta 2x.
- La API por lotes tiene un descuento fijo del 50% en entrada y salida.
- El modo rápido cuesta exactamente 2x la tarifa estándar para una velocidad de salida de 2.5x. Es una vista previa de investigación, solo para API de terceros —no Bedrock, Google Cloud ni Microsoft Foundry— y no se combina con la API por lotes.
- No hay recargo por contexto largo. La ventana de 1M de tokens es predeterminada y máxima; los tokens se facturan a la misma tarifa de $5 por millón.
Esto también define el coste máximo de una llamada individual en la API de Mensajes: 1M de tokens de entrada más una salida máxima de 128k.
Entrada: 1,000,000 / 1,000,000 × $5.00 = $5.00
Salida: 128,000 / 1,000,000 × $25.00 = $3.20
Total máximo: $8.20
En la API por lotes, la salida máxima puede subir a 300k con el encabezado beta output-300k-2026-03-24. En ese caso, el lado de salida tiene un límite de $3.75.
El ancla: igual que 4.8, la mitad de Fable 5
Así se posiciona Opus 5 frente a los modelos con los que probablemente lo comparará.
| Modelo | Entrada / MTok | Salida / MTok |
|---|---|---|
| Claude Opus 5 | $5.00 | $25.00 |
| Claude Opus 4.8 | $5.00 | $25.00 |
| Claude Fable 5 | $10.00 | $50.00 |
| Claude Sonnet 5, introductorio hasta el 31 de agosto de 2026 | $2.00 | $10.00 |
| Claude Sonnet 5, desde el 1 de septiembre de 2026 | $3.00 | $15.00 |
Hay dos conclusiones prácticas:
Migrar desde Opus 4.8 no cambia el precio por token. La tarifa es la misma que en 4.5, 4.6, 4.7 y 4.8. Sin embargo, sí puede cambiar el volumen total de tokens, especialmente por el pensamiento adaptativo y respuestas predeterminadas más largas. El desglose de precios de Opus 4.8 sigue siendo válido para el ID anterior.
Opus 5 cuesta la mitad que Fable 5. Anthropic afirma en el post de lanzamiento de Opus 5 que está dentro del 0.5% del pico de Fable 5 en CursorBench 3.2 y que lo supera en OSWorld 2.0 a aproximadamente un tercio del coste por tarea. Son cifras del proveedor y nadie las había reproducido de forma independiente hasta el 25 de julio de 2026. Trátelas como afirmaciones, no como resultados comprobados.
Para evaluar si la diferencia de precio compensa en su caso, consulte la comparación de Opus 5 vs Fable 5 y el detalle de precios de Fable 5.
Ejemplo práctico 1: una única solicitud
Suponga una llamada de resumen con:
- 8,000 tokens de entrada
- 1,200 tokens de salida
El cálculo es directo:
Entrada: 8,000 / 1,000,000 × $5.00 = $0.040
Salida: 1,200 / 1,000,000 × $25.00 = $0.030
Total por llamada = $0.070
Con 10,000 llamadas mensuales:
10,000 × $0.070 = $700/mes
La misma carga de trabajo costaría:
- Fable 5: $0.140 por llamada, o $1,400/mes.
- Sonnet 5 con tarifa introductoria: $0.028 por llamada, o $280/mes.
Aunque hay casi siete veces más tokens de entrada que de salida, la salida representa el 43% de la factura. La razón es simple: la salida cuesta cinco veces más que la entrada.
Esto importa especialmente en Opus 5 porque los tokens de pensamiento se cobran como salida y el pensamiento adaptativo está activado de forma predeterminada.
Ejemplo práctico 2: una sesión de agente larga con caché
Considere un agente de programación con:
- Un prompt de sistema y contexto de repositorio de 120,000 tokens.
- Una sesión de 40 turnos.
- 1,500 tokens nuevos de conversación por turno.
- 2,500 tokens de salida por turno.
Sin caché de prompt
Sin caché, el contexto completo se reenvía en cada turno.
| Partida | Tokens | Tarifa | Coste |
|---|---|---|---|
| Entrada: 120,000 × 40, más 60,000 nuevos | 4,860,000 | $5.00 | $24.30 |
| Salida: 2,500 × 40 | 100,000 | $25.00 | $2.50 |
| Total | $26.80 |
Con caché de prompt de 5 minutos
Si el prefijo de 120,000 tokens se almacena en caché:
| Partida | Tokens | Tarifa | Coste |
|---|---|---|---|
| Escritura en caché, una vez | 120,000 | $6.25 | $0.75 |
| Lecturas de caché: 39 turnos | 4,680,000 | $0.50 | $2.34 |
| Nueva entrada: 1,500 × 40 | 60,000 | $5.00 | $0.30 |
| Salida: 2,500 × 40 | 100,000 | $25.00 | $2.50 |
| Total | $5.89 |
El ahorro es una reducción del 78%:
Sin caché: $26.80
Con caché: $5.89
Ahorro: $20.91
Después de cachear correctamente, la salida pasa a ser el siguiente objetivo de optimización: representa el 42% de la factura, frente al 9% sin caché.
Elegir el TTL correcto
Las lecturas de caché actualizan el TTL de 5 minutos. Si los turnos del agente están separados por menos de cinco minutos, una sola escritura mantiene activa la caché.
Si el agente permanece inactivo durante más tiempo, use el TTL de una hora:
Escritura de 5 minutos: 120,000 / 1,000,000 × $6.25 = $0.75
Escritura de 1 hora: 120,000 / 1,000,000 × $10.00 = $1.20
El total subiría a $6.34, que sigue siendo un 76% menor que ejecutar la sesión sin caché.
Ejemplo práctico 3: procesamiento por lotes
La API por lotes reduce a la mitad el coste de entrada y salida para trabajos que no necesitan respuesta síncrona.
Suponga 50,000 documentos, cada uno con:
- 1,200 tokens de entrada
- 150 tokens de salida
| Ruta | Coste de entrada | Coste de salida | Total |
|---|---|---|---|
| Estándar | 60 MTok × $5.00 = $300.00 | 7.5 MTok × $25.00 = $187.50 | $487.50 |
| Por lotes | 60 MTok × $2.50 = $150.00 | 7.5 MTok × $12.50 = $93.75 | $243.75 |
Los tokens y el modelo son los mismos. El ahorro es de $243.75.
Use lotes para cargas como:
- Clasificación de contenido.
- Enriquecimiento de documentos.
- Evaluaciones offline.
- Resúmenes nocturnos.
- Retroalimentación no urgente.
La compensación es latencia, no calidad. Si una tarea tolera entrega asíncrona, usar el endpoint estándar deja el 50% del presupuesto sin aprovechar.
Ejemplo práctico 4: lo que realmente cuesta el modo rápido
El modo rápido duplica las tarifas:
Entrada: $10 por MTok
Salida: $50 por MTok
Al ejecutar la solicitud del primer ejemplo:
Entrada: 8,000 / 1,000,000 × $10.00 = $0.080
Salida: 1,200 / 1,000,000 × $50.00 = $0.060
Total por llamada = $0.140
Es exactamente el doble del coste estándar.
El modo rápido tiene sentido para interfaces interactivas donde el usuario percibe la velocidad de generación. Es difícil justificarlo para procesamiento en segundo plano.
Además, no se combina con la API por lotes: las dos palancas de coste son mutuamente excluyentes.
Las cuatro palancas que realmente mueven su factura
1. El mínimo de caché de prompts se redujo a 512 tokens
En Opus 4.8, el mínimo almacenable en caché era de 1,024 tokens. En Opus 5 es de 512 tokens.
Esto permite cachear prompts de sistema y prefijos reutilizados que antes eran demasiado pequeños. El cambio de implementación consiste en añadir el bloque de control de caché al prefijo reutilizable.
El punto de equilibrio llega rápido:
- TTL de 5 minutos: rentable a partir de 1.3 solicitudes; gana desde la segunda llamada.
- TTL de 1 hora: rentable a partir de 2.1 solicitudes; gana desde la tercera llamada.
Ejemplo: un prompt de sistema de 700 tokens reutilizado en 1,000 llamadas.
Sin caché:
700,000 / 1,000,000 × $5.00 = $3.50
Con caché de 5 minutos:
Escritura: 700 / 1,000,000 × $6.25 = $0.0044
Lecturas: 999 × (700 / 1,000,000 × $0.50) = $0.3497
Total: $0.354
Ese prompt no podía cachearse en Opus 4.8.
2. Procesamiento por lotes al 50%
Audite qué cargas de trabajo necesitan realmente una respuesta síncrona.
Una forma práctica de clasificar tareas:
| Tipo de carga | Ruta recomendada |
|---|---|
| Chat de usuario o autocompletado | Estándar o modo rápido |
| Clasificación masiva | Por lotes |
| Evaluaciones de prompts | Por lotes |
| Resúmenes programados | Por lotes |
| Procesamiento de cola de trabajos | Por lotes |
Mover una carga apta para lotes al endpoint por lotes reduce automáticamente el gasto de tokens a la mitad.
3. Los niveles de esfuerzo low y medium son utilizables
output_config.effort controla cuánto “piensa” el modelo. Los tokens de pensamiento se cobran como salida, a $25 por millón.
Opus 5 recalibró estos niveles. Anthropic afirma que low y medium son significativamente más fuertes que en modelos Opus anteriores. El valor predeterminado es high; xhigh sigue siendo el ajuste recomendado para programación y trabajo de agentes.
No migre la configuración de esfuerzo de Opus 4.8 sin medir. Ejecute el mismo conjunto de evaluaciones con cada nivel y compare:
- Calidad o tasa de aprobación.
-
output_tokens. - Coste por tarea.
- Latencia.
- Tasa de truncamiento.
Si una tarea usa en promedio 8,000 tokens de pensamiento en xhigh y 1,500 en low, el ahorro teórico es:
8,000 - 1,500 = 6,500 tokens de salida ahorrados
6,500 / 1,000,000 × $25.00 = $0.1625 por tarea
100,000 tareas × $0.1625 = $16,250
Estas cifras son ilustrativas. La diferencia real depende de sus prompts y evaluaciones. La guía del parámetro de esfuerzo explica cómo ejecutar ese barrido.
Una trampa importante: bajar el esfuerzo reduce tokens de pensamiento, pero no garantiza respuestas visibles más cortas. Si necesita entregables más breves, indíquelo explícitamente en el prompt.
4. Menor sobrecarga del prompt del sistema para uso de herramientas
Cuando envía definiciones de herramientas, la API inyecta un prompt del sistema que también se factura.
En Opus 5, esa sobrecarga es de 286 tokens para elección de herramientas auto o none:
| Modelo | Sobrecarga de herramientas |
|---|---|
| Opus 5 | 286 tokens |
| Opus 4.8 | 290 tokens |
| Opus 4.7 | 675 tokens |
La diferencia frente a Opus 4.8 es de solo cuatro tokens: aproximadamente $20 por millón de solicitudes, por lo que es ruido.
Frente a Opus 4.7, el ahorro es de 389 tokens por solicitud:
389 / 1,000,000 × $5.00 = $0.001945 por solicitud
1,000,000 solicitudes × $0.001945 = $1,945
Para optimizaciones aplicables a toda la línea Claude, consulte esta guía sobre cómo reducir su factura de la API de Claude.
Dos partidas que la gente pasa por alto
El multiplicador inference_geo: "us" es de 1.1x
Fijar la inferencia a infraestructura solo de EE. UU. por cumplimiento o residencia de datos aplica un multiplicador de 1.1x a todas las categorías de tokens.
| Categoría | Tarifa estándar | Con inference_geo: "us"
|
|---|---|---|
| Entrada | $5.00 | $5.50 |
| Salida | $25.00 | $27.50 |
| Acierto de caché | $0.50 | $0.55 |
| Entrada por lotes | $2.50 | $2.75 |
| Salida por lotes | $12.50 | $13.75 |
En el ejemplo de 10,000 llamadas mensuales:
Sin multiplicador: $700/mes
Con multiplicador 1.1x: $770/mes
En una factura de $50,000, representa $5,000 adicionales. Confirme que necesita esta fijación antes de activarla.
Priority Tier no es compatible con Opus 5
Opus 4.8 mantiene compatibilidad con Priority Tier, pero Opus 5 no. Si su planificación de capacidad depende de esos compromisos, es una restricción real de migración.
La guía de migración de Opus 4.8 a Opus 5 cubre este punto y otros cambios de API disruptivos.
Cambios de comportamiento que aparecen en su factura
El precio por token es solo la mitad de la ecuación. El volumen de tokens es la otra mitad.
1. El pensamiento está activado por defecto
En Opus 4.8, una solicitud sin el campo thinking se ejecutaba sin pensamiento. En Opus 5, una solicitud equivalente usa pensamiento adaptativo y esos tokens se facturan como salida.
Además, max_tokens limita conjuntamente el pensamiento y la respuesta. Algunas cargas de trabajo pueden empezar a truncarse si mantienen el mismo límite.
2. Opus 5 delega a subagentes con más facilidad
Cada subagente genera su propio conjunto de tokens facturados. Para cargas sensibles al coste:
- Limite la delegación cuando no aporte valor.
- Restrinja el número de subagentes.
- Mida el gasto por flujo completo, no solo por respuesta final.
- Compare calidad y coste antes de habilitar delegación en producción.
3. Opus 5 verifica su propio trabajo sin instrucciones explícitas
Si conserva instrucciones como “doble verificación de su trabajo”, elimínelas y vuelva a medir. La guía de prompts de Anthropic recomienda hacerlo porque Opus 5 ya realiza esa verificación.
La sobreverificación consume tokens. Ninguno de estos cambios modifica el precio por token, pero todos pueden aumentar la factura.
Confirmando su gasto real con Apidog
La forma más rápida de dejar de estimar es revisar el objeto usage de cada respuesta. Incluye:
{
"usage": {
"input_tokens": 0,
"output_tokens": 0,
"cache_creation_input_tokens": 0,
"cache_read_input_tokens": 0
}
}
Este desglose permite verificar por separado entrada normal, salida, creación de caché y lecturas de caché.
Apidog es una plataforma de desarrollo y pruebas de API. Para validar el coste de Opus 5:
- Cree una solicitud al endpoint de Mensajes con
"model": "claude-opus-5". - Duplique la solicitud guardada para cada nivel de esfuerzo y compare el volumen de tokens de pensamiento con prompts idénticos.
- Compruebe que
usage.cache_read_input_tokenssea mayor que cero cuando espere un acierto de caché. Si es cero, trate el resultado como una prueba fallida antes de que se convierta en una factura sorpresa. - Guarde las claves como variables de entorno en lugar de incluirlas en el cuerpo de la solicitud.
- Revise el flujo SSE para identificar dónde se consumen tokens de salida en generaciones largas.
Descargue Apidog para ejecutar estas comprobaciones junto con el tutorial de la guía de la API de Opus 5.
Lo que realmente está comprando por $5 / $25
Opus 5 ofrece una posición fuerte en relación precio-capacidad, pero no es la cima de la pila de Claude.
Fable 5 sigue siendo el modelo más capaz de Anthropic ampliamente lanzado. Opus 5 también sigue por detrás de Mythos 5 en explotación de ciberseguridad e investigación autónoma de biología, según Anthropic.
La forma honesta de plantearlo es: capacidad de clase frontera a la mitad del precio de frontera, con un techo explícitamente nombrado por encima. El explicador de clase Mythos cubre qué se sitúa por encima de esa línea.
Para la mayoría de equipos, la pregunta no es Opus 5 frente al modelo superior. La pregunta es si la carga de trabajo necesita Opus o si Sonnet 5, a $2 / $10 —y $3 / $15 desde el 1 de septiembre de 2026— puede hacer el trabajo por el 40% del precio.
Ejecute ambos modelos contra sus propias evaluaciones antes de comprometer presupuesto. Consulte la visión general de Claude Opus 5 para especificaciones y disponibilidad, y la visión general de modelos de Anthropic para la tabla canónica.
Preguntas frecuentes
¿Cuánto cuesta Claude Opus 5?
Cuesta $5 por millón de tokens de entrada y $25 por millón de tokens de salida en la API estándar. Los aciertos de caché cuestan $0.50 por millón, las ejecuciones por lotes cuestan $2.50 / $12.50 y el modo rápido $10 / $50.
¿Es Claude Opus 5 más caro que Opus 4.8?
Por token, no: las tarifas son idénticas. Sin embargo, la factura puede aumentar porque el pensamiento está activado por defecto y las respuestas predeterminadas son más largas. Mida el volumen de tokens en su tráfico real antes de asumir paridad de coste.
¿Hay un recargo por contexto largo en la ventana de 1M?
No. La ventana de contexto de 1M de tokens es predeterminada y máxima, sin un nivel premium para entradas largas.
¿Cuál es la forma más económica de ejecutar Claude Opus 5?
Aplique estas tres medidas:
- Almacene en caché prefijos reutilizados de al menos 512 tokens.
- Ejecute trabajos no urgentes mediante la API por lotes para obtener el descuento fijo del 50%.
- Pruebe niveles de esfuerzo hasta encontrar el más bajo que siga aprobando sus evaluaciones.
La guía de ruta gratuita y más económica incluye más opciones.
¿El anclaje regional tiene un coste adicional?
Sí. Configurar inference_geo: "us" aplica un multiplicador de 1.1x a todas las categorías de tokens, incluidos aciertos de caché y lotes.


Top comments (0)