Alibaba lanzó Qwen 3.8-Max a principios de agosto de 2026. Con la disponibilidad general, el precio ya no depende de la promoción de vista previa: la página oficial de precios de Model Studio lista qwen3.8-max a $2 por millón de tokens de entrada y $6 por millón de tokens de salida. Esta tarifa única cubre toda la ventana de contexto de hasta 1 millón de tokens.
El detalle clave es que no hay recargos por contexto largo: un prompt de 5.000 tokens y uno de 900.000 tokens usan la misma tarifa de entrada de $2 por millón.
En esta guía verás cómo calcular costes, cuándo usar caché, cómo controlar el gasto de razonamiento y cómo comparar Qwen 3.8-Max con Qwen 3.7-Max, Kimi K3, Claude Opus 5 y GPT-5.6 Terra. Para contexto sobre el modelo, consulta qué es Qwen 3.8 y por qué es importante.
El precio de lista solo sirve como estimación inicial. Qwen 3.8-Max usa reasoning_effort: xhigh de forma predeterminada, y los tokens de razonamiento se cobran como salida. Para presupuestar con precisión, ejecuta solicitudes reales y revisa el objeto usage. Apidog permite inspeccionar los tokens consumidos en cada respuesta mientras pruebas tu API.
Precio de disponibilidad general: $2 de entrada y $6 de salida
Según la tabla de precios de Model Studio, verificada a fecha de 3 de agosto de 2026:
| Artículo | Precio por 1 millón de tokens |
|---|---|
| Entrada | $2.00 |
| Salida, incluidos tokens de pensamiento | $6.00 |
| Entrada en caché, acierto de caché | 10% de la tarifa de entrada |
| Creación explícita de caché | 125% de la tarifa de entrada |
| Contexto | Un único nivel, de 0 a 1 millón de tokens |
| Pensamiento y no pensamiento | Misma tarifa |
Puntos prácticos:
- La ventana de contexto de 1 millón de tokens no añade un recargo.
- Los modos con razonamiento y sin razonamiento usan la misma tarifa, pero el razonamiento incrementa los tokens de salida facturados.
- La salida máxima es de 65.536 tokens por solicitud. A $6 por millón de tokens, una respuesta con el máximo de salida costaría aproximadamente $0.39.
El anuncio oficial de Qwen 3.8 describe el modelo con 2.4T de parámetros totales, 95B activos, contexto de 1 millón de tokens y entrada multimodal. La combinación de estas capacidades con una tarifa de $2/$6 reduce el coste frente a varios modelos de frontera.
Por qué el precio fijo para 1 millón de tokens importa
Muchos proveedores usan precios escalonados por longitud de contexto: una tarifa para prompts cortos y otra mayor al superar cierto umbral. Esto hace que las cargas de trabajo con documentos largos tengan costes difíciles de estimar.
Alibaba usa este enfoque escalonado en otros modelos. En la misma página de precios de Model Studio, modelos como qwen3-max y qwen3-coder-plus aumentan su precio por token al crecer la entrada.
Qwen 3.8-Max usa una única fila de precios: 0<Token≤1M.
Esto simplifica la estimación:
coste_entrada = tokens_entrada × 2 / 1_000_000
coste_salida = tokens_salida × 6 / 1_000_000
coste_total = coste_entrada + coste_salida
Para pipelines RAG, análisis documental, agentes sobre repositorios grandes o prompts con mucho contexto, el coste marginal de cada token se mantiene constante.
Comparación con Qwen 3.7-Max
- Qwen 3.7-Max: $2.50 de entrada / $7.50 de salida por millón de tokens.
- Qwen 3.8-Max: $2.00 de entrada / $6.00 de salida por millón de tokens.
A precio de lista, Qwen 3.8-Max reduce un 20% el coste de entrada y salida respecto a Qwen 3.7-Max.
Sin embargo, Qwen 3.7-Max tiene una promoción del 50%, que lo deja en $1.25/$3.75. Si no necesitas el contexto de 1 millón de tokens ni las mejoras multimodales y agénticas de Qwen 3.8-Max, puede ser una opción económica mientras dure la promoción.
Para cargas menos exigentes, Qwen 3.7-Plus mantiene una tarifa de $0.40/$1.60, además de su promoción del 20%.
Controla el coste de los tokens de razonamiento
Qwen 3.8-Max admite tres niveles para reasoning_effort:
xhighmediumlow
El valor predeterminado es xhigh. En este modo, el modelo genera tokens internos de razonamiento antes de entregar la respuesta final. Esos tokens se cobran como salida, a $6 por millón de tokens.
Una respuesta visible de 800 tokens puede haber producido miles de tokens adicionales de razonamiento. Por tanto, no calcules el gasto solo con el texto que recibe el usuario.
Recomendación por tipo de tarea
| Tipo de tarea |
reasoning_effort recomendado |
|---|---|
| Clasificación | low |
| Extracción de datos | low |
| Formateo o transformación | low |
| Resúmenes estructurados | medium |
| Planificación de agentes |
medium o xhigh
|
| Resolución de problemas complejos | xhigh |
Mide antes de fijar un presupuesto mensual. Revisa usage en cada respuesta y presta especial atención a los tokens de salida: cuestan tres veces más que los de entrada.
Usa caché de contexto para prefijos repetidos
Si reenvías el mismo prefijo en muchas solicitudes —por ejemplo, un prompt de sistema largo, documentación estable o definiciones de herramientas— el caché puede reducir de forma importante el coste de entrada.
- Un acierto de caché cuesta el 10% de la tarifa de entrada: $0.20 por millón de tokens.
- La creación explícita de caché cuesta el 125% de la tarifa de entrada: $2.50 por millón de tokens.
El punto de equilibrio es rápido:
- Crear la caché añade un 25% de coste una sola vez.
- Cada reutilización posterior ahorra un 90% respecto a enviar de nuevo esos tokens como entrada normal.
Si un prefijo se reutiliza dos veces o más, el caché ya empieza a compensar.
Cuota gratuita: 1 millón de tokens, Singapur y 90 días
Model Studio incluye una cuota gratuita para qwen3.8-max, con estas condiciones:
- Tamaño: 1 millón de tokens.
- Región: solo Singapur.
- Duración: 90 días desde la activación.
Para usar la cuota, configura este endpoint:
https://dashscope-intl.aliyuncs.com/compatible-mode/v1
La cuota no se aplica a los endpoints de Pekín ni de US-Virginia.
Ten en cuenta que los tokens de razonamiento también consumen la cuota. Si usas reasoning_effort: xhigh en tareas complejas, puedes agotar el millón de tokens antes de lo previsto.
Para conocer otras rutas sin coste, incluido Qwen Chat, consulta cómo usar Qwen 3.8 gratis.
Comparativa de precios
Precios por millón de tokens. Las promociones pueden expirar.
| Modelo | Entrada | Salida | Notas |
|---|---|---|---|
| Qwen 3.8-Max | $2.00 | $6.00 | Tarifa plana hasta 1 millón de tokens; caché al 10% |
| Qwen 3.7-Max | $2.50 | $7.50 | Promoción actual: $1.25/$3.75 |
| Qwen 3.7-Plus | $0.40 | $1.60 | Promoción actual del 20% |
| Kimi K3 | $3.00 | $15.00 | Aciertos de caché: $0.30 |
| Claude Opus 5 | $5.00 | $25.00 | — |
| GPT-5.6 Terra | $2.00 | $12.00 | — |
Interpretación práctica:
- Frente a Kimi K3, Qwen 3.8-Max cuesta un tercio menos en entrada y un 60% menos en salida. Su caché también es más barata: $0.20 frente a $0.30. Consulta la guía de API de Kimi K3 si quieres comparar ambas integraciones.
- Frente a Claude Opus 5, Qwen reduce un 60% el coste de entrada y un 76% el de salida.
- Frente a GPT-5.6 Terra, la entrada cuesta lo mismo, pero la salida de Qwen cuesta la mitad.
El precio no determina la calidad. Prueba los modelos con tus propios prompts, herramientas, documentos y criterios de evaluación.
Ejemplos de costes resueltos
Ejemplo 1: sesión de agente de 50.000 tokens
Supongamos una ejecución con:
- 38.000 tokens de entrada.
- 12.000 tokens de salida visible.
Entrada = 38_000 × 2 / 1_000_000 = $0.076
Salida = 12_000 × 6 / 1_000_000 = $0.072
Total = $0.148
Coste aproximado: $0.15 por sesión.
Ahora añade 8.000 tokens de razonamiento:
Salida total = 12_000 + 8_000 = 20_000 tokens
Salida = 20_000 × 6 / 1_000_000 = $0.12
Total = $0.076 + $0.12 = $0.196
Coste aproximado con razonamiento: $0.20 por sesión.
El razonamiento aumenta el coste aproximadamente un 33% en este escenario.
Ejemplo 2: análisis de documentos con 800.000 tokens
Supongamos:
- 800.000 tokens de documentos de entrada.
- 5.000 tokens de salida para un resumen estructurado.
Entrada = 800_000 × 2 / 1_000_000 = $1.60
Salida = 5_000 × 6 / 1_000_000 = $0.03
Total = $1.63
Coste aproximado: $1.63 por ejecución.
La ventaja aquí es la previsibilidad: los 800.000 tokens se facturan con la misma tarifa que un prompt corto.
Ejemplo 3: prefijo de 100.000 tokens, 50 llamadas diarias
Supongamos que cada llamada incluye:
- 100.000 tokens de prompt de sistema, documentación de producto y herramientas.
- 50 solicitudes al día.
Sin caché:
100_000 × 2 / 1_000_000 = $0.20 por solicitud
$0.20 × 50 = $10.00 al día
Con caché explícito:
Creación de caché:
100_000 × 2.50 / 1_000_000 = $0.25
49 aciertos de caché:
100_000 × 0.20 / 1_000_000 = $0.02 por acierto
$0.02 × 49 = $0.98
Total diario:
$0.25 + $0.98 = $1.23
Coste diario con caché: aproximadamente $1.23.
Esto representa un ahorro aproximado del 88% frente a reenviar el prefijo completo en cada solicitud.
Mide el uso real antes de presupuestar
Los ejemplos anteriores usan recuentos asumidos. En producción, los tokens de razonamiento, herramientas, documentos y respuestas variables cambiarán tus cifras.
Un flujo de trabajo práctico:
- Obtén tu clave API.
- Configura el endpoint regional adecuado.
- Envía solicitudes representativas de cada tipo de tarea.
- Guarda y revisa el objeto
usagede cada respuesta. - Calcula promedios de entrada, salida y razonamiento.
- Multiplica los promedios por las tarifas de $2/$6.
- Repite la prueba con distintos valores de
reasoning_effort.
La guía de API de Qwen 3.8 explica las tres URL base regionales y los protocolos compatibles con OpenAI y Anthropic.
En Apidog, puedes guardar las URL base regionales como entornos, ejecutar el mismo request con reasoning_effort distinto e inspeccionar los tokens desde la respuesta. Ejecuta al menos diez solicitudes por tipo de tarea, calcula el promedio y construye tu previsión a partir de datos reales.
También puedes hacer pruebas A/B con el mismo prompt contra qwen3.7-max o Kimi K3 en el mismo espacio de trabajo. Descarga Apidog gratis para obtener estimaciones de coste basadas en tus propias solicitudes.
En resumen
Qwen 3.8-Max ofrece una tarifa de $2 por millón de tokens de entrada y $6 por millón de tokens de salida, sin escalones de precio hasta 1 millón de tokens de contexto.
Para implementar una estrategia de costes predecible:
- Usa la fórmula
$2/1Mpara entrada y$6/1Mpara salida. - Incluye los tokens de razonamiento en tus cálculos.
- Ajusta
reasoning_effortsegún la complejidad de cada tarea. - Usa caché para prompts de sistema, herramientas y documentos repetidos.
- Mide
usageen solicitudes reales antes de proyectar gasto mensual. - No bases el presupuesto de producción únicamente en promociones o cuotas gratuitas.
Preguntas frecuentes
¿Qwen 3.8 cuesta más para prompts largos?
No. El precio oficial muestra un único nivel de 0 a 1 millón de tokens. Un prompt de 900.000 tokens usa la misma tarifa de entrada de $2 por millón que un prompt corto.
Esto contrasta con los modelos escalonados, incluidos algunos del catálogo de Alibaba en la lista de modelos de Model Studio, donde la tarifa aumenta con la longitud del contexto.
¿Los tokens de pensamiento cuestan extra en Qwen 3.8?
No existe una tarifa independiente para pensamiento. Los modos con y sin razonamiento usan las mismas tarifas de $2/$6.
Sin embargo, los tokens de pensamiento cuentan como salida y se cobran a $6 por millón de tokens. Como reasoning_effort usa xhigh por defecto, las tareas complejas pueden costar más de lo que sugiere la longitud de la respuesta visible.
Usa low o medium para tareas simples y revisa usage para conocer el consumo real.
¿Hay una forma gratuita de probar Qwen 3.8?
Sí. Model Studio incluye una cuota gratuita de 1 millón de tokens durante 90 días para el endpoint de Singapur. Qwen Chat también ofrece acceso gratuito desde el navegador.
Consulta cómo usar Qwen 3.8 gratis para ver ambas opciones y sus condiciones.
¿Sigue disponible el antiguo “precio de vista previa del 10%”?
No. Fue una promoción de la etapa de vista previa mencionada en la cobertura de julio de 2026. La disponibilidad general la sustituyó por la tabla estándar de $2/$6.
Usa la página de precios de Model Studio como fuente de referencia.
Top comments (0)