DEV Community

Cover image for Qwen 3.8: Precios Explicados – $2 Entrada / $6 Salida en Contexto de 1M
Roobia
Roobia

Posted on • Originally published at apidog.com

Qwen 3.8: Precios Explicados – $2 Entrada / $6 Salida en Contexto de 1M

Alibaba lanzó Qwen 3.8-Max a principios de agosto de 2026. Con la disponibilidad general, el precio ya no depende de la promoción de vista previa: la página oficial de precios de Model Studio lista qwen3.8-max a $2 por millón de tokens de entrada y $6 por millón de tokens de salida. Esta tarifa única cubre toda la ventana de contexto de hasta 1 millón de tokens.

Prueba Apidog hoy

El detalle clave es que no hay recargos por contexto largo: un prompt de 5.000 tokens y uno de 900.000 tokens usan la misma tarifa de entrada de $2 por millón.

En esta guía verás cómo calcular costes, cuándo usar caché, cómo controlar el gasto de razonamiento y cómo comparar Qwen 3.8-Max con Qwen 3.7-Max, Kimi K3, Claude Opus 5 y GPT-5.6 Terra. Para contexto sobre el modelo, consulta qué es Qwen 3.8 y por qué es importante.

El precio de lista solo sirve como estimación inicial. Qwen 3.8-Max usa reasoning_effort: xhigh de forma predeterminada, y los tokens de razonamiento se cobran como salida. Para presupuestar con precisión, ejecuta solicitudes reales y revisa el objeto usage. Apidog permite inspeccionar los tokens consumidos en cada respuesta mientras pruebas tu API.

Precio de disponibilidad general: $2 de entrada y $6 de salida

Según la tabla de precios de Model Studio, verificada a fecha de 3 de agosto de 2026:

Artículo Precio por 1 millón de tokens
Entrada $2.00
Salida, incluidos tokens de pensamiento $6.00
Entrada en caché, acierto de caché 10% de la tarifa de entrada
Creación explícita de caché 125% de la tarifa de entrada
Contexto Un único nivel, de 0 a 1 millón de tokens
Pensamiento y no pensamiento Misma tarifa

Puntos prácticos:

  • La ventana de contexto de 1 millón de tokens no añade un recargo.
  • Los modos con razonamiento y sin razonamiento usan la misma tarifa, pero el razonamiento incrementa los tokens de salida facturados.
  • La salida máxima es de 65.536 tokens por solicitud. A $6 por millón de tokens, una respuesta con el máximo de salida costaría aproximadamente $0.39.

El anuncio oficial de Qwen 3.8 describe el modelo con 2.4T de parámetros totales, 95B activos, contexto de 1 millón de tokens y entrada multimodal. La combinación de estas capacidades con una tarifa de $2/$6 reduce el coste frente a varios modelos de frontera.

Por qué el precio fijo para 1 millón de tokens importa

Muchos proveedores usan precios escalonados por longitud de contexto: una tarifa para prompts cortos y otra mayor al superar cierto umbral. Esto hace que las cargas de trabajo con documentos largos tengan costes difíciles de estimar.

Alibaba usa este enfoque escalonado en otros modelos. En la misma página de precios de Model Studio, modelos como qwen3-max y qwen3-coder-plus aumentan su precio por token al crecer la entrada.

Qwen 3.8-Max usa una única fila de precios: 0<Token≤1M.

Esto simplifica la estimación:

coste_entrada = tokens_entrada × 2 / 1_000_000
coste_salida  = tokens_salida × 6 / 1_000_000
coste_total   = coste_entrada + coste_salida
Enter fullscreen mode Exit fullscreen mode

Para pipelines RAG, análisis documental, agentes sobre repositorios grandes o prompts con mucho contexto, el coste marginal de cada token se mantiene constante.

Comparación con Qwen 3.7-Max

  • Qwen 3.7-Max: $2.50 de entrada / $7.50 de salida por millón de tokens.
  • Qwen 3.8-Max: $2.00 de entrada / $6.00 de salida por millón de tokens.

A precio de lista, Qwen 3.8-Max reduce un 20% el coste de entrada y salida respecto a Qwen 3.7-Max.

Sin embargo, Qwen 3.7-Max tiene una promoción del 50%, que lo deja en $1.25/$3.75. Si no necesitas el contexto de 1 millón de tokens ni las mejoras multimodales y agénticas de Qwen 3.8-Max, puede ser una opción económica mientras dure la promoción.

Para cargas menos exigentes, Qwen 3.7-Plus mantiene una tarifa de $0.40/$1.60, además de su promoción del 20%.

Controla el coste de los tokens de razonamiento

Qwen 3.8-Max admite tres niveles para reasoning_effort:

  • xhigh
  • medium
  • low

El valor predeterminado es xhigh. En este modo, el modelo genera tokens internos de razonamiento antes de entregar la respuesta final. Esos tokens se cobran como salida, a $6 por millón de tokens.

Una respuesta visible de 800 tokens puede haber producido miles de tokens adicionales de razonamiento. Por tanto, no calcules el gasto solo con el texto que recibe el usuario.

Recomendación por tipo de tarea

Tipo de tarea reasoning_effort recomendado
Clasificación low
Extracción de datos low
Formateo o transformación low
Resúmenes estructurados medium
Planificación de agentes medium o xhigh
Resolución de problemas complejos xhigh

Mide antes de fijar un presupuesto mensual. Revisa usage en cada respuesta y presta especial atención a los tokens de salida: cuestan tres veces más que los de entrada.

Usa caché de contexto para prefijos repetidos

Si reenvías el mismo prefijo en muchas solicitudes —por ejemplo, un prompt de sistema largo, documentación estable o definiciones de herramientas— el caché puede reducir de forma importante el coste de entrada.

  • Un acierto de caché cuesta el 10% de la tarifa de entrada: $0.20 por millón de tokens.
  • La creación explícita de caché cuesta el 125% de la tarifa de entrada: $2.50 por millón de tokens.

El punto de equilibrio es rápido:

  • Crear la caché añade un 25% de coste una sola vez.
  • Cada reutilización posterior ahorra un 90% respecto a enviar de nuevo esos tokens como entrada normal.

Si un prefijo se reutiliza dos veces o más, el caché ya empieza a compensar.

Cuota gratuita: 1 millón de tokens, Singapur y 90 días

Model Studio incluye una cuota gratuita para qwen3.8-max, con estas condiciones:

  • Tamaño: 1 millón de tokens.
  • Región: solo Singapur.
  • Duración: 90 días desde la activación.

Para usar la cuota, configura este endpoint:

https://dashscope-intl.aliyuncs.com/compatible-mode/v1
Enter fullscreen mode Exit fullscreen mode

La cuota no se aplica a los endpoints de Pekín ni de US-Virginia.

Ten en cuenta que los tokens de razonamiento también consumen la cuota. Si usas reasoning_effort: xhigh en tareas complejas, puedes agotar el millón de tokens antes de lo previsto.

Para conocer otras rutas sin coste, incluido Qwen Chat, consulta cómo usar Qwen 3.8 gratis.

Comparativa de precios

Precios por millón de tokens. Las promociones pueden expirar.

Modelo Entrada Salida Notas
Qwen 3.8-Max $2.00 $6.00 Tarifa plana hasta 1 millón de tokens; caché al 10%
Qwen 3.7-Max $2.50 $7.50 Promoción actual: $1.25/$3.75
Qwen 3.7-Plus $0.40 $1.60 Promoción actual del 20%
Kimi K3 $3.00 $15.00 Aciertos de caché: $0.30
Claude Opus 5 $5.00 $25.00
GPT-5.6 Terra $2.00 $12.00

Interpretación práctica:

  • Frente a Kimi K3, Qwen 3.8-Max cuesta un tercio menos en entrada y un 60% menos en salida. Su caché también es más barata: $0.20 frente a $0.30. Consulta la guía de API de Kimi K3 si quieres comparar ambas integraciones.
  • Frente a Claude Opus 5, Qwen reduce un 60% el coste de entrada y un 76% el de salida.
  • Frente a GPT-5.6 Terra, la entrada cuesta lo mismo, pero la salida de Qwen cuesta la mitad.

El precio no determina la calidad. Prueba los modelos con tus propios prompts, herramientas, documentos y criterios de evaluación.

Ejemplos de costes resueltos

Ejemplo 1: sesión de agente de 50.000 tokens

Supongamos una ejecución con:

  • 38.000 tokens de entrada.
  • 12.000 tokens de salida visible.
Entrada = 38_000 × 2 / 1_000_000 = $0.076
Salida  = 12_000 × 6 / 1_000_000 = $0.072
Total   = $0.148
Enter fullscreen mode Exit fullscreen mode

Coste aproximado: $0.15 por sesión.

Ahora añade 8.000 tokens de razonamiento:

Salida total = 12_000 + 8_000 = 20_000 tokens
Salida       = 20_000 × 6 / 1_000_000 = $0.12
Total        = $0.076 + $0.12 = $0.196
Enter fullscreen mode Exit fullscreen mode

Coste aproximado con razonamiento: $0.20 por sesión.

El razonamiento aumenta el coste aproximadamente un 33% en este escenario.

Ejemplo 2: análisis de documentos con 800.000 tokens

Supongamos:

  • 800.000 tokens de documentos de entrada.
  • 5.000 tokens de salida para un resumen estructurado.
Entrada = 800_000 × 2 / 1_000_000 = $1.60
Salida  = 5_000 × 6 / 1_000_000 = $0.03
Total   = $1.63
Enter fullscreen mode Exit fullscreen mode

Coste aproximado: $1.63 por ejecución.

La ventaja aquí es la previsibilidad: los 800.000 tokens se facturan con la misma tarifa que un prompt corto.

Ejemplo 3: prefijo de 100.000 tokens, 50 llamadas diarias

Supongamos que cada llamada incluye:

  • 100.000 tokens de prompt de sistema, documentación de producto y herramientas.
  • 50 solicitudes al día.

Sin caché:

100_000 × 2 / 1_000_000 = $0.20 por solicitud
$0.20 × 50 = $10.00 al día
Enter fullscreen mode Exit fullscreen mode

Con caché explícito:

Creación de caché:
100_000 × 2.50 / 1_000_000 = $0.25

49 aciertos de caché:
100_000 × 0.20 / 1_000_000 = $0.02 por acierto
$0.02 × 49 = $0.98

Total diario:
$0.25 + $0.98 = $1.23
Enter fullscreen mode Exit fullscreen mode

Coste diario con caché: aproximadamente $1.23.

Esto representa un ahorro aproximado del 88% frente a reenviar el prefijo completo en cada solicitud.

Mide el uso real antes de presupuestar

Los ejemplos anteriores usan recuentos asumidos. En producción, los tokens de razonamiento, herramientas, documentos y respuestas variables cambiarán tus cifras.

Un flujo de trabajo práctico:

  1. Obtén tu clave API.
  2. Configura el endpoint regional adecuado.
  3. Envía solicitudes representativas de cada tipo de tarea.
  4. Guarda y revisa el objeto usage de cada respuesta.
  5. Calcula promedios de entrada, salida y razonamiento.
  6. Multiplica los promedios por las tarifas de $2/$6.
  7. Repite la prueba con distintos valores de reasoning_effort.

La guía de API de Qwen 3.8 explica las tres URL base regionales y los protocolos compatibles con OpenAI y Anthropic.

En Apidog, puedes guardar las URL base regionales como entornos, ejecutar el mismo request con reasoning_effort distinto e inspeccionar los tokens desde la respuesta. Ejecuta al menos diez solicitudes por tipo de tarea, calcula el promedio y construye tu previsión a partir de datos reales.

También puedes hacer pruebas A/B con el mismo prompt contra qwen3.7-max o Kimi K3 en el mismo espacio de trabajo. Descarga Apidog gratis para obtener estimaciones de coste basadas en tus propias solicitudes.

En resumen

Qwen 3.8-Max ofrece una tarifa de $2 por millón de tokens de entrada y $6 por millón de tokens de salida, sin escalones de precio hasta 1 millón de tokens de contexto.

Para implementar una estrategia de costes predecible:

  • Usa la fórmula $2/1M para entrada y $6/1M para salida.
  • Incluye los tokens de razonamiento en tus cálculos.
  • Ajusta reasoning_effort según la complejidad de cada tarea.
  • Usa caché para prompts de sistema, herramientas y documentos repetidos.
  • Mide usage en solicitudes reales antes de proyectar gasto mensual.
  • No bases el presupuesto de producción únicamente en promociones o cuotas gratuitas.

Preguntas frecuentes

¿Qwen 3.8 cuesta más para prompts largos?

No. El precio oficial muestra un único nivel de 0 a 1 millón de tokens. Un prompt de 900.000 tokens usa la misma tarifa de entrada de $2 por millón que un prompt corto.

Esto contrasta con los modelos escalonados, incluidos algunos del catálogo de Alibaba en la lista de modelos de Model Studio, donde la tarifa aumenta con la longitud del contexto.

¿Los tokens de pensamiento cuestan extra en Qwen 3.8?

No existe una tarifa independiente para pensamiento. Los modos con y sin razonamiento usan las mismas tarifas de $2/$6.

Sin embargo, los tokens de pensamiento cuentan como salida y se cobran a $6 por millón de tokens. Como reasoning_effort usa xhigh por defecto, las tareas complejas pueden costar más de lo que sugiere la longitud de la respuesta visible.

Usa low o medium para tareas simples y revisa usage para conocer el consumo real.

¿Hay una forma gratuita de probar Qwen 3.8?

Sí. Model Studio incluye una cuota gratuita de 1 millón de tokens durante 90 días para el endpoint de Singapur. Qwen Chat también ofrece acceso gratuito desde el navegador.

Consulta cómo usar Qwen 3.8 gratis para ver ambas opciones y sus condiciones.

¿Sigue disponible el antiguo “precio de vista previa del 10%”?

No. Fue una promoción de la etapa de vista previa mencionada en la cobertura de julio de 2026. La disponibilidad general la sustituyó por la tabla estándar de $2/$6.

Usa la página de precios de Model Studio como fuente de referencia.

Top comments (0)