DEV Community

Cover image for Cómo usar la API de Qwen 3.8
Roobia
Roobia

Posted on • Originally published at apidog.com

Cómo usar la API de Qwen 3.8

Alibaba lanzó Qwen 3.8-Max a principios de agosto de 2026 y la API ya está disponible en Model Studio. El modelo tiene 2,4 billones de parámetros totales (95.000 millones activos), una ventana de contexto de 1 millón de tokens y un precio fijo de $2 por millón de tokens de entrada y $6 por millón de tokens de salida. Para conocer el contexto completo del modelo, consulte nuestra explicación de Qwen 3.8. Esta guía se centra en la implementación: crear una clave, elegir una región, ejecutar la primera llamada y conectarlo con sus herramientas.

Prueba Apidog hoy

Qwen 3.8-Max incluye dos protocolos desde el primer día:

  • Un endpoint compatible con OpenAI.
  • Un endpoint compatible con Anthropic.

Puede reutilizar código basado en el SDK de OpenAI o configurar Claude Code mediante variables de entorno. También puede probar ambos protocolos en Apidog, enviar la misma instrucción y comparar la respuesta o el streaming.

Qué necesita antes de empezar

Elemento Valor
ID del modelo qwen3.8-max
Ventana de contexto 1.000.000 tokens
Salida máxima 65.536 tokens
Tipos de entrada Texto e imágenes
Precios $2 de entrada / $6 de salida por 1M de tokens, plano en todo el contexto
Control de razonamiento reasoning_effort: xhigh (predeterminado), medium, low
Protocolos Completaciones de chat y respuestas de OpenAI; Mensajes de Anthropic
Variable de entorno de la clave DASHSCOPE_API_KEY

Qwen 3.8-Max en Model Studio

Esta información proviene de la publicación oficial de lanzamiento de Qwen 3.8 y de la documentación de Alibaba Cloud Model Studio.

Alibaba prometió publicar pesos abiertos en Hugging Face y ModelScope para la semana siguiente, pero a principios de agosto de 2026 todavía no están disponibles para descargar. Los ejemplos de esta guía usan la API alojada.

Paso 1: obtenga una clave API de QwenCloud

  1. Abra home.qwencloud.com.
  2. Inicie sesión o cree una cuenta.
  3. En la consola, genere una clave API.
  4. Guarde la clave como variable de entorno.

Alibaba usa internamente el nombre DashScope, por lo que la variable esperada es DASHSCOPE_API_KEY:

export DASHSCOPE_API_KEY="sk-your-key-here"
Enter fullscreen mode Exit fullscreen mode

Guarde la variable en su perfil de shell o en un archivo .env. No incluya la clave en el código fuente ni la suba al repositorio.

Para evaluar el modelo antes de invertir dinero real, hay una cuota gratuita de 1 millón de tokens, válida durante 90 días y disponible únicamente en la región de Singapur.

Paso 2: elija una URL base regional

Model Studio ofrece la API compatible con OpenAI en tres regiones. Seleccione la más próxima a sus servidores:

Región URL base
Pekín https://dashscope.aliyuncs.com/compatible-mode/v1
Singapur https://dashscope-intl.aliyuncs.com/compatible-mode/v1
EE. UU. (Virginia) https://dashscope-us.aliyuncs.com/compatible-mode/v1

Singapur (dashscope-intl) es la opción predeterminada para la mayoría de usuarios internacionales y es donde se aplica la cuota gratuita.

La lista de modelos de Model Studio indica que qwen3.8-max está disponible para generación de texto y comprensión de imágenes y video, y aparece en la parte superior de la tabla de modelos recomendados desde la actualización del 3 de agosto.

Los ejemplos siguientes usan Singapur. Sustituya la URL base si necesita usar Pekín o Virginia.

Paso 3: realice su primera llamada

El endpoint usa el formato de completaciones de chat de OpenAI. Puede utilizar el SDK oficial de Python openai cambiando la URL base.

Instale el SDK si todavía no lo tiene:

pip install openai
Enter fullscreen mode Exit fullscreen mode

Cree una llamada básica:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.getenv("DASHSCOPE_API_KEY"),
    base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)

completion = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[
        {"role": "system", "content": "You are a precise technical assistant."},
        {
            "role": "user",
            "content": "Explain idempotency in REST APIs in two sentences.",
        },
    ],
)

print(completion.choices[0].message.content)
Enter fullscreen mode Exit fullscreen mode

La misma solicitud con cURL:

curl https://dashscope-intl.aliyuncs.com/compatible-mode/v1/chat/completions \
  -H "Authorization: Bearer $DASHSCOPE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.8-max",
    "messages": [
      {
        "role": "user",
        "content": "Explain idempotency in REST APIs in two sentences."
      }
    ]
  }'
Enter fullscreen mode Exit fullscreen mode

Si ya utiliza un proveedor compatible con OpenAI, la migración requiere principalmente dos cambios:

  1. Actualizar base_url.
  2. Cambiar el ID del modelo a qwen3.8-max.

El flujo es igual al de nuestra guía de la API de Qwen 3.7 Plus, con un ID de modelo nuevo y las cifras actualizadas.

Paso 4: transmita respuestas y lea el razonamiento

Qwen 3.8-Max es un modelo de razonamiento y, de forma predeterminada, genera pensamiento interno. En respuestas transmitidas:

  • Los deltas de reasoning_content llegan antes que la respuesta final.
  • Los deltas de content contienen la respuesta visible.

Maneje ambos campos en el consumidor del stream:

stream = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[
        {
            "role": "user",
            "content": "Design a rate limiting strategy for a public API.",
        }
    ],
    stream=True,
)

thinking_done = False

for chunk in stream:
    delta = chunk.choices[0].delta
    reasoning = getattr(delta, "reasoning_content", None)

    if reasoning:
        print(reasoning, end="", flush=True)
    elif delta.content:
        if not thinking_done:
            print("\n--- answer ---")
            thinking_done = True

        print(delta.content, end="", flush=True)
Enter fullscreen mode Exit fullscreen mode

Tenga en cuenta dos implicaciones prácticas:

  1. Los tokens de pensamiento se facturan como tokens de salida.
  2. El esfuerzo predeterminado puede mejorar la corrección, pero también incrementar la latencia en interfaces conversacionales.

Mida la latencia y los tokens de salida con sus propias instrucciones antes de seleccionar una configuración para producción.

Paso 5: ajuste reasoning_effort y los controles de pensamiento

La API expone tres niveles de reasoning_effort:

  • xhigh: valor predeterminado; genera más razonamiento.
  • medium: equilibrio entre calidad, costo y latencia.
  • low: adecuado para clasificación, extracción y chat simple.

Un mayor esfuerzo implica más tokens de pensamiento, mayor latencia y potencialmente mejores resultados en problemas complejos.

También puede controlar el comportamiento de pensamiento mediante:

  • enable_thinking: activa o desactiva el razonamiento.
  • preserve_thinking: conserva el contexto de razonamiento entre turnos; está activado de forma predeterminada.

Como son extensiones de DashScope, envíelas mediante extra_body cuando use el SDK de OpenAI:

completion = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[
        {
            "role": "user",
            "content": "Classify this ticket: 'Login page 500s on Safari.'",
        }
    ],
    extra_body={
        "reasoning_effort": "low",
        "enable_thinking": True,
    },
)
Enter fullscreen mode Exit fullscreen mode

La facturación se calcula por token independientemente de si el pensamiento está activado o desactivado. La variable que más afecta el costo es la cantidad de tokens de pensamiento generados, controlada directamente por reasoning_effort.

Como punto de partida:

  • Use xhigh para codificación y análisis agentivo.
  • Use low para endpoints de alto volumen.
  • Use medium cuando necesite un equilibrio inicial.

Evalúe siempre con su tráfico real.

Use el endpoint compatible con Anthropic

Además del endpoint compatible con OpenAI, Qwen 3.8 ofrece un endpoint con protocolo Anthropic:

https://dashscope-intl.aliyuncs.com/apps/anthropic
Enter fullscreen mode Exit fullscreen mode

Este endpoint usa el formato de Mensajes de Anthropic. Puede utilizar herramientas construidas para ese ecosistema sin reescribir el cliente.

Para configurar Claude Code, exporte estas tres variables:

export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=$DASHSCOPE_API_KEY
export ANTHROPIC_MODEL=qwen3.8-max
Enter fullscreen mode Exit fullscreen mode

Después, ejecute:

claude
Enter fullscreen mode Exit fullscreen mode

Claude Code ejecutará su bucle agentivo contra Qwen 3.8-Max.

Alibaba realizó gran parte de sus pruebas de rendimiento de codificación con el arnés de Claude Code. Por tanto, el endpoint Anthropic no es solo una capa de compatibilidad: es una configuración utilizada por el propio proveedor para producir sus resultados de codificación.

Si trabaja con agentes de código, consulte nuestro análisis de Qwen 3.8 para codificación, que cubre las referencias y otras configuraciones oficiales para Codex, Qoder, Qwen Code y OpenClaw.

El protocolo dual es especialmente útil si su equipo mantiene herramientas en ambos ecosistemas. Puede probar una migración sin reescribir primero los clientes.

Cuánto cuesta

El precio es:

  • $2 por millón de tokens de entrada
  • $6 por millón de tokens de salida
  • Tarifa plana desde 0 hasta 1 millón de tokens de contexto

No hay recargo por contexto largo dentro de esa ventana de 1 millón de tokens.

El almacenamiento en caché de contexto reduce la entrada repetida al 10% del precio de entrada en aciertos de caché. La creación explícita de caché se factura al 125%.

Consulte las cifras vigentes en la página oficial de precios.

Precios de Qwen 3.8-Max

El precio de lanzamiento es inferior al precio de lista de Qwen 3.7-Max, que era de $2,5/$7,5. Sin embargo, recuerde que los tokens de pensamiento cuentan como salida y que el esfuerzo predeterminado es xhigh. El costo real puede ser mayor que un cálculo basado solo en la respuesta final.

Para ver ejemplos y las condiciones de la cuota gratuita, consulte el desglose completo de precios de Qwen 3.8.

Pruebe y depure la API de Qwen 3.8 en Apidog

Una API con dos protocolos, tres regiones y streaming SSE se beneficia de una colección reproducible de solicitudes. Configure su proyecto en Apidog de esta forma:

Configuración de la API de Qwen en Apidog

1. Importe o cree la especificación compatible con OpenAI

Cree un proyecto y agregue el endpoint de completaciones de chat:

POST /chat/completions
Enter fullscreen mode Exit fullscreen mode

Defina el esquema de solicitud con campos como:

{
  "model": "qwen3.8-max",
  "messages": [
    {
      "role": "user",
      "content": "Explain idempotency in REST APIs in two sentences."
    }
  ]
}
Enter fullscreen mode Exit fullscreen mode

Como la API usa el formato de OpenAI, puede importar una especificación existente y cambiar únicamente la URL del servidor. Agregue el endpoint de Mensajes de Anthropic como una segunda API dentro del mismo proyecto.

2. Modele las regiones como entornos

Cree tres entornos:

  • Pekín
  • Singapur
  • EE. UU. (Virginia)

En cada entorno, defina una variable base_url:

# Singapur
https://dashscope-intl.aliyuncs.com/compatible-mode/v1
Enter fullscreen mode Exit fullscreen mode

Use una variable secreta compartida para la clave:

DASHSCOPE_API_KEY
Enter fullscreen mode Exit fullscreen mode

Así podrá cambiar de región desde un selector de entorno, sin editar cada solicitud manualmente. También podrá comparar la latencia desde su ubicación antes de elegir una región para producción.

3. Inspeccione los eventos SSE

Envíe una solicitud con streaming activado:

{
  "model": "qwen3.8-max",
  "stream": true,
  "messages": [
    {
      "role": "user",
      "content": "Design a rate limiting strategy for a public API."
    }
  ]
}
Enter fullscreen mode Exit fullscreen mode

Revise los eventos sin procesar en la vista de respuesta. Debería observar primero los deltas de reasoning_content y, después, los deltas de content.

Esta comparación es útil cuando el parser de streaming falla en producción: permite comprobar rápidamente si el problema está en el cliente o en la respuesta del proveedor.

4. Compare modelos con la misma instrucción

Duplique una solicitud y cambie el modelo:

qwen3.8-max
Enter fullscreen mode Exit fullscreen mode

por:

qwen3.7-max
Enter fullscreen mode Exit fullscreen mode

Ejecute ambas con la misma instrucción y registre:

  • Tiempo de respuesta.
  • Recuento de tokens.
  • Calidad de la salida.
  • Comportamiento del razonamiento.

También puede mantener una solicitud de la API de Kimi K3 en el mismo proyecto para hacer pruebas A/B con su carga de trabajo real.

Las tablas de referencia de los proveedores son un punto de partida. Sus propias instrucciones, datos y límites de latencia son la prueba relevante.

Descargue Apidog gratis para seguir esta guía. La configuración inicial puede completarse en aproximadamente diez minutos.

Preguntas frecuentes

¿Existe una forma gratuita de probar la API de Qwen 3.8?

Sí. Las nuevas cuentas de Model Studio obtienen una cuota gratuita de 1 millón de tokens para qwen3.8-max, válida durante 90 días y solo en la región de Singapur.

Para usarla, dirija el tráfico de evaluación a:

https://dashscope-intl.aliyuncs.com/compatible-mode/v1
Enter fullscreen mode Exit fullscreen mode

¿Puedo ejecutar Qwen 3.8 localmente en lugar de usar la API?

Todavía no. Alibaba prometió pesos abiertos en Hugging Face y ModelScope para la semana siguiente, pero a principios de agosto de 2026 aún no estaban disponibles para descargar.

Además, con 2,4 billones de parámetros totales, el autoalojamiento requerirá un proyecto multinodo incluso con cuantización. Por ahora, la API alojada es la única forma de ejecutar el modelo.

¿El endpoint de Anthropic admite las mismas características que el de OpenAI?

El endpoint Anthropic usa el protocolo de Mensajes de Anthropic y existe principalmente para herramientas de ese ecosistema, con Claude Code como integración documentada oficialmente.

Para código de aplicación directo, el endpoint compatible con OpenAI es el camino mejor documentado. Incluye reasoning_effort, enable_thinking y reasoning_content en respuestas transmitidas.

¿Cómo se compara qwen3.8-max con Qwen3-Coder para trabajo de codificación?

Son herramientas diferentes. Qwen3-Coder es una línea de modelos especializada en programación, mientras que qwen3.8-max es el modelo insignia general.

Según las pruebas de rendimiento realizadas por Alibaba, qwen3.8-max también obtiene buenos resultados en codificación agentiva, con 86,6 en Terminal Bench 2.1.

Para elegir entre ambos, pruebe los dos con la misma colección de solicitudes. Las llamadas son idénticas salvo por el ID del modelo.

Conclusión

Qwen 3.8-Max es sencillo de adoptar si ya usa clientes compatibles con OpenAI o herramientas del ecosistema Anthropic:

  • Cambie la URL base y el ID de modelo para usar el SDK de OpenAI.
  • Configure tres variables de entorno para usar Claude Code.
  • Use Singapur para aprovechar la cuota gratuita.
  • Controle reasoning_effort para equilibrar costo, latencia y calidad.
  • Mida los tokens de pensamiento, ya que se facturan como salida.

Empiece con la cuota gratuita de Singapur, pruebe respuestas en streaming y valide el comportamiento con sus propias instrucciones antes de depender de cualquier tabla de rendimiento, incluida la de Alibaba.

Configurar regiones como entornos y guardar ambos protocolos como solicitudes en Apidog convierte una prueba manual con cURL en una evaluación repetible para todo el equipo.

Top comments (0)