DEV Community

Cover image for Cómo usar Qwen 3.8 gratis
Roobia
Roobia

Posted on • Originally published at apidog.com

Cómo usar Qwen 3.8 gratis

Alibaba lanzó Qwen 3.8-Max a principios de agosto de 2026, y los resultados de búsqueda ya se están llenando de afirmaciones de “úsalo gratis para siempre” que no resisten el contacto con los términos reales. Esta es la versión honesta, verificada con las propias páginas de Alibaba a partir del 3 de agosto de 2026.

Prueba Apidog hoy

Hay exactamente cuatro rutas que valen la pena: dos funcionan hoy, una es una promesa con fecha adjunta y una es una alternativa. Si primero quieres una imagen completa del modelo —2,4 billones de parámetros totales, 95B activos y contexto de 1M de tokens—, consulta nuestra descripción general de Qwen 3.8 y vuelve después.

Mapa rápido

Ruta ¿Gratis? ¿Funciona hoy? Peculiaridad
Qwen Chat Aplicación para consumidores, sin API
Cuota de API de Model Studio 1M de tokens Solo región de Singapur, 90 días
Pesos abiertos (autoalojamiento) Pesos gratis Todavía no Prometido “la próxima semana”; el hardware no es gratis
Modelos Qwen antiguos No es Qwen 3.8

Ruta 1: Qwen Chat, la opción sin configuración

El camino gratuito más rápido es Qwen Chat, la opción orientada a consumidores de Alibaba. Inicia sesión, selecciona el modelo y podrás conversar con Qwen 3.8-Max sin tarjeta ni consola cloud. La publicación oficial de lanzamiento lo señala como la forma predeterminada de probar el modelo.

Interfaz de usuario de Qwen Chat

Qué puedes hacer

  • Probar el modelo insignia desde una interfaz de chat.
  • Evaluar la comprensión de imágenes y documentos mostrada en las demos de lanzamiento.
  • Validar rápidamente la calidad general de las respuestas.

Qué no puedes hacer

  • Obtener una clave API.
  • Automatizar solicitudes.
  • Conectarlo directamente a tu aplicación, agente o suite de pruebas.
  • Usarlo como referencia exacta del comportamiento de la API.

Las aplicaciones de chat aplican prompts de sistema y configuraciones propias. Por eso, el resultado que ves en Qwen Chat no tiene por qué coincidir exactamente con el que devuelve la API sin procesar.

Veredicto: es real, gratuito y útil para una primera prueba. No es una ruta de integración para desarrolladores.

Ruta 2: cuota gratuita de Model Studio

Esta es la ruta relevante si escribes código. Alibaba Cloud Model Studio ofrece a las nuevas activaciones una cuota gratuita de 1 millón de tokens para qwen3.8-max.

Antes de implementar, ten en cuenta estas restricciones de la página de precios.

1. La cuota solo aplica en Singapur

La cuota gratuita funciona únicamente en la región internacional de Singapur. Usa esta URL base:

https://dashscope-intl.aliyuncs.com/compatible-mode/v1
Enter fullscreen mode Exit fullscreen mode

Si apuntas a endpoints de Beijing o US-Virginia, pagarás desde el primer token. Si tu aplicación necesita un endpoint de EE. UU. por latencia o requisitos de residencia, la cuota gratuita no te servirá.

2. La cuota dura 90 días

Los 1 millón de tokens son válidos durante 90 días desde la activación.

No se acumulan ni se transfieren:

  • Los tokens no usados caducan.
  • La transición a facturación ocurre al agotar la cuota o al vencer el plazo.
  • No conviene activar la cuenta si planeas evaluar el modelo varios meses después.

3. Después de la cuota, la API deja de ser gratuita

La tarifa indicada es:

  • $2 por millón de tokens de entrada
  • $6 por millón de tokens de salida

No hay niveles de precio según la longitud del contexto dentro del límite de 1M de tokens. Es una tarifa competitiva para un modelo insignia, pero no es gratuita.

Configura alertas de facturación antes de empezar. Para estimar costes con cargas de trabajo reales, consulta la guía de precios de Qwen 3.8.

Configuración inicial

  1. Crea una cuenta en Alibaba Cloud Model Studio.
  2. Activa el servicio.
  3. Genera una clave API.
  4. Guarda la clave en una variable de entorno:
export DASHSCOPE_API_KEY="tu_clave_api"
Enter fullscreen mode Exit fullscreen mode

El catálogo de modelos lista qwen3.8-max entre los modelos recomendados.

El endpoint es compatible con el protocolo de OpenAI. También existe un endpoint compatible con Anthropic. Consulta el tutorial de la API de Qwen 3.8 para ver ejemplos con streaming y razonamiento.

Ejemplo de solicitud compatible con OpenAI

Configura primero las variables de entorno:

export DASHSCOPE_API_KEY="tu_clave_api"
export DASHSCOPE_BASE_URL="https://dashscope-intl.aliyuncs.com/compatible-mode/v1"
Enter fullscreen mode Exit fullscreen mode

Después, realiza una solicitud de chat:

curl "$DASHSCOPE_BASE_URL/chat/completions" \
  -H "Authorization: Bearer $DASHSCOPE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.8-max",
    "messages": [
      {
        "role": "user",
        "content": "Explica cómo implementar reintentos exponenciales en una API REST."
      }
    ],
    "reasoning_effort": "low"
  }'
Enter fullscreen mode Exit fullscreen mode

Usa low o medium durante las pruebas rutinarias para reducir el consumo de tokens.

Una trampa que consume cuota: el razonamiento está activado por defecto

Qwen 3.8-Max se envía con reasoning_effort configurado en xhigh, y los tokens de pensamiento se facturan como salida.

Un prompt complejo puede generar miles de tokens de razonamiento antes de empezar la respuesta visible. En una cuenta de pago es un coste; en una cuota gratuita de 1M de tokens puede ser la diferencia entre dos semanas de pruebas y dos días.

Para solicitudes que no requieran razonamiento profundo, reduce el nivel:

{
  "reasoning_effort": "low"
}
Enter fullscreen mode Exit fullscreen mode

Opciones prácticas:

  • Usa low para clasificación, extracción, formato y tareas repetitivas.
  • Usa medium para generación de código y análisis moderado.
  • Reserva xhigh para problemas que realmente requieran razonamiento complejo.

Haz que el millón de tokens dure

Un millón de tokens desaparece rápido si cada iteración de depuración reenvía toda la cadena de prompts. Aplica estas prácticas:

  1. Ajusta una solicitud antes de repetirla.

    Construye y ejecuta la llamada en Apidog, modifica parámetros e inspecciona la respuesta transmitida —incluidos los deltas de razonamiento— una solicitud a la vez. Es preferible a consumir cuota con bucles de reintentos en el código de la aplicación.

  2. Simula las respuestas ya verificadas.

    Cuando conozcas la forma de la respuesta, guarda un ejemplo y haz que el servidor mock de Apidog lo devuelva a tu frontend o agente. Desarrollar contra un mock no consume tokens; usa el endpoint real solo para validaciones finales.

  3. Mide el uso por solicitud.

    El cuerpo de respuesta devuelve el recuento de tokens. Regístralo para conocer tu consumo real y evitar descubrir que la cuota terminó a mitad de sprint.

Puedes descargar Apidog gratis para aplicar este flujo. También puedes guardar las URLs base de Singapur, Beijing y EE. UU. como entornos y alternar entre ellas sin cambiar el código manualmente.

Veredicto: es una ruta real y útil para desarrolladores durante 90 días. Respeta la restricción regional y controla la fecha de caducidad.

Ruta 3: pesos abiertos, prometidos pero todavía no descargables

El anuncio más importante para quienes buscan acceso gratuito es que Qwen 3.8-Max será el primer modelo de clase Qwen-Max con pesos abiertos. Alibaba afirma que los pesos llegarán a Hugging Face y ModelScope “la próxima semana”, alrededor del 10 de agosto.

A 3 de agosto de 2026, todavía no se pueden descargar:

  • No hay pesos para extraer.
  • No hay nada que cuantificar.
  • No hay una ejecución local oficial disponible.

Si encuentras un tutorial que promete ejecutar Qwen 3.8 localmente antes de que los pesos estén publicados, verifica qué modelo está usando realmente.

Como referencia, Kimi K3 hizo una promesa similar en su lanzamiento y publicó los pesos 11 días después. El plazo es plausible, pero aún no se ha cumplido para Qwen 3.8-Max.

La realidad del autoalojamiento

Incluso cuando los pesos lleguen, “gratis” necesitará un asterisco enorme.

Qwen 3.8-Max tiene 2,4 billones de parámetros totales. El precedente más cercano es Kimi K3: un modelo de 2,8T parámetros que se distribuyó como 594 GB de pesos incluso con cuantificación MXFP4 agresiva.

Reduciendo esa referencia para los 2,4T de Qwen, seguirás necesitando:

  • Cientos de gigabytes de pesos.
  • Varias GPU.
  • Probablemente una configuración multinodo para servir el modelo.
  • Infraestructura de almacenamiento, red y monitorización.

No es un modelo para una GPU de consumo ni para una estación de trabajo individual. La guía para ejecutar Kimi K3 localmente describe el tipo de hardware necesario, y la misma economía aplica aquí.

Entonces, ¿qué aportan realmente los pesos abiertos?

Principalmente, permiten que proveedores de terceros alojen el modelo. Esa competencia suele reducir los precios de hosting frente a las tarifas del proveedor original. Para la mayoría de desarrolladores, “pesos abiertos gratis” significará acceso API alojado más económico, no Qwen 3.8-Max ejecutándose en un portátil.

Veredicto: todavía no es una ruta disponible. Revisa el estado a mediados de agosto y presupuesta hosting, no hardware.

Ruta 4: alternativa con modelos Qwen antiguos

Si necesitas “un modelo Qwen capaz sin coste” en lugar de “Qwen 3.8-Max específicamente”, los modelos anteriores ofrecen rutas gratuitas que no caducan a los 90 días.

Los modelos Qwen de código abierto más pequeños ya funcionan en hardware que muchas personas tienen, y la generación anterior dispone de opciones de acceso sin coste. Consulta la guía sobre cómo usar Qwen 3.7 gratis.

El intercambio es sencillo: renuncias a las mejoras de rendimiento que hicieron noticia con Qwen 3.8-Max.

Para estos casos, los modelos anteriores pueden ser suficientes:

  • Proyectos secundarios.
  • Clasificadores.
  • Prototipos.
  • Aprendizaje de la API de Qwen antes de asumir costes.
  • Casos de uso que caben en hardware local más modesto.

Lo que no es real

A 3 de agosto de 2026, estas opciones no existen:

  • No hay un nivel gratuito de API ilimitado. La cuota es de 1 millón de tokens y caduca.
  • No hay cuota gratuita fuera de Singapur. Beijing y US-Virginia facturan desde el primer token.
  • Todavía no hay pesos descargables. “La próxima semana” es una promesa, no un enlace.
  • No hay Qwen 3.8 oficial gratuito en agregadores de terceros. El acceso alojado por terceros probablemente aparecerá después de la publicación de los pesos. Antes de eso, cualquier servicio que afirme ofrecer Qwen 3.8-Max gratis merece verificación.

Preguntas frecuentes

¿La API de Qwen 3.8 es realmente gratuita?

Parcialmente. Alibaba Cloud Model Studio ofrece 1 millón de tokens gratuitos, válidos durante 90 días y solo en la región de Singapur.

Después, se aplican estas tarifas:

  • $2 por millón de tokens de entrada.
  • $6 por millón de tokens de salida.

Planifica la evaluación dentro de esa ventana de 90 días.

¿Puedo descargar y ejecutar Qwen 3.8 localmente ahora mismo?

No. Los pesos están prometidos para Hugging Face y ModelScope alrededor del 10 de agosto de 2026, pero aún no se habían publicado al momento de escribir este artículo.

Cuando estén disponibles, necesitarás cientos de gigabytes de almacenamiento y un servicio multi-GPU. Es un modelo de 2,4T parámetros, no algo que puedas ejecutar en una laptop.

¿En qué se diferencia de las opciones gratuitas de Kimi K3?

Los pesos de Kimi K3 ya están disponibles para descargar, por lo que su ruta de autoalojamiento existe hoy. La de Qwen 3.8 todavía está pendiente.

Sin embargo, ambos modelos son demasiado grandes para hardware de consumo. Consulta la guía sobre cómo usar Kimi K3 gratis para comparar las rutas disponibles.

¿La cuota gratuita cubre los tokens de pensamiento?

Sí, pero también los consume. La salida de razonamiento se factura como salida normal y el valor predeterminado de reasoning_effort es xhigh.

Reduce ese parámetro para llamadas rutinarias; de lo contrario, tu cuota puede desaparecer en razonamiento que ni siquiera necesitas mostrar al usuario.

Conclusión

El acceso gratuito a Qwen 3.8 es real, pero muy específico:

  • Qwen Chat sirve para pruebas casuales.
  • Model Studio ofrece 1 millón de tokens en Singapur durante 90 días para desarrolladores.
  • Los pesos abiertos están prometidos, pero aún no disponibles.
  • Los modelos Qwen anteriores son la alternativa si necesitas opciones gratuitas más sostenibles.

Si eliges la ruta de la API, invierte la cuota en evaluaciones reales, no en depuración repetitiva. Prototipa solicitudes en Apidog, simula respuestas durante el desarrollo y reserva los tokens del endpoint en vivo para las pruebas que determinen si Qwen 3.8-Max merece un lugar en tu stack.

Top comments (0)