La mayoría de los lanzamientos de modelos muestran la capacidad de programación con una puntuación de HumanEval o una búsqueda binaria. Alibaba presenta Qwen 3.8-Max de otra forma: afirma que el modelo puede ejecutar un proyecto de software durante semanas, abrir incidencias, fusionar pull requests y entregar funcionalidades con mínima o ninguna intervención humana. Este artículo revisa las tres demostraciones publicadas por Alibaba, sus benchmarks y, sobre todo, cómo usar qwen3.8-max hoy en herramientas como Claude Code, Codex, Qoder, Qwen Code y OpenClaw.
Si necesitas contexto sobre el modelo, consulta qué es Qwen 3.8: 2.4T de parámetros totales, 95B activos, ventana de contexto de 1M de tokens y pesos abiertos prometidos para la semana posterior al lanzamiento. Aquí el foco está en programación. La información refleja el estado al 3 de agosto de 2026.
Lo que Alibaba afirma realmente
Según la publicación oficial de lanzamiento de Qwen 3.8, el objetivo no es solo generar funciones correctas. Alibaba posiciona Qwen 3.8-Max como un agente capaz de mantener una tarea de ingeniería de larga duración: planificar, implementar, recuperarse de errores y producir una entrega revisable.
La afirmación es relevante por tres motivos:
- Las demostraciones son largas. Una ejecución de 16 días evalúa recuperación ante errores, gestión de contexto y deriva del objetivo; no solo la capacidad de resolver una tarea de 20 minutos.
- Una demostración tiene repositorio público. Puedes inspeccionar commits, incidencias y pull requests en lugar de depender de una captura de pantalla.
- Alibaba usó el arnés de Claude Code. También publicó una configuración oficial para usar Qwen 3.8-Max con ese flujo de trabajo.
Todos los resultados citados provienen de materiales de lanzamiento de Alibaba. A principios de agosto de 2026 no había verificación independiente; trata estas demostraciones como demostraciones del proveedor, no como auditorías externas.
Las tres demostraciones de programación
oh-my-cli: 16 días de desarrollo autónomo
La demostración principal consiste en una herramienta de línea de comandos creada por Qwen 3.8-Max sin supervisión continua. Al 30 de julio, la ejecución llevaba 16 días y había generado:
- 265 commits
- 127 pull requests
- 151 incidencias
El repositorio es público: qwen-code-dev-bot/oh-my-cli.
Para evaluar esta demostración, no te limites al número de commits. Audita el repositorio con esta lista:
- Abre una incidencia y comprueba si el PR relacionado la resuelve realmente.
- Revisa si las incidencias representan trabajo útil o tareas creadas artificialmente para cerrarse después.
- Busca regresiones: verifica si commits posteriores corrigen errores introducidos por el propio modelo.
- Ejecuta los tests y el linter del proyecto.
- Evalúa si la estructura del código sigue siendo mantenible después de decenas de cambios.
Estos indicadores ofrecen una señal más útil sobre autonomía a largo plazo que una puntuación aislada de benchmark.
Reproducción de un paper: código de investigación
La segunda demostración reproduce un artículo de investigación de aprendizaje automático desde cero. Según Alibaba, la ejecución:
- Duró aproximadamente 125 horas.
- Generó unas 7.600 líneas de código.
- Ejecutó 33 rondas de entrenamiento en GPU.
- Reprodujo 6 hallazgos del artículo.
- Superó el resultado reportado en 2,7 puntos en AIME24.
Reproducir investigación es más difícil que implementar una API convencional. Los entornos fallan, los hiperparámetros pueden estar incompletos y un error silencioso puede invalidar horas de entrenamiento. Esta demostración se relaciona directamente con el resultado de Qwen 3.8-Max en PaperBench.
Concurso Tianchi: 24 horas contra equipos humanos
La tercera demostración colocó al modelo en una competición de ciencia de datos de Tianchi con un límite de 24 horas. Durante ese periodo, Qwen 3.8-Max realizó 45 envíos y terminó con una precisión de 0.853.
El resultado lo situó por delante de 458 de los 526 equipos humanos participantes.
El modelo no ganó el concurso, pero superó aproximadamente al 87 % de los participantes. La señal interesante aquí es la iteración bajo presión: cada envío alimenta la siguiente hipótesis, ajuste o experimento.
También hay una limitación importante: Tianchi es la plataforma de Alibaba, por lo que el proveedor controlaba el entorno de la demostración.
Benchmarks de programación
Alibaba publicó los siguientes resultados. Todos corresponden a ejecuciones propias del proveedor.
| Benchmark | Qwen 3.8-Max | Mejor rival según la tabla de Alibaba |
|---|---|---|
| Terminal Bench 2.1 | 86.6 | 88.8 (GPT-5.6 Sol) |
| SWE-bench Pro | 67.7 | 80.0 (Fable 5) |
| PaperBench | 93.0 | 90.5 (GPT-5.6 Sol) |
La lectura práctica de estos números es la siguiente:
-
Terminal Bench 2.1: 86.6. Qwen 3.8-Max supera a Claude Opus 4.8 y Fable 5, ambos con 84.6 en la tabla de Alibaba. Este resultado respalda el tipo de trabajo de agente por terminal mostrado en
oh-my-cli. - SWE-bench Pro: 67.7. Es el resultado menos favorable. Fable 5 alcanza 80.0 en la misma tabla. Para correcciones de errores en repositorios grandes, Qwen 3.8-Max queda más de 12 puntos por detrás del líder indicado.
- PaperBench: 93.0. Es la fila más fuerte del modelo y respalda directamente la demostración de reproducción de investigación.
Hay una salvedad metodológica: Alibaba ejecutó gran parte de los benchmarks, incluidos modelos rivales, usando el arnés de Claude Code. La elección del arnés puede afectar los resultados de agentes, así que estos datos son una referencia útil, no un veredicto definitivo.
La parte práctica es que, si ya usas Claude Code, puedes probar el modelo en un entorno similar al utilizado para esas mediciones.
Cómo programar con Qwen 3.8-Max hoy
Qwen 3.8-Max está disponible en Alibaba Cloud Model Studio. Para las integraciones necesitas una clave de API de DashScope, disponible en home.qwencloud.com.
Según la página de precios de Model Studio, el coste es:
-
$2por millón de tokens de entrada. -
$6por millón de tokens de salida. - Precio plano en toda la ventana de contexto de 1M de tokens.
Usar Qwen 3.8-Max con Claude Code
Qwen 3.8-Max expone un endpoint compatible con Anthropic. Configura estas variables de entorno antes de iniciar Claude Code:
export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=your-dashscope-api-key
export ANTHROPIC_MODEL=qwen3.8-max
Después inicia Claude Code como lo haces normalmente.
claude
Las solicitudes se enrutarán a Qwen 3.8-Max en lugar de a Claude.
Para confirmar que tu entorno está bien configurado:
- Ejecuta Claude Code desde un repositorio de prueba.
- Pide una modificación pequeña y verificable.
- Revisa el diff generado.
- Ejecuta tests, linter y compilación antes de aceptar el cambio.
- Solo después prueba tareas de varios archivos o sesiones largas.
Usar Qwen 3.8-Max con Codex
Codex puede usar el endpoint compatible con OpenAI. Añade un proveedor en su configuración:
model = "qwen3.8-max"
model_provider = "qwencloud"
[model_providers.qwencloud]
name = "QwenCloud"
base_url = "https://dashscope-intl.aliyuncs.com/compatible-mode/v1"
env_key = "DASHSCOPE_API_KEY"
context_window = 1000000
Después exporta la clave:
export DASHSCOPE_API_KEY="your-dashscope-api-key"
La diferencia frente a Claude Code es el protocolo: Codex usa el endpoint compatible con OpenAI, mientras que Claude Code usa el endpoint compatible con Anthropic.
Usar Qoder, Qwen Code y OpenClaw
Las otras integraciones publicadas por Alibaba se configuran de esta forma:
-
Qoder CLI: selecciona
qwen3.8-maxcomo modelo. Es una integración de primera parte. -
Qwen Code: define
DASHSCOPE_API_KEYy selecciona el modelo. Si ya usabas modelos Qwen anteriores, el flujo no cambia. -
OpenClaw: configura el identificador
qwen3.8-maxymaxTokensen65,536.
Para configuraciones actualizadas, consulta la publicación oficial de lanzamiento, ya que las opciones de CLI y los nombres de configuración pueden cambiar.
Ajusta reasoning_effort según la tarea
Qwen 3.8-Max admite el parámetro reasoning_effort con tres niveles:
-
xhigh— predeterminado mediumlow
Úsalo de forma deliberada:
| Tipo de tarea | Valor recomendado |
|---|---|
| Refactorización de varios archivos | xhigh |
| Depuración compleja | xhigh |
| Planificación de cambios grandes | xhigh |
| Renombrados masivos | low |
| Documentación y docstrings | low |
| Cambios mecánicos | low |
Los tokens de razonamiento se facturan como tokens de salida. Como la salida cuesta $6 por millón de tokens, mantener xhigh en tareas mecánicas puede aumentar el coste sin aportar una mejora real.
Si tu tarea no requiere un modelo de este tamaño, considera alternativas de la misma familia:
- Qwen3 Coder para trabajo de programación dedicado.
- Qwen3 Coder Flash para tareas rápidas y de menor coste.
- Kimi K3 para programación como otra referencia de modelo de código abierto.
Prueba lo que construye el modelo: el paso de Apidog
El código generado por un agente puede compilar correctamente y aun así fallar al integrarse con una API real. Algunos errores habituales son:
- Usar un endpoint incorrecto.
- Manejar mal un
429 Too Many Requests. - Enviar payloads que no pasan validación.
- Asumir campos que no existen en la respuesta.
- No procesar correctamente respuestas de streaming.
1. Prueba los endpoints del código generado
Cuando Qwen 3.8-Max cree un cliente API o un servicio, importa la especificación en Apidog y prueba los endpoints directamente.
Valida al menos:
- Flujos de autenticación.
- Respuestas
2xx,4xxy5xx. - Payloads inválidos y casos límite.
- Límites de tasa.
- Campos opcionales, nulos o ausentes.
- Comportamiento de reintentos y timeouts.
Si quieres evaluar la API del propio modelo, la guía de la API de Qwen 3.8 explica la configuración de los protocolos OpenAI y Anthropic. Puedes usar Apidog para inspeccionar ambos endpoints, incluidas respuestas de streaming y deltas de razonamiento.
2. Simula APIs antes de dar autonomía al agente
No apuntes una ejecución autónoma larga directamente a producción. Una sesión de 16 días puede generar:
- Mutaciones no deseadas de datos.
- Límites de tasa agotados.
- Costes inesperados.
- Efectos secundarios difíciles de revertir.
Usa servidores mock de Apidog para proporcionar respuestas realistas sin tocar sistemas productivos.
Un flujo seguro sería:
- Importa o crea la especificación de tu API.
- Configura respuestas mock para casos normales y errores.
- Apunta el código generado al servidor mock.
- Ejecuta tests de integración contra el mock.
- Revisa manualmente los cambios.
- Cambia a la URL base real solo después de aprobar el resultado.
Puedes descargar Apidog gratis para configurar esta simulación en pocos minutos.
Cuanta más autonomía otorgues a un agente de programación, más importante será controlar las APIs con las que puede comunicarse. No puedes revisar cada commit en tiempo real, pero sí puedes limitar y verificar los sistemas externos que el código puede afectar.
Preguntas frecuentes
¿Es Qwen 3.8 bueno para programar?
Según los resultados publicados por Alibaba, es fuerte en programación de agentes y tareas de investigación:
- Terminal Bench 2.1:
86.6 - PaperBench:
93.0
En corrección de incidencias a escala de repositorio, el resultado es más moderado:
- SWE-bench Pro:
67.7 - Fable 5 en la misma tabla:
80.0
La conclusión práctica es que parece especialmente orientado a tareas autónomas largas y flujos de investigación, no necesariamente a liderar la corrección clásica de incidencias en repositorios.
¿Puedo usar Qwen 3.8-Max en Claude Code?
Sí. Configura estas variables:
export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=your-dashscope-api-key
export ANTHROPIC_MODEL=qwen3.8-max
Alibaba publicó esta configuración y usó el arnés de Claude Code para gran parte de sus benchmarks de programación.
¿Cuánto cuesta programar con Qwen 3.8-Max?
Según Alibaba Cloud Model Studio:
-
$2por millón de tokens de entrada. -
$6por millón de tokens de salida. - La tarifa es plana en la ventana de contexto de 1M de tokens.
Los tokens de razonamiento cuentan como salida. Como xhigh es el valor predeterminado, las sesiones largas de agentes pueden costar más de lo esperado. Consulta el desglose de benchmarks de Qwen 3.8 para más contexto sobre costes y comparativas.
¿La ejecución de 16 días de oh-my-cli fue realmente autónoma?
Esa es la afirmación de Alibaba. La diferencia frente a muchas demostraciones de proveedores es que puedes revisar el artefacto público: qwen-code-dev-bot/oh-my-cli.
El repositorio registraba 265 commits, 127 pull requests y 151 incidencias al 30 de julio de 2026. La calidad y utilidad de esos cambios sigue siendo algo que debes evaluar revisando el código, los tests, las incidencias y los PRs.



Top comments (0)