Alibaba hat Qwen 3.8-Max Anfang August 2026 offiziell veröffentlicht. Das Mixture-of-Experts-Modell (MoE) umfasst 2,4 Billionen Parameter, aktiviert pro Token jedoch nur 95 Milliarden. Über ein Kontextfenster von bis zu 1 Million Token kostet die API pauschal 2 $ pro Million Eingabe-Token und 6 $ pro Million Ausgabe-Token. Alibaba hat außerdem angekündigt, die Gewichte innerhalb einer Woche auf Hugging Face und ModelScope bereitzustellen — erstmals für ein Qwen-Modell der Max-Klasse.
Probieren Sie Apidog noch heute aus
Die offizielle Ankündigung beschreibt Qwen 3.8-Max als bisher leistungsfähigstes Qwen-Modell. Dieser Beitrag zeigt, wie Sie das Modell einordnen, per API ansprechen, beide unterstützten Protokolle testen und die Kosten für Ihren Workload realistisch abschätzen. Die API unterstützt OpenAI- und Anthropic-kompatible Endpunkte. Ein Client wie Apidog hilft dabei, beide Varianten mit demselben Schlüssel zu testen.
Qwen 3.8-Max auf einen Blick
| Spezifikation | Qwen 3.8-Max |
|---|---|
| Entwickler | Alibaba (Qwen Team) |
| Veröffentlichung | Anfang August 2026 (GA in Model Studio, 3. August) |
| Architektur | MoE, basierend auf der Qwen-3.5-Grundlage |
| Gesamtparameter | 2,4T |
| Aktive Parameter | 95B (~4 % Aktivierung) |
| Kontextfenster | 1.000.000 Token |
| Maximale Ausgabe | 65.536 Token |
| Modalitäten | Text- und Bildeingabe, Textausgabe |
| Reasoning-Kontrollen |
reasoning_effort: xhigh (Standard), medium, low
|
| API-Modell-ID | qwen3.8-max |
| Preise | 2 $ Eingabe / 6 $ Ausgabe pro 1M Token, pauschal über den gesamten Kontext |
| Offene Gewichte | Für etwa 10. August versprochen; Anfang August 2026 noch nicht verfügbar |
| API-Protokolle | OpenAI-kompatibel und Anthropic-kompatibel |
Die Angaben stammen aus Alibabas Veröffentlichungsmaterialien und der Model-Studio-Preisseite.
Was Qwen 3.8-Max ist
Qwen 3.8-Max ist Alibabas neues Qwen-Flaggschiff und ersetzt Qwen3.7-Max an der Spitze der Reihe. Laut Hersteller steigen unter anderem die Werte auf Terminal Bench 2.1 von 74,5 auf 86,6 und auf PaperBench von 64,8 auf 93,0.
Wenn Sie bereits Qwen3.7-Max verwenden, vergleichen Sie vor einem Wechsel insbesondere Qualität, Antwortlänge, Reasoning-Kosten und Latenz. Eine direkte Übersicht bietet der Vergleich Qwen 3.8 vs. Qwen 3.7 Max.
Die zentrale Architekturentscheidung ist die MoE-Aufteilung:
- 2,4 Billionen Gesamtparameter
- 95 Milliarden aktive Parameter pro Forward Pass
- etwa 4 % Aktivierung
Dadurch kann Alibaba ein sehr großes Modell zu 2 $/6 $ pro Million Token anbieten. Zum Vergleich: Kimi K3 hat 2,8T Gesamtparameter und 104B aktive Parameter. Qwen 3.8-Max ist damit in beiden Kennzahlen kleiner.
Eingaben und Reasoning konfigurieren
Die veröffentlichte API-Konfiguration nennt Text und Bilder als Eingabemodalitäten. Alibaba demonstriert im Blog zusätzlich Langdokument-Verständnis für PDFs mit mehr als 200 Seiten sowie Videofähigkeiten über sogenannte Memory Graphs. Behandeln Sie diese Beispiele als demonstrierte Fähigkeiten, nicht als zusätzliche dokumentierte API-Eingabetypen.
Für die Inferenz stehen drei Reasoning-Stufen zur Verfügung:
{
"reasoning_effort": "xhigh"
}
Mögliche Werte:
-
xhigh— Standard, höchste Reasoning-Intensität -
medium— Kompromiss zwischen Kosten und Tiefe -
low— für schnellere oder günstigere Antworten
Zusätzlich gibt es enable_thinking und preserve_thinking. Denken wird standardmäßig beibehalten. Wichtig für die Kostenplanung: Thinking-Token werden als Ausgabe-Token abgerechnet. Der Listenpreis bleibt zwar identisch, aber xhigh kann die tatsächliche Zahl der Ausgabe-Token deutlich erhöhen.
Das erste Qwen-Modell der Max-Klasse mit offenen Gewichten
Alibaba hat bereits viele Qwen-Modelle veröffentlicht, aber bislang kein Max-Modell mit offenen Gewichten. Für Qwen 3.8-Max wurden Gewichte für Hugging Face und ModelScope „nächste Woche“ angekündigt, ungefähr zum 10. August.
Berücksichtigen Sie dabei zwei Einschränkungen:
Die Gewichte sind Anfang August 2026 noch nicht verfügbar.
Die Veröffentlichung ist angekündigt, aber noch nicht erfolgt. Kimi K3 zeigt einen möglichen Präzedenzfall: Seine Gewichte erschienen 11 Tage nach dem Start.Selbst-Hosting eines 2,4T-Modells ist ein Multi-Node-Projekt.
Auch quantisiert ist das Modell nicht für eine normale Workstation gedacht. Für die meisten Teams bedeutet „offene Gewichte“ eher Zugang über Drittanbieter als lokales Deployment.
Wenn Sie Qwen 3.8-Max ohne Listenpreis testen möchten, prüfen Sie Qwen Chat und das kostenlose Model-Studio-Kontingent. Die verfügbaren Optionen beschreibt der Leitfaden zur kostenlosen Nutzung von Qwen 3.8.
Was die Benchmarks zeigen — einschließlich der Verluste
Alibaba vergleicht Qwen 3.8-Max mit Claude Opus 4.8, Fable 5, GPT-5.6 Sol und Qwen3.7-Max. Lesen Sie diese Ergebnisse mit zwei wichtigen Einschränkungen:
- Die Werte stammen vom Anbieter.
- Die meisten Coding-Benchmarks wurden mit dem Claude Code Harness ausgeführt.
- Mehrere Benchmarks, darunter QwenSWEBench, QwenQoderBench, CoWorkBench und RecreationBench, sind interne Alibaba-Benchmarks.
- Zum Zeitpunkt der Veröffentlichung gibt es keine unabhängigen Zahlen von Quellen wie Artificial Analysis.
Starke Ergebnisse laut Alibaba
- PaperBench: 93,0 — vor GPT-5.6 Sol (90,5), Fable 5 (88,8) und Opus 4.8 (80,3)
- IFBench: 82,8 — vor Sol (72,7)
- Terminal Bench 2.1: 86,6 — vor Opus 4.8 und Fable 5 (je 84,6), hinter Sol (88,8)
- Multimodale Aufgaben — MathVision 95,2, LogicVista 91,9, OSWorld-Verified 86,1 sowie starke OCR-Ergebnisse
Schwächere Ergebnisse laut Alibaba
- SWE-bench Pro: 67,7 — hinter Fable 5 (80,0) und Opus 4.8 (69,2), aber vor Sol (64,6)
- HLE: 43,6 — hinter Fable 5 (53,3), Sol (47,2) und Opus 4.8 (45,7)
Praktisch eingeordnet: Qwen 3.8-Max wirkt laut Herstellertabelle besonders stark bei multimodalen Aufgaben, Dokumentenintelligenz und mehreren agentischen Benchmarks. Für zentrale Software-Engineering-Aufgaben liegt Fable 5 in dieser Tabelle jedoch vorn.
Bei GPQA Diamond erreicht Qwen 3.8-Max 92,6: gleichauf mit Fable 5 und knapp hinter Sol mit 94,1. Eine detailliertere Einordnung der Messmethoden finden Sie in der Qwen-3.8-Benchmarks-Analyse.
Alibaba veröffentlichte außerdem Showcase-Läufe, darunter:
- eine 16-tägige autonome Coding-Session in einem öffentlichen Repository,
- 265 Commits und 127 Pull Requests,
- eine Paper-Reproduktion mit einem Ergebnis über dem AIME24-Wert des Originalpapiers,
- eine Tianchi-Wettbewerbsteilnahme, die laut Anbieter 458 von 526 menschlichen Teams innerhalb von 24 Stunden übertraf.
Diese Demos sind Fähigkeitsindikatoren, aber keine kontrollierten unabhängigen Bewertungen. Für die Coding-Perspektive inklusive Harness-Konfigurationen siehe Qwen 3.8 für Kodierung.
Vergleich mit Kimi K3, Fable 5 und GPT-5.6 Sol
Gegen Kimi K3
Kimi K3 und Qwen 3.8-Max sind die naheliegenden Konkurrenten: zwei große MoE-Modelle chinesischer Labs, deren Veröffentlichungen nur wenige Wochen auseinanderliegen.
| Merkmal | Qwen 3.8-Max | Kimi K3 |
|---|---|---|
| Gesamtparameter | 2,4T | 2,8T |
| Aktive Parameter | 95B | 104B |
| Modalitäten | Text und Bild | Text |
| Eingabepreis | 2 $ / 1M Token | 3 $ / 1M Token |
| Ausgabepreis | 6 $ / 1M Token | 15 $ / 1M Token |
| Gewichte | angekündigt | bereits verfügbar |
Eine direkte, unabhängige Gegenüberstellung liegt noch nicht vor. Beide Anbieter verwenden eigene Tabellen. Einen Vergleich Zeile für Zeile finden Sie unter Qwen 3.8 vs. Kimi K3. Für den Einstieg in Moonshots Modell lesen Sie Was ist Kimi K3?.
Gegen Fable 5
Fable 5 bleibt laut Alibabas eigener Tabelle bei Coding die Referenz:
- SWE-bench Pro: 80,0 für Fable 5 gegenüber 67,7 für Qwen 3.8-Max
- HLE: 53,3 für Fable 5 gegenüber 43,6 für Qwen 3.8-Max
Qwen bietet dafür einen niedrigeren Preis, ein 1M-Kontextfenster, angekündigte offene Gewichte und stärkere multimodale Werte.
Gegen GPT-5.6 Sol
GPT-5.6 Sol liegt laut Tabelle bei Terminal Bench, GPQA und HLE vorne:
- Terminal Bench: 88,8 vs. 86,6
- GPQA: 94,1 vs. 92,6
- HLE: 47,2 vs. 43,6
Qwen 3.8-Max führt dagegen bei:
- PaperBench: 93,0 vs. 90,5
- IFBench: 82,8 vs. 72,7
Beim Preis liegt Qwen mit 2 $/6 $ unter GPT-5.6 Terra mit 2 $/12 $ für Ausgabe-Token. Ein weiterer Preisanker: Claude Opus 5 kostet 5 $/25 $.
Preise: 2 $/6 $ über bis zu 1M Token
Die Preisformel ist einfach:
Kosten = (Eingabe-Token / 1.000.000 × 2 $)
+ (Ausgabe-Token / 1.000.000 × 6 $)
Die Besonderheit: Der Preis bleibt bis zur 1M-Kontextgrenze pauschal. Viele Langkontextmodelle erhöhen die Preise für längere Prompts; Qwen 3.8-Max tut das laut Preisangaben nicht.
Weitere Punkte für Ihre Kostenrechnung:
- Cache-Hits kosten 10 % des Eingabepreises
- Explizite Cache-Erstellung kostet 125 %
- Ein kostenloses Kontingent von 1M Token ist verfügbar
- Das Kontingent gilt nur in der Region Singapur und 90 Tage
- Thinking-Token zählen als Ausgabe-Token
-
xhighist die Standard-Reasoning-Stufe
Qwen3.7-Max bleibt trotz Nachfolger relevant: Sein Listenpreis liegt bei 2,5 $/7,5 $, aber eine 50%-Aktion reduziert ihn derzeit auf 1,25 $/3,75 $. Rechnen Sie deshalb vor einer Migration mit echten Prompts und nicht nur mit Listenpreisen.
Durchgerechnete Kostenbeispiele und Details zu Reasoning-Token enthält der Qwen-3.8-Preisleitfaden.
So greifen Sie auf Qwen 3.8-Max zu
Es gibt fünf Zugangswege.
1. Qwen Chat
Nutzen Sie die Consumer-App ohne API-Schlüssel. Das ist der schnellste Weg, um Modellqualität, Bildverständnis und Antwortstil mit Ihren eigenen Prompts zu prüfen.
2. Alibaba Cloud Model Studio API
- Erstellen Sie einen API-Schlüssel unter home.qwencloud.com.
- Speichern Sie ihn als Umgebungsvariable.
- Verwenden Sie die Modell-ID
qwen3.8-max. - Rufen Sie den OpenAI-kompatiblen Chat-Completions- oder Responses-Endpunkt auf.
export DASHSCOPE_API_KEY="ihr-api-schluessel"
Verfügbare regionale Basis-URLs:
Peking:
https://dashscope.aliyuncs.com/compatible-mode/v1
Singapur:
https://dashscope-intl.aliyuncs.com/compatible-mode/v1
US Virginia:
https://dashscope-us.aliyuncs.com/compatible-mode/v1
Die Model-Studio-Modellübersicht führt Qwen 3.8-Max im empfohlenen Stack.
3. Anthropic-kompatibler Endpunkt
Der Anthropic-kompatible Endpunkt lautet:
https://dashscope-intl.aliyuncs.com/apps/anthropic
Damit können Tools, die das Anthropic-Messages-Protokoll erwarten, mit wenigen Konfigurationsänderungen auf Qwen zeigen.
4. Coding-Harnesses
Alibaba veröffentlichte Konfigurationen für:
- Claude Code
- Codex
- Qoder
- Qwen Code
- OpenClaw
Für Claude Code setzen Sie unter anderem:
export ANTHROPIC_BASE_URL="https://dashscope-intl.aliyuncs.com/apps/anthropic"
export ANTHROPIC_MODEL="qwen3.8-max"
Das ist besonders relevant, weil Alibaba die meisten Coding-Benchmarks selbst im Claude Code Harness durchgeführt hat.
5. Offene Gewichte
Hugging Face und ModelScope sind als Download-Quellen angekündigt. Anfang August 2026 sind die Gewichte noch nicht verfügbar.
Für eine vollständige Einrichtung mit Python- und cURL-Beispielen lesen Sie den Qwen-3.8-API-Leitfaden.
Dual-Protokoll-API testen
Da dasselbe Modell über OpenAI- und Anthropic-kompatible Protokolle erreichbar ist, sollten Sie beide Routen mit identischen Eingaben testen.
Praktischer Ablauf:
- Speichern Sie Peking, Singapur und US Virginia als getrennte Umgebungen.
- Senden Sie denselben Prompt an den OpenAI-kompatiblen Endpunkt.
- Wiederholen Sie die Anfrage über den Anthropic-kompatiblen Endpunkt.
- Vergleichen Sie Antwortinhalt, Latenz, Tokenverbrauch und Streaming-Verhalten.
- Prüfen Sie im SSE-Stream insbesondere
reasoning_content-Deltas. - Wiederholen Sie den Test mit
xhigh,mediumundlow.
In Apidog können Sie dafür Umgebungen, Header, Requests und Tests in einem Workspace verwalten. So lassen sich auch qwen3.8-max, qwen3.7-max und kimi-k3 mit denselben Prompts A/B-testen. Laden Sie Apidog herunter, wenn Sie die Endpunkte direkt vergleichen möchten.
Wo Qwen 3.8-Max in der Produktreihe steht
Qwen 3.8-Max liegt über Qwen3.7-Max und den Plus-Modellen.
Eine praktische Auswahlhilfe:
- Qwen 3.8-Max: für maximale multimodale und agentische Fähigkeiten
- Qwen3.7-Max: als günstigeres Flaggschiff, solange die 50%-Aktion verfügbar ist
- Plus-Modelle: für Routineaufgaben mit niedrigeren Kosten
Weitere Empfehlungen nach Workload finden Sie im Leitfaden zu den besten Qwen-Modellen.
FAQ
Ist Qwen 3.8 Open Source?
Noch nicht. Alibaba hat Gewichte für Hugging Face und ModelScope ab der Veröffentlichung Anfang August 2026 für „nächste Woche“ angekündigt. Zum Zeitpunkt des Schreibens steht noch kein Download bereit. Bis dahin nutzen Sie die API oder Qwen Chat. Kostenlose Optionen erklärt der Artikel Qwen 3.8 kostenlos nutzen.
Wie viel kostet Qwen 3.8-Max?
2 $ pro Million Eingabe-Token und 6 $ pro Million Ausgabe-Token, pauschal bis zum 1M-Kontextlimit. Cache-Hits kosten 10 % des Eingabepreises. Thinking-Token werden als Ausgabe abgerechnet; bei standardmäßigem xhigh sollten Sie daher mit höheren effektiven Ausgabekosten rechnen.
Ist Qwen 3.8-Max besser als Kimi K3?
Eine direkte unabhängige Gegenüberstellung gibt es noch nicht. Auf dem Papier ist Qwen 3.8-Max kleiner als Kimi K3, unterstützt aber Bild- und Texteingaben und ist bei Ausgabe-Token günstiger. Kimi K3 hat aktuell den Vorteil bereits veröffentlichter Gewichte.
Kann ich Qwen 3.8-Max in Claude Code verwenden?
Ja. Setzen Sie ANTHROPIC_BASE_URL auf den Anthropic-kompatiblen DashScope-Endpunkt und ANTHROPIC_MODEL=qwen3.8-max. Alibaba nennt außerdem offizielle Konfigurationen für Codex, Qoder, Qwen Code und OpenClaw.
Nächste Schritte
Qwen 3.8-Max ist als API in drei Regionen allgemein verfügbar, hat veröffentlichte Preise und eine umfangreiche — allerdings vom Anbieter durchgeführte — Benchmark-Tabelle. Die offene Gewichtsversion ist angekündigt, aber Anfang August 2026 noch nicht verfügbar.
Testen Sie das Modell mit Ihrer eigenen Arbeitslast:
- Aktivieren Sie das kostenlose Kontingent.
- Testen Sie OpenAI- und Anthropic-kompatible Endpunkte.
- Vergleichen Sie
xhigh,mediumundlow. - Messen Sie Ausgabe-Token inklusive Thinking-Token.
- Führen Sie A/B-Tests gegen Qwen3.7-Max oder Kimi K3 aus.
- Prüfen Sie um den 10. August erneut, ob die Gewichte veröffentlicht wurden.
Starten Sie mit dem API-Einrichtungsleitfaden.

Top comments (0)