Alibaba veröffentlichte Qwen 3.8-Max Anfang August 2026. Wenn Sie bereits qwen3.7-max in Produktion einsetzen, ist ein Wechsel keine automatische Entscheidung: Das neue Modell verbessert agentische und forschungsnahe Benchmarks deutlich, unterstützt Bildeingaben, hat einen niedrigeren Listenpreis und soll offene Gewichte erhalten. Gleichzeitig macht die zeitlich begrenzte 50%-Aktion für Qwen 3.7-Max das ältere Modell aktuell günstiger.
Prüfen Sie deshalb zuerst Ihre reale Arbeitslast statt nur Benchmark-Tabellen. Für den vollständigen Überblick über das neue Modell lesen Sie die Qwen-3.8-Max-Erklärung. Hintergrund zum Vorgänger finden Sie unter Was Qwen 3.7 zu bieten hatte.
Hinweis zur Methodik: Alle Benchmark-Werte stammen aus Alibabas offiziellem Qwen-3.8-Release-Post. Beide Modelle wurden im selben Anbieter-Run evaluiert; die Deltas sind daher intern vergleichbar. Unabhängige Verifizierungen standen zum Zeitpunkt der Veröffentlichung noch aus. Viele Coding-Werte basieren auf dem Claude-Code-Harness, einige Benchmarks sind Qwen-intern.
Die Kurzfassung
| Änderung | Qwen 3.7-Max | Qwen 3.8-Max |
|---|---|---|
| Terminal Bench 2.1 | 74.5 | 86.6 |
| SWE-bench Pro | 60.6 | 67.7 |
| PaperBench | 64.8 | 93.0 |
| IFBench | 79.1 | 82.8 |
| GPQA Diamond | 92.4 | 92.6 |
| HLE | 41.4 | 43.6 |
| Listenpreis pro 1M Tokens | $2.5 In / $7.5 Out | $2 In / $6 Out |
| Aktueller Preis | $1.25 In / $3.75 Out | $2 In / $6 Out |
| Bildeingabe | Nein | Ja |
| Offengelegte Architektur | Nicht offengelegt | 2.4T gesamt, 95B aktiv, MoE |
| Offene Gewichte | Nie veröffentlicht | Für „nächste Woche“ angekündigt |
| Kontextfenster | 1M Tokens | 1M Tokens |
Benchmark-Deltas: Wo sich ein Upgrade lohnt
Die größten Fortschritte betreffen agentische Aufgaben: Das Modell plant, führt Tools aus und korrigiert Zwischenschritte.
Terminal Bench 2.1: 74.5 → 86.6
Ein Plus von 12 Punkten bei terminalgesteuerten Agentenaufgaben. In Alibabas Tabelle liegt Qwen 3.8-Max damit vor Claude Opus 4.8 und Fable 5, die jeweils 84.6 erreichen. GPT-5.6 Sol liegt mit 88.8 weiterhin vorne.SWE-bench Pro: 60.6 → 67.7
Ein Gewinn von 7 Punkten bei Software-Engineering-Aufgaben. Das ist relevant, aber kein Spitzenplatz: Fable 5 erreicht in derselben Tabelle 80.0.PaperBench: 64.8 → 93.0
Der größte Sprung: 28 Punkte bei der Reproduktion von KI-Forschungspapieren. Wenn Ihre Workflows lange technische Dokumente, Forschungsreproduktion oder mehrstufige wissenschaftliche Argumentation enthalten, ist dies das stärkste Upgrade-Argument.IFBench: 79.1 → 82.8
Die Befolgung komplexer Anweisungen verbessert sich um fast 4 Punkte. Qwen 3.7-Max war hier bereits stark; Qwen 3.8-Max baut diesen Vorsprung aus.GPQA Diamond: 92.4 → 92.6
Praktisch keine Änderung. Für wissenschaftliche Q&A auf Graduiertenniveau liefert ein Wechsel wahrscheinlich keinen messbaren Qualitätsgewinn.HLE: 41.4 → 43.6
Ein Plus von rund 2 Punkten, aber weiterhin hinter den Spitzenwerten in Alibabas Vergleichstabelle.
Das Muster ist klar: starke Gewinne bei Agenten- und Forschungsszenarien, kleinere Verbesserungen bei Instruction Following und kaum Bewegung bei bereits gesättigten Wissens-Benchmarks. Eine detailliertere Tabelle finden Sie im Qwen-3.8-Benchmarks-Breakdown.
Architektur: 2.4T Parameter, 95B aktiv
Qwen 3.8-Max ist ein Mixture-of-Experts-Modell auf Basis der Qwen-3.5-Architektur:
- 2.4 Billionen Parameter insgesamt
- 95 Milliarden aktive Parameter pro Forward-Pass
- ungefähr 4 % Aktivierungsverhältnis
- 1M Tokens Kontextfenster
Für die Kostenplanung ist vor allem die Aktivierung relevant: Die Inferenz berechnet 95B aktive Parameter, nicht alle 2.4T Parameter.
Bei Qwen 3.7-Max veröffentlichte Alibaba keine vergleichbaren Architekturwerte. Für Qwen 3.8-Max nennen sowohl die Model-Studio-Modelldokumentation als auch der Release-Post diese Größenordnungen. Das erleichtert Kapazitäts- und Kostenmodelle.
Zum Vergleich: Kimi K3 wird mit 2.8T Parametern insgesamt und 104B aktiven Parametern angegeben. Qwen 3.8-Max ist auf beiden Achsen kleiner.
Multimodal: Bildeingaben statt separatem Vision-Modell
Qwen 3.7-Max ist ein Textmodell. Qwen 3.8-Max akzeptiert Bildeingaben nativ.
Laut Alibabas multimodaler Tabelle erzielt Qwen 3.8-Max unter anderem:
- MathVision: 95.2
- LogicVista: 91.9
- OSWorld-Verified: 86.1
Praktisch können Sie damit Workflows konsolidieren, die bisher ein separates Vision-Modell benötigten:
- Screenshots analysieren
- Dokumentbilder auswerten
- UI-Automatisierung vorbereiten
- Diagramme extrahieren
- visuelle Fehlerberichte klassifizieren
Prüfen Sie vor der Implementierung die API-Dokumentation für Ihren konkreten Eingabetyp. Der Release-Post zeigt außerdem lange Dokumente und Videos, diese Demonstrationen sind jedoch nicht automatisch gleichbedeutend mit einem eigenständigen API-Eingabetyp.
Preise: Listenpreis gegen aktuelle Aktion
Qwen 3.8-Max startet mit einem einheitlichen Preis über das gesamte 1M-Kontextfenster:
| Modell | Eingabe pro 1M Tokens | Ausgabe pro 1M Tokens |
|---|---|---|
| Qwen 3.7-Max, Listenpreis | $2.50 | $7.50 |
| Qwen 3.7-Max, aktuelle Aktion | $1.25 | $3.75 |
| Qwen 3.8-Max | $2.00 | $6.00 |
Zum Listenpreis ist Qwen 3.8-Max 20 % günstiger als Qwen 3.7-Max. Aktuell ist Qwen 3.7-Max durch die 50%-Aktion jedoch 38 % günstiger als Qwen 3.8-Max.
Beachten Sie zwei Punkte:
Die Aktion kann jederzeit enden.
Alibaba bezeichnet sie als zeitlich begrenzt und veröffentlicht kein Enddatum. Planen Sie daher nicht dauerhaft mit$1.25 / $3.75.Thinking Tokens erhöhen die effektiven Kosten.
Qwen 3.8-Max verwendet standardmäßigreasoning_effort: xhigh. Thinking Tokens werden als Ausgabe abgerechnet. Setzen Sie den Parameter deshalb bewusst, bevor Sie Kosten hochrechnen.
{
"model": "qwen3.8-max",
"reasoning_effort": "medium",
"enable_thinking": true,
"messages": [
{
"role": "user",
"content": "Analysiere diese Aufgabe und liefere eine knappe Begründung."
}
]
}
Der Qwen-3.8-Preisleitfaden behandelt Cache-Ökonomie und Kosten pro Aufgabe.
Wenn Ihre Aufgaben keine Max-Klasse benötigen, bleibt qwen3.7-plus mit $0.4 / $1.6 die günstigere Option. Der Plus-vs.-Max-Vergleich zeigt, wann Plus ausreicht.
Offene Gewichte: Für die Max-Klasse erstmals angekündigt
Qwen 3.7-Max erhielt keine offenen Gewichte, und Alibaba hatte dies auch nicht angekündigt.
Für Qwen 3.8-Max verspricht Alibaba Gewichte auf Hugging Face und ModelScope „nächste Woche“, ungefähr um den 10. August 2026. Zum Zeitpunkt des Artikels, dem 3. August 2026, waren die Gewichte noch nicht verfügbar.
Behandeln Sie das als Ankündigung, nicht als ausgeliefertes Feature. Selbst quantisiert ist ein 2.4T-Modell ein Multi-Node-Self-Hosting-Projekt. Für viele Teams dürften die praktischen Folgen daher eher so aussehen:
- Zugriff über Drittanbieter-Hosting
- mehr Auswahl bei Inferenzanbietern
- zusätzlicher Preisdruck
- bessere Optionen für Beschaffungs- und Compliance-Anforderungen
Wenn offene Gewichte ein hartes Kriterium sind, kann dies allein die Entscheidung zwischen 3.7 und 3.8 bestimmen.
Was sich nicht geändert hat
Kontextfenster: weiterhin 1M Tokens
Beide Modelle bieten ein Kontextfenster von 1M Tokens. Ein Wechsel bringt keine Erweiterung, aber Qwen 3.8-Max berechnet diesen Kontext zum einheitlichen Preis.
Zugriffspfad: Modell-ID austauschen
Beide Modelle werden über Alibaba Cloud Model Studio mit OpenAI-kompatiblen Endpunkten bereitgestellt. Für die grundlegende Migration ersetzen Sie nur die Modell-ID:
- "model": "qwen3.7-max"
+ "model": "qwen3.8-max"
Qwen 3.8-Max bietet zusätzlich eine Anthropic-kompatible API-Oberfläche. Das ist nützlich, wenn Ihre vorhandenen Tools bereits dieses Protokoll sprechen, beispielsweise in Apidog.
Reasoning-Kontrollen: jetzt explizit
Qwen 3.8-Max dokumentiert diese Parameter:
-
reasoning_effort:xhigh,medium,low enable_thinkingpreserve_thinking
Wenn Sie bei Qwen 3.7-Max Prompting um implizites Reasoning-Verhalten aufgebaut haben, testen Sie mit expliziten Einstellungen. Beginnen Sie für Kosten- und Latenztests mit medium und vergleichen Sie die Qualität gegen xhigh.
Upgrade-Entscheidung: Drei praktische Wege
Sofort auf Qwen 3.8-Max wechseln
Wechseln Sie jetzt, wenn Ihre Workloads überwiegend agentisch oder forschungsintensiv sind:
- Terminal-Agenten
- mehrstufige Tool-Workflows
- technische Recherche
- Reproduktion wissenschaftlicher Arbeiten
- Screenshot- und Bildanalyse
- UI-bezogene Automatisierung
Die Deltas bei Terminal Bench und PaperBench sind groß genug, um einen Produktionstest zu rechtfertigen. Sie erhalten zusätzlich Bildeingaben und langfristig den niedrigeren Listenpreis.
Qwen 3.7-Max während der Aktion weiterverwenden
Bleiben Sie vorerst bei Qwen 3.7-Max, wenn:
- Ihre Workloads hauptsächlich Q&A, Zusammenfassungen oder Chat sind
- die aktuelle Qualität Ihre Anforderungen erfüllt
- der aktuelle Preis wichtiger ist als Bildunterstützung oder Agentenleistung
- Sie keine deutliche Verbesserung bei GPQA-ähnlichen Aufgaben erwarten
Setzen Sie eine monatliche Erinnerung zur Prüfung der Aktion. Ihr realistischer Fallback ist Qwen 3.8-Max zu $2 / $6, nicht Qwen 3.7-Max zum alten Listenpreis.
Auf qwen3.7-plus herunterstufen
Nutzen Sie qwen3.7-plus, wenn Ihre Aufgaben routinemäßig und kostenkritisch sind:
- Klassifizierung
- strukturierte Extraktion
- Vorlagengenerierung
- Standard-Zusammenfassungen
- einfache Transformationen
Mit $0.4 / $1.6 ist Plus bei der Eingabe fünfmal günstiger als Qwen 3.8-Max. Für viele dieser Aufgaben ist Max-Klasse-Kapazität unnötig.
Wechsel vor der Produktion testen
Anbieter-Benchmarks ersetzen keinen Test mit Ihren Prompts, Daten und Qualitätskriterien. Führen Sie deshalb einen kontrollierten Side-by-Side-Vergleich durch.
1. Repräsentative Testfälle auswählen
Nehmen Sie nicht nur einfache Prompts. Stellen Sie ein Set zusammen, das Ihre Produktion abbildet:
- typische Anfragen
- lange Kontexte
- Fehlerfälle
- strukturierte JSON-Ausgaben
- Tool- oder Agentenschritte
- Bildinputs, falls relevant
2. Zwei Konfigurationen anlegen
Verwenden Sie dieselbe Anfrage und ändern Sie nur die Modell-ID:
{
"model": "{{qwen_model}}",
"reasoning_effort": "{{reasoning_effort}}",
"messages": [
{
"role": "user",
"content": "{{prompt}}"
}
]
}
Beispiel für zwei Umgebungen:
QWEN_37_MAX
qwen_model=qwen3.7-max
reasoning_effort=xhigh
QWEN_38_MAX
qwen_model=qwen3.8-max
reasoning_effort=medium
3. Qualität, Latenz und Token-Nutzung vergleichen
Bewerten Sie nicht nur die Antwortqualität. Protokollieren Sie mindestens:
| Metrik | Warum sie wichtig ist |
|---|---|
| Erfolgsquote | Erfüllt das Modell die Aufgabe? |
| Format-Treue | Bleibt JSON oder das gewünschte Schema gültig? |
| Latenz | Ist die Antwortzeit produktionsfähig? |
| Ausgabe-Tokens | Welche Kosten entstehen tatsächlich? |
| Fehlerrate | Wie oft braucht der Workflow Retries? |
| Agentenschritte | Werden Tools und Zwischenschritte sinnvoll genutzt? |
In Apidog können Sie eine Model-Studio-Sammlung anlegen und zwei Umgebungen verwenden, die sich nur in der Modell-ID unterscheiden. Führen Sie dieselben Requests in beiden Umgebungen aus und vergleichen Sie Antwort, Latenz und Token-Nutzung direkt.
So wird aus „Sollten wir upgraden?“ eine reproduzierbare Entscheidung auf Basis Ihres eigenen Traffics. Laden Sie Apidog kostenlos herunter, bevor Sie eine Produktionskonfiguration ändern.
FAQ
Ist Qwen 3.8-Max günstiger als Qwen 3.7-Max?
Zum Listenpreis ja: $2 / $6 gegenüber $2.5 / $7.5 pro 1M Tokens. Aktuell nein: Die zeitlich begrenzte 50%-Aktion für Qwen 3.7-Max senkt den Preis auf $1.25 / $3.75. Damit ist Qwen 3.7-Max derzeit 38 % günstiger als Qwen 3.8-Max. Details stehen im Qwen-3.8-Preisleitfaden.
Muss ich meinen Code für den Wechsel von qwen3.7-max auf qwen3.8-max ändern?
Für die Grundnutzung nicht. Beide Modelle verwenden dieselben OpenAI-kompatiblen Model-Studio-Endpunkte. Ersetzen Sie die Modell-ID und setzen Sie reasoning_effort bewusst, da Qwen 3.8-Max standardmäßig xhigh nutzt und Thinking Tokens als Ausgabe abgerechnet werden.
Für Bildeingaben benötigen Sie das Nachrichtenformat für Bildinputs; diese Funktion ist nur in Qwen 3.8-Max verfügbar.
Hat Qwen 3.7-Max offene Gewichte?
Nein. Alibaba veröffentlichte für Qwen 3.7-Max keine offenen Gewichte und kündigte dies auch nicht an. Qwen 3.8-Max ist das erste Max-Modell mit angekündigten offenen Gewichten, die ungefähr am 10. August 2026 auf Hugging Face und ModelScope erscheinen sollen. Am 3. August waren sie noch nicht verfügbar.
Ist Qwen 3.8-Max besser als Claude oder GPT?
Das hängt vom Benchmark ab und die genannten Werte stammen aus Alibabas eigener Tabelle. Qwen 3.8-Max liegt dort bei Terminal Bench 2.1 vor Opus 4.8 und Fable 5 und führt bei PaperBench sowie IFBench. Bei SWE-bench Pro liegt es mit 67.7 aber deutlich hinter Fable 5 mit 80.0. Bei HLE liegt es ebenfalls hinter den Spitzenwerten.
Warten Sie für eine endgültige Bewertung auf unabhängige Drittanbieter-Evaluierungen und testen Sie die Modelle mit Ihrer eigenen Arbeitslast.

Top comments (0)