DEV Community

Cover image for Was ist Qwen 3.8-Max?
Emre Demir
Emre Demir

Posted on • Originally published at apidog.com

Was ist Qwen 3.8-Max?

Alibaba hat Qwen 3.8-Max Anfang August 2026 offiziell veröffentlicht. Das Mixture-of-Experts-Modell (MoE) umfasst 2,4 Billionen Parameter, aktiviert pro Token jedoch nur 95 Milliarden. Über ein Kontextfenster von bis zu 1 Million Token kostet die API pauschal 2 $ pro Million Eingabe-Token und 6 $ pro Million Ausgabe-Token. Alibaba hat außerdem angekündigt, die Gewichte innerhalb einer Woche auf Hugging Face und ModelScope bereitzustellen — erstmals für ein Qwen-Modell der Max-Klasse.

Probieren Sie Apidog noch heute aus

Die offizielle Ankündigung beschreibt Qwen 3.8-Max als bisher leistungsfähigstes Qwen-Modell. Dieser Beitrag zeigt, wie Sie das Modell einordnen, per API ansprechen, beide unterstützten Protokolle testen und die Kosten für Ihren Workload realistisch abschätzen. Die API unterstützt OpenAI- und Anthropic-kompatible Endpunkte. Ein Client wie Apidog hilft dabei, beide Varianten mit demselben Schlüssel zu testen.

Qwen 3.8-Max auf einen Blick

Spezifikation Qwen 3.8-Max
Entwickler Alibaba (Qwen Team)
Veröffentlichung Anfang August 2026 (GA in Model Studio, 3. August)
Architektur MoE, basierend auf der Qwen-3.5-Grundlage
Gesamtparameter 2,4T
Aktive Parameter 95B (~4 % Aktivierung)
Kontextfenster 1.000.000 Token
Maximale Ausgabe 65.536 Token
Modalitäten Text- und Bildeingabe, Textausgabe
Reasoning-Kontrollen reasoning_effort: xhigh (Standard), medium, low
API-Modell-ID qwen3.8-max
Preise 2 $ Eingabe / 6 $ Ausgabe pro 1M Token, pauschal über den gesamten Kontext
Offene Gewichte Für etwa 10. August versprochen; Anfang August 2026 noch nicht verfügbar
API-Protokolle OpenAI-kompatibel und Anthropic-kompatibel

Die Angaben stammen aus Alibabas Veröffentlichungsmaterialien und der Model-Studio-Preisseite.

Was Qwen 3.8-Max ist

Qwen 3.8-Max ist Alibabas neues Qwen-Flaggschiff und ersetzt Qwen3.7-Max an der Spitze der Reihe. Laut Hersteller steigen unter anderem die Werte auf Terminal Bench 2.1 von 74,5 auf 86,6 und auf PaperBench von 64,8 auf 93,0.

Wenn Sie bereits Qwen3.7-Max verwenden, vergleichen Sie vor einem Wechsel insbesondere Qualität, Antwortlänge, Reasoning-Kosten und Latenz. Eine direkte Übersicht bietet der Vergleich Qwen 3.8 vs. Qwen 3.7 Max.

Qwen 3.8-Max Benchmark- und Modellübersicht

Die zentrale Architekturentscheidung ist die MoE-Aufteilung:

  • 2,4 Billionen Gesamtparameter
  • 95 Milliarden aktive Parameter pro Forward Pass
  • etwa 4 % Aktivierung

Dadurch kann Alibaba ein sehr großes Modell zu 2 $/6 $ pro Million Token anbieten. Zum Vergleich: Kimi K3 hat 2,8T Gesamtparameter und 104B aktive Parameter. Qwen 3.8-Max ist damit in beiden Kennzahlen kleiner.

Eingaben und Reasoning konfigurieren

Die veröffentlichte API-Konfiguration nennt Text und Bilder als Eingabemodalitäten. Alibaba demonstriert im Blog zusätzlich Langdokument-Verständnis für PDFs mit mehr als 200 Seiten sowie Videofähigkeiten über sogenannte Memory Graphs. Behandeln Sie diese Beispiele als demonstrierte Fähigkeiten, nicht als zusätzliche dokumentierte API-Eingabetypen.

Für die Inferenz stehen drei Reasoning-Stufen zur Verfügung:

{
  "reasoning_effort": "xhigh"
}
Enter fullscreen mode Exit fullscreen mode

Mögliche Werte:

  • xhigh — Standard, höchste Reasoning-Intensität
  • medium — Kompromiss zwischen Kosten und Tiefe
  • low — für schnellere oder günstigere Antworten

Zusätzlich gibt es enable_thinking und preserve_thinking. Denken wird standardmäßig beibehalten. Wichtig für die Kostenplanung: Thinking-Token werden als Ausgabe-Token abgerechnet. Der Listenpreis bleibt zwar identisch, aber xhigh kann die tatsächliche Zahl der Ausgabe-Token deutlich erhöhen.

Das erste Qwen-Modell der Max-Klasse mit offenen Gewichten

Alibaba hat bereits viele Qwen-Modelle veröffentlicht, aber bislang kein Max-Modell mit offenen Gewichten. Für Qwen 3.8-Max wurden Gewichte für Hugging Face und ModelScope „nächste Woche“ angekündigt, ungefähr zum 10. August.

Berücksichtigen Sie dabei zwei Einschränkungen:

  1. Die Gewichte sind Anfang August 2026 noch nicht verfügbar.

    Die Veröffentlichung ist angekündigt, aber noch nicht erfolgt. Kimi K3 zeigt einen möglichen Präzedenzfall: Seine Gewichte erschienen 11 Tage nach dem Start.

  2. Selbst-Hosting eines 2,4T-Modells ist ein Multi-Node-Projekt.

    Auch quantisiert ist das Modell nicht für eine normale Workstation gedacht. Für die meisten Teams bedeutet „offene Gewichte“ eher Zugang über Drittanbieter als lokales Deployment.

Wenn Sie Qwen 3.8-Max ohne Listenpreis testen möchten, prüfen Sie Qwen Chat und das kostenlose Model-Studio-Kontingent. Die verfügbaren Optionen beschreibt der Leitfaden zur kostenlosen Nutzung von Qwen 3.8.

Was die Benchmarks zeigen — einschließlich der Verluste

Alibaba vergleicht Qwen 3.8-Max mit Claude Opus 4.8, Fable 5, GPT-5.6 Sol und Qwen3.7-Max. Lesen Sie diese Ergebnisse mit zwei wichtigen Einschränkungen:

  • Die Werte stammen vom Anbieter.
  • Die meisten Coding-Benchmarks wurden mit dem Claude Code Harness ausgeführt.
  • Mehrere Benchmarks, darunter QwenSWEBench, QwenQoderBench, CoWorkBench und RecreationBench, sind interne Alibaba-Benchmarks.
  • Zum Zeitpunkt der Veröffentlichung gibt es keine unabhängigen Zahlen von Quellen wie Artificial Analysis.

Starke Ergebnisse laut Alibaba

  • PaperBench: 93,0 — vor GPT-5.6 Sol (90,5), Fable 5 (88,8) und Opus 4.8 (80,3)
  • IFBench: 82,8 — vor Sol (72,7)
  • Terminal Bench 2.1: 86,6 — vor Opus 4.8 und Fable 5 (je 84,6), hinter Sol (88,8)
  • Multimodale Aufgaben — MathVision 95,2, LogicVista 91,9, OSWorld-Verified 86,1 sowie starke OCR-Ergebnisse

Schwächere Ergebnisse laut Alibaba

  • SWE-bench Pro: 67,7 — hinter Fable 5 (80,0) und Opus 4.8 (69,2), aber vor Sol (64,6)
  • HLE: 43,6 — hinter Fable 5 (53,3), Sol (47,2) und Opus 4.8 (45,7)

Praktisch eingeordnet: Qwen 3.8-Max wirkt laut Herstellertabelle besonders stark bei multimodalen Aufgaben, Dokumentenintelligenz und mehreren agentischen Benchmarks. Für zentrale Software-Engineering-Aufgaben liegt Fable 5 in dieser Tabelle jedoch vorn.

Bei GPQA Diamond erreicht Qwen 3.8-Max 92,6: gleichauf mit Fable 5 und knapp hinter Sol mit 94,1. Eine detailliertere Einordnung der Messmethoden finden Sie in der Qwen-3.8-Benchmarks-Analyse.

Alibaba veröffentlichte außerdem Showcase-Läufe, darunter:

  • eine 16-tägige autonome Coding-Session in einem öffentlichen Repository,
  • 265 Commits und 127 Pull Requests,
  • eine Paper-Reproduktion mit einem Ergebnis über dem AIME24-Wert des Originalpapiers,
  • eine Tianchi-Wettbewerbsteilnahme, die laut Anbieter 458 von 526 menschlichen Teams innerhalb von 24 Stunden übertraf.

Diese Demos sind Fähigkeitsindikatoren, aber keine kontrollierten unabhängigen Bewertungen. Für die Coding-Perspektive inklusive Harness-Konfigurationen siehe Qwen 3.8 für Kodierung.

Vergleich mit Kimi K3, Fable 5 und GPT-5.6 Sol

Gegen Kimi K3

Kimi K3 und Qwen 3.8-Max sind die naheliegenden Konkurrenten: zwei große MoE-Modelle chinesischer Labs, deren Veröffentlichungen nur wenige Wochen auseinanderliegen.

Merkmal Qwen 3.8-Max Kimi K3
Gesamtparameter 2,4T 2,8T
Aktive Parameter 95B 104B
Modalitäten Text und Bild Text
Eingabepreis 2 $ / 1M Token 3 $ / 1M Token
Ausgabepreis 6 $ / 1M Token 15 $ / 1M Token
Gewichte angekündigt bereits verfügbar

Eine direkte, unabhängige Gegenüberstellung liegt noch nicht vor. Beide Anbieter verwenden eigene Tabellen. Einen Vergleich Zeile für Zeile finden Sie unter Qwen 3.8 vs. Kimi K3. Für den Einstieg in Moonshots Modell lesen Sie Was ist Kimi K3?.

Gegen Fable 5

Fable 5 bleibt laut Alibabas eigener Tabelle bei Coding die Referenz:

  • SWE-bench Pro: 80,0 für Fable 5 gegenüber 67,7 für Qwen 3.8-Max
  • HLE: 53,3 für Fable 5 gegenüber 43,6 für Qwen 3.8-Max

Qwen bietet dafür einen niedrigeren Preis, ein 1M-Kontextfenster, angekündigte offene Gewichte und stärkere multimodale Werte.

Gegen GPT-5.6 Sol

GPT-5.6 Sol liegt laut Tabelle bei Terminal Bench, GPQA und HLE vorne:

  • Terminal Bench: 88,8 vs. 86,6
  • GPQA: 94,1 vs. 92,6
  • HLE: 47,2 vs. 43,6

Qwen 3.8-Max führt dagegen bei:

  • PaperBench: 93,0 vs. 90,5
  • IFBench: 82,8 vs. 72,7

Beim Preis liegt Qwen mit 2 $/6 $ unter GPT-5.6 Terra mit 2 $/12 $ für Ausgabe-Token. Ein weiterer Preisanker: Claude Opus 5 kostet 5 $/25 $.

Preise: 2 $/6 $ über bis zu 1M Token

Die Preisformel ist einfach:

Kosten = (Eingabe-Token / 1.000.000 × 2 $)
       + (Ausgabe-Token / 1.000.000 × 6 $)
Enter fullscreen mode Exit fullscreen mode

Die Besonderheit: Der Preis bleibt bis zur 1M-Kontextgrenze pauschal. Viele Langkontextmodelle erhöhen die Preise für längere Prompts; Qwen 3.8-Max tut das laut Preisangaben nicht.

Weitere Punkte für Ihre Kostenrechnung:

  • Cache-Hits kosten 10 % des Eingabepreises
  • Explizite Cache-Erstellung kostet 125 %
  • Ein kostenloses Kontingent von 1M Token ist verfügbar
  • Das Kontingent gilt nur in der Region Singapur und 90 Tage
  • Thinking-Token zählen als Ausgabe-Token
  • xhigh ist die Standard-Reasoning-Stufe

Qwen3.7-Max bleibt trotz Nachfolger relevant: Sein Listenpreis liegt bei 2,5 $/7,5 $, aber eine 50%-Aktion reduziert ihn derzeit auf 1,25 $/3,75 $. Rechnen Sie deshalb vor einer Migration mit echten Prompts und nicht nur mit Listenpreisen.

Durchgerechnete Kostenbeispiele und Details zu Reasoning-Token enthält der Qwen-3.8-Preisleitfaden.

So greifen Sie auf Qwen 3.8-Max zu

Es gibt fünf Zugangswege.

1. Qwen Chat

Nutzen Sie die Consumer-App ohne API-Schlüssel. Das ist der schnellste Weg, um Modellqualität, Bildverständnis und Antwortstil mit Ihren eigenen Prompts zu prüfen.

2. Alibaba Cloud Model Studio API

  1. Erstellen Sie einen API-Schlüssel unter home.qwencloud.com.
  2. Speichern Sie ihn als Umgebungsvariable.
  3. Verwenden Sie die Modell-ID qwen3.8-max.
  4. Rufen Sie den OpenAI-kompatiblen Chat-Completions- oder Responses-Endpunkt auf.
export DASHSCOPE_API_KEY="ihr-api-schluessel"
Enter fullscreen mode Exit fullscreen mode

Verfügbare regionale Basis-URLs:

Peking:
https://dashscope.aliyuncs.com/compatible-mode/v1

Singapur:
https://dashscope-intl.aliyuncs.com/compatible-mode/v1

US Virginia:
https://dashscope-us.aliyuncs.com/compatible-mode/v1
Enter fullscreen mode Exit fullscreen mode

Die Model-Studio-Modellübersicht führt Qwen 3.8-Max im empfohlenen Stack.

3. Anthropic-kompatibler Endpunkt

Der Anthropic-kompatible Endpunkt lautet:

https://dashscope-intl.aliyuncs.com/apps/anthropic
Enter fullscreen mode Exit fullscreen mode

Damit können Tools, die das Anthropic-Messages-Protokoll erwarten, mit wenigen Konfigurationsänderungen auf Qwen zeigen.

4. Coding-Harnesses

Alibaba veröffentlichte Konfigurationen für:

  • Claude Code
  • Codex
  • Qoder
  • Qwen Code
  • OpenClaw

Für Claude Code setzen Sie unter anderem:

export ANTHROPIC_BASE_URL="https://dashscope-intl.aliyuncs.com/apps/anthropic"
export ANTHROPIC_MODEL="qwen3.8-max"
Enter fullscreen mode Exit fullscreen mode

Das ist besonders relevant, weil Alibaba die meisten Coding-Benchmarks selbst im Claude Code Harness durchgeführt hat.

5. Offene Gewichte

Hugging Face und ModelScope sind als Download-Quellen angekündigt. Anfang August 2026 sind die Gewichte noch nicht verfügbar.

Für eine vollständige Einrichtung mit Python- und cURL-Beispielen lesen Sie den Qwen-3.8-API-Leitfaden.

Dual-Protokoll-API testen

Da dasselbe Modell über OpenAI- und Anthropic-kompatible Protokolle erreichbar ist, sollten Sie beide Routen mit identischen Eingaben testen.

Praktischer Ablauf:

  1. Speichern Sie Peking, Singapur und US Virginia als getrennte Umgebungen.
  2. Senden Sie denselben Prompt an den OpenAI-kompatiblen Endpunkt.
  3. Wiederholen Sie die Anfrage über den Anthropic-kompatiblen Endpunkt.
  4. Vergleichen Sie Antwortinhalt, Latenz, Tokenverbrauch und Streaming-Verhalten.
  5. Prüfen Sie im SSE-Stream insbesondere reasoning_content-Deltas.
  6. Wiederholen Sie den Test mit xhigh, medium und low.

In Apidog können Sie dafür Umgebungen, Header, Requests und Tests in einem Workspace verwalten. So lassen sich auch qwen3.8-max, qwen3.7-max und kimi-k3 mit denselben Prompts A/B-testen. Laden Sie Apidog herunter, wenn Sie die Endpunkte direkt vergleichen möchten.

Wo Qwen 3.8-Max in der Produktreihe steht

Qwen 3.8-Max liegt über Qwen3.7-Max und den Plus-Modellen.

Eine praktische Auswahlhilfe:

  • Qwen 3.8-Max: für maximale multimodale und agentische Fähigkeiten
  • Qwen3.7-Max: als günstigeres Flaggschiff, solange die 50%-Aktion verfügbar ist
  • Plus-Modelle: für Routineaufgaben mit niedrigeren Kosten

Weitere Empfehlungen nach Workload finden Sie im Leitfaden zu den besten Qwen-Modellen.

FAQ

Ist Qwen 3.8 Open Source?

Noch nicht. Alibaba hat Gewichte für Hugging Face und ModelScope ab der Veröffentlichung Anfang August 2026 für „nächste Woche“ angekündigt. Zum Zeitpunkt des Schreibens steht noch kein Download bereit. Bis dahin nutzen Sie die API oder Qwen Chat. Kostenlose Optionen erklärt der Artikel Qwen 3.8 kostenlos nutzen.

Wie viel kostet Qwen 3.8-Max?

2 $ pro Million Eingabe-Token und 6 $ pro Million Ausgabe-Token, pauschal bis zum 1M-Kontextlimit. Cache-Hits kosten 10 % des Eingabepreises. Thinking-Token werden als Ausgabe abgerechnet; bei standardmäßigem xhigh sollten Sie daher mit höheren effektiven Ausgabekosten rechnen.

Ist Qwen 3.8-Max besser als Kimi K3?

Eine direkte unabhängige Gegenüberstellung gibt es noch nicht. Auf dem Papier ist Qwen 3.8-Max kleiner als Kimi K3, unterstützt aber Bild- und Texteingaben und ist bei Ausgabe-Token günstiger. Kimi K3 hat aktuell den Vorteil bereits veröffentlichter Gewichte.

Kann ich Qwen 3.8-Max in Claude Code verwenden?

Ja. Setzen Sie ANTHROPIC_BASE_URL auf den Anthropic-kompatiblen DashScope-Endpunkt und ANTHROPIC_MODEL=qwen3.8-max. Alibaba nennt außerdem offizielle Konfigurationen für Codex, Qoder, Qwen Code und OpenClaw.

Nächste Schritte

Qwen 3.8-Max ist als API in drei Regionen allgemein verfügbar, hat veröffentlichte Preise und eine umfangreiche — allerdings vom Anbieter durchgeführte — Benchmark-Tabelle. Die offene Gewichtsversion ist angekündigt, aber Anfang August 2026 noch nicht verfügbar.

Testen Sie das Modell mit Ihrer eigenen Arbeitslast:

  1. Aktivieren Sie das kostenlose Kontingent.
  2. Testen Sie OpenAI- und Anthropic-kompatible Endpunkte.
  3. Vergleichen Sie xhigh, medium und low.
  4. Messen Sie Ausgabe-Token inklusive Thinking-Token.
  5. Führen Sie A/B-Tests gegen Qwen3.7-Max oder Kimi K3 aus.
  6. Prüfen Sie um den 10. August erneut, ob die Gewichte veröffentlicht wurden.

Starten Sie mit dem API-Einrichtungsleitfaden.

Top comments (0)