Zwei Wochen lang fehlten zu Qwen 3.8 belastbare Zahlen. Die Pressevorpremieren im Juli versprachen ein Spitzenmodell, lieferten aber keine Benchmarks. Das änderte sich am 3. August 2026: Alibabas offizieller Release-Beitrag für Qwen 3.8-Max enthält eine vollständige Vergleichstabelle gegen Claude Opus 4.8, Fable 5, GPT-5.6 Sol und Qwen3.7-Max sowie eine separate multimodale Tabelle gegen Gemini 3.1 Pro und GPT-5.6 Sol.
Apidog noch heute ausprobieren
Die Zahlen sind nützlich, wenn Sie sie richtig einordnen: Es gibt klare Stärken, erkennbare Schwächen und methodische Details, die bei einer Anbieter-Tabelle entscheidend sind. Dieser Beitrag zeigt, was die Ergebnisse aussagen, worauf Sie beim Lesen achten sollten und wie Sie Qwen 3.8-Max mit Ihren eigenen API-Requests testen. Für Parameter, Preise und Zugriff starten Sie mit unserem Qwen 3.8-Max Erklärer.
Wichtig: Alle folgenden Werte stammen aus Alibabas veröffentlichter Tabelle. Die in den Fußnoten genannten Leaderboard-Daten sind auf den 3. August 2026 datiert. Zum Zeitpunkt der Veröffentlichung dieses Beitrags lagen keine unabhängigen Evaluierungen vor.
Die Tabelle auf einen Blick
Hier sind die wichtigsten Ergebnisse für das Textmodell. Höhere Werte sind jeweils besser.
| Benchmark | Qwen 3.8-Max | Claude Opus 4.8 | Fable 5 | GPT-5.6 Sol | Qwen3.7-Max |
|---|---|---|---|---|---|
| Terminal Bench 2.1 | 86,6 | 84,6 | 84,6 | 88,8 | 74,5 |
| SWE-bench Pro | 67,7 | 69,2 | 80,0 | 64,6 | 60,6 |
| PaperBench | 93,0 | 80,3 | 88,8 | 90,5 | 64,8 |
| GPQA Diamond | 92,6 | 92,0 | 92,6 | 94,1 | 92,4 |
| IFBench | 82,8 | 62,2 | 63,5 | 72,7 | 79,1 |
| HLE (Humanity’s Last Exam) | 43,6 | 45,7 | 53,3 | 47,2 | 41,4 |
Quelle: von Alibaba erstellte Benchmark-Tabelle. Der Unterschied zwischen einer Anbieter-Behauptung und einer unabhängigen Messung ist bei der Interpretation dieser Werte wichtig.
Wo Qwen 3.8-Max gewinnt
PaperBench: stärkste Flaggschiff-Zeile
PaperBench prüft, ob ein Modell Forschungsergebnisse reproduzieren kann. Qwen 3.8-Max erreicht laut Alibaba 93,0 Punkte und liegt damit vor:
- GPT-5.6 Sol: 90,5
- Fable 5: 88,8
- Claude Opus 4.8: 80,3
Besonders auffällig ist der Sprung gegenüber Qwen3.7-Max von 64,8 auf 93,0 Punkte. Ein Zuwachs von 28 Punkten bei einem einzelnen Benchmark sollte unabhängig überprüft werden. Falls er sich bestätigt, wäre dies ein starkes Signal für Aufgaben mit längeren Forschungs-, Analyse- und Reproduktionsschritten.
IFBench: deutlicher Vorsprung bei Anweisungen
Bei IFBench erzielt Qwen 3.8-Max 82,8 Punkte. In Alibabas Tabelle folgt GPT-5.6 Sol mit 72,7, danach Fable 5 mit 63,5 und Opus 4.8 mit 62,2.
Das ist ein Vorsprung von 10 bis 20 Punkten. Da Qwen3.7-Max bereits 79,1 erreichte, könnte präzise Anweisungsbefolgung eine stabile Qwen-Stärke sein und nicht nur ein Effekt dieser Modellgeneration.
Für die Praxis sollten Sie das mit Prompts testen, die mehrere harte Anforderungen kombinieren, etwa:
Gib ausschließlich valides JSON zurück.
Verwende genau diese Felder: title, severity, summary.
summary darf höchstens 120 Zeichen lang sein.
Wenn Informationen fehlen, setze severity auf "unknown".
Messen Sie nicht nur, ob die Antwort plausibel klingt, sondern ob alle Anforderungen gleichzeitig erfüllt werden.
Terminal Bench 2.1: vor Claude, hinter GPT-5.6 Sol
Bei Alibabas Durchführung von Terminal Bench 2.1 erreicht Qwen 3.8-Max 86,6 Punkte:
- GPT-5.6 Sol: 88,8
- Qwen 3.8-Max: 86,6
- Claude Opus 4.8: 84,6
- Fable 5: 84,6
Das ist kein Gesamtsieg, aber ein zweiter Platz und ein Vorsprung von zwei Punkten gegenüber Opus 4.8. Für Teams, die terminalgesteuerte Agenten evaluieren, ist das interessant — allerdings nur, wenn das verwendete Agent-Harness und die Tool-Definitionen mit dem eigenen Setup vergleichbar sind.
Multimodal: visuelles Schlussfolgern und Dokumente
In der separaten multimodalen Tabelle ist Qwen 3.8-Max laut Alibaba besonders stark:
- MathVision: 95,2
- LogicVista: 91,9
- OSWorld-Verified: 86,1
- Führende Werte in fast allen OCR-Zeilen der Tabelle
Claude Opus 4.8 und Fable 5 treten in diesem Vergleich nicht direkt in den multimodalen Zeilen an. Gegen Gemini 3.1 Pro und GPT-5.6 Sol sind visuelles Schlussfolgern und Dokumentenintelligenz deshalb die klarsten Differenzierungsmerkmale.
Im Vergleich zu einer weiteren großen Open-Weight-Veröffentlichung des Sommers ist der Unterschied besonders deutlich: Kimi K3 ist rein textbasiert. Details dazu finden Sie in unserem Vergleich von Qwen 3.8 und Kimi K3.
Wo Qwen 3.8-Max verliert
Alibaba hat auch schwächere Werte veröffentlicht. Diese Zeilen sind für eine technische Entscheidung genauso relevant wie die Bestwerte.
HLE: 43,6, deutlich hinter Fable 5
Beim breit angelegten Wissensbenchmark Humanity’s Last Exam erreicht Qwen 3.8-Max 43,6 Punkte:
- Fable 5: 53,3
- GPT-5.6 Sol: 47,2
- Claude Opus 4.8: 45,7
- Qwen 3.8-Max: 43,6
Qwen 3.8-Max liegt damit unter den vier Flaggschiffen auf dem letzten Platz und fast zehn Punkte hinter Fable 5. Gegenüber Qwen3.7-Max mit 41,4 ist die Verbesserung gering.
Wenn Ihre Anwendung breite Fachfragen, komplexe Wissensabfragen oder domänenübergreifende Argumentation priorisiert, sollten Sie diesen Bereich mit eigenen Testfällen gewichten.
SWE-bench Pro: 67,7 gegenüber 80,0 für Fable 5
Bei SWE-bench Pro liegt Qwen 3.8-Max mit 67,7 im Mittelfeld:
- Fable 5: 80,0
- Claude Opus 4.8: 69,2
- Qwen 3.8-Max: 67,7
- GPT-5.6 Sol: 64,6
- Qwen3.7-Max: 60,6
Der Fortschritt gegenüber Qwen3.7-Max ist real. Gleichzeitig bleiben zwei Aussagen wahr:
- Qwen 3.8-Max schlägt Opus 4.8 bei Terminal Bench 2.1.
- Qwen 3.8-Max liegt bei SWE-bench Pro deutlich hinter Fable 5.
Für Coding-Agenten sollten Sie deshalb nicht einen einzelnen Benchmark als Kaufentscheidung verwenden. Testen Sie echte Issues aus Ihren Repositories: fehlende Tests, fehlerhafte Validierungen, API-Migrationen und mehrdateiige Refactorings.
DeepSWE und tiefere Software-Engineering-Aufgaben
DeepSWE ist eine weitere Zeile, in der Qwen 3.8-Max laut Alibabas Tabelle nicht an der Spitze liegt. Das Muster ist konsistent:
- wettbewerbsfähig bei terminalgesteuerten Agent-Aufgaben,
- schwächer bei besonders tiefen Software-Engineering-Evaluierungen.
Die praktische Einordnung: Für Tool-Use, Shell-orientierte Workflows und klar abgegrenzte Coding-Aufgaben kann Qwen 3.8-Max interessant sein. Bei umfangreichen Repository-Aufgaben sollten Sie die Qualität gegen Ihre aktuelle Baseline testen.
Was das Kleingedruckte verändert
Eine Benchmark-Tabelle ist keine neutrale Messung. Diese vier Details aus Alibabas Veröffentlichung sollten Ihre Interpretation beeinflussen.
1. Jede Zahl stammt vom Anbieter
Alibaba evaluierte sowohl das eigene Modell als auch Konkurrenzmodelle. Das ist bei Launch-Tabellen üblich, aber relevant: Anbieter entscheiden über Benchmark-Versionen, Prompts, Sampling-Einstellungen, Wiederholungen und Auswertungsregeln.
Das bedeutet nicht automatisch, dass die Daten falsch sind. Es bedeutet, dass sie eine Anbieter-Behauptung darstellen, bis unabhängige Läufe sie bestätigen.
2. Die meisten Coding-Benchmarks nutzten Claude Code als Harness
Alibaba führte die meisten Coding-Benchmarks mit Claude Code aus, also mit Anthropics Agent-Harness. Qwen 3.8-Max wurde dabei über eine Anthropic-kompatible API angesprochen.
Das hat zwei Konsequenzen:
- Alle Modelle werden in einem einheitlichen, verbreiteten Tool ausgeführt.
- Die Ergebnisse sind spezifisch für Qwen innerhalb des Claude-Code-Harnesses.
Bei agentenbasierten Benchmarks kann das Harness Ergebnisse um mehrere Punkte verändern. Wenn Sie Qwen über ein anderes SDK, eigene Tool-Schemas oder einen anderen Agent-Loop betreiben, sind die veröffentlichten Werte nicht automatisch auf Ihr Setup übertragbar.
3. Mehrere Benchmarks stammen vom Qwen-Team
QwenSWEBench, QwenQoderBench, CoWorkBench und RecreationBench wurden vom Qwen-Team entwickelt.
Interne Benchmarks können wertvoll sein, insbesondere wenn sie reale Fähigkeiten abbilden, die öffentliche Tests nicht erfassen. Sie sind aber anders zu bewerten als etablierte öffentliche Benchmarks wie SWE-bench Pro. Prüfen Sie daher bei jeder zitierten Kennzahl, ob sie aus einer unabhängigen oder herstellerinternen Evaluierung stammt.
4. Die Fußnote zu Fable 5
Alibabas Tabelle enthält die Fußnote: „Fable5-Ergebnisse können Fallbacks beinhalten.“
Damit ist ausdrücklich markiert, dass mindestens eine Konkurrenzspalte möglicherweise nicht ausschließlich das erwartete Modell abbildet. Unabhängig von der technischen Ursache erschwert das einen sauberen Vergleich.
Diese Einschränkungen sind nicht Alibaba-spezifisch. Anthropic, OpenAI und Google veröffentlichen ebenfalls selbst erstellte Vergleichstabellen mit eigenen methodischen Entscheidungen. Dasselbe Muster zeigte sich auch in unserer Kimi-K3-Benchmarks-Aufschlüsselung.
Checkliste für die nächste Anbieter-Tabelle
Solange keine unabhängigen Ergebnisse vorliegen, verwenden Sie diese Checkliste:
Wer hat die Evaluierung durchgeführt?
Selbst gemeldete Werte für Konkurrenzmodelle benötigen besonders genaue Prüfung.Welches Harness und welche Einstellungen wurden verwendet?
Bei Agent-Benchmarks beeinflussen Harness, Tools, Prompts und Wiederholungsregeln die Ergebnisse direkt.Welche Benchmarks hat der Anbieter selbst entwickelt?
Interne Evaluierungen messen Fähigkeiten, sind aber nicht direkt mit öffentlichen Benchmarks gleichzusetzen.Lesen Sie die Fußnoten.
Hinweise wie „kann Fallbacks beinhalten“ können die Vergleichbarkeit erheblich einschränken.Prüfen Sie, was fehlt.
Nicht veröffentlichte Zeilen können genauso aussagekräftig sein wie veröffentlichte. Vergleichen Sie etwa mit der letzten Modellgeneration bei verschiedenen Anbietern, um verschwundene Benchmarks zu erkennen.Warten Sie auf eine zweite Quelle.
Unabhängige Leaderboards und Community-Evaluierungen liefern meist innerhalb weniger Tage zusätzliche Daten.
Führen Sie Ihre eigene Evaluierung durch
Die beste Alternative zu generischen Benchmark-Tabellen ist ein Test mit Ihren echten Prompts, Tool-Aufrufen und Qualitätskriterien.
Qwen 3.8-Max ist über Alibaba Cloud Model Studio verfügbar. Die Modell-ID lautet qwen3.8-max und ist auf der offiziellen Modellseite gelistet. Es gibt sowohl eine OpenAI-kompatible als auch eine Anthropic-kompatible API.
Praktisches Setup
Erstellen Sie zwei identische Requests:
- Einen Request an Qwen 3.8-Max.
- Einen Request an Ihr aktuelles Basismodell, etwa Qwen3.7-Max, Kimi K3, Claude oder GPT.
Verwenden Sie dann 20 bis 30 reale Produktions-Prompts. Bewerten Sie nicht nur den Text, sondern konkrete Bedingungen:
- Ist die Antwort valides JSON?
- Sind alle Pflichtfelder vorhanden?
- Werden Formatvorgaben eingehalten?
- Werden Tool-Argumente korrekt erzeugt?
- Bleibt die Latenz unter Ihrem Grenzwert?
- Bleiben Token-Kosten im geplanten Budget?
Ein Beispiel für Assertions bei einer JSON-Antwort:
{
"status": "open",
"priority": "high",
"summary": "Fehler beim Validieren einer E-Mail-Adresse"
}
Prüfen Sie etwa:
- HTTP-Status ist 200
- Response ist valides JSON
- $.status existiert
- $.priority ist einer von: low, medium, high
- $.summary ist nicht leer
- Antwortzeit liegt unter 3000 ms
In Apidog können Sie beide Endpunkte als Umgebungen anlegen, Requests duplizieren und Testfälle für dieselben Prompts ausführen. Die Testberichte zeigen Pass-Raten und Antwortzeiten pro Modell nebeneinander — bezogen auf Ihre Workload statt auf eine öffentliche Standardaufgabe.
Berücksichtigen Sie dabei zwei Qwen-spezifische Punkte:
- Qwen 3.8-Max nutzt standardmäßig
reasoning_effort: xhigh. Messen Sie Kosten und Latenz mit dem Reasoning-Level, das Sie später tatsächlich einsetzen. - Wenn Sie den Anthropic-kompatiblen Endpunkt nutzen, testen Sie ihn separat. Die meisten Coding-Benchmarks in Alibabas Tabelle liefen über dieses Protokoll und einen Claude-Code-Harness.
Laden Sie Apidog herunter, richten Sie beide Modelle als Umgebungen ein und vergleichen Sie sie mit denselben Inputs, Assertions und Latenzgrenzen.
Häufig gestellte Fragen
Sind die Qwen-3.8-Benchmark-Zahlen unabhängig verifiziert?
Nein. Stand 3. August 2026 stammen alle veröffentlichten Werte aus Alibabas eigener Tabelle. Artificial Analysis und Community-Leaderboards hatten Qwen 3.8-Max zum Zeitpunkt der Veröffentlichung noch nicht bewertet. Behandeln Sie die Ergebnisse daher als Anbieter-Behauptung, bis unabhängige Läufe verfügbar sind.
Was ist Qwen 3.8-Max’ bestes Benchmark-Ergebnis?
In der Flaggschiff-Tabelle ist es PaperBench mit 93,0 Punkten. Damit liegt Qwen 3.8-Max vor GPT-5.6 Sol mit 90,5, Fable 5 mit 88,8 und Opus 4.8 mit 80,3. In der multimodalen Tabelle zählen MathVision mit 95,2 sowie die OCR-Zeilen zu den stärksten Ergebnissen.
Wo verliert Qwen 3.8-Max deutlich?
Bei HLE erreicht Qwen 3.8-Max 43,6 Punkte und liegt damit hinter Fable 5 mit 53,3, GPT-5.6 Sol mit 47,2 und Opus 4.8 mit 45,7. Bei SWE-bench Pro erzielt es 67,7 gegenüber 80,0 für Fable 5. Auch bei DeepSWE liegt es laut Alibabas Tabelle zurück.
Wie viel besser ist Qwen 3.8-Max als Qwen3.7-Max?
Die veröffentlichten Generationensprünge sind groß:
- Terminal Bench 2.1: 74,5 auf 86,6
- SWE-bench Pro: 60,6 auf 67,7
- PaperBench: 64,8 auf 93,0
Ob sich das Upgrade lohnt, hängt von Ihrer Arbeitslast, Preis, Latenz und benötigter Modalität ab. Unser Vergleich von Qwen 3.8 und Qwen 3.7 hilft bei der vollständigen Entscheidung.

Top comments (0)