Die meisten Modelleinführungen bewerben ihre Programmierfähigkeiten auf die gleiche Weise: Hier ist unser HumanEval-Score, hier ist ein Code-Snippet, in dem das Modell eine binäre Suche schreibt. Alibaba wählte mit Qwen 3.8-Max einen anderen Weg. Die Behauptung ist nicht „es schreibt gute Funktionen.“ Die Behauptung ist, dass es ein Softwareprojekt wochenlang eigenständig betreiben kann: Probleme öffnen, Pull-Requests zusammenführen und Funktionen bereitstellen, ohne dass ein Mensch eingreifen muss.
Das ist eine kühne Behauptung, die einer genauen Prüfung bedarf. Dieser Artikel beleuchtet die drei Code-Showcases, die Alibaba zum Start veröffentlichte (alles Anbieter-Demos, eine mit einem öffentlichen Repository, das Sie prüfen können), die dahinterliegenden Programmier-Benchmark-Zahlen und dann den Teil, den Sie heute umsetzen können: wie man tatsächlich mit qwen3.8-max in Claude Code, Codex, Qoder, Qwen Code und OpenClaw programmiert und wie man die API-Ausgabe des generierten Codes testet.
Wenn Sie neu beim Modell selbst sind, beginnen Sie mit der Übersicht über was Qwen 3.8 ist: 2,4 Billionen Gesamtparameter, 95 Milliarden aktiv, ein 1M-Token-Kontextfenster und offene Gewichte, die für die Woche nach dem Start versprochen wurden. Hier konzentrieren wir uns auf die Programmiergeschichte. Alles unten spiegelt den Stand der Dinge vom 3. August 2026 wider.
Was Alibaba tatsächlich behauptet
Die Rahmung im offiziellen Qwen-3.8-Release-Post ist Autonomie über Code-Snippets. Alibaba positioniert Qwen 3.8-Max als ein Modell, das eine langfristige Engineering-Aufgabe im Kopf behalten kann: die Arbeit planen, sie über Tage hinweg ausführen, sich von eigenen Fehlern erholen und am Ende etwas Überprüfbares liefern.
Drei Dinge machen diese Behauptung interessanter als das übliche Marketing am Starttag:
- Die Demos sind lang. Sechzehn Tage sind ein anderes Regime als ein 20-minütiger Agent-Benchmark. Fehlerbehebung, Kontextmanagement und Drift spielen in diesem Maßstab eine viel größere Rolle.
- Eine Demo ist öffentlich. Sie können das Repository durchsuchen, die Commits lesen und die Codequalität selbst beurteilen. Die meisten Anbieter-Showcases bieten das nicht.
- Das Testgerüst ist das eines Konkurrenten. Alibaba führte die meisten seiner Programmier-Benchmarks mit dem Claude-Code-Testgerüst durch und veröffentlichte eine offizielle Konfiguration, damit Sie dasselbe tun können. Mehr dazu weiter unten.
Standard-Vorbehalt, und er gilt für den gesamten Artikel: Jede hier genannte Zahl stammt aus Alibabas eigenen Startmaterialien. Es gibt noch keine unabhängige Verifizierung (Stand: Anfang August 2026). Behandeln Sie die Showcases als Demos, nicht als Prüfungen.
Die drei Coding-Showcases
oh-my-cli: 16 Tage autonome Entwicklung
Die Hauptdemo: Alibaba ließ Qwen 3.8-Max ein Kommandozeilen-Tool bauen und unbeaufsichtigt laufen. Bis zum 30. Juli lief die Entwicklung seit 16 Tagen und produzierte 265 Commits, 127 Pull-Requests und 151 Issues, die alle vom Modell selbst geöffnet, bearbeitet und geschlossen wurden.
Das Repository ist öffentlich unter qwen-code-dev-bot/oh-my-cli, was der nützlichste Teil des gesamten Showcases ist. Sie müssen der Commit-Anzahl nicht blind vertrauen. Lesen Sie PR-Beschreibungen, prüfen Sie, ob Issues echte Fehler oder nur Fleißarbeit sind, und bewerten Sie, ob der Code hält.
Achten Sie bei der Prüfung besonders auf diese Punkte:
- Beheben PRs die referenzierten Issues tatsächlich?
- Erstellt das Modell künstliche Aufgaben, nur um sie anschließend schließen zu können?
- Wie reagiert es auf eigene Regressionen?
- Bleiben Tests, Dokumentation und Implementierung konsistent?
Diese Muster sagen mehr über langfristige Zuverlässigkeit aus als eine einzelne Benchmark-Punktzahl.
Der Paper-Reproduktionslauf: Forschungscode, kein Anwendungscode
Die zweite Demo zielt auf eine schwierigere Art des Codierens ab: die Reproduktion eines Machine-Learning-Forschungspapiers von Grund auf neu. Laut Alibabas Zahlen dauerte der Lauf etwa 125 Stunden, produzierte rund 7.600 Zeilen Code und führte dabei 33 GPU-Trainingsrunden durch.
Das Ergebnis: Das Modell reproduzierte 6 der Ergebnisse des Papers und ging dann noch einen Schritt weiter. Es übertraf das gemeldete Ergebnis des Papers bei AIME24 um 2,7 Punkte.
Forschung zu reproduzieren ist eine gnadenlose Aufgabe: Umgebungen brechen zusammen, Hyperparameter verstecken sich in Fußnoten, und ein stiller Fehler kann einen Trainingslauf ungültig machen, dessen Ergebnis Sie erst Stunden später sehen. Ein Modell, das 33 Trainingsrunden durchstehen und mit übereinstimmenden Zahlen herauskommen kann, leistet mehr als Autovervollständigung.
Diese Demo passt zu Qwen 3.8-Max' stärkster Benchmark-Reihe, PaperBench.
Der Tianchi-Wettbewerb: 24 Stunden gegen menschliche Teams
Der dritte Showcase stellte das Modell in einen Live-Datenwissenschafts-Wettbewerb auf Alibabas Tianchi-Plattform mit einem Zeitlimit von 24 Stunden. Das Modell reichte in diesem Zeitfenster 45 Beiträge ein, verbesserte seinen Ansatz jedes Mal und erreichte eine Endgenauigkeit von 0,853. Damit lag es vor 458 der 526 teilnehmenden menschlichen Teams.
Bemerkenswert ist die Form dieses Ergebnisses: Das Modell hat nicht gewonnen. Es schlug 87 % des Feldes, was zugleich beeindruckend und ehrlich ist. Die Demo zeigt außerdem eine Fähigkeit, die die anderen beiden Showcases nicht abdecken: schnelle Iteration unter Zeitdruck, bei der die Bewertung jedes Beitrags den nächsten Versuch beeinflusst.
Ein weiterer Vorbehalt ist hier besonders wichtig: Tianchi ist Alibabas eigene Plattform. Die Demo ist real, aber der Anbieter kontrollierte den Veranstaltungsort.
Die Programmier-Benchmarks hinter den Demos
Alibaba veröffentlichte zum Start eine vollständige Benchmark-Tabelle. Hier sind die programmierrelevanten Zeilen. Alle Zahlen stammen aus Alibabas eigenen Läufen.
| Benchmark | Qwen 3.8-Max | Bester Rivale laut Alibabas Tabelle |
|---|---|---|
| Terminal Bench 2.1 | 86,6 | 88,8 (GPT-5.6 Sol) |
| SWE-bench Pro | 67,7 | 80,0 (Fable 5) |
| PaperBench | 93,0 | 90,5 (GPT-5.6 Sol) |
Daraus ergeben sich drei praktische Erkenntnisse:
- Terminal Bench 2.1 (86,6): Qwen 3.8-Max liegt bei terminalgestützter Agentenarbeit vor Claude Opus 4.8 und Fable 5, die in Alibabas Tabelle beide bei 84,6 liegen. Diese Zahl stützt die oh-my-cli-Demo.
- SWE-bench Pro (67,7): Hier liegt das Modell deutlich hinter Fable 5 mit 80,0. Bei Repository-Fehlerbehebung – also Aufgaben wie „Behebe diesen Bug in meiner Codebasis“ – beträgt der Abstand zum Tabellenführer mehr als 12 Punkte.
- PaperBench (93,0): Das ist die stärkste Vorzeigereihe des Modells. Sie stützt direkt die Paper-Reproduktionsdemo.
Lesen Sie außerdem das Kleingedruckte: Alibaba führte die meisten Code-Benchmarks auf dem Claude-Code-Harness aus, einschließlich der Läufe für Konkurrenzmodelle. Die Fußnoten weisen darauf hin, dass Ergebnisse von Fable 5 Fallbacks beinhalten könnten.
Die Wahl des Harnesses beeinflusst Agentic-Benchmark-Scores erheblich. Eine vom Anbieter durchgeführte Tabelle auf einem bestimmten Harness ist daher ein Datenpunkt, kein endgültiges Urteil.
Für die Praxis hat das auch eine positive Seite: Wenn Sie Claude Code bereits einsetzen, können Sie dieselbe Integrationsform verwenden, auf der Alibaba seine eigenen Messungen durchgeführt hat.
So programmieren Sie heute tatsächlich mit Qwen 3.8
Qwen 3.8-Max ist laut Alibaba GA auf Alibaba Cloud Model Studio. Alibaba veröffentlichte offizielle Konfigurationen für fünf Coding-Tools. Für alle benötigen Sie einen DashScope-API-Schlüssel von home.qwencloud.com.
Laut offizieller Model-Studio-Preisliste betragen die Preise:
- 2 $ pro Million Input-Token
- 6 $ pro Million Output-Token
- derselbe Preis über das gesamte 1M-Kontextfenster
Claude Code
Qwen 3.8-Max stellt einen Anthropic-kompatiblen API-Endpunkt bereit. Konfigurieren Sie Claude Code über drei Umgebungsvariablen:
export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=your-dashscope-api-key
export ANTHROPIC_MODEL=qwen3.8-max
Starten Sie Claude Code anschließend wie gewohnt. Anfragen werden an Qwen 3.8-Max statt an Claude weitergeleitet.
Prüfen Sie vor längeren Agentenläufen zuerst eine kleine Aufgabe:
claude "Analysiere dieses Repository und erstelle nur einen Plan für die fehlenden Tests."
So validieren Sie API-Schlüssel, Routing und Modellverhalten, bevor der Agent Dateien verändert.
Codex
Codex benötigt einen Provider-Eintrag in seiner Konfiguration:
model = "qwen3.8-max"
model_provider = "qwencloud"
[model_providers.qwencloud]
name = "QwenCloud"
base_url = "https://dashscope-intl.aliyuncs.com/compatible-mode/v1"
env_key = "DASHSCOPE_API_KEY"
context_window = 1000000
Setzen Sie danach den Schlüssel in Ihrer Umgebung:
export DASHSCOPE_API_KEY=your-dashscope-api-key
Diese Konfiguration verwendet den OpenAI-kompatiblen Endpunkt statt des Anthropic-Endpunkts. Modell und API-Schlüssel bleiben gleich, nur das Protokollformat ändert sich.
Qoder, Qwen Code und OpenClaw
Die übrigen Integrationen lassen sich kürzer einrichten:
-
Qoder CLI: Wählen Sie
qwen3.8-maxals Modell. Als Erstpartei-Integration ist die Einrichtung ein Konfigurationswert. -
Qwen Code: Setzen Sie
DASHSCOPE_API_KEYund wählen Sie das Modell aus. Wenn Sie bereits frühere Qwen-Coding-Modelle verwendet haben, ändert sich sonst nichts. -
OpenClaw: Die offizielle Konfiguration setzt die Modell-ID und
maxTokensauf65536, was der maximalen Ausgabelänge des Modells entspricht.
Verwenden Sie für die exakte, aktuelle Syntax immer die Konfigurationen aus dem Launch-Post, statt sich ausschließlich auf einen Blog-Snapshot zu verlassen.
Den Denkaufwand bewusst einstellen
Qwen 3.8-Max unterstützt den Parameter reasoning_effort mit drei Stufen:
-
xhigh– Standard mediumlow
Für Coding-Aufgaben ist diese Einstellung wichtiger als viele andere Schalter.
Verwenden Sie xhigh für agentische Arbeit:
- Multi-Datei-Refaktorierungen
- komplexe Debugging-Sitzungen
- Migrationsaufgaben
- Architekturänderungen
- Aufgaben, bei denen das Modell zuerst planen und dann iterativ bearbeiten soll
Verwenden Sie low für mechanische Änderungen:
- Umbenennungen
- einfache Dokumentationsupdates
- Docstring-Prüfungen
- Formatierungsanpassungen
- klar definierte Einzeldatei-Änderungen
Denk-Token werden als Output-Token abgerechnet. Da xhigh die Standardeinstellung ist, können lange Agentensitzungen deutlich mehr kosten als eine einfache Bearbeitung.
Wenn Qwen 3.8-Max für Ihre Aufgabe größer als nötig ist, gibt es weiterhin die Qwen3-Coder-Linie für dedizierte Coding-Aufgaben. Qwen3 Coder Flash deckt das schnelle und günstigere Ende ab. Für einen weiteren Open-Weight-Schwergewichtler können Sie vergleichen, wie Kimi K3 Coding-Aufgaben handhabt.
Testen, was das Modell baut: Der Apidog-Schritt
In autonomen Coding-Demos fehlt häufig ein entscheidender Teil: das Testen der API-Aufrufe, die der generierte Code ausführt.
Ein Agent kann 7.600 Zeilen Code schreiben, die sauber kompilieren, und trotzdem:
- den falschen Endpunkt aufrufen,
- einen
429 Too Many Requests-Fehler falsch behandeln, - fehlerhafte Request-Bodies senden,
- Authentifizierungsannahmen treffen, die in Produktion nicht gelten,
- ungewollt produktive Daten verändern.
Zwei Gewohnheiten schließen diese Lücke.
Testen Sie die Endpunkte, die Ihr generierter Code aufruft
Wenn Qwen 3.8-Max einen Dienst scaffoldet oder einen API-Client schreibt, importieren Sie die relevante Spezifikation in Apidog und testen Sie die Endpunkte direkt.
Prüfen Sie mindestens:
- Authentifizierungsflüsse
- Erfolgsantworten
- Fehlerantworten wie
400,401,403,404,409,422und429 - Edge-Case-Payloads
- Pagination, Rate Limits und Timeouts
- Verhalten bei ungültigen oder fehlenden Feldern
Es ist günstiger, eine falsche Annahme in einem API-Test zu finden als in einem Stack-Trace zwei Tage nach Beginn einer autonomen Sitzung.
Wenn Sie die Modell-API selbst bewerten möchten, beschreibt der Qwen-3.8-API-Leitfaden die Einrichtung für OpenAI- und Anthropic-Protokolle. In Apidog können Sie beide Protokollformen nebeneinander untersuchen, einschließlich Streaming-Antworten und Reasoning-Deltas.
Verwenden Sie Mock-APIs, damit Agentenläufe nicht die Produktion treffen
Je länger Agentenläufe dauern, desto wichtiger wird diese Absicherung. Eine 16-tägige autonome Sitzung mit Live-Aufrufen an Produktionssysteme ist riskant:
- Ratenbegrenzungen
- Datenmutationen
- unvorhersehbare Kosten
- versehentlich ausgelöste Workflows
- schwer nachvollziehbare Seiteneffekte
Mock-Server in Apidog liefern realistische Antworten, ohne echte Systeme zu berühren.
Praktisches Vorgehen:
- Erstellen Sie einen Mock-Server für die API-Spezifikation.
- Konfigurieren Sie den Agenten mit einer Mock-Basis-URL.
- Lassen Sie den generierten Code gegen den Mock entwickeln und testen.
- Prüfen Sie Änderungen per Pull Request.
- Tauschen Sie die Basis-URL erst nach menschlicher Freigabe gegen die reale URL aus.
Sie können Apidog kostenlos herunterladen, um einen Mock in wenigen Minuten einzurichten.
Das Muster gilt allgemein: Je mehr Autonomie Sie einem Coding-Modell geben, desto wichtiger wird die API-Schicht als Kontrollfläche. Sie können nicht jeden Commit in Echtzeit prüfen, aber Sie können kontrollieren, womit der generierte Code kommunizieren darf.
FAQs
Ist Qwen 3.8 gut zum Codieren?
Nach Alibabas eigenen Zahlen ist es stark bei agentenhafter und forschungsartiger Programmierung: Terminal Bench 2.1 mit 86,6 und PaperBench mit 93,0. Bei Repository-Fehlerbehebung liegt es mit 67,7 auf SWE-bench Pro hinter Fable 5 mit 80,0.
Alle Zahlen stammen vom Anbieter und wurden noch nicht unabhängig überprüft. Die sachliche Lesart: stark für langfristige autonome Arbeit und Forschungsreproduktion, aber nicht der Spitzenreiter bei klassischer Fehlerbehebung in bestehenden Codebasen.
Kann ich Qwen 3.8 in Claude Code verwenden?
Ja, offiziell. Setzen Sie:
-
ANTHROPIC_BASE_URLaufhttps://dashscope-intl.aliyuncs.com/apps/anthropic -
ANTHROPIC_AUTH_TOKENauf Ihren DashScope-Schlüssel -
ANTHROPIC_MODELaufqwen3.8-max
Alibaba veröffentlichte diese Konfiguration und führte die meisten eigenen Programmier-Benchmarks auf dem Claude-Code-Harness aus.
Wie viel kostet das Codieren mit Qwen 3.8?
Laut Alibaba kostet Qwen 3.8-Max 2 $ pro Million Input-Token und 6 $ pro Million Output-Token, pauschal über den 1M-Kontext.
Denk-Token werden als Output abgerechnet. Da der Standardwert für reasoning_effort auf xhigh steht, sollten Sie bei längeren Agentensitzungen höhere Kosten einplanen als der reine Input-Preis vermuten lässt.
Eine detailliertere Aufschlüsselung finden Sie in der Qwen-3.8-Benchmarks-Analyse und den dort verlinkten Preisinformationen.
War der 16-tägige oh-my-cli-Lauf wirklich autonom?
Das ist Alibabas Behauptung. Anders als bei den meisten Anbieter-Demos können Sie jedoch das Artefakt selbst prüfen: Das Repository ist öffentlich unter qwen-code-dev-bot/oh-my-cli, mit 265 Commits, 127 PRs und 151 Issues zum Stand vom 30. Juli 2026.
Ob die Codequalität die Einordnung als autonome Entwicklung rechtfertigt, müssen Sie selbst beurteilen. Lesen Sie die Commits, verfolgen Sie Issues bis zu den zugehörigen PRs und prüfen Sie, wie das Projekt mit Regressionen umgeht.



Top comments (0)