Der Juli 2026 brachte zwei führende Open-Weight-Frontier-Modelle aus China hervor: Moonshot AI veröffentlichte Kimi K3 am 16. Juli, Alibaba stellte Qwen 3.8-Max drei Tage später vor und machte es Anfang August allgemein verfügbar. Beide sind Mixture-of-Experts-Modelle im Billionenbereich, passen in Agent-Harnesses im Claude-Code-Stil und liegen preislich unter vielen US-Frontier-Angeboten. In der Praxis unterscheiden sie sich jedoch bei verfügbaren Gewichten, Modalität, API-Oberfläche und laufenden Kosten.
Apidog noch heute ausprobieren
Die oberflächliche Ähnlichkeit verdeckt relevante Unterschiede: Was können Sie heute herunterladen? Welche Eingaben unterstützt das Modell? Und welches kostet bei hoher Agenten-Nutzung weniger? Dieser Vergleich betrachtet den Stand vom 3. August 2026. Für die vollständigen Qwen-Spezifikationen lesen Sie zuerst den Qwen-3.8-Max-Erklärer.
Wichtig: Es gibt noch keinen unabhängigen direkten Benchmark von Qwen 3.8-Max gegen Kimi K3 unter demselben Harness. Alle Benchmark-Zahlen in diesem Artikel stammen von den jeweiligen Anbietern. Nutzen Sie sie als Indikator, nicht als endgültige Entscheidung.
Der Zeitplan: Was ist bereits verfügbar?
Bei Open-Weight-Modellen zählt nicht nur die Ankündigung, sondern der tatsächliche Download.
Kimi K3
Moonshot stellte Kimi K3 am 16. Juli 2026 vor und veröffentlichte die Gewichte elf Tage später, am 27. Juli:
- Format: MXFP4
- Download-Größe: 594 GB
- Verfügbarkeit: Hugging Face
- Status: herunterladbar, quantisierbar und selbst hostbar
Sie können K3 heute auf eigener Hardware ausführen, weiter quantisieren, inspizieren und für Forschung oder Compliance-Fälle einsetzen.
Qwen 3.8-Max
Qwen 3.8-Max wurde am 19. Juli als Vorschau angekündigt und Anfang August im Alibaba Cloud Model Studio allgemein verfügbar, laut dem offiziellen Qwen-Release-Post.
Die Gewichte wurden für Hugging Face und ModelScope für die folgende Woche angekündigt, also ungefähr den 10. August. Am 3. August 2026 sind sie noch nicht verfügbar.
Praktische Konsequenz: Wenn Selbsthosting jetzt eine harte Anforderung ist, ist Kimi K3 aktuell die einzige Option.
Parameter: Zwei MoE-Modelle im Billionenbereich
Beide Modelle verwenden eine sparse Mixture-of-Experts-Architektur. Deshalb sind Gesamtparameter und aktivierte Parameter pro Token getrennt zu betrachten.
| Spezifikation | Qwen 3.8-Max | Kimi K3 |
|---|---|---|
| Gesamtparameter | 2,4 T | 2,8 T |
| Aktive Parameter pro Token | 95 Mrd. | 104 Mrd. |
| Aktivierungsverhältnis | ca. 4 % | ca. 3,7 % |
| Architektur-Basis | Qwen 3.5 Basis, MoE | MoE |
| Open-Weight-Format | angekündigt, ca. 10. Aug. | MXFP4, 594 GB auf Hugging Face |
Qwen 3.8-Max aktiviert pro Token rund 9 Milliarden Parameter weniger. Das bedeutet nicht automatisch bessere Qualität, kann aber bei großem Durchsatz die Inferenzkosten senken.
Für Selbsthosting ist K3s 594-GB-Download die entscheidende Zahl. Mit KV-Cache für lange Kontexte liegt das klar im Multi-Node-Bereich. Auch Qwen 3.8-Max dürfte mit 2,4 T Gesamtparametern in einer ähnlichen Gewichtsklasse landen, sobald die Dateien verfügbar sind.
Empfehlung: Nutzen Sie gehostete APIs für Produktion, sofern Sie nicht explizit Self-Hosting, Compliance-Prüfbarkeit oder Forschungszugriff benötigen.
Offenheit: verfügbare Gewichte vs. Ankündigung
„Open Weight“ ist nur dann operativ relevant, wenn die Gewichte veröffentlicht wurden.
Kimi K3: heute offen
K3-Gewichte sind öffentlich verfügbar. Damit können Sie:
- das Repository und die Lizenz prüfen,
- die Gewichte herunterladen,
- eigene Quantisierungen erstellen,
- Fine-Tuning evaluieren,
- einen festen Modellstand betreiben,
- Drittanbieter-Hosting verwenden.
Qwen 3.8-Max: angekündigt offen
Qwen 3.8-Max wäre das erste Qwen-Max-Modell mit offenen Gewichten. Frühere Max-Modelle waren API-only. Solange das Repository aber nicht live ist, bleibt Qwen 3.8-Max praktisch ein API-Modell mit angekündigter Gewicht-Veröffentlichung.
Entscheidung heute: Kimi K3 gewinnt bei Offenheit. Prüfen Sie diesen Punkt erneut, sobald Alibaba die Gewichte bereitstellt.
Modalität: Qwen verarbeitet Bilder, K3 ist textbasiert
Hier ist der Unterschied eindeutig.
Qwen 3.8-Max akzeptiert Text und Bilder:
{
"input_modalities": ["text", "image"]
}
Die Bildverarbeitung ist in der API verfügbar. Alibaba demonstriert außerdem lange PDF-Dokumente und Videoverständnis in Blog-Beispielen. Diese Demos sollten Sie jedoch nicht mit offiziell dokumentierten API-Eingabetypen gleichsetzen.
Kimi K3 ist ein Textmodell. Für Screenshots, gescannte Dokumente, OCR, UI-Verständnis oder Computer-Use-Agenten benötigen Sie zusätzlich ein Vision-Modell und eine Integrationsschicht.
| Anwendungsfall | Geeigneteres Modell |
|---|---|
| Textbasierte Code-Agenten | Beide |
| Lange textbasierte Dokumente | Beide, Limits prüfen |
| Screenshot-Analyse | Qwen 3.8-Max |
| OCR und gescannte PDFs | Qwen 3.8-Max |
| UI-Agenten | Qwen 3.8-Max |
| Self-Hosting eines Textmodells | Kimi K3 |
Kontext, Ausgabe und API-Oberfläche
Qwen 3.8-Max bietet:
- 1.000.000 Tokens Kontextfenster
- 65.536 Tokens maximale Ausgabe
-
reasoning_effortmitlow,mediumundxhigh - standardmäßig aktivierte Denk-Ausgabe
Qwen ist über Alibaba Cloud Model Studio verfügbar und bietet regionale Endpunkte für Peking, Singapur und US-Virginia. Besonders praktisch: Die Plattform unterstützt sowohl OpenAI- als auch Anthropic-kompatible APIs.
Sie können Qwen beispielsweise in einem Claude-Code-kompatiblen Setup über Umgebungsvariablen konfigurieren:
export ANTHROPIC_BASE_URL="https://<dashscope-anthropic-endpoint>"
export ANTHROPIC_MODEL="qwen3.8-max"
export ANTHROPIC_API_KEY="<ihr-api-key>"
Die regionalen Endpunkte und Modelloptionen finden Sie in der Model-Studio-Modellübersicht.
Wenn Sie mehrere Regionen testen, speichern Sie die Base-URLs als getrennte Umgebungen in Apidog, statt Requests manuell umzuschreiben.
Kimi K3 unterstützt ebenfalls das Anthropic-Protokoll und passt damit in Claude-Code-artige Agent-Harnesses. Für aktuelle Endpunktdetails und Limits lesen Sie den Kimi-K3-Erklärer.
Preisgestaltung: Qwen ist besonders bei Ausgabe günstiger
Die veröffentlichten Preise pro Million Tokens:
| Tarif | Qwen 3.8-Max | Kimi K3 |
|---|---|---|
| Eingabe | 2,00 $ | 3,00 $ |
| Ausgabe | 6,00 $ | 15,00 $ |
| Cache-Hit-Eingabe | 0,20 $ | 0,30 $ |
| Staffelung | Pauschal bis 1M Kontext | Nach Moonshots Zeitplan |
Qwen 3.8-Max berechnet laut der offiziellen Model-Studio-Preisseite unabhängig von der Kontextlänge 2 $ pro Million Eingabe-Tokens und 6 $ pro Million Ausgabe-Tokens.
Zusätzlich gelten:
- Cache-Erstellung: 125 % des Eingabepreises
- Cache-Hit: 10 % des Eingabepreises
- Kostenloses Kontingent: 1 Million Tokens, nur Region Singapur, 90 Tage gültig
K3 kostet 3 $ pro Million Eingabe-Tokens und 15 $ pro Million Ausgabe-Tokens.
Kosten für Agenten realistisch schätzen
Für ausgabelastige Agenten-Loops ist Qwen auf Listenpreisbasis deutlich günstiger:
1 Mio. Ausgabe-Tokens:
- Qwen 3.8-Max: 6 $
- Kimi K3: 15 $
Das entspricht beim Ausgabe-Preis einem Faktor von 2,5.
Beachten Sie bei Qwen jedoch: reasoning_effort steht standardmäßig auf xhigh, und Denk-Tokens werden als Ausgabe abgerechnet. Eine einfache Schätzung mit sichtbaren Ein- und Ausgabe-Tokens kann Ihre realen Kosten unterschätzen.
Nutzen Sie die Qwen-3.8-Preisaufschlüsselung, um die Kosten mit Ihrem eigenen Token-Mix zu modellieren.
Benchmarks: Anbieterzahlen, kein direkter Schiedsrichter
Es gibt zwei Arten von Aussagen:
Vorhanden:
- Alibaba veröffentlichte Qwen-3.8-Max-Ergebnisse gegen Claude Opus 4.8, Fable 5, GPT-5.6 Sol und Qwen 3.7-Max.
- Moonshot veröffentlichte K3-Ergebnisse gegen eine ähnliche Frontier-Auswahl.
Nicht vorhanden:
- Keine unabhängige Evaluation von Qwen 3.8-Max und Kimi K3 unter denselben Bedingungen.
- Keine direkte Tabelle mit identischem Harness, Prompt-Set, Sampling und Tooling.
- Zum Zeitpunkt des Artikels keine Artificial-Analysis-Zahlen für Qwen 3.8-Max.
Aus Alibabas eigener Tabelle:
| Benchmark | Qwen 3.8-Max | Claude Opus 4.8 | Fable 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Terminal Bench 2.1 | 86,6 | 84,6 | 84,6 | 88,8 |
| SWE-bench Pro | 67,7 | 69,2 | 80,0 | 64,6 |
| PaperBench | 93,0 | 80,3 | 88,8 | 90,5 |
| GPQA Diamond | 92,6 | 92,0 | 92,6 | 94,1 |
| HLE | 43,6 | 45,7 | 53,3 | 47,2 |
Die Tabelle zeigt auch Einschränkungen: Qwen liegt bei SWE-bench Pro deutlich hinter Fable 5 und bei HLE hinter allen aufgeführten Modellen. Starke Qwen-Reihen sind PaperBench, Anweisungsbefolgung und multimodale Tests.
Moonshot positioniert K3 in seiner Starttabelle ebenfalls stark gegen Frontier-Modelle. Details und Einschränkungen finden Sie im Vergleich Kimi K3 vs. Claude Opus 4.8.
Fazit zu Benchmarks: Vergleichen Sie Anbieter-Tabellen nicht als direkte Rangliste. Unterschiedliche Harnesses, Prompt-Formate, Tool-Definitionen und Sampling-Parameter können Ergebnisse erheblich verändern. Weitere Details zu den Qwen-Ergebnissen enthält die Qwen-3.8-Benchmarks-Analyse.
Führen Sie Ihren eigenen Vergleich in Apidog durch
Der nützlichste Benchmark ist Ihre eigene Arbeitslast.
Beide Modelle bieten OpenAI-kompatible Chat-Completions-Endpunkte. Damit können Sie einen wiederholbaren A/B-Test einrichten.
1. Zwei Umgebungen anlegen
Legen Sie eine Umgebung für Qwen und eine für Kimi an:
Qwen-Umgebung
- base_url: DashScope-Endpunkt
- model: qwen3.8-max
- api_key: QWEN_API_KEY
Kimi-Umgebung
- base_url: Moonshot-Endpunkt
- model: <K3-Modell-ID>
- api_key: KIMI_API_KEY
2. Einen realen Prompt speichern
Testen Sie keine Rätsel oder generische Coding-Fragen. Nutzen Sie stattdessen eine echte Aufgabe aus Ihrem Produkt:
- Bugfix aus einem anonymisierten Repository
- API-Design-Aufgabe
- Migration eines Datenmodells
- Analyse eines echten Log-Auszuges
- Generierung eines Testplans
- Extraktion strukturierter Daten aus Dokumenten
3. Identische Request-Nutzlast senden
Wechseln Sie nur die Umgebung. Prompt, Temperatur, max_tokens und Tool-Definitionen bleiben gleich.
{
"model": "{{model}}",
"messages": [
{
"role": "user",
"content": "Analysiere diesen Fehler und liefere einen minimalen Patch."
}
],
"max_tokens": 4096
}
4. Assertions hinzufügen
Machen Sie aus einem subjektiven Vibe-Check einen wiederholbaren Test:
- HTTP-Status ist 200
- Antwort enthält erwartete JSON-Schlüssel
- Latenz bleibt unter dem definierten Grenzwert
- Antwort enthält erforderliche Fachbegriffe
- Ausgabe überschreitet kein Token- oder Zeichenlimit
Apidog zeigt Status, Latenz und vollständige Responses. Mit SSE-Debugging können Sie zusätzlich prüfen, wie Denk-Inhalte gestreamt werden — relevant, wenn Ihre Anwendung Reasoning-Tokens verarbeitet oder ausblendet.
Laden Sie Apidog kostenlos herunter und testen Sie zehn reale Prompts über beide Endpunkte. Das liefert für Ihre Roadmap mehr verwertbare Daten als eine Anbieter-Tabelle.
Die Scorecard
| Achse | Gewinner heute | Einschränkung |
|---|---|---|
| Gesamt-/aktive Parameter | Qwen 3.8-Max | Weniger Parameter bedeuten primär andere Bereitstellungskosten, nicht automatisch bessere Qualität |
| Offene Gewichte | Kimi K3 | Qwen-Gewichte sind für ca. 10. Aug. angekündigt |
| Modalität | Qwen 3.8-Max | Bildinput ist dokumentiert; Video- und Langdokument-Demos sind keine garantierten API-Eingabetypen |
| Kontextfenster | Qwen 3.8-Max | 1M Kontext und 65.536 maximale Ausgabe; K3-Limits separat prüfen |
| Preis | Qwen 3.8-Max | Standardmäßiges xhigh-Reasoning kann reale Ausgabekosten erhöhen |
| Benchmarks | Keine Entscheidung | Beide Tabellen sind Anbieter-getrieben |
| Harness-Ökosystem | Unentschieden | Beide bieten Anthropic-kompatible Endpunkte |
| Erfüllung der Open-Weight-Zusage | Kimi K3 | K3 lieferte Gewichte elf Tage nach Start aus; Qwen hat noch nicht geliefert |
Welches Modell wann wählen?
Wählen Sie Kimi K3, wenn:
- Sie diese Woche Gewichte auf eigener Hardware benötigen.
- Ihre Compliance-Vorgaben ein prüfbares und fixierbares Modell erfordern.
- Ihre Workload rein textbasiert ist.
- Ihre Kosten überwiegend aus gut gecachten Eingabe-Tokens bestehen.
Wählen Sie Qwen 3.8-Max, wenn:
- Ihre Anwendung Bilder, Screenshots oder Dokumente verarbeitet.
- Sie viele Ausgabe-Tokens erzeugen, etwa in Agenten-Loops oder bei Codegenerierung.
- Sie ein Kontextfenster von 1 Million Tokens benötigen.
- Sie ohne gestaffelte Kontextpreise planen möchten.
Warten Sie, wenn:
- offene Gewichte Ihr einziges Entscheidungskriterium sind,
- Sie Self-Hosting erst nach Veröffentlichung der Qwen-Gewichte evaluieren können,
- oder Sie noch keine eigenen Aufgaben über beide APIs getestet haben.
Die wesentliche Entwicklung ist nicht nur, welches Modell gewinnt: Entwickler haben innerhalb weniger Wochen zwei günstige, Harness-kompatible Frontier-Optionen erhalten. Entscheiden Sie nicht allein anhand einer Anbieter-Tabelle. Führen Sie Ihre eigenen Prompts, Agenten-Flows und Kostenmodelle gegen beide Endpunkte aus.
FAQ
Ist Kimi K3 offener als Qwen 3.8-Max?
Heute ja. K3s Gewichte sind seit dem 27. Juli 2026 als 594-GB-MXFP4-Release auf Hugging Face verfügbar. Qwen 3.8-Max hat Gewichte für ungefähr den 10. August angekündigt, sie sind aktuell aber nicht herunterladbar.
Bis Alibaba liefert, kann nur K3 tatsächlich selbst gehostet werden. Der lokale K3-Leitfaden beschreibt die Anforderungen.
Welches Modell ist besser beim Codieren?
Das lässt sich ohne unabhängigen direkten Vergleich nicht ehrlich beantworten. Beide Anbieter veröffentlichen starke Zahlen für agentisches Codieren, aber unter unterschiedlichen Bedingungen.
Führen Sie beide Modelle gegen reale Aufgaben aus Ihrem Repository aus:
- Nutzen Sie dieselben Dateien und Tool-Definitionen.
- Fixieren Sie Temperatur und Token-Limits.
- Bewerten Sie Tests, Patch-Qualität, Laufzeit und Kosten.
- Wiederholen Sie den Test nach Modellupdates.
Kann ich beide Modelle in Claude Code verwenden?
Ja. Beide Modelle bieten Anthropic-kompatible Endpunkte.
Für Qwen setzen Sie ANTHROPIC_BASE_URL auf den DashScope-Anthropic-Endpunkt und verwenden:
export ANTHROPIC_MODEL="qwen3.8-max"
Kimi K3 unterstützt dasselbe Muster über Moonshots Endpunkt. Diese gemeinsame Schnittstelle macht einen A/B-Test vergleichsweise einfach.
Welches Modell ist für typische Agenten-Workloads günstiger?
Auf Listenpreisbasis ist Qwen 3.8-Max günstiger:
- Qwen: 2 $ Eingabe / 6 $ Ausgabe pro Million Tokens
- Kimi K3: 3 $ Eingabe / 15 $ Ausgabe pro Million Tokens
Bei ausgabelastigen Agenten-Loops ist der Unterschied besonders groß. Bei stark gecachten, eingabeintensiven Workloads ist K3 durch seine Cache-Hit-Rate von 0,30 $ näher an Qwens 0,20 $.
Berücksichtigen Sie bei Qwen die Kosten für Reasoning-Tokens, bevor Sie eine finale Entscheidung treffen.
Top comments (0)