DEV Community

Cover image for Qwen 3.8 vs Kimi K3: Chinas zwei Open-Source KI-Giganten im Vergleich
Emre Demir
Emre Demir

Posted on • Originally published at apidog.com

Qwen 3.8 vs Kimi K3: Chinas zwei Open-Source KI-Giganten im Vergleich

Der Juli 2026 brachte zwei führende Open-Weight-Frontier-Modelle aus China hervor: Moonshot AI veröffentlichte Kimi K3 am 16. Juli, Alibaba stellte Qwen 3.8-Max drei Tage später vor und machte es Anfang August allgemein verfügbar. Beide sind Mixture-of-Experts-Modelle im Billionenbereich, passen in Agent-Harnesses im Claude-Code-Stil und liegen preislich unter vielen US-Frontier-Angeboten. In der Praxis unterscheiden sie sich jedoch bei verfügbaren Gewichten, Modalität, API-Oberfläche und laufenden Kosten.

Apidog noch heute ausprobieren

Die oberflächliche Ähnlichkeit verdeckt relevante Unterschiede: Was können Sie heute herunterladen? Welche Eingaben unterstützt das Modell? Und welches kostet bei hoher Agenten-Nutzung weniger? Dieser Vergleich betrachtet den Stand vom 3. August 2026. Für die vollständigen Qwen-Spezifikationen lesen Sie zuerst den Qwen-3.8-Max-Erklärer.

Wichtig: Es gibt noch keinen unabhängigen direkten Benchmark von Qwen 3.8-Max gegen Kimi K3 unter demselben Harness. Alle Benchmark-Zahlen in diesem Artikel stammen von den jeweiligen Anbietern. Nutzen Sie sie als Indikator, nicht als endgültige Entscheidung.

Der Zeitplan: Was ist bereits verfügbar?

Bei Open-Weight-Modellen zählt nicht nur die Ankündigung, sondern der tatsächliche Download.

Kimi K3

Moonshot stellte Kimi K3 am 16. Juli 2026 vor und veröffentlichte die Gewichte elf Tage später, am 27. Juli:

  • Format: MXFP4
  • Download-Größe: 594 GB
  • Verfügbarkeit: Hugging Face
  • Status: herunterladbar, quantisierbar und selbst hostbar

Sie können K3 heute auf eigener Hardware ausführen, weiter quantisieren, inspizieren und für Forschung oder Compliance-Fälle einsetzen.

Qwen 3.8-Max

Qwen 3.8-Max wurde am 19. Juli als Vorschau angekündigt und Anfang August im Alibaba Cloud Model Studio allgemein verfügbar, laut dem offiziellen Qwen-Release-Post.

Die Gewichte wurden für Hugging Face und ModelScope für die folgende Woche angekündigt, also ungefähr den 10. August. Am 3. August 2026 sind sie noch nicht verfügbar.

Praktische Konsequenz: Wenn Selbsthosting jetzt eine harte Anforderung ist, ist Kimi K3 aktuell die einzige Option.

Parameter: Zwei MoE-Modelle im Billionenbereich

Beide Modelle verwenden eine sparse Mixture-of-Experts-Architektur. Deshalb sind Gesamtparameter und aktivierte Parameter pro Token getrennt zu betrachten.

Spezifikation Qwen 3.8-Max Kimi K3
Gesamtparameter 2,4 T 2,8 T
Aktive Parameter pro Token 95 Mrd. 104 Mrd.
Aktivierungsverhältnis ca. 4 % ca. 3,7 %
Architektur-Basis Qwen 3.5 Basis, MoE MoE
Open-Weight-Format angekündigt, ca. 10. Aug. MXFP4, 594 GB auf Hugging Face

Qwen 3.8-Max aktiviert pro Token rund 9 Milliarden Parameter weniger. Das bedeutet nicht automatisch bessere Qualität, kann aber bei großem Durchsatz die Inferenzkosten senken.

Für Selbsthosting ist K3s 594-GB-Download die entscheidende Zahl. Mit KV-Cache für lange Kontexte liegt das klar im Multi-Node-Bereich. Auch Qwen 3.8-Max dürfte mit 2,4 T Gesamtparametern in einer ähnlichen Gewichtsklasse landen, sobald die Dateien verfügbar sind.

Empfehlung: Nutzen Sie gehostete APIs für Produktion, sofern Sie nicht explizit Self-Hosting, Compliance-Prüfbarkeit oder Forschungszugriff benötigen.

Offenheit: verfügbare Gewichte vs. Ankündigung

„Open Weight“ ist nur dann operativ relevant, wenn die Gewichte veröffentlicht wurden.

Kimi K3: heute offen

K3-Gewichte sind öffentlich verfügbar. Damit können Sie:

  • das Repository und die Lizenz prüfen,
  • die Gewichte herunterladen,
  • eigene Quantisierungen erstellen,
  • Fine-Tuning evaluieren,
  • einen festen Modellstand betreiben,
  • Drittanbieter-Hosting verwenden.

Qwen 3.8-Max: angekündigt offen

Qwen 3.8-Max wäre das erste Qwen-Max-Modell mit offenen Gewichten. Frühere Max-Modelle waren API-only. Solange das Repository aber nicht live ist, bleibt Qwen 3.8-Max praktisch ein API-Modell mit angekündigter Gewicht-Veröffentlichung.

Entscheidung heute: Kimi K3 gewinnt bei Offenheit. Prüfen Sie diesen Punkt erneut, sobald Alibaba die Gewichte bereitstellt.

Modalität: Qwen verarbeitet Bilder, K3 ist textbasiert

Hier ist der Unterschied eindeutig.

Qwen 3.8-Max akzeptiert Text und Bilder:

{
  "input_modalities": ["text", "image"]
}
Enter fullscreen mode Exit fullscreen mode

Die Bildverarbeitung ist in der API verfügbar. Alibaba demonstriert außerdem lange PDF-Dokumente und Videoverständnis in Blog-Beispielen. Diese Demos sollten Sie jedoch nicht mit offiziell dokumentierten API-Eingabetypen gleichsetzen.

Kimi K3 ist ein Textmodell. Für Screenshots, gescannte Dokumente, OCR, UI-Verständnis oder Computer-Use-Agenten benötigen Sie zusätzlich ein Vision-Modell und eine Integrationsschicht.

Anwendungsfall Geeigneteres Modell
Textbasierte Code-Agenten Beide
Lange textbasierte Dokumente Beide, Limits prüfen
Screenshot-Analyse Qwen 3.8-Max
OCR und gescannte PDFs Qwen 3.8-Max
UI-Agenten Qwen 3.8-Max
Self-Hosting eines Textmodells Kimi K3

Kontext, Ausgabe und API-Oberfläche

Qwen 3.8-Max bietet:

  • 1.000.000 Tokens Kontextfenster
  • 65.536 Tokens maximale Ausgabe
  • reasoning_effort mit low, medium und xhigh
  • standardmäßig aktivierte Denk-Ausgabe

Qwen ist über Alibaba Cloud Model Studio verfügbar und bietet regionale Endpunkte für Peking, Singapur und US-Virginia. Besonders praktisch: Die Plattform unterstützt sowohl OpenAI- als auch Anthropic-kompatible APIs.

Sie können Qwen beispielsweise in einem Claude-Code-kompatiblen Setup über Umgebungsvariablen konfigurieren:

export ANTHROPIC_BASE_URL="https://<dashscope-anthropic-endpoint>"
export ANTHROPIC_MODEL="qwen3.8-max"
export ANTHROPIC_API_KEY="<ihr-api-key>"
Enter fullscreen mode Exit fullscreen mode

Die regionalen Endpunkte und Modelloptionen finden Sie in der Model-Studio-Modellübersicht.

Wenn Sie mehrere Regionen testen, speichern Sie die Base-URLs als getrennte Umgebungen in Apidog, statt Requests manuell umzuschreiben.

Kimi K3 unterstützt ebenfalls das Anthropic-Protokoll und passt damit in Claude-Code-artige Agent-Harnesses. Für aktuelle Endpunktdetails und Limits lesen Sie den Kimi-K3-Erklärer.

Preisgestaltung: Qwen ist besonders bei Ausgabe günstiger

Die veröffentlichten Preise pro Million Tokens:

Tarif Qwen 3.8-Max Kimi K3
Eingabe 2,00 $ 3,00 $
Ausgabe 6,00 $ 15,00 $
Cache-Hit-Eingabe 0,20 $ 0,30 $
Staffelung Pauschal bis 1M Kontext Nach Moonshots Zeitplan

Qwen 3.8-Max berechnet laut der offiziellen Model-Studio-Preisseite unabhängig von der Kontextlänge 2 $ pro Million Eingabe-Tokens und 6 $ pro Million Ausgabe-Tokens.

Zusätzlich gelten:

  • Cache-Erstellung: 125 % des Eingabepreises
  • Cache-Hit: 10 % des Eingabepreises
  • Kostenloses Kontingent: 1 Million Tokens, nur Region Singapur, 90 Tage gültig

K3 kostet 3 $ pro Million Eingabe-Tokens und 15 $ pro Million Ausgabe-Tokens.

Kosten für Agenten realistisch schätzen

Für ausgabelastige Agenten-Loops ist Qwen auf Listenpreisbasis deutlich günstiger:

1 Mio. Ausgabe-Tokens:
- Qwen 3.8-Max: 6 $
- Kimi K3:      15 $
Enter fullscreen mode Exit fullscreen mode

Das entspricht beim Ausgabe-Preis einem Faktor von 2,5.

Beachten Sie bei Qwen jedoch: reasoning_effort steht standardmäßig auf xhigh, und Denk-Tokens werden als Ausgabe abgerechnet. Eine einfache Schätzung mit sichtbaren Ein- und Ausgabe-Tokens kann Ihre realen Kosten unterschätzen.

Nutzen Sie die Qwen-3.8-Preisaufschlüsselung, um die Kosten mit Ihrem eigenen Token-Mix zu modellieren.

Benchmarks: Anbieterzahlen, kein direkter Schiedsrichter

Es gibt zwei Arten von Aussagen:

Vorhanden:

  • Alibaba veröffentlichte Qwen-3.8-Max-Ergebnisse gegen Claude Opus 4.8, Fable 5, GPT-5.6 Sol und Qwen 3.7-Max.
  • Moonshot veröffentlichte K3-Ergebnisse gegen eine ähnliche Frontier-Auswahl.

Nicht vorhanden:

  • Keine unabhängige Evaluation von Qwen 3.8-Max und Kimi K3 unter denselben Bedingungen.
  • Keine direkte Tabelle mit identischem Harness, Prompt-Set, Sampling und Tooling.
  • Zum Zeitpunkt des Artikels keine Artificial-Analysis-Zahlen für Qwen 3.8-Max.

Aus Alibabas eigener Tabelle:

Benchmark Qwen 3.8-Max Claude Opus 4.8 Fable 5 GPT-5.6 Sol
Terminal Bench 2.1 86,6 84,6 84,6 88,8
SWE-bench Pro 67,7 69,2 80,0 64,6
PaperBench 93,0 80,3 88,8 90,5
GPQA Diamond 92,6 92,0 92,6 94,1
HLE 43,6 45,7 53,3 47,2

Die Tabelle zeigt auch Einschränkungen: Qwen liegt bei SWE-bench Pro deutlich hinter Fable 5 und bei HLE hinter allen aufgeführten Modellen. Starke Qwen-Reihen sind PaperBench, Anweisungsbefolgung und multimodale Tests.

Moonshot positioniert K3 in seiner Starttabelle ebenfalls stark gegen Frontier-Modelle. Details und Einschränkungen finden Sie im Vergleich Kimi K3 vs. Claude Opus 4.8.

Fazit zu Benchmarks: Vergleichen Sie Anbieter-Tabellen nicht als direkte Rangliste. Unterschiedliche Harnesses, Prompt-Formate, Tool-Definitionen und Sampling-Parameter können Ergebnisse erheblich verändern. Weitere Details zu den Qwen-Ergebnissen enthält die Qwen-3.8-Benchmarks-Analyse.

Führen Sie Ihren eigenen Vergleich in Apidog durch

Der nützlichste Benchmark ist Ihre eigene Arbeitslast.

Beide Modelle bieten OpenAI-kompatible Chat-Completions-Endpunkte. Damit können Sie einen wiederholbaren A/B-Test einrichten.

1. Zwei Umgebungen anlegen

Legen Sie eine Umgebung für Qwen und eine für Kimi an:

Qwen-Umgebung
- base_url: DashScope-Endpunkt
- model: qwen3.8-max
- api_key: QWEN_API_KEY

Kimi-Umgebung
- base_url: Moonshot-Endpunkt
- model: <K3-Modell-ID>
- api_key: KIMI_API_KEY
Enter fullscreen mode Exit fullscreen mode

2. Einen realen Prompt speichern

Testen Sie keine Rätsel oder generische Coding-Fragen. Nutzen Sie stattdessen eine echte Aufgabe aus Ihrem Produkt:

  • Bugfix aus einem anonymisierten Repository
  • API-Design-Aufgabe
  • Migration eines Datenmodells
  • Analyse eines echten Log-Auszuges
  • Generierung eines Testplans
  • Extraktion strukturierter Daten aus Dokumenten

3. Identische Request-Nutzlast senden

Wechseln Sie nur die Umgebung. Prompt, Temperatur, max_tokens und Tool-Definitionen bleiben gleich.

{
  "model": "{{model}}",
  "messages": [
    {
      "role": "user",
      "content": "Analysiere diesen Fehler und liefere einen minimalen Patch."
    }
  ],
  "max_tokens": 4096
}
Enter fullscreen mode Exit fullscreen mode

4. Assertions hinzufügen

Machen Sie aus einem subjektiven Vibe-Check einen wiederholbaren Test:

- HTTP-Status ist 200
- Antwort enthält erwartete JSON-Schlüssel
- Latenz bleibt unter dem definierten Grenzwert
- Antwort enthält erforderliche Fachbegriffe
- Ausgabe überschreitet kein Token- oder Zeichenlimit
Enter fullscreen mode Exit fullscreen mode

Apidog zeigt Status, Latenz und vollständige Responses. Mit SSE-Debugging können Sie zusätzlich prüfen, wie Denk-Inhalte gestreamt werden — relevant, wenn Ihre Anwendung Reasoning-Tokens verarbeitet oder ausblendet.

Laden Sie Apidog kostenlos herunter und testen Sie zehn reale Prompts über beide Endpunkte. Das liefert für Ihre Roadmap mehr verwertbare Daten als eine Anbieter-Tabelle.

Die Scorecard

Achse Gewinner heute Einschränkung
Gesamt-/aktive Parameter Qwen 3.8-Max Weniger Parameter bedeuten primär andere Bereitstellungskosten, nicht automatisch bessere Qualität
Offene Gewichte Kimi K3 Qwen-Gewichte sind für ca. 10. Aug. angekündigt
Modalität Qwen 3.8-Max Bildinput ist dokumentiert; Video- und Langdokument-Demos sind keine garantierten API-Eingabetypen
Kontextfenster Qwen 3.8-Max 1M Kontext und 65.536 maximale Ausgabe; K3-Limits separat prüfen
Preis Qwen 3.8-Max Standardmäßiges xhigh-Reasoning kann reale Ausgabekosten erhöhen
Benchmarks Keine Entscheidung Beide Tabellen sind Anbieter-getrieben
Harness-Ökosystem Unentschieden Beide bieten Anthropic-kompatible Endpunkte
Erfüllung der Open-Weight-Zusage Kimi K3 K3 lieferte Gewichte elf Tage nach Start aus; Qwen hat noch nicht geliefert

Welches Modell wann wählen?

Wählen Sie Kimi K3, wenn:

  • Sie diese Woche Gewichte auf eigener Hardware benötigen.
  • Ihre Compliance-Vorgaben ein prüfbares und fixierbares Modell erfordern.
  • Ihre Workload rein textbasiert ist.
  • Ihre Kosten überwiegend aus gut gecachten Eingabe-Tokens bestehen.

Wählen Sie Qwen 3.8-Max, wenn:

  • Ihre Anwendung Bilder, Screenshots oder Dokumente verarbeitet.
  • Sie viele Ausgabe-Tokens erzeugen, etwa in Agenten-Loops oder bei Codegenerierung.
  • Sie ein Kontextfenster von 1 Million Tokens benötigen.
  • Sie ohne gestaffelte Kontextpreise planen möchten.

Warten Sie, wenn:

  • offene Gewichte Ihr einziges Entscheidungskriterium sind,
  • Sie Self-Hosting erst nach Veröffentlichung der Qwen-Gewichte evaluieren können,
  • oder Sie noch keine eigenen Aufgaben über beide APIs getestet haben.

Die wesentliche Entwicklung ist nicht nur, welches Modell gewinnt: Entwickler haben innerhalb weniger Wochen zwei günstige, Harness-kompatible Frontier-Optionen erhalten. Entscheiden Sie nicht allein anhand einer Anbieter-Tabelle. Führen Sie Ihre eigenen Prompts, Agenten-Flows und Kostenmodelle gegen beide Endpunkte aus.

FAQ

Ist Kimi K3 offener als Qwen 3.8-Max?

Heute ja. K3s Gewichte sind seit dem 27. Juli 2026 als 594-GB-MXFP4-Release auf Hugging Face verfügbar. Qwen 3.8-Max hat Gewichte für ungefähr den 10. August angekündigt, sie sind aktuell aber nicht herunterladbar.

Bis Alibaba liefert, kann nur K3 tatsächlich selbst gehostet werden. Der lokale K3-Leitfaden beschreibt die Anforderungen.

Welches Modell ist besser beim Codieren?

Das lässt sich ohne unabhängigen direkten Vergleich nicht ehrlich beantworten. Beide Anbieter veröffentlichen starke Zahlen für agentisches Codieren, aber unter unterschiedlichen Bedingungen.

Führen Sie beide Modelle gegen reale Aufgaben aus Ihrem Repository aus:

  1. Nutzen Sie dieselben Dateien und Tool-Definitionen.
  2. Fixieren Sie Temperatur und Token-Limits.
  3. Bewerten Sie Tests, Patch-Qualität, Laufzeit und Kosten.
  4. Wiederholen Sie den Test nach Modellupdates.

Kann ich beide Modelle in Claude Code verwenden?

Ja. Beide Modelle bieten Anthropic-kompatible Endpunkte.

Für Qwen setzen Sie ANTHROPIC_BASE_URL auf den DashScope-Anthropic-Endpunkt und verwenden:

export ANTHROPIC_MODEL="qwen3.8-max"
Enter fullscreen mode Exit fullscreen mode

Kimi K3 unterstützt dasselbe Muster über Moonshots Endpunkt. Diese gemeinsame Schnittstelle macht einen A/B-Test vergleichsweise einfach.

Welches Modell ist für typische Agenten-Workloads günstiger?

Auf Listenpreisbasis ist Qwen 3.8-Max günstiger:

  • Qwen: 2 $ Eingabe / 6 $ Ausgabe pro Million Tokens
  • Kimi K3: 3 $ Eingabe / 15 $ Ausgabe pro Million Tokens

Bei ausgabelastigen Agenten-Loops ist der Unterschied besonders groß. Bei stark gecachten, eingabeintensiven Workloads ist K3 durch seine Cache-Hit-Rate von 0,30 $ näher an Qwens 0,20 $.

Berücksichtigen Sie bei Qwen die Kosten für Reasoning-Tokens, bevor Sie eine finale Entscheidung treffen.

Top comments (0)