DEV Community

Cover image for Wie man Qwen 3.8 kostenlos nutzt
Emre Demir
Emre Demir

Posted on • Originally published at apidog.com

Wie man Qwen 3.8 kostenlos nutzt

Alibaba hat Qwen 3.8-Max Anfang August 2026 veröffentlicht. Gleichzeitig tauchen bereits Aussagen wie „für immer kostenlos“ auf, die den tatsächlichen Bedingungen nicht entsprechen. Dieser Artikel fasst den Stand vom 3. August 2026 anhand der offiziellen Alibaba-Informationen zusammen.

Apidog noch heute testen

Es gibt vier praktikable Zugangswege: Zwei funktionieren sofort, einer ist für die kommende Woche angekündigt und einer nutzt ältere Modelle. Wenn Sie zuerst den Modellüberblick benötigen – 2,4 Billionen Gesamtparameter, 95 Milliarden aktive Parameter und 1 Million Token Kontextfenster – lesen Sie die Qwen-3.8-Übersicht.

Kurzübersicht

Weg Kostenlos? Funktioniert heute? Einschränkung
Qwen Chat Ja Ja Consumer-App, keine API
Model Studio API-Kontingent 1 Mio. Token Ja Nur Region Singapur, 90 Tage
Offene Gewichte / Self-Hosting Gewichte kostenlos Noch nicht Für „nächste Woche“ angekündigt; Hardware kostet
Ältere Qwen-Modelle Ja Ja Nicht Qwen 3.8-Max

Weg 1: Qwen Chat ohne Einrichtung

Der schnellste kostenlose Einstieg ist Qwen Chat. Melden Sie sich an, wählen Sie Qwen 3.8-Max und testen Sie das Modell ohne Kreditkarte oder Cloud-Konsole. Der offizielle Release-Post nennt diesen Weg als Standardoption zum Ausprobieren.

Qwen Chat

Sie erhalten kostenlosen Zugriff auf das Flaggschiffmodell über eine Chat-Oberfläche, einschließlich Bild- und Dokumentenverständnis aus den Launch-Demos.

Für Entwickler hat dieser Weg aber klare Grenzen:

  • Keine API-Schlüssel
  • Keine Automatisierung
  • Keine Integration in App, CI oder Testsuite
  • Keine Garantie, dass das Chat-Verhalten der rohen API entspricht

Chat-Anwendungen verwenden eigene System-Prompts und Einstellungen. Nutzen Sie Qwen Chat daher als Produktdemo, nicht als reproduzierbaren API-Benchmark.

Fazit: Kostenlos und sofort nutzbar, aber nicht für API-Integrationen geeignet.

Weg 2: Model Studio API-Kontingent

Für Entwickler ist das kostenlose Kontingent von Alibaba Cloud Model Studio der relevante Weg. Neue Aktivierungen erhalten für qwen3.8-max 1 Million kostenlose Token.

Die Preisseite von Model Studio enthält jedoch wichtige Bedingungen.

1. Das Kontingent gilt nur für Singapur

Die kostenlosen Token gelten ausschließlich in der internationalen Region Singapur. Verwenden Sie dafür diese Base URL:

https://dashscope-intl.aliyuncs.com/compatible-mode/v1
Enter fullscreen mode Exit fullscreen mode

Wenn Sie stattdessen Peking oder US-Virginia ansprechen, fallen vom ersten Token an Kosten an. Prüfen Sie daher vor der Integration Ihre Region und Latenzanforderungen.

2. Das Kontingent läuft nach 90 Tagen ab

Die 1 Million Token sind ab Aktivierung 90 Tage gültig. Nicht verwendete Token verfallen und werden nicht übertragen.

Praktisch bedeutet das:

  1. Aktivieren Sie das Kontingent erst, wenn Ihre Evaluierung startet.
  2. Planen Sie Tests innerhalb des 90-Tage-Fensters.
  3. Verlassen Sie sich nicht auf Restkontingent für spätere Sprints.

3. Nach dem Kontingent gelten reguläre Preise

Nach Ablauf oder Verbrauch des Kontingents kostet Qwen 3.8-Max:

  • 2 $ pro Million Eingabe-Token
  • 6 $ pro Million Ausgabe-Token

Der Preis gilt über das gesamte 1M-Kontextfenster hinweg. Richten Sie vor dem ersten Test eine Abrechnungswarnung ein. Eine Aufschlüsselung typischer Workloads finden Sie im Qwen-3.8-Preisleitfaden.

API-Zugang einrichten

So nehmen Sie das Kontingent in Anspruch:

  1. Erstellen Sie ein Model-Studio-Konto.
  2. Aktivieren Sie den Dienst.
  3. Erzeugen Sie einen API-Schlüssel.
  4. Speichern Sie ihn als Umgebungsvariable:
export DASHSCOPE_API_KEY="ihr-api-schluessel"
Enter fullscreen mode Exit fullscreen mode

Der Modellkatalog listet qwen3.8-max als empfohlenes Modell. Der Dienst unterstützt ein OpenAI-kompatibles Protokoll sowie einen Anthropic-kompatiblen Endpunkt. Der Qwen-3.8-API-Walkthrough zeigt beide Varianten, einschließlich Streaming und Reasoning-Ausgabe.

Kontingent-Falle: Reasoning ist standardmäßig aktiv

Qwen 3.8-Max verwendet standardmäßig:

reasoning_effort=xhigh
Enter fullscreen mode Exit fullscreen mode

Reasoning-Token zählen als Ausgabe-Token. Ein einzelner komplexer Prompt kann daher mehrere Tausend zusätzliche Token erzeugen, bevor die sichtbare Antwort beginnt.

Setzen Sie für Routineanfragen einen niedrigeren Wert:

{
  "model": "qwen3.8-max",
  "reasoning_effort": "low",
  "messages": [
    {
      "role": "user",
      "content": "Fasse diese Fehlermeldung in drei Schritten zusammen."
    }
  ]
}
Enter fullscreen mode Exit fullscreen mode

Verwenden Sie medium oder xhigh nur dann, wenn die Aufgabe tatsächlich mehrstufiges Reasoning benötigt.

So reicht 1 Million Token länger

Eine Million Token ist für Evaluierungen nützlich, verschwindet aber schnell, wenn jede Debugging-Iteration den vollständigen Prompt erneut sendet.

1. Requests vor der Schleife testen

Erstellen und validieren Sie API-Aufrufe zunächst in Apidog. Prüfen Sie Parameter, Request-Body, Streaming und Reasoning-Deltas einzeln, bevor Sie eine Schleife oder Batch-Verarbeitung starten.

2. Bekannte Antworten mocken

Sobald Sie das Antwortformat kennen, speichern Sie eine Beispielantwort und verwenden Sie einen Mock-Server für Frontend- oder Agentenentwicklung. Das verhindert, dass jede lokale UI-Änderung erneut Live-Token verbraucht.

3. Token-Nutzung pro Request erfassen

Die API liefert Token-Zähler im Response-Body. Protokollieren Sie diese Werte pro Anfrage, damit Sie Verbrauch und Kosten früh erkennen.

{
  "usage": {
    "prompt_tokens": 1240,
    "completion_tokens": 860,
    "total_tokens": 2100
  }
}
Enter fullscreen mode Exit fullscreen mode

Wenn Sie diesen Workflow verwenden möchten, können Sie Apidog kostenlos herunterladen. Speichern Sie die Base URLs für Singapur, Peking und die USA als getrennte Umgebungen, damit ein Regionenwechsel nicht versehentlich das kostenlose Kontingent umgeht.

Fazit: Der aktuell beste kostenlose Weg für Entwickler – sofern Sie die Region Singapur und das 90-Tage-Ablaufdatum beachten.

Weg 3: Offene Gewichte – angekündigt, aber noch nicht verfügbar

Die zentrale Ankündigung für Self-Hosting lautet: Qwen 3.8-Max soll das erste Qwen-Max-Modell mit offenen Gewichten werden. Alibaba kündigt die Veröffentlichung auf Hugging Face und ModelScope für „nächste Woche“ an, also ungefähr für den 10. August.

Mit Stand vom 3. August 2026 sind die Gewichte nicht verfügbar:

  • Kein Download
  • Keine Quantisierung
  • Kein lokales Inferenz-Setup
  • Kein funktionierendes Tutorial für Qwen 3.8-Max auf eigener Hardware

Wenn ein Tutorial vor der tatsächlichen Veröffentlichung behauptet, Qwen 3.8-Max lokal auszuführen, ist Vorsicht angebracht.

Self-Hosting: der Hardware-Realitätscheck

Auch nach Veröffentlichung bedeutet „offene Gewichte“ nicht automatisch „kostenlos auf dem Laptop ausführen“.

Qwen 3.8-Max hat 2,4 Billionen Gesamtparameter. Als Vergleich dient Kimi K3 mit 2,8 Billionen Parametern: Selbst stark quantisiert als MXFP4 lagen die Gewichte bei 594 GB. Für Qwen 3.8-Max ist deshalb ebenfalls mit mehreren hundert Gigabyte Gewichtedaten zu rechnen.

Das erfordert realistisch:

  • Mehrere GPUs
  • Häufig mehrere Nodes
  • Ausreichend VRAM und Storage
  • Ein produktionsfähiges Serving-Setup

Eine Consumer-GPU oder einzelne Workstation ist dafür nicht ausreichend. Die Hardware-Anforderungen dieser Modellklasse werden im Artikel zum lokalen Ausführen von Kimi K3 detailliert beschrieben.

Der praktische Vorteil offener Gewichte liegt für die meisten Entwickler eher darin, dass Drittanbieter das Modell hosten können. Mehr Hosting-Anbieter führen typischerweise zu mehr Preiswettbewerb und damit potenziell günstigeren APIs.

Fazit: Noch nicht verfügbar. Nach der Veröffentlichung sind eher günstigere Hosting-Angebote als lokale Laptop-Deployments zu erwarten.

Weg 4: Kostenlose ältere Qwen-Modelle

Wenn Sie ein leistungsfähiges Qwen-Modell benötigen, aber nicht zwingend Qwen 3.8-Max, sind ältere Modelle eine praktikable Alternative.

Kleinere Qwen-Modelle mit offenen Gewichten lassen sich bereits auf verfügbarer Hardware ausführen. Außerdem gibt es für die ältere Modellreihe kostenlose Zugangswege ohne 90-Tage-Frist. Der Leitfaden zum kostenlosen Verwenden von Qwen 3.7 fasst diese Optionen zusammen.

Der Kompromiss ist klar: Sie verzichten auf die Benchmark-Verbesserungen von Qwen 3.8-Max. Für Nebenprojekte, Klassifikationsaufgaben oder zum Erlernen der Qwen-API sind ältere Modelle aber oft ausreichend.

Was derzeit nicht existiert

Mit Stand vom 3. August 2026 gibt es folgende Optionen nicht:

  • Keinen unbegrenzten kostenlosen API-Tarif. Das 1M-Token-Kontingent läuft ab.
  • Keinen kostenlosen Tarif außerhalb Singapurs. Peking und US-Virginia berechnen ab dem ersten Token.
  • Keine herunterladbaren Qwen-3.8-Max-Gewichte. „Nächste Woche“ ist eine Ankündigung, kein Download-Link.
  • Keinen offiziellen kostenlosen Qwen-3.8-Max-Zugang über Drittanbieter-Aggregatoren. Vor einer Gewichtungsveröffentlichung sollten Sie skeptisch sein, wenn ein Anbieter kostenloses 3.8-Max verspricht.

FAQ

Ist die Qwen-3.8-API wirklich kostenlos?

Teilweise. Alibaba Cloud Model Studio bietet 1 Million kostenlose Token für 90 Tage in der Region Singapur. Danach kosten Eingaben 2 $ und Ausgaben 6 $ pro Million Token.

Kann ich Qwen 3.8-Max lokal herunterladen und ausführen?

Nein. Die Gewichte sind für Hugging Face und ModelScope um den 10. August 2026 angekündigt, waren zum Zeitpunkt dieses Artikels aber noch nicht verfügbar. Nach der Veröffentlichung ist mit mehreren hundert Gigabyte Gewichtedaten und Multi-GPU-Serving zu rechnen.

Wie unterscheidet sich das von den kostenlosen Kimi-K3-Optionen?

Kimi K3 ist bereits als herunterladbares Modell verfügbar, daher ist Self-Hosting dort heute möglich. Beide Modelle sind aber für Consumer-Hardware zu groß. Der Leitfaden zum kostenlosen Verwenden von Kimi K3 beschreibt die verfügbaren Optionen.

Verbrauchen Reasoning-Token das kostenlose Kontingent?

Ja. Reasoning-Ausgaben werden wie reguläre Ausgabe-Token abgerechnet. Da reasoning_effort standardmäßig auf xhigh steht, sollten Sie den Wert für Routineanfragen auf low oder medium senken.

Fazit

Kostenloser Zugriff auf Qwen 3.8-Max ist möglich, aber klar begrenzt:

  • Qwen Chat für gelegentliche manuelle Tests
  • 1 Million API-Token über Model Studio in Singapur für 90 Tage
  • Offene Gewichte erst nach der angekündigten Veröffentlichung

Wenn Sie den API-Weg wählen, verwenden Sie die kostenlosen Token für Evaluierung statt für wiederholtes Debugging. Prototypen Sie Requests in Apidog, mocken Sie stabile Antworten während der Entwicklung und reservieren Sie Live-Calls für die Tests, die tatsächlich entscheiden, ob Qwen 3.8-Max in Ihren Stack passt.

Top comments (0)