Claude Opus 5 wurde am 24. Juli 2026 zum Preis von 5 $ pro Million Eingabe-Tokens und 25 $ pro Million Ausgabe-Tokens eingeführt. Das entspricht dem Preis von Opus 4.8 und ist genau halb so teuer wie Fable 5. Für Ihre tatsächliche Rechnung zählen aber nicht nur diese Basispreise, sondern auch Cache-Schreibvorgänge, Cache-Treffer, Batch-Preise, schneller Modus, regionale Multiplikatoren und verändertes Modellverhalten. Dieser Leitfaden zeigt die vollständige Preistabelle, konkrete Kostenrechnungen und einen Workflow, mit dem Sie Ihre eigenen Token-Daten prüfen können. Senden Sie dazu Anfragen über Apidog und werten Sie den usage-Block jeder Antwort aus.
Die vollständige Preisübersicht für Claude Opus 5
Jeder folgende Preis stammt aus der Preisdokumentation von Anthropic und gilt für die Modell-ID claude-opus-5.
| Token-Kategorie | Preis pro Million Tokens |
|---|---|
| Eingabe (Standard) | 5,00 $ |
| Ausgabe (Standard) | 25,00 $ |
| Prompt-Cache-Schreibvorgang, 5 Minuten TTL | 6,25 $ |
| Prompt-Cache-Schreibvorgang, 1 Stunde TTL | 10,00 $ |
| Cache-Treffer und Aktualisierungen | 0,50 $ |
| Batch API-Eingabe | 2,50 $ |
| Batch API-Ausgabe | 12,50 $ |
| Schneller Modus, Eingabe | 10,00 $ |
| Schneller Modus, Ausgabe | 50,00 $ |
Wichtige Konsequenzen aus der Tabelle:
- Cache-Treffer kosten nur ein Zehntel der Standardeingabe. Das ist der größte Kostenhebel.
- Cache-Schreibvorgänge kosten mehr als normale Eingabe: Faktor 1,25 bei 5 Minuten TTL und Faktor 2 bei 1 Stunde TTL.
- Die Batch API reduziert Eingabe- und Ausgabekosten pauschal um 50 %.
- Der schnelle Modus kostet exakt das Doppelte, liefert aber etwa die 2,5-fache Ausgabegeschwindigkeit. Er ist eine Forschungsvorschau, nur über die First-Party-API verfügbar und nicht mit der Batch API kombinierbar.
- Langer Kontext verursacht keinen Aufpreis. Das Kontextfenster von 1 Million Tokens ist Standard und Maximum. Tokens oberhalb einer bestimmten Kontextstufe werden nicht teurer abgerechnet.
Damit gibt es auch eine harte Obergrenze für einen einzelnen Messages-API-Aufruf:
1.000.000 Eingabe-Tokens × 5,00 $ / MTok = 5,00 $
128.000 Ausgabe-Tokens × 25,00 $ / MTok = 3,20 $
Maximal: 8,20 $ pro Anfrage
Bei der Batch API kann die maximale Ausgabe mit dem Beta-Header output-300k-2026-03-24 auf 300.000 Tokens steigen. Die Ausgabeseite ist dann auf 3,75 $ begrenzt.
Der Anker: gleich wie 4.8, die Hälfte von Fable 5
| Modell | Eingabe / MTok | Ausgabe / MTok |
|---|---|---|
| Claude Opus 5 | 5,00 $ | 25,00 $ |
| Claude Opus 4.8 | 5,00 $ | 25,00 $ |
| Claude Fable 5 | 10,00 $ | 50,00 $ |
| Claude Sonnet 5, Einführung bis 31. August 2026 | 2,00 $ | 10,00 $ |
| Claude Sonnet 5, ab 1. September 2026 | 3,00 $ | 15,00 $ |
Daraus folgen zwei praktische Entscheidungen:
Ein Upgrade von Opus 4.8 auf Opus 5 verändert nicht den Preis pro Token. Die Modell-ID auszutauschen ändert Ihre Stückkosten nicht. Allerdings kann sich das Token-Volumen ändern, etwa durch standardmäßig aktiviertes Denken oder längere Antworten. Die Preisübersicht für Opus 4.8 bleibt für Workloads auf der alten Modell-ID relevant.
Opus 5 kostet halb so viel wie Fable 5. Anthropic gibt im Startbeitrag zu Opus 5 an, dass Opus 5 auf CursorBench 3.2 innerhalb von 0,5 % des Spitzenwerts von Fable 5 liegt und es auf OSWorld 2.0 bei etwa einem Drittel der Kosten pro Aufgabe übertrifft. Diese Angaben stammen vom Anbieter und waren Stand 25. Juli 2026 nicht unabhängig reproduziert. Behandeln Sie sie als Herstellerangaben, nicht als gesicherte Benchmarks.
Für die Einordnung helfen der Vergleich Opus 5 vs. Fable 5 und die Fable-5-Preisliste.
Rechenbeispiel 1: Eine einzelne Anfrage
Nehmen wir einen Zusammenfassungs-Request mit:
- 8.000 Eingabe-Tokens
- 1.200 Ausgabe-Tokens
Die Rechnung lautet:
Eingabe:
8.000 / 1.000.000 × 5,00 $ = 0,040 $
Ausgabe:
1.200 / 1.000.000 × 25,00 $ = 0,030 $
Gesamt:
0,070 $ pro Aufruf
Bei 10.000 Aufrufen pro Monat:
10.000 × 0,070 $ = 700 $ pro Monat
Zum Vergleich:
| Modell | Kosten pro Aufruf | Kosten bei 10.000 Aufrufen |
|---|---|---|
| Opus 5 | 0,070 $ | 700 $ |
| Fable 5 | 0,140 $ | 1.400 $ |
| Sonnet 5 zum Einführungspreis | 0,028 $ | 280 $ |
Obwohl die Eingabe fast siebenmal größer als die Ausgabe ist, macht die Ausgabe hier bereits 43 % der Kosten aus. Ausgabe-Tokens kosten fünfmal so viel wie Eingabe-Tokens. Das ist besonders relevant, weil Denk-Tokens als Ausgabe abgerechnet werden und adaptives Denken bei Opus 5 standardmäßig aktiviert ist.
Rechenbeispiel 2: Lange Agenten-Sitzung mit Caching
Angenommen, ein Coding-Agent arbeitet mit:
- 120.000 Tokens System-Prompt und Repository-Kontext
- 40 Runden
- 1.500 neuen Konversations-Tokens pro Runde
- 2.500 Ausgabe-Tokens pro Runde
Ohne Prompt-Caching
Ohne Cache senden Sie in jeder Runde den vollständigen Kontext erneut.
| Posten | Tokens | Rate | Kosten |
|---|---|---|---|
| Eingabe: 120.000 × 40 plus 60.000 neue Tokens | 4.860.000 | 5,00 $ | 24,30 $ |
| Ausgabe: 2.500 × 40 | 100.000 | 25,00 $ | 2,50 $ |
| Gesamt | 26,80 $ |
Mit 5-Minuten-Prompt-Cache
Cachen Sie das stabile Präfix mit 120.000 Tokens einmalig.
| Posten | Tokens | Rate | Kosten |
|---|---|---|---|
| Cache-Schreibvorgang, einmalig | 120.000 | 6,25 $ | 0,75 $ |
| Cache-Lesevorgänge, 39 Runden | 4.680.000 | 0,50 $ | 2,34 $ |
| Neue Eingabe: 1.500 × 40 | 60.000 | 5,00 $ | 0,30 $ |
| Ausgabe: 2.500 × 40 | 100.000 | 25,00 $ | 2,50 $ |
| Gesamt | 5,89 $ |
Das senkt die Kosten von 26,80 $ auf 5,89 $:
Einsparung: rund 78 %
Nach dem Caching wird die Ausgabe zum nächsten Optimierungsziel: Sie verursacht jetzt 42 % der Rechnung statt zuvor 9 %.
Bei der 5-Minuten-TTL aktualisiert jeder Cache-Lesevorgang die Gültigkeit. Solange zwischen zwei Agenten-Runden weniger als fünf Minuten liegen, bleibt der Cache warm. Ist der Agent länger inaktiv, verwenden Sie die 1-Stunden-TTL:
Cache-Schreibvorgang mit 1 Stunde TTL:
120.000 / 1.000.000 × 10,00 $ = 1,20 $
Neue Gesamtkosten:
1,20 $ + 2,34 $ + 0,30 $ + 2,50 $ = 6,34 $
Auch das liegt noch 76 % unter dem ungecachten Lauf.
Rechenbeispiel 3: Stapelverarbeitung
Für asynchrone Workloads bietet die Batch API 50 % Rabatt. Beispiel:
- 50.000 Dokumente
- 1.200 Eingabe-Tokens je Dokument
- 150 Ausgabe-Tokens je Dokument
| Pfad | Eingabekosten | Ausgabekosten | Gesamt |
|---|---|---|---|
| Standard | 60 MTok × 5,00 $ = 300,00 $ | 7,5 MTok × 25,00 $ = 187,50 $ | 487,50 $ |
| Batch | 60 MTok × 2,50 $ = 150,00 $ | 7,5 MTok × 12,50 $ = 93,75 $ | 243,75 $ |
Sie sparen bei identischen Tokens und demselben Modell:
487,50 $ - 243,75 $ = 243,75 $
Der Kompromiss ist Latenz, nicht Qualität. Batch eignet sich besonders für:
- Klassifizierung
- Datenanreicherung
- Evaluationen
- Backfills
- nächtliche Zusammenfassungen
- Offline-Inhaltsverarbeitung
Wenn der Job keine synchrone Antwort braucht, sollten Sie ihn nicht über den Standard-Endpunkt ausführen.
Rechenbeispiel 4: Was der schnelle Modus kostet
Der schnelle Modus verdoppelt die Preise auf 10 $ pro Million Eingabe-Tokens und 50 $ pro Million Ausgabe-Tokens.
Für das Beispiel mit 8.000 Eingabe- und 1.200 Ausgabe-Tokens:
Eingabe:
8.000 / 1.000.000 × 10,00 $ = 0,080 $
Ausgabe:
1.200 / 1.000.000 × 50,00 $ = 0,060 $
Gesamt:
0,140 $ pro Aufruf
Das ist exakt doppelt so teuer wie der Standardmodus und entspricht preislich Fable 5 im Standardmodus.
Verwenden Sie den schnellen Modus für interaktive Oberflächen, bei denen sichtbare Streaming-Latenz relevant ist. Für Hintergrundjobs ist der Aufpreis schwer zu rechtfertigen. Batch und schneller Modus lassen sich nicht kombinieren.
Die vier Hebel, die Ihre Rechnung beeinflussen
1. Prompt-Cache-Minimum: 512 Tokens
Bei Opus 4.8 lag das cachebare Minimum bei 1.024 Tokens. Bei Opus 5 beträgt es nur noch 512 Tokens.
Dadurch können Sie auch kleinere wiederverwendete Präfixe cachen, etwa:
- System-Prompts
- Tool-Anweisungen
- Policies
- gemeinsame Few-Shot-Beispiele
- statischen Repo- oder Produktkontext
Die Break-even-Punkte:
- 5 Minuten TTL: Caching lohnt sich ab etwa 1,3 Anfragen, also praktisch ab dem zweiten Aufruf.
- 1 Stunde TTL: Caching lohnt sich ab etwa 2,1 Anfragen, also ab dem dritten Aufruf.
Beispiel: Ein System-Prompt mit 700 Tokens wird in einem Burst 1.000-mal wiederverwendet.
Ungecacht:
700 × 1.000 / 1.000.000 × 5,00 $ = 3,50 $
Mit 5-Minuten-Cache:
Schreiben: 700 / 1.000.000 × 6,25 $ = 0,0044 $
Lesen: 999 × 700 / 1.000.000 × 0,50 $ = 0,3497 $
Gesamt: rund 0,354 $
Dieser Prompt war bei Opus 4.8 zu kurz für Caching.
2. Batch API: 50 % Rabatt
Prüfen Sie explizit, welche Aufgaben eine synchrone Antwort brauchen. Häufig können diese Jobs in Batch laufen:
- Evaluationen
- Inhaltsklassifizierung
- Backfills
- Datenbereinigung
- nächtliche Reports
- Zusammenfassungen großer Dokumentmengen
Wenn eine Antwort nicht sofort benötigt wird, ist Batch normalerweise die günstigere Standardwahl.
3. Aufwandsstufen low und medium
output_config.effort steuert, wie viel das Modell denkt. Denk-Tokens werden als Ausgabe abgerechnet, also mit 25 $ pro Million Tokens.
Opus 5 hat die Aufwandsstufen laut Anthropic neu kalibriert. low und medium sollen deutlich stärker als bei früheren Opus-Modellen sein. Der Standard ist high; für Coding- und Agentenworkloads bleibt xhigh der empfohlene Startpunkt.
Beispielhafte Rechnung:
xhigh: 8.000 Denk-Tokens
low: 1.500 Denk-Tokens
Differenz:
6.500 Ausgabe-Tokens
Ersparnis pro Aufgabe:
6.500 / 1.000.000 × 25,00 $ = 0,1625 $
Bei 100.000 Aufgaben:
16.250 $
Das ist nur eine illustrative Rechnung. Die tatsächliche Differenz hängt von Prompt, Tool-Use und Aufgabe ab. Führen Sie daher einen Effort-Sweep gegen Ihre eigenen Evaluierungen aus, statt Einstellungen von Opus 4.8 direkt zu übernehmen. Der Leitfaden zum Effort-Parameter beschreibt diesen Prozess.
Wichtig: Niedrigerer Aufwand reduziert Denk-Tokens, nicht automatisch die sichtbare Antwortlänge. Wenn Sie kürzere Antworten brauchen, geben Sie das im Prompt explizit vor.
4. Geringerer Tool-Use-System-Prompt-Overhead
Bei Tool-Definitionen injiziert die API einen System-Prompt, dessen Tokens abgerechnet werden. Bei Opus 5 beträgt dieser Overhead:
286 Tokens für Tool-Auswahl auto oder none
Vergleich:
| Modell | Tool-Use-Overhead |
|---|---|
| Opus 5 | 286 Tokens |
| Opus 4.8 | 290 Tokens |
| Opus 4.7 | 675 Tokens |
Der Unterschied zu Opus 4.8 beträgt nur vier Tokens pro Request und ist praktisch vernachlässigbar. Gegenüber Opus 4.7 sparen Sie hingegen 389 Tokens:
389 / 1.000.000 × 5,00 $ = 0,001945 $ pro Anfrage
Bei 1 Million Anfragen:
1.945 $
Weitere modellübergreifende Optimierungen finden Sie im Leitfaden zum Senken Ihrer Claude-API-Rechnung.
Zwei Posten, die oft übersehen werden
Regionaler Multiplikator: inference_geo: "us"
Wenn Sie die Inferenz aus Compliance- oder Datenresidenzgründen an reine US-Infrastruktur binden, gilt ein Multiplikator von 1,1× für alle Token-Kategorien:
| Kategorie | Standard | Mit inference_geo: "us"
|
|---|---|---|
| Eingabe | 5,00 $ | 5,50 $ |
| Ausgabe | 25,00 $ | 27,50 $ |
| Cache-Treffer | 0,50 $ | 0,55 $ |
| Batch-Eingabe | 2,50 $ | 2,75 $ |
| Batch-Ausgabe | 12,50 $ | 13,75 $ |
Das Beispiel aus Abschnitt 1 steigt dadurch von 700 $ auf 770 $ im Monat. Bei einer Rechnung von 50.000 $ bedeutet der Multiplikator 5.000 $ Zusatzkosten. Prüfen Sie daher vorab, ob die Bindung erforderlich ist.
Kein Priority Tier für Opus 5
Priority Tier wird für Opus 5 nicht unterstützt; Opus 4.8 behält diese Option. Wenn Ihre Kapazitätsplanung von Priority-Tier-Zusagen abhängt, ist das eine relevante Einschränkung beim Wechsel. Der Migrationsleitfaden von Opus 4.8 zu Opus 5 behandelt dies zusammen mit den API-Änderungen.
Verhaltensänderungen, die auf Ihrer Rechnung erscheinen
Token-Preise sind nur die halbe Rechnung. Die andere Hälfte ist das tatsächlich erzeugte Token-Volumen.
Denken ist standardmäßig aktiviert.
Bei Opus 4.8 lief eine Anfrage ohnethinking-Feld ohne Denken. Bei Opus 5 aktiviert dieselbe Anfrage adaptives Denken. Diese Tokens werden als Ausgabe abgerechnet. Damax_tokensDenken und sichtbare Antwort gemeinsam begrenzt, können Antworten außerdem früher abgeschnitten werden.Opus 5 delegiert leichter an Subagenten.
Jeder Subagent erzeugt eigene abgerechnete Tokens. Begrenzen Sie Delegation bei kostensensiblen Aufgaben.Opus 5 überprüft eigene Arbeit eher selbstständig.
Wenn Sie Prompt-Anweisungen wie „Überprüfe deine Arbeit“ aus älteren Prompts übernommen haben, empfiehlt Anthropic im Prompting-Leitfaden, diese zu entfernen. Selbstprüfung kostet Tokens.
Keine dieser Änderungen verändert den Preis pro Token. Alle drei können aber Ihre Gesamtausgaben erhöhen.
Tatsächliche Ausgaben mit Apidog prüfen
Der schnellste Weg zu belastbaren Zahlen ist das usage-Objekt jeder API-Antwort. Es enthält getrennt:
{
"input_tokens": 0,
"output_tokens": 0,
"cache_creation_input_tokens": 0,
"cache_read_input_tokens": 0
}
Damit können Sie die oben gezeigten Rechnungen direkt gegen Ihren eigenen Traffic validieren.
Apidog ist eine API-Entwicklungs- und Testplattform. Richten Sie eine Anfrage an den Messages-Endpunkt mit "model": "claude-opus-5" ein und führen Sie dann diese Prüfungen durch:
- Effort-Stufen vergleichen: Duplizieren Sie die gespeicherte Anfrage für jede Aufwandsstufe und vergleichen Sie die Denk-Tokens bei identischen Prompts.
-
Cache als Testbedingung prüfen: Stellen Sie sicher, dass
usage.cache_read_input_tokensgrößer als null ist. Ein defekter Cache sollte als fehlgeschlagener Test sichtbar werden, nicht erst als unerwartete Rechnung. - Schlüssel in Umgebungsvariablen speichern: Hinterlegen Sie API-Schlüssel nicht im Request-Body. So verhindert ein Entwicklungsschlüssel, dass versehentlich Batch-Verarbeitung in Produktionsgröße startet.
- SSE-Streaming beobachten: Prüfen Sie bei langen Generierungen, wohin die Ausgabe-Tokens gehen und ob die sichtbare Antwort tatsächlich den erwarteten Nutzen liefert.
Laden Sie Apidog herunter, um diese Prüfungen zusammen mit dem Opus-5-API-Leitfaden umzusetzen.
Was Sie tatsächlich für 5 $ / 25 $ kaufen
Opus 5 bietet ein starkes Preis-Leistungs-Verhältnis, ist aber nicht die Spitze des Claude-Stacks. Fable 5 bleibt Anthropics leistungsfähigstes, weit verbreitetes Modell. Opus 5 liegt laut Anthropic bei Cybersicherheitsausnutzung und autonomer Biologieforschung weiterhin hinter Mythos 5.
Die sachliche Einordnung lautet daher:
Fähigkeiten der Spitzenklasse zum halben Spitzenpreis, mit einer klar benannten Obergrenze darüber.
Der Mythos-Klasse-Erklärer beschreibt die Modelle oberhalb dieser Grenze.
Für die meisten Teams ist jedoch die wichtigere Frage, ob der Workload überhaupt Opus benötigt. Sonnet 5 kostet 2 $ / 10 $ pro Million Tokens bis zum 31. August 2026 und danach 3 $ / 15 $ ab dem 1. September 2026. Testen Sie beide Modelle gegen Ihre eigenen Evaluierungen, bevor Sie ein Produktionsbudget festlegen.
Vollständige Spezifikationen und Verfügbarkeit finden Sie in der Claude-Opus-5-Übersicht sowie in Anthropics Modellübersicht.
FAQ
Wie viel kostet Claude Opus 5?
Über die Standard-API kostet Claude Opus 5 5 $ pro Million Eingabe-Tokens und 25 $ pro Million Ausgabe-Tokens. Cache-Treffer kosten 0,50 $, Batch-Läufe 2,50 $ / 12,50 $ und der schnelle Modus 10 $ / 50 $.
Ist Claude Opus 5 teurer als Opus 4.8?
Pro Token nicht: Die Preise sind identisch. Ihre Rechnung kann dennoch steigen, weil Denken standardmäßig aktiviert ist und Standardantworten länger ausfallen können. Messen Sie deshalb das tatsächliche Token-Volumen.
Gibt es einen Aufpreis für langen Kontext im 1M-Fenster?
Nein. Das Kontextfenster von 1 Million Tokens ist Standard und Maximum. Es gibt keine Premium-Stufe für lange Eingaben.
Was ist der günstigste Weg, Claude Opus 5 zu betreiben?
Cachen Sie wiederverwendete Präfixe aggressiv, führen Sie nicht dringende Jobs per Batch API aus und wählen Sie die niedrigste Aufwandsstufe, die Ihre Evaluierungen besteht. Der Leitfaden zum kostenlosen und günstigsten Pfad enthält weitere Details.
Kostet regionale Bindung extra?
Ja. inference_geo: "us" wendet einen Multiplikator von 1,1× auf alle Token-Kategorien an, einschließlich Cache-Treffer und Batch.


Top comments (0)