DEV Community

Cover image for Claude Opus 5 Preise: Die vollständige Kostenaufschlüsselung 2026
Emre Demir
Emre Demir

Posted on • Originally published at apidog.com

Claude Opus 5 Preise: Die vollständige Kostenaufschlüsselung 2026

Claude Opus 5 wurde am 24. Juli 2026 zum Preis von 5 $ pro Million Eingabe-Tokens und 25 $ pro Million Ausgabe-Tokens eingeführt. Das entspricht dem Preis von Opus 4.8 und ist genau halb so teuer wie Fable 5. Für Ihre tatsächliche Rechnung zählen aber nicht nur diese Basispreise, sondern auch Cache-Schreibvorgänge, Cache-Treffer, Batch-Preise, schneller Modus, regionale Multiplikatoren und verändertes Modellverhalten. Dieser Leitfaden zeigt die vollständige Preistabelle, konkrete Kostenrechnungen und einen Workflow, mit dem Sie Ihre eigenen Token-Daten prüfen können. Senden Sie dazu Anfragen über Apidog und werten Sie den usage-Block jeder Antwort aus.

Teste Apidog noch heute

Die vollständige Preisübersicht für Claude Opus 5

Jeder folgende Preis stammt aus der Preisdokumentation von Anthropic und gilt für die Modell-ID claude-opus-5.

Token-Kategorie Preis pro Million Tokens
Eingabe (Standard) 5,00 $
Ausgabe (Standard) 25,00 $
Prompt-Cache-Schreibvorgang, 5 Minuten TTL 6,25 $
Prompt-Cache-Schreibvorgang, 1 Stunde TTL 10,00 $
Cache-Treffer und Aktualisierungen 0,50 $
Batch API-Eingabe 2,50 $
Batch API-Ausgabe 12,50 $
Schneller Modus, Eingabe 10,00 $
Schneller Modus, Ausgabe 50,00 $

Wichtige Konsequenzen aus der Tabelle:

  • Cache-Treffer kosten nur ein Zehntel der Standardeingabe. Das ist der größte Kostenhebel.
  • Cache-Schreibvorgänge kosten mehr als normale Eingabe: Faktor 1,25 bei 5 Minuten TTL und Faktor 2 bei 1 Stunde TTL.
  • Die Batch API reduziert Eingabe- und Ausgabekosten pauschal um 50 %.
  • Der schnelle Modus kostet exakt das Doppelte, liefert aber etwa die 2,5-fache Ausgabegeschwindigkeit. Er ist eine Forschungsvorschau, nur über die First-Party-API verfügbar und nicht mit der Batch API kombinierbar.
  • Langer Kontext verursacht keinen Aufpreis. Das Kontextfenster von 1 Million Tokens ist Standard und Maximum. Tokens oberhalb einer bestimmten Kontextstufe werden nicht teurer abgerechnet.

Preisübersicht für Claude Opus 5

Damit gibt es auch eine harte Obergrenze für einen einzelnen Messages-API-Aufruf:

1.000.000 Eingabe-Tokens × 5,00 $ / MTok = 5,00 $
128.000 Ausgabe-Tokens × 25,00 $ / MTok = 3,20 $

Maximal: 8,20 $ pro Anfrage
Enter fullscreen mode Exit fullscreen mode

Bei der Batch API kann die maximale Ausgabe mit dem Beta-Header output-300k-2026-03-24 auf 300.000 Tokens steigen. Die Ausgabeseite ist dann auf 3,75 $ begrenzt.

Der Anker: gleich wie 4.8, die Hälfte von Fable 5

Modell Eingabe / MTok Ausgabe / MTok
Claude Opus 5 5,00 $ 25,00 $
Claude Opus 4.8 5,00 $ 25,00 $
Claude Fable 5 10,00 $ 50,00 $
Claude Sonnet 5, Einführung bis 31. August 2026 2,00 $ 10,00 $
Claude Sonnet 5, ab 1. September 2026 3,00 $ 15,00 $

Daraus folgen zwei praktische Entscheidungen:

  1. Ein Upgrade von Opus 4.8 auf Opus 5 verändert nicht den Preis pro Token. Die Modell-ID auszutauschen ändert Ihre Stückkosten nicht. Allerdings kann sich das Token-Volumen ändern, etwa durch standardmäßig aktiviertes Denken oder längere Antworten. Die Preisübersicht für Opus 4.8 bleibt für Workloads auf der alten Modell-ID relevant.

  2. Opus 5 kostet halb so viel wie Fable 5. Anthropic gibt im Startbeitrag zu Opus 5 an, dass Opus 5 auf CursorBench 3.2 innerhalb von 0,5 % des Spitzenwerts von Fable 5 liegt und es auf OSWorld 2.0 bei etwa einem Drittel der Kosten pro Aufgabe übertrifft. Diese Angaben stammen vom Anbieter und waren Stand 25. Juli 2026 nicht unabhängig reproduziert. Behandeln Sie sie als Herstellerangaben, nicht als gesicherte Benchmarks.

Für die Einordnung helfen der Vergleich Opus 5 vs. Fable 5 und die Fable-5-Preisliste.

Rechenbeispiel 1: Eine einzelne Anfrage

Nehmen wir einen Zusammenfassungs-Request mit:

  • 8.000 Eingabe-Tokens
  • 1.200 Ausgabe-Tokens

Die Rechnung lautet:

Eingabe:
8.000 / 1.000.000 × 5,00 $ = 0,040 $

Ausgabe:
1.200 / 1.000.000 × 25,00 $ = 0,030 $

Gesamt:
0,070 $ pro Aufruf
Enter fullscreen mode Exit fullscreen mode

Bei 10.000 Aufrufen pro Monat:

10.000 × 0,070 $ = 700 $ pro Monat
Enter fullscreen mode Exit fullscreen mode

Zum Vergleich:

Modell Kosten pro Aufruf Kosten bei 10.000 Aufrufen
Opus 5 0,070 $ 700 $
Fable 5 0,140 $ 1.400 $
Sonnet 5 zum Einführungspreis 0,028 $ 280 $

Obwohl die Eingabe fast siebenmal größer als die Ausgabe ist, macht die Ausgabe hier bereits 43 % der Kosten aus. Ausgabe-Tokens kosten fünfmal so viel wie Eingabe-Tokens. Das ist besonders relevant, weil Denk-Tokens als Ausgabe abgerechnet werden und adaptives Denken bei Opus 5 standardmäßig aktiviert ist.

Rechenbeispiel 2: Lange Agenten-Sitzung mit Caching

Angenommen, ein Coding-Agent arbeitet mit:

  • 120.000 Tokens System-Prompt und Repository-Kontext
  • 40 Runden
  • 1.500 neuen Konversations-Tokens pro Runde
  • 2.500 Ausgabe-Tokens pro Runde

Ohne Prompt-Caching

Ohne Cache senden Sie in jeder Runde den vollständigen Kontext erneut.

Posten Tokens Rate Kosten
Eingabe: 120.000 × 40 plus 60.000 neue Tokens 4.860.000 5,00 $ 24,30 $
Ausgabe: 2.500 × 40 100.000 25,00 $ 2,50 $
Gesamt 26,80 $

Mit 5-Minuten-Prompt-Cache

Cachen Sie das stabile Präfix mit 120.000 Tokens einmalig.

Posten Tokens Rate Kosten
Cache-Schreibvorgang, einmalig 120.000 6,25 $ 0,75 $
Cache-Lesevorgänge, 39 Runden 4.680.000 0,50 $ 2,34 $
Neue Eingabe: 1.500 × 40 60.000 5,00 $ 0,30 $
Ausgabe: 2.500 × 40 100.000 25,00 $ 2,50 $
Gesamt 5,89 $

Das senkt die Kosten von 26,80 $ auf 5,89 $:

Einsparung: rund 78 %
Enter fullscreen mode Exit fullscreen mode

Nach dem Caching wird die Ausgabe zum nächsten Optimierungsziel: Sie verursacht jetzt 42 % der Rechnung statt zuvor 9 %.

Bei der 5-Minuten-TTL aktualisiert jeder Cache-Lesevorgang die Gültigkeit. Solange zwischen zwei Agenten-Runden weniger als fünf Minuten liegen, bleibt der Cache warm. Ist der Agent länger inaktiv, verwenden Sie die 1-Stunden-TTL:

Cache-Schreibvorgang mit 1 Stunde TTL:
120.000 / 1.000.000 × 10,00 $ = 1,20 $

Neue Gesamtkosten:
1,20 $ + 2,34 $ + 0,30 $ + 2,50 $ = 6,34 $
Enter fullscreen mode Exit fullscreen mode

Auch das liegt noch 76 % unter dem ungecachten Lauf.

Rechenbeispiel 3: Stapelverarbeitung

Für asynchrone Workloads bietet die Batch API 50 % Rabatt. Beispiel:

  • 50.000 Dokumente
  • 1.200 Eingabe-Tokens je Dokument
  • 150 Ausgabe-Tokens je Dokument
Pfad Eingabekosten Ausgabekosten Gesamt
Standard 60 MTok × 5,00 $ = 300,00 $ 7,5 MTok × 25,00 $ = 187,50 $ 487,50 $
Batch 60 MTok × 2,50 $ = 150,00 $ 7,5 MTok × 12,50 $ = 93,75 $ 243,75 $

Sie sparen bei identischen Tokens und demselben Modell:

487,50 $ - 243,75 $ = 243,75 $
Enter fullscreen mode Exit fullscreen mode

Der Kompromiss ist Latenz, nicht Qualität. Batch eignet sich besonders für:

  • Klassifizierung
  • Datenanreicherung
  • Evaluationen
  • Backfills
  • nächtliche Zusammenfassungen
  • Offline-Inhaltsverarbeitung

Wenn der Job keine synchrone Antwort braucht, sollten Sie ihn nicht über den Standard-Endpunkt ausführen.

Rechenbeispiel 4: Was der schnelle Modus kostet

Der schnelle Modus verdoppelt die Preise auf 10 $ pro Million Eingabe-Tokens und 50 $ pro Million Ausgabe-Tokens.

Für das Beispiel mit 8.000 Eingabe- und 1.200 Ausgabe-Tokens:

Eingabe:
8.000 / 1.000.000 × 10,00 $ = 0,080 $

Ausgabe:
1.200 / 1.000.000 × 50,00 $ = 0,060 $

Gesamt:
0,140 $ pro Aufruf
Enter fullscreen mode Exit fullscreen mode

Das ist exakt doppelt so teuer wie der Standardmodus und entspricht preislich Fable 5 im Standardmodus.

Verwenden Sie den schnellen Modus für interaktive Oberflächen, bei denen sichtbare Streaming-Latenz relevant ist. Für Hintergrundjobs ist der Aufpreis schwer zu rechtfertigen. Batch und schneller Modus lassen sich nicht kombinieren.

Die vier Hebel, die Ihre Rechnung beeinflussen

1. Prompt-Cache-Minimum: 512 Tokens

Bei Opus 4.8 lag das cachebare Minimum bei 1.024 Tokens. Bei Opus 5 beträgt es nur noch 512 Tokens.

Dadurch können Sie auch kleinere wiederverwendete Präfixe cachen, etwa:

  • System-Prompts
  • Tool-Anweisungen
  • Policies
  • gemeinsame Few-Shot-Beispiele
  • statischen Repo- oder Produktkontext

Die Break-even-Punkte:

  • 5 Minuten TTL: Caching lohnt sich ab etwa 1,3 Anfragen, also praktisch ab dem zweiten Aufruf.
  • 1 Stunde TTL: Caching lohnt sich ab etwa 2,1 Anfragen, also ab dem dritten Aufruf.

Beispiel: Ein System-Prompt mit 700 Tokens wird in einem Burst 1.000-mal wiederverwendet.

Ungecacht:
700 × 1.000 / 1.000.000 × 5,00 $ = 3,50 $

Mit 5-Minuten-Cache:
Schreiben: 700 / 1.000.000 × 6,25 $ = 0,0044 $
Lesen: 999 × 700 / 1.000.000 × 0,50 $ = 0,3497 $

Gesamt: rund 0,354 $
Enter fullscreen mode Exit fullscreen mode

Dieser Prompt war bei Opus 4.8 zu kurz für Caching.

2. Batch API: 50 % Rabatt

Prüfen Sie explizit, welche Aufgaben eine synchrone Antwort brauchen. Häufig können diese Jobs in Batch laufen:

  • Evaluationen
  • Inhaltsklassifizierung
  • Backfills
  • Datenbereinigung
  • nächtliche Reports
  • Zusammenfassungen großer Dokumentmengen

Wenn eine Antwort nicht sofort benötigt wird, ist Batch normalerweise die günstigere Standardwahl.

3. Aufwandsstufen low und medium

output_config.effort steuert, wie viel das Modell denkt. Denk-Tokens werden als Ausgabe abgerechnet, also mit 25 $ pro Million Tokens.

Opus 5 hat die Aufwandsstufen laut Anthropic neu kalibriert. low und medium sollen deutlich stärker als bei früheren Opus-Modellen sein. Der Standard ist high; für Coding- und Agentenworkloads bleibt xhigh der empfohlene Startpunkt.

Beispielhafte Rechnung:

xhigh: 8.000 Denk-Tokens
low:   1.500 Denk-Tokens

Differenz:
6.500 Ausgabe-Tokens

Ersparnis pro Aufgabe:
6.500 / 1.000.000 × 25,00 $ = 0,1625 $

Bei 100.000 Aufgaben:
16.250 $
Enter fullscreen mode Exit fullscreen mode

Das ist nur eine illustrative Rechnung. Die tatsächliche Differenz hängt von Prompt, Tool-Use und Aufgabe ab. Führen Sie daher einen Effort-Sweep gegen Ihre eigenen Evaluierungen aus, statt Einstellungen von Opus 4.8 direkt zu übernehmen. Der Leitfaden zum Effort-Parameter beschreibt diesen Prozess.

Wichtig: Niedrigerer Aufwand reduziert Denk-Tokens, nicht automatisch die sichtbare Antwortlänge. Wenn Sie kürzere Antworten brauchen, geben Sie das im Prompt explizit vor.

4. Geringerer Tool-Use-System-Prompt-Overhead

Bei Tool-Definitionen injiziert die API einen System-Prompt, dessen Tokens abgerechnet werden. Bei Opus 5 beträgt dieser Overhead:

286 Tokens für Tool-Auswahl auto oder none
Enter fullscreen mode Exit fullscreen mode

Vergleich:

Modell Tool-Use-Overhead
Opus 5 286 Tokens
Opus 4.8 290 Tokens
Opus 4.7 675 Tokens

Der Unterschied zu Opus 4.8 beträgt nur vier Tokens pro Request und ist praktisch vernachlässigbar. Gegenüber Opus 4.7 sparen Sie hingegen 389 Tokens:

389 / 1.000.000 × 5,00 $ = 0,001945 $ pro Anfrage

Bei 1 Million Anfragen:
1.945 $
Enter fullscreen mode Exit fullscreen mode

Weitere modellübergreifende Optimierungen finden Sie im Leitfaden zum Senken Ihrer Claude-API-Rechnung.

Zwei Posten, die oft übersehen werden

Regionaler Multiplikator: inference_geo: "us"

Wenn Sie die Inferenz aus Compliance- oder Datenresidenzgründen an reine US-Infrastruktur binden, gilt ein Multiplikator von 1,1× für alle Token-Kategorien:

Kategorie Standard Mit inference_geo: "us"
Eingabe 5,00 $ 5,50 $
Ausgabe 25,00 $ 27,50 $
Cache-Treffer 0,50 $ 0,55 $
Batch-Eingabe 2,50 $ 2,75 $
Batch-Ausgabe 12,50 $ 13,75 $

Das Beispiel aus Abschnitt 1 steigt dadurch von 700 $ auf 770 $ im Monat. Bei einer Rechnung von 50.000 $ bedeutet der Multiplikator 5.000 $ Zusatzkosten. Prüfen Sie daher vorab, ob die Bindung erforderlich ist.

Kein Priority Tier für Opus 5

Priority Tier wird für Opus 5 nicht unterstützt; Opus 4.8 behält diese Option. Wenn Ihre Kapazitätsplanung von Priority-Tier-Zusagen abhängt, ist das eine relevante Einschränkung beim Wechsel. Der Migrationsleitfaden von Opus 4.8 zu Opus 5 behandelt dies zusammen mit den API-Änderungen.

Verhaltensänderungen, die auf Ihrer Rechnung erscheinen

Token-Preise sind nur die halbe Rechnung. Die andere Hälfte ist das tatsächlich erzeugte Token-Volumen.

  1. Denken ist standardmäßig aktiviert.

    Bei Opus 4.8 lief eine Anfrage ohne thinking-Feld ohne Denken. Bei Opus 5 aktiviert dieselbe Anfrage adaptives Denken. Diese Tokens werden als Ausgabe abgerechnet. Da max_tokens Denken und sichtbare Antwort gemeinsam begrenzt, können Antworten außerdem früher abgeschnitten werden.

  2. Opus 5 delegiert leichter an Subagenten.

    Jeder Subagent erzeugt eigene abgerechnete Tokens. Begrenzen Sie Delegation bei kostensensiblen Aufgaben.

  3. Opus 5 überprüft eigene Arbeit eher selbstständig.

    Wenn Sie Prompt-Anweisungen wie „Überprüfe deine Arbeit“ aus älteren Prompts übernommen haben, empfiehlt Anthropic im Prompting-Leitfaden, diese zu entfernen. Selbstprüfung kostet Tokens.

Keine dieser Änderungen verändert den Preis pro Token. Alle drei können aber Ihre Gesamtausgaben erhöhen.

Tatsächliche Ausgaben mit Apidog prüfen

Der schnellste Weg zu belastbaren Zahlen ist das usage-Objekt jeder API-Antwort. Es enthält getrennt:

{
  "input_tokens": 0,
  "output_tokens": 0,
  "cache_creation_input_tokens": 0,
  "cache_read_input_tokens": 0
}
Enter fullscreen mode Exit fullscreen mode

Damit können Sie die oben gezeigten Rechnungen direkt gegen Ihren eigenen Traffic validieren.

Apidog-Ansicht für API-Antworten

Apidog ist eine API-Entwicklungs- und Testplattform. Richten Sie eine Anfrage an den Messages-Endpunkt mit "model": "claude-opus-5" ein und führen Sie dann diese Prüfungen durch:

  1. Effort-Stufen vergleichen: Duplizieren Sie die gespeicherte Anfrage für jede Aufwandsstufe und vergleichen Sie die Denk-Tokens bei identischen Prompts.
  2. Cache als Testbedingung prüfen: Stellen Sie sicher, dass usage.cache_read_input_tokens größer als null ist. Ein defekter Cache sollte als fehlgeschlagener Test sichtbar werden, nicht erst als unerwartete Rechnung.
  3. Schlüssel in Umgebungsvariablen speichern: Hinterlegen Sie API-Schlüssel nicht im Request-Body. So verhindert ein Entwicklungsschlüssel, dass versehentlich Batch-Verarbeitung in Produktionsgröße startet.
  4. SSE-Streaming beobachten: Prüfen Sie bei langen Generierungen, wohin die Ausgabe-Tokens gehen und ob die sichtbare Antwort tatsächlich den erwarteten Nutzen liefert.

Laden Sie Apidog herunter, um diese Prüfungen zusammen mit dem Opus-5-API-Leitfaden umzusetzen.

Was Sie tatsächlich für 5 $ / 25 $ kaufen

Opus 5 bietet ein starkes Preis-Leistungs-Verhältnis, ist aber nicht die Spitze des Claude-Stacks. Fable 5 bleibt Anthropics leistungsfähigstes, weit verbreitetes Modell. Opus 5 liegt laut Anthropic bei Cybersicherheitsausnutzung und autonomer Biologieforschung weiterhin hinter Mythos 5.

Die sachliche Einordnung lautet daher:

Fähigkeiten der Spitzenklasse zum halben Spitzenpreis, mit einer klar benannten Obergrenze darüber.

Der Mythos-Klasse-Erklärer beschreibt die Modelle oberhalb dieser Grenze.

Für die meisten Teams ist jedoch die wichtigere Frage, ob der Workload überhaupt Opus benötigt. Sonnet 5 kostet 2 $ / 10 $ pro Million Tokens bis zum 31. August 2026 und danach 3 $ / 15 $ ab dem 1. September 2026. Testen Sie beide Modelle gegen Ihre eigenen Evaluierungen, bevor Sie ein Produktionsbudget festlegen.

Vollständige Spezifikationen und Verfügbarkeit finden Sie in der Claude-Opus-5-Übersicht sowie in Anthropics Modellübersicht.

FAQ

Wie viel kostet Claude Opus 5?

Über die Standard-API kostet Claude Opus 5 5 $ pro Million Eingabe-Tokens und 25 $ pro Million Ausgabe-Tokens. Cache-Treffer kosten 0,50 $, Batch-Läufe 2,50 $ / 12,50 $ und der schnelle Modus 10 $ / 50 $.

Ist Claude Opus 5 teurer als Opus 4.8?

Pro Token nicht: Die Preise sind identisch. Ihre Rechnung kann dennoch steigen, weil Denken standardmäßig aktiviert ist und Standardantworten länger ausfallen können. Messen Sie deshalb das tatsächliche Token-Volumen.

Gibt es einen Aufpreis für langen Kontext im 1M-Fenster?

Nein. Das Kontextfenster von 1 Million Tokens ist Standard und Maximum. Es gibt keine Premium-Stufe für lange Eingaben.

Was ist der günstigste Weg, Claude Opus 5 zu betreiben?

Cachen Sie wiederverwendete Präfixe aggressiv, führen Sie nicht dringende Jobs per Batch API aus und wählen Sie die niedrigste Aufwandsstufe, die Ihre Evaluierungen besteht. Der Leitfaden zum kostenlosen und günstigsten Pfad enthält weitere Details.

Kostet regionale Bindung extra?

Ja. inference_geo: "us" wendet einen Multiplikator von 1,1× auf alle Token-Kategorien an, einschließlich Cache-Treffer und Batch.

Top comments (0)