DEV Community

Cover image for Claude Fable 5.1 Benchmarks: Was die Zahlen wirklich aussagen
Emre Demir
Emre Demir

Posted on Originally published at apidog.com

Claude Fable 5.1 Benchmarks: Was die Zahlen wirklich aussagen

Anthropic hat Claude Fable 5.1 am 1. September 2026 zusammen mit einer Benchmark-Tabelle veröffentlicht, die das Modell über neun Tests mit Fable 5, Opus 5 und GPT-5.6 Sol vergleicht. Die größte Schlagzeile war Terminal-Bench-Science: Fable 5.1 erreichte 52,6 % gegenüber 24,7 % für Fable 5. Weniger Aufmerksamkeit bekam CursorBench, wo Fable 5.1 Opus 5 nur um 3,4 Punkte übertrifft – bei einem Modell, das doppelt so viel kostet.

Apidog heute ausprobieren

Dieser Leitfaden ordnet alle veröffentlichten Zahlen ein, erklärt die Benchmarks und trennt große von kleinen Unterschieden. Wichtig: Alle Ergebnisse stammen von Anthropic. Mythos 5.1 übertrifft Fable 5.1 beim einzigen veröffentlichten agentischen Codierungstest, und eine Einführungstabelle ersetzt keine eigenen Evaluierungen. Die Hauptquelle ist Anthropic’s Einführungsbeitrag; den Modellkontext erklärt Was Claude Fable 5.1 ist.

Die vollständige Tabelle

Benchmark Was er misst Fable 5.1 Fable 5 Opus 5 GPT-5.6 Sol
Terminal-Bench-Science 0.1 Agentische wissenschaftliche Forschung in einem Terminal 52,6 % 24,7 % 29,0 % 22,4 %
Terminal-Bench 4.0 Agentische Codierung in einem Terminal 55,8 % 42,0 % 52,3 % 37,3 %
GDPval-AA v2 Wirtschaftlich wertvolle Wissensarbeit (Elo) 1853 1723 1824 1711
OSWorld 2.0 (Partial Credit) Computernutzung bei echten Desktop-Aufgaben 77,9 % 72,9 % 75,4 % Nicht berichtet
OSWorld 2.0 (Strict) Vollständige Erledigung derselben Aufgaben 41,7 % 36,1 % 39,6 % Nicht berichtet
Humanity’s Last Exam (ohne Tools) Expertenfragen für logisches Denken 60,9 % 57,8 % 56,6 % Nicht berichtet
Humanity’s Last Exam (mit Tools) Dasselbe mit Suche und Code 65,0 % 63,8 % 63,6 % Nicht berichtet
AutomationBench End-to-End-Geschäftsprozesse 31,4 % 17,1 % 26,9 % 19,6 %
CursorBench 3.2.0 Codierungsaufgaben im IDE-Stil 73,4 % 70,5 % 70,0 % 67,2 %

Anthropic veröffentlichte außerdem für Mythos 5.1 einen Wert von 60,9 % auf Terminal-Bench 4.0. VentureBeat berichtete zusätzlich über ein BrowserBase-Ergebnis: 82 % für Fable 5.1, 74 % für Opus 5 und 57 % für Fable 5 bei den schwierigsten Browser-Agent-Aufgaben. Diese Zahl stammt aus der Presseberichterstattung, nicht aus dem Einführungsbeitrag.

Die großen Unterschiede

Terminal-Bench-Science 0.1: 52,6 % vs. 24,7 % und 29,0 %

Fable 5.1 übertrifft Fable 5 deutlich und liegt fast doppelt so hoch wie Opus 5. Der Benchmark setzt das Modell mit wissenschaftlichen Werkzeugen in ein Terminal und verlangt mehrstufige Forschung. Das ist der stärkste Beleg für Anthropic’s Fokus auf „langfristige Problemlösung“.

Allerdings ist Version 0.1 noch jung. Die Aufgaben und Ergebnisse können sich mit der Weiterentwicklung des Benchmarks verändern.

AutomationBench

AutomationBench: 31,4 % vs. 17,1 % und 26,9 %

AutomationBench misst End-to-End-Geschäftsprozesse über mehrere Anwendungen hinweg. Die absoluten Werte sind bei allen Modellen niedrig, doch Fable 5.1 erreicht fast doppelt so viel wie Fable 5 und liegt 4,5 Punkte vor Opus 5.

Wenn Ihr Produkt Geschäftsaufgaben über mehrere Anwendungen automatisiert, ist dies eine der relevantesten Zeilen der Tabelle.

Terminal-Bench 4.0: 55,8 % vs. 42,0 % und 52,3 %

Bei agentischer Codierung liegt Fable 5.1 um 13,8 Punkte vor Fable 5 und um 3,5 Punkte vor Opus 5. Damit kehrt der Vorteil der Fable-Stufe gegenüber Opus 5 zurück, nachdem Opus 5 Fable 5 bei diesem Benchmark im Juli übertroffen hatte. Der Benchmark-Vergleich zu Opus 5 enthält die Julizahlen.

Terminal-Bench

GDPval-AA v2: 1853 vs. 1723 und 1824

Fable 5.1 erzielt einen Elo-Gewinn von 130 gegenüber Fable 5. GDPval-AA v2 misst Wissensarbeit und wird von Anthropic für Aussagen zu Dokumenten, Tabellen und Präsentationen herangezogen. Der Abstand zu Opus 5 beträgt dagegen nur 29 Elo und ist damit gering.

Die kleinen Unterschiede

CursorBench 3.2.0: 73,4 % vs. 70,5 % und 70,0 %

CursorBench misst Codierungsaufgaben im IDE-Stil. Fable 5.1 liegt nur etwa drei Punkte vor Fable 5 und Opus 5. Für die größte Entwicklerzielgruppe ist das der wichtigste Benchmark – und zugleich der Bereich mit dem kleinsten Vorsprung.

Wenn Ihre Arbeitslast hauptsächlich „Hilf mir in meinem Editor“ lautet, rechtfertigt die Einführungstabelle allein keinen doppelt so hohen Preis.

CursorBench

OSWorld 2.0: 77,9 % / 41,7 % vs. 75,4 % / 39,6 %

OSWorld misst Computernutzung bei realen Desktop-Aufgaben. Fable 5.1 liegt bei Partial Credit und Strict Scoring jeweils etwa zwei Punkte vor Opus 5 und fünf Punkte vor Fable 5.

Der Strict-Wert ist besonders aufschlussreich: Weniger als die Hälfte der Aufgaben wurde von einem Modell vollständig erledigt. Computernutzung bleibt damit ein schwacher Bereich moderner Spitzenmodelle.

Humanity’s Last Exam: 60,9 % / 65,0 % vs. 56,6 % / 63,6 %

Ohne Tools liegt Fable 5.1 um 4,3 Punkte vor Opus 5 – der größte der kleineren Vorsprünge. Mit Suche und Codeausführung schrumpft der Abstand auf 1,4 Punkte, weil die zusätzlichen Werkzeuge das Feld angleichen.

Der Wert ohne Tools misst reines logisches Denken besser. Der Wert mit Tools kommt der tatsächlichen Nutzung näher.

Humanity’s Last Exam

Fable 5.1 vs. GPT-5.6 Sol

Anthropic veröffentlichte vier Benchmark-Zeilen mit einer GPT-5.6-Sol-Spalte. Fable 5.1 führt in allen vier:

  • Terminal-Bench-Science: 30,2 Punkte Vorsprung
  • Terminal-Bench 4.0: 18,5 Punkte
  • AutomationBench: 11,8 Punkte
  • CursorBench: 6,2 Punkte
  • GDPval-AA: 1853 gegenüber 1711 Elo

Zwei Einschränkungen bleiben:

  1. Anthropic führte die Vergleichsläufe selbst durch.
  2. Für fünf der neun Benchmarks veröffentlichte Anthropic keinen GPT-5.6-Sol-Wert und nannte dafür keinen Grund.

Der frühere Vergleich GPT-5.6 Sol vs. Claude Fable 5 behandelte die vorherige Modellgeneration. Nach den neuen Zahlen vergrößert Fable 5.1 jeden Vorsprung, den Fable 5 dort hatte.

Was die Einführungsberichterstattung übersprungen hat

Alle Zahlen stammen vom Anbieter

Anthropic führte sämtliche Tests selbst durch, einschließlich der Vergleichsläufe mit Konkurrenzmodellen. Zum Start hatte kein unabhängiges Labor die Ergebnisse reproduziert.

Anthropic’s Benchmark-Historie ist im Allgemeinen belastbar. Die kleinen Abstände bei CursorBench und OSWorld könnten sich durch eine andere Testumgebung oder Bewertungsoption jedoch umkehren.

Mythos 5.1 liegt noch darüber

Anthropic’s Systemkarte und der Einführungsbeitrag beschreiben Fable 5.1 und Mythos 5.1 als „dasselbe Modell, aber mit unterschiedlichen Sicherheitsstufen“.

Für Mythos 5.1 veröffentlichte Anthropic 60,9 % auf Terminal-Bench 4.0 – fünf Punkte mehr als Fable 5.1 mit 55,8 %. Dieser Abstand zeigt, welchen Preis die Schutzmaßnahmen bei agentischer Codierung haben können. Der Vergleich Mythos 5.1 vs. Fable 5.1 erklärt, wer auf das Modell zugreifen kann.

Das Aufwandsniveau wurde nicht veröffentlicht

Anthropic’s Aufwandsdokumentation zufolge sind die Gewinne von Fable 5.1 bei xhigh und max am größten. Der Einführungsbeitrag nennt jedoch weder das Aufwandsniveau für die einzelnen Ergebnisse noch den Aufwand der Vergleichsmodelle.

Da der Aufwand ein zentraler Qualitätshebel ist, erschwert diese Lücke die Reproduzierbarkeit.

Mehrsprachige Leistung bleibt unverändert

Anthropic gibt an, dass die mehrsprachige Leistung ungefähr auf dem Niveau von Fable 5 liegt. Für nicht-englische Arbeitslasten sollte die Einführungstabelle den tatsächlichen Gewinn daher nicht überzeichnen.

Schutzmaßnahmen sind eine andere Benchmark-Kategorie

Gegenüber Fable 5 berichtet Anthropic von:

  • 85 % weniger biologischen Fehlalarmen bei gutartigen Anfragen
  • etwa 60 % weniger Cyber-Interventionen pro Claude-Code-Sitzung

Diese Werte basieren auf Anthropic’s eigenem Traffic und sind extern nicht reproduzierbar. Für Fable-5-Nutzer, die häufig auf Ablehnungen stoßen, können sie dennoch wichtiger sein als reine Fähigkeitsbenchmarks.

Was Sie selbst testen sollten

Eine Einführungstabelle zeigt, wo sich Tests lohnen. Eigene Evaluierungen entscheiden, ob ein Wechsel sinnvoll ist.

1. Langfristige Agentenaufgabe

Führen Sie eine reale, mehrstufige Aufgabe aus Ihrem Produkt aus:

  • Fable 5.1 mit high
  • Opus 5 mit xhigh
  • Fable 5 mit high

Das entspricht der Logik von Terminal-Bench-Science und AutomationBench. So sehen Sie, ob sich der doppelte Preis für Ihre Arbeitslast auszahlt.

2. Schwierige Codierungs-Prompts

Testen Sie Ihre zehn anspruchsvollsten Codierungs-Prompts mit identischem Aufwand auf Fable 5.1 und Opus 5. Sind die Ergebnisse gleichwertig, bestätigt das die CursorBench-Tendenz – und Opus 5 könnte die wirtschaftlichere Wahl sein.

3. Aufwand von low bis max

Führen Sie eine Aufwandserhebung nur für Fable 5.1 mit Einstellungen von low bis max durch. Anthropic behauptet, dass medium ungefähr Fable 5 entspricht und low bei den Kosten pro Aufgabe mit Opus 5 konkurrieren kann. Überprüfen Sie diese Aussage mit Ihren eigenen Aufgaben.

4. Verweigerungsrate

Zählen Sie Ablehnungen bei gutartigen Sicherheits- oder Biowissenschafts-Prompts für Fable 5 und Fable 5.1. Damit lässt sich Anthropic’s Behauptung zu 60 % weniger Cyber-Interventionen und 85 % weniger biologischen Fehlalarmen zumindest für Ihre Arbeitslast an einem Nachmittag überprüfen.

Erstellen Sie alle vier Tests als Anfragen in Apidog. Verwenden Sie model und effort als Umgebungsvariablen, ergänzen Sie Zusicherungen für stop_reason und eine erwartete Zeichenkette in der Antwort und führen Sie die Sammlung für jedes Modell aus.

Der Ausführungsverlauf liefert eine reproduzierbare Evaluierungstabelle ohne zusätzliche Infrastruktur. Apidog herunterladen; die API-Anleitung zeigt die passenden Anfrageformen.

Apidog-Evaluierung

Wie die Benchmarks zur Entscheidung beitragen

  • Langfristige Agenten, Forschung und Automatisierung: Die Unterschiede sind groß und konsistent. Fable 5.1 ist hier das stärkere Modell. Die Preisübersicht zeigt, wie günstigere Cache-Zugriffe die Kostenlücke bei diesen Arbeitslasten reduzieren.
  • IDE-Codierung, Wissens-Q&A und werkzeuggestütztes Denken: Die Abstände zu Opus 5 liegen meist bei ein bis vier Punkten. Anthropic’s eigene Empfehlung lautet: Bleiben Sie bei Opus 5, sofern Fable 5.1 Ihre Evaluierungen nicht mit höherem Aufwand klar gewinnt. Der Vergleich Fable 5.1 vs. Opus 5 enthält weitere Details.
  • Wechsel von Fable 5: Jede Benchmark-Zeile verbessert sich, während der Preis unverändert bleibt und die Rate falsch-positiver Ergebnisse sinkt. Der Vergleich Fable 5.1 vs. Fable 5 behandelt die Migrationskosten.

FAQ

Was ist das beste Benchmark-Ergebnis von Claude Fable 5.1?

Terminal-Bench-Science 0.1 mit 52,6 %. Das ist mehr als doppelt so viel wie Fable 5 mit 24,7 % und liegt vor Opus 5 mit 29,0 % sowie GPT-5.6 Sol mit 22,4 %. Alle Werte stammen von Anthropic.

Wie schneidet Fable 5.1 im Vergleich zu Opus 5 beim Codieren ab?

Fable 5.1 erreicht 55,8 % gegenüber 52,3 % auf Terminal-Bench 4.0 und 73,4 % gegenüber 70,0 % auf CursorBench 3.2.0. Der Vorsprung beträgt in realen Codierungsaufgaben nur etwa drei Punkte.

Ist Fable 5.1 besser als GPT-5.6 Sol?

In den Benchmarks, für die Anthropic beide Werte veröffentlichte, ja: Der Vorsprung liegt je nach Test zwischen 6 und 30 Punkten. Anthropic führte die GPT-5.6-Sol-Läufe selbst durch; fünf der neun Zeilen enthalten keinen Vergleichswert.

Sind die Benchmarks unabhängig überprüft?

Zum Start nicht. Alle Zahlen stammen von Anthropic und sollten als Behauptungen betrachtet werden, die Sie an Ihrer eigenen Arbeitslast testen müssen.

Wie schneidet Mythos 5.1 ab?

Anthropic veröffentlichte 60,9 % auf Terminal-Bench 4.0 – fünf Punkte mehr als Fable 5.1 mit 55,8 %. Beide Modelle basieren auf derselben Modellbasis, verwenden aber unterschiedliche Schutzmaßnahmen.

Welches Aufwandsniveau erzeugte die Ergebnisse?

Anthropic hat es nicht angegeben. Da Anthropic die größten Gewinne bei xhigh und max erwartet, sollten Sie von hohem Aufwand ausgehen und bei niedrigeren Einstellungen mit geringeren Ergebnissen rechnen.

Top comments (0)