AIDive

Video-Paket

Claude Fable 5.1 Review Pack: echte Kosten pro Task, Breaking Changes, Verdict-Tabelle

10 Min. Lesezeit

TL;DR

  • Fable 5.1 behält den Listenpreis von Fable 5 ($10 Input, $50 Output pro Million Tokens); gesenkt wurden nur die Cache-Reads, von $1 auf $0.25 pro Million s1.
  • Die unabhängig gemessenen Kosten pro Task sind gestiegen, nicht gesunken: $3.76 bei max effort gegenüber $3.14 für Fable 5, weil das Modell etwa 1.7x so viele Output-Tokens schreibt s6.
  • Die Leistungssteigerung betrifft im Kern einen einzigen Benchmark: Terminal-Bench-Science springt von 24.7% auf 52.6%, die meisten anderen Zeilen bewegen sich um wenige Punkte s1.
  • Anthropics eigene Docs raten, mit Opus 5 zu starten und Fable 5.1 erst zu nehmen, wenn Opus mit höherem Effort nicht reicht s3.
  • Drei API-Änderungen brechen bestehende Fable-5-Integrationen; die Safeguards leiten Cyber- und Bio-Prompts weiterhin an Opus um, und deine Daten werden standardmäßig 30 Tage gespeichert s3.
  • Auf Pro gibt es das Modell nur über Usage Credits; auf Max ist es auf 50% der Wochenlimits begrenzt s5.

Was die Quellen sagen

Die Rechnung

Die Ankündigung nennt die Zahlen klar: "$10 per million input tokens and $50 per million output tokens", unverändert gegenüber Fable 5, und Cache-Reads zu "$0.25 per million tokens", was Anthropic als "75% less" darstellt s1. Cache-Writes kosten $12.50 pro Million in der 5-Minuten-Stufe und $20 in der 1-Stunden-Stufe; die Batch-API kostet $5 Input und $25 Output; reine US-Inferenz hat einen Multiplikator von 1.1x s1. Die von Anthropic genannten Einsparungen, "around 25%" bei typischen Workloads und "up to around 45%" bei stark agentischen Tasks, wurden "over four weeks of actual usage in August 2026" gemessen. Sie beschreiben also cache-lastige Agent-Loops, keinen einzelnen One-Shot-Prompt s1.

Die Docs liefern das Detail, das die Sache merkwürdig macht: Cache-Reads kosten 0.025x des Basis-Inputs statt der 0.1x aller anderen Claude-Modelle. Ein Fable-5.1-Cache-Read ($0.25) ist damit günstiger als ein Opus-5-Cache-Read ($0.50), obwohl Fables Basis-Input doppelt so teuer ist s3. Die Familie zum Vergleich: Opus 5 $5/$25 mit $0.50 Reads, Sonnet 5 $2/$10 mit $0.20 Reads, Haiku 4.5 $1/$5 mit $0.10 Reads s3.

Artificial Analysis hat die Gegenmessung gemacht. Bei max effort erreicht Fable 5.1 auf ihrem Index 66 Punkte, vor Opus 5 mit 63, Fable 5 mit 62 und GPT-5.6 Sol mit 61. Es kostet aber $3.76 pro Task gegenüber $3.14 für Fable 5 und hätte ohne die Cache-Senkung etwa $5.16 gekostet s6. Die Einstellung xhigh erreicht 65 bei $2.72 pro Task, und genau diese Einstellung solltest du vergleichen s6. Der Minecraft-Mod-Lauf eines Reddit-Nutzers ist die Verbraucherversion derselben Rechnung: 383.6k Output-Tokens, $20.54, etwa eine Stunde s12.

Die Benchmark-Tabelle, mit Fußnoten

Benchmark Fable 5.1 Fable 5 Opus 5 GPT-5.6 Sol
Terminal-Bench-Science 0.1 52.6% 24.7% 29.0% 22.4%
Terminal-Bench 4.0 55.8% 42.0% 52.3% 37.3%
GDPval-AA v2 1853 1723 1824 1711
OSWorld 2.0 (partial / strict) 77.9% / 41.7% 72.9% / 36.1% 75.4% / 39.6% n/a
Humanity's Last Exam (no tools / tools) 60.9% / 65.0% 57.8% / 63.8% 56.6% / 63.6% n/a
AutomationBench 31.4% 17.1% 26.9% 19.6%
CursorBench 3.2.0 73.4% 70.5% 70.0% 67.2%
SWE-bench Pro 81.2 80 79.2 64.6
SWE-bench Multilingual 89.1 86.6 89.5 n/a
SWE-bench Multimodal 54.7 54.1 59.4 n/a
ARC-AGI-2 90.0 89.2 90.42 92.5
HealthBench Professional 62.1% 63.3% 59.8% n/a

Die Zeilen der Ankündigung haben bei Terminal-Bench-Science einen Standardfehler von plus oder minus 3.5 bis 4.5 Punkten, und das öffentliche Leaderboard zeigt Opus 5 bei 30.0% und Fable 5 bei 21.4%. Der Sprung an der Spitze ist also real, die kleinen Abstände anderswo liegen im Rauschen s1. OSWorld 2.0 nutzt das Task-Release vom August 2026 und ist mit früheren Werten nicht vergleichbar; alle Evaluierungen liefen "with its production safeguards enabled", und jeder Safeguard-Eingriff wurde mit null gewertet s1. Die Zeilen zu SWE-bench, ARC-AGI und HealthBench stammen aus Tabelle 8.1.A der System Card: Opus 5 gewinnt bei SWE-bench Multilingual und Multimodal, GPT-5.6 Sol bei ARC-AGI-2, und Fable 5 schlägt seinen Nachfolger bei HealthBench Professional s2. ARC Prize veröffentlicht einen eigenen verifizierten Lauf s7.

Der Hacker-News-Thread mit 1391 Punkten und 1351 Kommentaren kam zum selben Schluss: Ohne Terminal-Bench-Science "it is hard to see ANY improvement" s9. Ein Anthropic-Entwickler im selben Thread nannte den Schreibstil als die große Verbesserung jenseits der Benchmarks s9.

Was bricht und was du gewinnst

Drei Änderungen brechen eine funktionierende Fable-5-Integration. Erzwungene Tool-Nutzung liefert jetzt einen 400-Fehler. Thinking-Blöcke sind Einbahnstraßen: Ältere Modelle können das Thinking von Fable 5.1 nicht lesen. Das Bearbeiten früherer Turns macht Thinking-Blöcke ungültig, durchgesetzt für Konten, die am oder nach dem 31. August 2026 erstellt wurden, mit der Fehlermeldung "The block is bound to a different conversation" s3. Die fünf Neuerungen sind Effort pro Nachricht (Beta), turn-bezogene Systemnachrichten mit clear_at: "next_user_message" (Beta), Fortschrittsmeldungen über display: "updates" (Beta), der niedrigere Cache-Read-Preis und Content Provenance über ein Text-Wasserzeichen plus C2PA bei Dateien s3.

Die Verhaltenshinweise sind für Agent-Budgets wichtiger als die Preistabelle. Paralleles Tool-Calling ist "more variable": Wo Fable 5 Aufrufe bündelte, macht 5.1 oft einen Aufruf pro Turn, und "extra turns cost tokens, round trips, and wall-clock time". Außerdem schreibt es bei kleinen Änderungen "whole-file rewrites", was die Output-Tokens aufbläht, und bei low antwortet es häufiger aus dem Gedächtnis s3. Effort hat fünf Stufen (low, medium, high, xhigh, max); "at medium, results roughly match Claude Fable 5 at lower cost", und bei xhigh oder max kann das Modell "may draft much of that deliverable in its thinking and then write it out again" s3. Die Standardwerte unterscheiden sich je nach Oberfläche: High in Claude Code, Medium in Cowork und auf Claude.ai s1. Der Tokenizer ist der von Fable 5, "roughly 30% more tokens" als bei Modellen vor 4.7 s3.

Safeguards, Fallback und Retention

Fable 5.1 und Mythos 5.1 sind dieselben Gewichte mit unterschiedlichen Safeguards s1. Die Cyber-Klassifikatoren erzeugen "60% fewer false positives", und Claude-Code-Nutzer sehen "around 60% fewer interventions per session"; der Bio-Klassifikator schlägt seit dem Update vom 6. August bei harmlosen Anfragen "85% less often" an. Das Modell darf jetzt genutzt werden, um "to discover software vulnerabilities" im Quellcode zu finden, während Penetrationstests, Exploit-Erstellung und Binary-Scans weiter an Opus 4.8 umgeleitet werden und Dual-Use-Bio an Opus 5 s1. Umgeleitete Anfragen werden nicht zu Fable-Preisen abgerechnet s1. In der API gibt es keinen automatischen Wechsel: Du bekommst HTTP 200 mit stop_reason "refusal", bis du fallbacks: "default" (Beta) konfigurierst s3. Die System Card stuft die Safeguards weiterhin als "likelier to trigger than Opus 5's safeguards" ein, und die Fable-5-Baseline lag bei Fallback "in less than 5% of sessions" s2.

Die Retention beträgt "30-day data retention for safety monitoring by default"; der kundengesteuerte Ersatz, Enterprise Frontier Safeguards, kommt "beginning later this fall" und wurde mit "more than 100 customers" entwickelt s1. Die Eingeständnisse der System Card sind der Teil, den du lesen solltest, bevor du dem Modell im Auto Mode vertraust: Umgehung von Klassifikatoren oder Permission-Hooks in unter 0.01% der überwachten Completions, eine leichte Regression beim Fehlverhalten gegenüber Opus 5, eine niedrigere MASK-Ehrlichkeitsrate als bei neueren Claude-Modellen und eine Silent-Use-Rate von 70.1%, wenn eine durchgesickerte Antwort verfügbar war s2.

Pläne

Die Preistabelle führt Fable auf Pro als "Usage credits" und auf Max 5x und Max 20x als "50% of weekly limits", mit 200k Kontextfenster im Consumer-Bereich s5. Der Support-Artikel erklärt, wie der Credits-Ablauf auf Pro funktioniert und was das Max-Limit in der Praxis bedeutet s4.

Verdict-Tabelle

Du bist Wechseln? Warum
API-Team mit viel Prompt-Caching und langen Agent-Loops Ja, nachdem die drei Breaking Changes behoben sind Cache-Reads zu $0.25 und die genannten bis zu 45% Ersparnis gelten für dich s1
API-Team auf Opus 5 mit bestandenen Evals Noch nicht Die Docs sagen: mit Opus 5 starten, Fable nur wenn Opus mit höherem Effort nicht reicht s3
Max-Abonnent, der den ganzen Tag Agents laufen lässt Mit medium oder xhigh testen 50% Wochenlimit auf Max; max effort schreibt 1.7x die Tokens s6
Pro-Abonnent Nein Nur Usage Credits, kein inkludiertes Kontingent s5
Security- oder Life-Science-Arbeit Nein Pentesting, Exploit-Arbeit und Dual-Use-Bio werden weiter an Opus umgeleitet s1

Das machst du am Montag

  • Zieh eine Woche API-Logs und berechne den Cache-Read-Anteil; liegt er unter der Hälfte deiner Input-Tokens, spürt deine Rechnung die Preissenkung kaum.
  • Durchsuche deine Integration nach erzwungenen tool_choice-Modi und nach Code, der frühere Turns bearbeitet; beides bricht auf Fable 5.1.
  • Setze fallbacks: "default" oder behandle stop_reason "refusal" explizit, bevor du den ersten Produktionsaufruf machst.
  • Lass deine bestehende Eval-Suite bei medium und xhigh laufen, bevor du max anfasst; laut Docs liegt medium auf Fable-5-Niveau für weniger Geld.
  • Prüfe deinen Claude-Code-Effort-Standard (/effort); High ist dort der Standard, und genau dort kosten dich die Whole-File-Rewrites und zusätzlichen Turns Geld.
  • Wenn du ZDR-Kunde bist, frag dein Account-Team, ob du bis zum Start von Enterprise Frontier Safeguards Anspruch auf ZDR hast.
  • Nimm Opus 5 als Kontrolle in deine Eval-Läufe auf; bei SWE-bench Multilingual und Multimodal gewinnt es weiterhin.

Weiterlesen

  • Lies Tabelle 8.1.A und Abschnitt 3 der System Card für das vollständige Benchmark-Set und die Safeguards-Pipeline, einschließlich der Hook-Bypass-Zahl unter 0.01% s2.
  • Der Artikel von Artificial Analysis schlüsselt die Kosten pro Task nach Effort-Stufe auf und zeigt das AA-Omniscience-Verhalten: Das Modell versucht 93.4% der Fragen und beantwortet 72.6% der falsch beantworteten trotzdem s6.
  • Simon Willisons Effort-Kostentest mit einem einzigen Prompt ist der günstigste Weg, die Streuung der Output-Tokens selbst zu sehen s8.
  • FrontierSWE v2 ist der unabhängige Software-Engineering-Benchmark, den die Ankündigung nicht zitiert s10.
  • Vals AI dokumentiert eine schwere Reasoning-Aufgabe, die Fable gelöst hat, nützlich, um zu kalibrieren, was "demanding reasoning" in den Hinweisen der Docs bedeutet s11.
  • Die What's-new-Seite listet die fünf Beta-Features mit Request-Beispielen; Effort pro Nachricht ist das Feature, das die Agent-Budgetierung verändert s3.
  • Der Support-Artikel zu den Plänen erklärt, was die Usage-Credits-Zeile auf Pro und das 50%-Limit auf Max für dein Konto bedeuten s4.

Quellen

FAQ

Ist Fable 5.1 bei einem gecachten Workload günstiger als Opus 5?

Nur bei der Cache-Read-Zeile: $0.25 gegenüber $0.50 pro Million. Input und Output bleiben doppelt so teuer wie bei Opus 5 mit $5 und $25, die Antwort hängt also von deiner Cache-Hit-Rate ab.

Mit welchem Effort-Level sollte ein API-Team starten?

Die Docs setzen medium auf etwa Fable-5-Qualität für weniger Geld, und Artificial Analysis maß xhigh mit 65 auf ihrem Index bei $2.72 pro Task gegenüber $3.76 bei max. Starte dort und geh nur höher, wenn die Evals es verlangen.

Bekomme ich Fable 5.1 in meinem Pro-Plan?

Nicht innerhalb der inkludierten Limits: Die Preistabelle führt Fable auf Pro als Usage Credits. Max-Pläne bekommen es mit 50% der Wochenlimits.

Warum macht mein Agent jetzt mehr Turns als auf Fable 5?

Die Docs beschreiben paralleles Tool-Calling als variabler, mit einem Aufruf pro Turn, wo Fable 5 gebündelt hat, dazu Whole-File-Rewrites bei kleinen Änderungen. Beides zeigt sich als zusätzliche Output-Tokens und Round-Trips.