AIDive

Pack video

Claude Fable 5.1 review pack: costo reale per task, breaking change, tabella verdetto

10 min di lettura

TL;DR

  • Fable 5.1 mantiene il prezzo di listino di Fable 5 ($10 in input, $50 in output per milione di token); l'unico taglio riguarda le letture dalla cache, da $1 a $0.25 per milione s1.
  • Il costo per task misurato in modo indipendente è salito, non sceso: $3.76 a max effort contro $3.14 di Fable 5, perché scrive circa 1.7x i token di output s6.
  • Il salto di capacità riguarda in sostanza un solo benchmark: Terminal-Bench-Science passa da 24.7% a 52.6%, la maggior parte delle altre righe si sposta di pochi punti s1.
  • La documentazione di Anthropic stessa dice di partire da Opus 5 e di passare a Fable 5.1 solo quando Opus con effort più alto non basta s3.
  • Tre modifiche API rompono le integrazioni con Fable 5; le safeguard continuano a deviare i prompt cyber e bio su Opus, e i tuoi dati restano conservati 30 giorni per impostazione predefinita s3.
  • Su Pro è disponibile solo con usage credits; su Max è limitato al 50% dei limiti settimanali s5.

Cosa dicono le fonti

Il conto

L'annuncio riporta i numeri in modo chiaro: "$10 per million input tokens and $50 per million output tokens", invariati rispetto a Fable 5, e letture dalla cache a "$0.25 per million tokens", che Anthropic presenta come "75% less" s1. Le scritture in cache costano $12.50 per milione nella fascia da 5 minuti e $20 in quella da 1 ora; la batch API costa $5 in input e $25 in output; l'inferenza solo US ha un moltiplicatore di 1.1x s1. I risparmi citati da Anthropic, "around 25%" sui carichi tipici e "up to around 45%" sui task molto agentici, sono stati misurati "over four weeks of actual usage in August 2026", quindi descrivono loop di agenti con molta cache, non un prompt singolo s1.

La documentazione aggiunge il dettaglio che rende la cosa strana: le letture dalla cache costano 0.025x dell'input base invece dello 0.1x di tutti gli altri modelli Claude, quindi una lettura cache di Fable 5.1 ($0.25) costa meno di una di Opus 5 ($0.50), anche se l'input base di Fable è il doppio s3. La famiglia per confronto: Opus 5 $5/$25 con letture a $0.50, Sonnet 5 $2/$10 con letture a $0.20, Haiku 4.5 $1/$5 con letture a $0.10 s3.

Artificial Analysis ha fatto la misura opposta. A max effort Fable 5.1 ottiene 66 sul loro indice, davanti a Opus 5 con 63, Fable 5 con 62 e GPT-5.6 Sol con 61, ma costa $3.76 per task contro $3.14 di Fable 5, e senza il taglio della cache sarebbe costato circa $5.16 s6. L'impostazione xhigh ottiene 65 a $2.72 per task, ed è quella che la maggior parte delle persone dovrebbe confrontare s6. La run di un utente Reddit su una mod di Minecraft è la versione consumer dello stesso calcolo: 383.6k token di output, $20.54, circa un'ora s12.

La tabella dei benchmark, con note

Benchmark Fable 5.1 Fable 5 Opus 5 GPT-5.6 Sol
Terminal-Bench-Science 0.1 52.6% 24.7% 29.0% 22.4%
Terminal-Bench 4.0 55.8% 42.0% 52.3% 37.3%
GDPval-AA v2 1853 1723 1824 1711
OSWorld 2.0 (partial / strict) 77.9% / 41.7% 72.9% / 36.1% 75.4% / 39.6% n/a
Humanity's Last Exam (no tools / tools) 60.9% / 65.0% 57.8% / 63.8% 56.6% / 63.6% n/a
AutomationBench 31.4% 17.1% 26.9% 19.6%
CursorBench 3.2.0 73.4% 70.5% 70.0% 67.2%
SWE-bench Pro 81.2 80 79.2 64.6
SWE-bench Multilingual 89.1 86.6 89.5 n/a
SWE-bench Multimodal 54.7 54.1 59.4 n/a
ARC-AGI-2 90.0 89.2 90.42 92.5
HealthBench Professional 62.1% 63.3% 59.8% n/a

Le righe dell'annuncio hanno un errore standard di più o meno 3.5-4.5 punti su Terminal-Bench-Science, e la leaderboard pubblica mostra Opus 5 al 30.0% e Fable 5 al 21.4%: il divario di punta è reale, ma i piccoli scarti altrove rientrano nel rumore s1. OSWorld 2.0 usa il rilascio di task di agosto 2026 e non è confrontabile con i valori precedenti; tutte le valutazioni sono state eseguite "with its production safeguards enabled" e qualsiasi intervento delle safeguard è stato conteggiato come zero s1. Le righe di SWE-bench, ARC-AGI e HealthBench vengono dalla tabella 8.1.A della system card, dove Opus 5 vince su SWE-bench Multilingual e Multimodal, GPT-5.6 Sol vince su ARC-AGI-2 e Fable 5 batte il suo successore su HealthBench Professional s2. ARC Prize pubblica una propria run verificata s7.

Il thread di Hacker News, con 1391 punti e 1351 commenti, è arrivato alla stessa lettura: tolto Terminal-Bench-Science "it is hard to see ANY improvement" s9. Un ingegnere di Anthropic nello stesso thread ha indicato lo stile di scrittura come il grande miglioramento oltre i benchmark s9.

Cosa si rompe e cosa guadagni

Tre modifiche rompono un'integrazione funzionante con Fable 5. L'uso forzato dei tool ora restituisce un errore 400. I blocchi di thinking sono a senso unico: i modelli precedenti non possono leggere il thinking di Fable 5.1. Modificare i turni precedenti invalida i blocchi di thinking, con applicazione per gli account creati dal 31 agosto 2026 in poi, con l'errore "The block is bound to a different conversation" s3. Le cinque aggiunte sono l'effort per messaggio (beta), i messaggi di sistema limitati al turno con clear_at: "next_user_message" (beta), gli aggiornamenti di avanzamento tramite display: "updates" (beta), il prezzo più basso delle letture cache e la provenienza dei contenuti tramite filigrana di testo più C2PA sui file s3.

Le note sul comportamento contano più della tabella dei prezzi per i budget degli agenti. Il tool calling parallelo è "more variable": dove Fable 5 raggruppava le chiamate, 5.1 spesso ne fa una per turno, e "extra turns cost tokens, round trips, and wall-clock time". Fa anche "whole-file rewrites for small changes", che gonfiano i token di output, e a low risponde più spesso a memoria s3. L'effort ha cinque livelli (low, medium, high, xhigh, max); "at medium, results roughly match Claude Fable 5 at lower cost", e a xhigh o max il modello "may draft much of that deliverable in its thinking and then write it out again" s3. I default cambiano per superficie: High in Claude Code, Medium in Cowork e su Claude.ai s1. Il tokenizer è quello di Fable 5, "roughly 30% more tokens" rispetto ai modelli precedenti alla 4.7 s3.

Safeguard, fallback e retention

Fable 5.1 e Mythos 5.1 hanno gli stessi pesi con safeguard diverse s1. I classificatori cyber producono "60% fewer false positives" e gli utenti di Claude Code vedono "around 60% fewer interventions per session"; il classificatore bio scatta "85% less often" per richieste innocue dall'aggiornamento del 6 agosto. Il modello può ora essere usato "to discover software vulnerabilities" nel codice sorgente, mentre penetration test, generazione di exploit e scansione di binari continuano a essere deviati su Opus 4.8, e il bio dual-use su Opus 5 s1. Le richieste deviate non vengono fatturate ai prezzi di Fable s1. Nell'API non c'è passaggio automatico: ottieni HTTP 200 con stop_reason "refusal" finché non configuri fallbacks: "default" (beta) s3. La system card valuta ancora le safeguard "likelier to trigger than Opus 5's safeguards", e la baseline di Fable 5 usava il fallback "in less than 5% of sessions" s2.

La retention è "30-day data retention for safety monitoring by default"; il sostituto controllato dal cliente, Enterprise Frontier Safeguards, arriva "beginning later this fall" ed è stato costruito con "more than 100 customers" s1. Le ammissioni della system card sono la parte da leggere prima di fidarsi del modello in auto mode: aggirare classificatori o hook di permessi in meno dello 0.01% dei completamenti monitorati, una lieve regressione sul comportamento disallineato rispetto a Opus 5, un tasso di onestà MASK più basso dei recenti modelli Claude e un silent use rate del 70.1% quando era disponibile una risposta trapelata s2.

Piani

La tabella prezzi indica Fable su Pro come "Usage credits" e su Max 5x e Max 20x come "50% of weekly limits", con la finestra di contesto consumer a 200k s5. L'articolo di supporto spiega come funzionano i crediti su Pro e cosa significa in pratica il limite su Max s4.

Tabella verdetto

Chi sei Passare? Perché
Team API con molto prompt caching e loop di agenti lunghi Sì, dopo aver sistemato le tre breaking change Le letture cache a $0.25 e il risparmio citato fino al 45% valgono per te s1
Team API su Opus 5 con eval che passano Non ancora La documentazione dice di partire da Opus 5; Fable solo se Opus a effort più alto non basta s3
Abbonato Max che fa girare agenti tutto il giorno Prova a medium o xhigh Limite settimanale al 50% su Max; max effort scrive 1.7x i token s6
Abbonato Pro No Solo usage credits, nessuna quota inclusa s5
Lavoro di sicurezza o scienze della vita No Pentesting, lavoro sugli exploit e bio dual-use vengono ancora deviati su Opus s1

Da fare lunedì

  • Scarica una settimana di log API e calcola la quota di letture cache; se è sotto la metà dei tuoi token di input, il taglio di prezzo incide poco sul conto.
  • Cerca nella tua integrazione le modalità tool_choice forzate e qualsiasi codice che modifica i turni precedenti; entrambi si rompono su Fable 5.1.
  • Imposta fallbacks: "default" o gestisci esplicitamente stop_reason "refusal" prima della prima chiamata in produzione.
  • Esegui la tua suite di eval esistente a medium e xhigh prima di toccare max; la documentazione colloca medium al livello di Fable 5 a costo inferiore.
  • Controlla il default di effort in Claude Code (/effort); lì il default è High, ed è dove le riscritture di interi file e i turni extra ti costano.
  • Se sei cliente ZDR, verifica con il tuo account team se hai diritto a ZDR fino al rilascio di Enterprise Frontier Safeguards.
  • Aggiungi Opus 5 come controllo nelle tue eval; su SWE-bench Multilingual e Multimodal vince ancora.

Per approfondire

  • Leggi la tabella 8.1.A e la sezione 3 della system card per il set completo di benchmark e la pipeline delle safeguard, compresa la cifra sotto lo 0.01% di bypass degli hook s2.
  • L'articolo di Artificial Analysis scompone il costo per task per livello di effort e mostra il comportamento AA-Omniscience: tenta il 93.4% delle domande e risponde al 72.6% di quelle che sbaglia s6.
  • Il test di costo per livello di effort di Simon Willison su un singolo prompt è il modo più economico per vedere con i tuoi occhi la dispersione dei token di output s8.
  • FrontierSWE v2 è il benchmark indipendente di software engineering che l'annuncio non cita s10.
  • Vals AI documenta un task di ragionamento difficile risolto da Fable, utile per calibrare cosa significa "demanding reasoning" nelle indicazioni della documentazione s11.
  • La pagina what's new elenca le cinque funzioni beta con esempi di richiesta; l'effort per messaggio è quella che cambia il budget degli agenti s3.
  • L'articolo di supporto sui piani spiega cosa significano per il tuo account la riga usage credits su Pro e il limite del 50% su Max s4.

Fonti

FAQ

Fable 5.1 costa meno di Opus 5 per un carico con cache?

Solo sulla riga delle letture cache: $0.25 contro $0.50 per milione. Input e output restano il doppio di Opus 5 ($5 e $25), quindi la risposta dipende dal tuo cache hit ratio.

Con quale livello di effort dovrebbe iniziare un team API?

La documentazione colloca medium più o meno alla qualità di Fable 5 a costo inferiore, e Artificial Analysis ha misurato xhigh a 65 sul suo indice per $2.72 a task contro $3.76 a max. Parti da lì e sali solo se le eval lo richiedono.

Ho Fable 5.1 nel mio piano Pro?

Non nei limiti inclusi: la tabella prezzi indica Fable su Pro come usage credits. I piani Max lo ottengono al 50% dei limiti settimanali.

Perché il mio agente ora fa più turni che su Fable 5?

La documentazione descrive il tool calling parallelo come più variabile, con una chiamata per turno dove Fable 5 le raggruppava, più riscritture di interi file per piccole modifiche. Entrambi si vedono come token di output e round trip in più.