AIDive

Pack vidéo

Pack Claude Fable 5.1 : coût réel par tâche, changements cassants, verdict

10 min de lecture

TL;DR

  • Fable 5.1 garde le prix catalogue de Fable 5 (10 $ en entrée, 50 $ en sortie par million de tokens). La seule baisse concerne les lectures de cache, de 1 $ à 0,25 $ par million s1.
  • Le coût indépendant par tâche a augmenté, pas baissé : $3.76 à l'effort max contre $3.14 pour Fable 5, parce que le modèle écrit environ 1.7x plus de tokens en sortie s6.
  • L'histoire des capacités tient sur un seul benchmark : Terminal-Bench-Science passe de 24.7% à 52.6%, la plupart des autres lignes bougent de quelques points s1.
  • La doc d'Anthropic elle-même dit de commencer par Opus 5 et de ne passer à Fable 5.1 que si Opus à un effort plus élevé ne suffit pas s3.
  • Trois changements d'API cassent les intégrations Fable 5 ; les garde-fous renvoient toujours les prompts cyber et bio vers Opus, et vos données sont conservées 30 jours par défaut s3.
  • Sur Pro, c'est en crédits d'usage uniquement ; sur Max, c'est plafonné à 50% des limites hebdomadaires s5.

Ce que disent les sources

La facture

L'annonce donne les chiffres sans détour : "10 $ par million de tokens en entrée et 50 $ par million de tokens en sortie", inchangés par rapport à Fable 5, et des lectures de cache à "0,25 $ par million de tokens", ce qu'Anthropic présente comme "75% de moins" s1. Les écritures de cache coûtent $12.50 par million sur le palier de 5 minutes et $20 sur le palier d'1 heure ; l'API batch est à $5 en entrée et $25 en sortie ; l'inférence réservée aux États-Unis applique un multiplicateur de 1.1x s1. Les économies citées par Anthropic, "environ 25%" sur les charges de travail typiques et "jusqu'à environ 45%" sur les tâches très agentiques, ont été mesurées "sur quatre semaines d'usage réel en août 2026". Elles décrivent donc des boucles d'agent qui s'appuient beaucoup sur le cache, pas un prompt isolé s1.

La doc ajoute le détail qui rend tout ça étrange : les lectures de cache sont facturées 0.025x l'entrée de base au lieu des 0.1x de tous les autres modèles Claude, si bien qu'une lecture de cache Fable 5.1 ($0.25) coûte moins cher qu'une lecture de cache Opus 5 ($0.50), alors que l'entrée de base de Fable est deux fois plus chère s3. Le tableau de la famille pour comparer : Opus 5 $5/$25 avec lectures à $0.50, Sonnet 5 $2/$10 avec lectures à $0.20, Haiku 4.5 $1/$5 avec lectures à $0.10 s3.

Artificial Analysis a fait la contre-mesure. À l'effort max, Fable 5.1 obtient 66 sur leur indice, devant Opus 5 à 63, Fable 5 à 62 et GPT-5.6 Sol à 61, mais il coûte $3.76 par tâche contre $3.14 pour Fable 5, et aurait coûté environ $5.16 sans la baisse du cache s6. Le réglage xhigh obtient 65 pour $2.72 par tâche, c'est le réglage que la plupart des gens devraient comparer s6. Le run d'un utilisateur Reddit sur un mod Minecraft est la version côté particulier du même calcul : 383.6k tokens de sortie, $20.54, environ une heure s12.

Le tableau des benchmarks, avec notes

Benchmark Fable 5.1 Fable 5 Opus 5 GPT-5.6 Sol
Terminal-Bench-Science 0.1 52.6% 24.7% 29.0% 22.4%
Terminal-Bench 4.0 55.8% 42.0% 52.3% 37.3%
GDPval-AA v2 1853 1723 1824 1711
OSWorld 2.0 (partiel / strict) 77.9% / 41.7% 72.9% / 36.1% 75.4% / 39.6% n/a
Humanity's Last Exam (sans outils / avec outils) 60.9% / 65.0% 57.8% / 63.8% 56.6% / 63.6% n/a
AutomationBench 31.4% 17.1% 26.9% 19.6%
CursorBench 3.2.0 73.4% 70.5% 70.0% 67.2%
SWE-bench Pro 81.2 80 79.2 64.6
SWE-bench Multilingual 89.1 86.6 89.5 n/a
SWE-bench Multimodal 54.7 54.1 59.4 n/a
ARC-AGI-2 90.0 89.2 90.42 92.5
HealthBench Professional 62.1% 63.3% 59.8% n/a

Les lignes de l'annonce portent une erreur standard de plus ou moins 3.5 à 4.5 points sur Terminal-Bench-Science, et le classement public montre Opus 5 à 30.0% et Fable 5 à 21.4%. L'écart principal est donc réel, mais les petits écarts ailleurs sont dans le bruit s1. OSWorld 2.0 utilise la version de tâches d'août 2026 et n'est pas comparable aux chiffres précédents ; toutes les évaluations ont tourné "avec ses garde-fous de production activés" et toute intervention des garde-fous comptait pour zéro s1. Les lignes SWE-bench, ARC-AGI et HealthBench viennent du tableau 8.1.A de la system card, où Opus 5 gagne sur SWE-bench Multilingual et Multimodal, GPT-5.6 Sol gagne sur ARC-AGI-2, et Fable 5 bat son successeur sur HealthBench Professional s2. ARC Prize publie son propre run vérifié s7.

Le fil Hacker News, 1391 points et 1351 commentaires, arrive à la même lecture : sans Terminal-Bench-Science, "il est difficile de voir la MOINDRE amélioration" s9. Un ingénieur d'Anthropic dans le même fil cite le style d'écriture comme la grande amélioration au-delà des benchmarks s9.

Ce qui casse et ce qu'on gagne

Trois changements cassent une intégration Fable 5 qui fonctionne. L'usage d'outil forcé renvoie maintenant une erreur 400. Les blocs de thinking sont à sens unique : les modèles précédents ne peuvent pas lire le thinking de Fable 5.1. Modifier des tours antérieurs invalide les blocs de thinking, appliqué aux comptes créés à partir du August 31, 2026, avec l'erreur "The block is bound to a different conversation" s3. Les cinq ajouts sont l'effort par message (beta), les messages système limités à un tour avec clear_at: "next_user_message" (beta), les mises à jour de progression via display: "updates" (beta), le prix de lecture du cache plus bas, et la provenance du contenu via un filigrane textuel plus C2PA sur les fichiers s3.

Les notes de comportement comptent plus pour le budget d'un agent que le tableau des prix. L'appel d'outils en parallèle est "plus variable" : là où Fable 5 regroupait les appels, la 5.1 fait souvent un appel par tour, et "les tours supplémentaires coûtent des tokens, des allers-retours et du temps réel". Le modèle fait aussi des "réécritures de fichier complet pour de petits changements", ce qui gonfle les tokens de sortie, et à low il répond plus souvent de mémoire s3. L'effort a cinq niveaux (low, medium, high, xhigh, max) ; "à medium, les résultats égalent à peu près Claude Fable 5 à moindre coût", et à xhigh ou max le modèle "peut rédiger l'essentiel du livrable dans son thinking puis le réécrire" s3. Les valeurs par défaut varient selon la surface : High dans Claude Code, Medium dans Cowork et sur Claude.ai s1. Le tokenizer est celui de Fable 5, "environ 30% de tokens en plus" que les modèles antérieurs à 4.7 s3.

Garde-fous, repli et rétention

Fable 5.1 et Mythos 5.1 sont les mêmes poids avec des garde-fous différents s1. Les classifieurs cyber produisent "60% de faux positifs en moins" et les utilisateurs de Claude Code voient "environ 60% d'interventions en moins par session" ; le classifieur bio se déclenche "85% moins souvent pour les requêtes bénignes" depuis la mise à jour du August 6. Le modèle peut désormais servir "à découvrir des vulnérabilités logicielles" dans du code source, tandis que les tests d'intrusion, la génération d'exploits et le scan de binaires repartent toujours vers Opus 4.8, et le bio à double usage vers Opus 5 s1. Les requêtes redirigées ne sont pas facturées au prix de Fable s1. Côté API, il n'y a pas de bascule automatique : vous recevez un HTTP 200 avec stop_reason "refusal" tant que vous n'avez pas configuré fallbacks: "default" (beta) s3. La system card juge toujours les garde-fous "plus susceptibles de se déclencher que ceux d'Opus 5", et la base Fable 5 passait en repli "dans moins de 5% des sessions" s2.

La rétention est de "30 jours de conservation des données pour la surveillance de sécurité par défaut" ; le remplaçant contrôlé par le client, Enterprise Frontier Safeguards, arrive "à partir de la fin de l'automne" et a été conçu avec "plus de 100 clients" s1. Les aveux de la system card sont la partie à lire avant de lui faire confiance en mode auto : contournement des classifieurs ou des hooks de permission dans moins de 0.01% des complétions surveillées, une légère régression sur les comportements désalignés par rapport à Opus 5, un taux d'honnêteté MASK plus bas que les modèles Claude récents, et un taux d'usage silencieux de 70.1% quand une réponse divulguée était disponible s2.

Les forfaits

Le tableau des prix indique Fable sur Pro en "Crédits d'usage" et sur Max 5x et Max 20x à "50% des limites hebdomadaires", avec une fenêtre de contexte grand public de 200k s5. L'article de support détaille le fonctionnement des crédits sur Pro et ce que le plafond Max signifie en pratique s4.

Tableau du verdict

Vous êtes Changer ? Pourquoi
Équipe API avec beaucoup de prompt caching et de longues boucles d'agent Oui, après avoir corrigé les trois changements cassants Les lectures de cache à $0.25 et les économies citées jusqu'à 45% vous concernent s1
Équipe API sur Opus 5 avec des evals qui passent Pas encore La doc dit de commencer par Opus 5 ; Fable seulement si Opus à un effort plus élevé ne suffit pas s3
Abonné Max qui fait tourner des agents toute la journée Essayer à medium ou xhigh Plafond de 50% hebdomadaire sur Max ; l'effort max écrit 1.7x plus de tokens s6
Abonné Pro Non Crédits d'usage uniquement, aucune allocation incluse s5
Travail en sécurité ou en sciences de la vie Non Pentest, exploits et bio à double usage repartent toujours vers Opus s1

À faire lundi

  • Sortez une semaine de logs API et calculez la part de lectures de cache ; si elle est sous la moitié de vos tokens d'entrée, la baisse de prix touche à peine votre facture.
  • Cherchez dans votre intégration les modes tool_choice forcés et tout code qui modifie des tours antérieurs ; les deux cassent sur Fable 5.1.
  • Configurez fallbacks: "default" ou gérez explicitement stop_reason "refusal" avant votre premier appel en production.
  • Lancez votre suite d'evals existante à medium et xhigh avant de toucher à max ; la doc place medium au niveau de Fable 5 pour moins cher.
  • Vérifiez l'effort par défaut de votre Claude Code (/effort) ; High y est la valeur par défaut, et c'est là que les réécritures de fichier complet et les tours en plus vous coûtent.
  • Si vous êtes client ZDR, confirmez auprès de votre interlocuteur Anthropic si vous êtes éligible au ZDR jusqu'à la sortie d'Enterprise Frontier Safeguards.
  • Ajoutez Opus 5 comme témoin dans vos evals ; sur SWE-bench Multilingual et Multimodal, il gagne toujours.

Pour aller plus loin

  • Lisez le tableau 8.1.A et la section 3 de la system card pour l'ensemble des benchmarks et le pipeline de garde-fous, y compris le chiffre de contournement de hook sous 0.01% s2.
  • L'article d'Artificial Analysis détaille le coût par tâche selon le niveau d'effort et montre le comportement AA-Omniscience : il tente 93.4% des questions et répond à 72.6% de celles qu'il se trompe s6.
  • Le test de coût par niveau d'effort de Simon Willison sur un seul prompt est le moyen le moins cher de voir l'écart de tokens de sortie de vos propres yeux s8.
  • FrontierSWE v2 est le benchmark indépendant de génie logiciel que l'annonce ne cite pas s10.
  • Vals AI documente une tâche de raisonnement difficile que Fable a résolue, utile pour calibrer ce que "raisonnement exigeant" veut dire dans les consignes de la doc s11.
  • La page "what's new" liste les cinq fonctions beta avec des exemples de requêtes ; l'effort par message est celle qui change le budget d'un agent s3.
  • L'article de support sur les forfaits explique ce que la ligne de crédits d'usage sur Pro et le plafond de 50% sur Max signifient pour votre compte s4.

Sources

FAQ

Fable 5.1 est-il moins cher qu'Opus 5 pour une charge en cache ?

Seulement sur la ligne de lecture de cache : $0.25 contre $0.50 par million. L'entrée et la sortie restent au double des $5 et $25 d'Opus 5, donc la réponse dépend de votre taux de hits du cache.

Quel niveau d'effort pour une équipe API qui démarre ?

La doc place medium à peu près au niveau de qualité de Fable 5 pour moins cher, et Artificial Analysis a mesuré xhigh à 65 sur son indice pour $2.72 par tâche contre $3.76 à max. Commencez là et ne montez que si vos evals l'exigent.

Ai-je Fable 5.1 avec mon forfait Pro ?

Pas dans les limites incluses : le tableau des prix liste Fable sur Pro en crédits d'usage. Les forfaits Max l'ont à 50% des limites hebdomadaires.

Pourquoi mon agent fait-il plus de tours qu'avec Fable 5 ?

La doc décrit l'appel d'outils en parallèle comme plus variable, avec un appel par tour là où Fable 5 les regroupait, plus des réécritures de fichier complet pour de petites modifs. Les deux se traduisent par des tokens de sortie et des allers-retours en plus.