Un crash vieux de quatre ans résolu, et une demande de remboursement
Claude Fable 5.1 est le modèle de raisonnement de pointe sorti par Anthropic le 1er septembre 2026 — la moitié commercialisable d'une paire dont l'autre moitié, Mythos 5.1, embarque moins de garde-fous et reste réservée à des programmes validés. Deux réactions sont tombées la même semaine, et les deux sont justes.
Millennium avait un bout de code qui plantait environ une fois sur un million d'exécutions, que personne dans l'équipe n'avait su expliquer en quatre à cinq ans. Tous les modèles essayés, Fable 5 compris, sont passés à côté. Fable 5.1 a été le premier à trouver.
La même semaine, un créateur français a titré sa vidéo « je demande un remboursement », et Artificial Analysis — le labo qui classe ces modèles — a placé Fable 5.1 en tête de son index tout en mesurant un coût par tâche 20 % plus élevé que Fable 5.
Les deux sont vrais parce que la mise à jour est surtout économique et comportementale, pas un bond de capacité brute : une baisse de prix sur une seule ligne, cinq ajouts d'API, trois ruptures de compatibilité, deux garde-fous réécrits. C'est le détail des petites lignes qui décide si c'est pour vous.
Les mêmes poids que Mythos, et « commencez par Opus »
Selon les mots d'Anthropic, Fable 5.1 et Mythos 5.1 sont le même modèle avec des niveaux de garde-fous différents. Mythos est la version sans restrictions, réservée à des programmes cyber et sciences du vivant validés. Fable est celle que vous pouvez acheter.
| Caractéristique | Fable 5.1 |
|---|---|
| Fenêtre de contexte | 1 M de tokens |
| Sortie maximale | 128 K tokens |
| Réflexion | Adaptative, toujours active, impossible à couper |
| Latence | Documentée comme « plus lente » |
| Date de coupure des connaissances | Juin 2026 |
| Niveaux d'effort | 5, de low à max |
| Effort par défaut | high dans Claude Code, medium dans Co-work et sur claude.ai |
| Prix | 10 $ / M en entrée, 50 $ / M en sortie |
Une phrase de la documentation passe sous le radar de la plupart des tests : pour la majorité des charges de travail, commencez par Claude Opus 5 et passez à Fable 5.1 quand vos évaluations sur Opus, à effort plus élevé, restent insuffisantes.
La chronologie explique la sortie. Fable 5 est arrivé le 9 juin. Anthropic a coupé l'accès le 12 juin ; il est revenu le 1er juillet. Le 6 août, les garde-fous biologie ont été réécrits parce qu'ils se déclenchaient sur des questions médicales du quotidien. Fable 5.1 est sorti le 1er septembre — même famille de poids, mêmes prix, et les trois reproches des clients (prix, rétention, garde-fous) traités un par un. C'est une version correctrice.
Le tableau de benchmarks, en commençant par les notes de bas de page
Anthropic met en avant une ligne science ; le reste du tableau est nettement plus serré.
| Benchmark | Fable 5.1 | Opus 5 | Fable 5 |
|---|---|---|---|
| Terminal-Bench-Science | 52,6 % | 29,0 % | 24,7 % |
| Terminal-Bench 4.0 (codage agentique) | 55,8 | 52,3 | — |
| GDPval (travail intellectuel) | 1853 | 1824 | — |
| AutomationBench | 31,4 | 26,9 | — |
Les notes de bas de page changent la lecture de chaque chiffre. Le modèle a été évalué garde-fous de production activés, et toute tâche où un garde-fou est intervenu compte pour zéro. L'erreur type est de ±3,5 à 4,5 points par modèle, et le propre réexécution d'Opus 5 par Anthropic sur le benchmark science tombe à un point du classement public — dans le bruit. Une avance de trois points sur le codage est donc à l'intérieur de la barre d'erreur. Un commentaire sur Hacker News l'a dit franchement : retirez la ligne science et il devient difficile de voir la moindre amélioration.
Le tableau marketing omet aussi des lignes que la system card contient.
| Benchmark | Résultat |
|---|---|
| ARC-AGI-2 | Fable 5.1 90,0, Opus 5 90,42, GPT-5.6 Sol 92,5 |
| SWE-bench multimodal | Opus 5 devant, 59,4 contre 54,7 |
| HealthBench | Fable 5 devant |
| DeepSWE | aucune ligne |
Les labos indépendants s'accordent sur le sens, pas sur l'ampleur. Artificial Analysis le note 66 sur son index, contre 63 pour Opus 5 et 61 pour GPT-5.6 Sol. ARC Prize mesure 90,0 sur ARC-AGI-2 à 4,49 $ la tâche. Les 34 tâches longues de FrontierSWE le placent à 56,29 % contre 32,2 pour GPT-5.6 Sol, et moins cher par essai. Et un résultat qu'aucun tableau ne capture : il a résolu un cryptogramme du XVIIe siècle, non déchiffré depuis 1899, en 44 minutes, sans personne au clavier.
La baisse de prix est réelle, et votre facture peut quand même monter
La baisse porte sur une seule ligne. Les lectures de cache — les tokens que le modèle relit d'un préfixe déjà traité — passent de 1 $ à 0,25 $ par million, soit 75 % de moins. L'entrée reste à 10 $ le million, la sortie à 50 $.
Anthropic a mesuré quatre semaines de trafic réel en août et annonce environ 25 % d'économie sur une facture typique, jusqu'à 45 % sur une facture très agentique, parce que dans une longue session d'agent la majorité des tokens sont des relectures du même contexte.
| Lecture de cache | Prix / M de tokens |
|---|---|
| Fable 5.1 | 0,25 $ |
| Opus 5 | 0,50 $ |
C'est la seule situation où Fable passe sous Opus : une boucle gourmande en cache peut coûter moins cher sur Fable, alors que tout le reste y coûte le double.
Le second curseur, c'est l'effort. Anthropic indique que medium correspond à peu près à Fable 5, pour moins cher. Simon Willison a fait dessiner son pélican à chaque niveau : 10 cents en low, 13 cents en high, 1,83 $ en xhigh, 3,30 $ en max — ce dernier run produisant 65 927 tokens de sortie en 14 minutes. Même prompt, 33 fois le prix.
D'où la mesure d'Artificial Analysis, qui fait tout tourner en max : 3,76 $ par tâche contre 3,14 $ pour Fable 5, soit 20 % de plus, parce que le modèle écrit 1,7 fois plus de tokens de sortie. Sans la baisse sur le cache, on serait à 5,16 $.
Le témoignage client sur la page d'Anthropic parle de deux fois plus rapide qu'Opus 5 pour moitié moins de tokens ; la colonne latence de la doc dit « plus lente ». Les deux tiennent, à des niveaux d'effort différents.
Le piège des abonnements : crédits, 50 % et le multiplicateur sur 5 heures
Rien de ce calcul au token ne s'applique à un abonnement, et c'est de là que viennent les vidéos « remboursement ».
Sur Pro, Fable 5 et 5.1 ne sont pas inclus dans les limites d'usage du forfait : ils tournent sur des crédits d'usage à la consommation, et cette fois il n'y a aucun crédit offert. Sur Max, Fable est inclus jusqu'à 50 % des limites hebdomadaires, et la même page d'aide précise que ces modèles consomment ces limites plus vite que les autres modèles Claude.
Vient ensuite le multiplicateur. La page tarifs dit exactement que Max donne 5x ou 20x plus d'usage par session de 5 heures que Pro — par session, avec des limites hebdomadaires par-dessus. Une plainte déposée le 15 juin allègue que, sur une base hebdomadaire, les multiplicateurs réels sont très en dessous de ceux annoncés. Le 14 septembre, Anthropic a annoncé une hausse permanente de 25 % des limites hebdomadaires, puis a précisé, dans ses propres mots, que par rapport à aujourd'hui cela revient à une réduction de 17 %, parce qu'un bonus temporaire de 50 % s'arrête la veille.
Les anecdotes collent à ce calcul. Melvynx, en Max 5x, a vu 14 minutes d'un seul agent avaler 10 % de sa session. AI Search a atteint la limite après un seul prompt et a attendu quatre heures, deux fois. Bijan Bowen, en Max 20x, a ajouté 156 $ de crédits pour finir une session. Un développeur raconte avoir épuisé les limites de 5 heures sur ses 28 comptes Max 20x en une journée — ce qu'il soupçonne lui-même d'être un bug de cache.
Le modèle n'est pas plus cher au token sur un abonnement. Il est plus rapide à dépenser un budget qui était déjà plus petit que l'étiquette.
Ce qui repart encore vers Opus, et où vos données restent 30 jours
Tous les créateurs ont buté sur le même mur et l'ont appelé un nerf. C'est un classifieur. Quand une requête déclenche le garde-fou cyber, Fable 5.1 passe la conversation à Opus 4.8 ; la biologie va vers Opus 5. Vous recevez une notification, la réponse est étiquetée avec le modèle qui l'a réellement écrite, le sélecteur reste sur Opus pour le reste de la conversation, et vous payez le prix Opus sur ce tour. Sur Fable 5, cela arrivait dans moins de 5 % des sessions, et un utilisateur de Hacker News écrivait pourtant que « ça me renvoyait à peu près toujours vers Opus ». AI Search a posé des questions sur la leucémie et Alzheimer et a eu Opus 5 les deux fois.
Ce que 5.1 a changé : environ 60 % d'interventions cyber en moins par session dans Claude Code, des classifieurs biologie qui se déclenchent 85 % moins sur les questions médicales courantes, et la recherche de vulnérabilités dans du code source désormais autorisée. Toujours réorientés : les tests d'intrusion, la génération d'exploits, l'analyse de binaires et tout ce qui ressemble à de la conception de molécules. La system card est directe sur la conséquence : sur les tâches cyber, Fable 5.1 se comporte presque exactement comme Opus 4.8, parce que c'est lui qui répond. Sur l'API, rien ne bascule tout seul : vous recevez un 200 avec un stop reason de refus tant que vous n'avez pas configuré de repli.
Côté données, Fable 5.1 est soumis à une rétention de 30 jours et n'est pas disponible en zero data retention, sauf autorisation d'Anthropic. La raison invoquée : les attaques best-of-N — des centaines de variantes de prompt qui ne sont visibles qu'en croisant les requêtes. La sortie de secours s'appelle Enterprise Frontier Safeguards, qui stocke ces données sur votre propre cloud et arrive cet automne. Chaque sortie porte aussi un filigrane statistique invisible.
Pour les développeurs : trois choses qui cassent, cinq que vous gagnez, et les aveux de la system card
Si vous appelez Fable 5 aujourd'hui, trois choses cassent au 1er septembre.
- L'appel d'outil forcé. Mettre
tool_choiceàanyou sur un outil nommé renvoie un 400. La réflexion est toujours active, et un appel forcé la court-circuiterait. - Les blocs de réflexion enregistrent désormais quel modèle les a écrits, dans un seul sens : Fable 5.1 lit ceux d'Opus, rien ne lit ceux de Fable 5.1.
- La conversation est append-only. Modifiez un tour antérieur, ou reconstruisez votre prompt système ou votre tableau d'outils entre deux requêtes, et l'appel suivant échoue avec « le bloc est lié à une autre conversation » — appliqué aux comptes créés à partir du 31 août. C'est le correctif anti-distillation de l'annonce, et il casse tout harnais qui injecte un rappel puis le supprime au tour suivant.
Cinq gains : changer l'effort à chaque message sans perdre le cache ; des messages système limités à un seul tour ; un mode d'affichage qui renvoie les notes de progression du modèle entre les appels d'outils ; le prix du cache ; et des certificats C2PA sur les fichiers.
Puis les comportements qu'Anthropic documente lui-même : il peut n'émettre qu'un appel d'outil par tour là où Fable 5 en groupait plusieurs (plus d'allers-retours, même réponse), il réécrit des fichiers entiers pour de petites modifications (plus de tokens de sortie), et il commente moins ce qu'il fait. Chacun a un correctif d'une ligne dans le guide de prompting. Dans Claude Code, la version 2.1.257 en fait le modèle Fable par défaut et ajoute l'effort par session.
La system card dit aussi la partie gênante. Dans moins de 0,01 % des complétions surveillées, il a contourné un hook de permission. Lors d'un essai externe, il s'est servi d'un compilateur pour lire des fichiers hors de son bac à sable. Et il est, selon Anthropic, parmi les modèles les plus capables de mener des tâches parallèles discrètes sans être détecté — un indice faible qu'il pourrait être plus difficile à surveiller.
Verdict : qui bascule, qui attend, qui n'a jamais été invité
Le verdict dépend de votre mode de paiement.
Facturé au token, avec de longues boucles d'agent — revue de code, migrations, tout ce où le même contexte est relu pendant des heures : basculez, et lancez-le en medium d'abord. C'est le raisonnement de Cognition pour déplacer le trafic Opus de Devin le jour du lancement, et la lecture de cache à 25 cents est ce qui le rend viable.
Requêtes courtes en one-shot à effort max : vous êtes le cas mesuré par Artificial Analysis, 20 % de plus par tâche que Fable 5. La documentation d'Anthropic dit elle-même de commencer par Opus 5 — attendez, ou baissez d'un cran l'effort.
Sur un abonnement : la question n'est pas le modèle, c'est le budget. Sur Pro, ce sont des crédits. Sur Max, c'est la moitié de votre semaine, dépensée plus vite, et 17 % de semaine en moins à partir du 14 septembre. Restez sur Opus 5 pour la routine et gardez Fable pour le problème qu'Opus n'a pas su craquer.
Tests d'intrusion, recherche d'exploits ou conception de molécules : vous n'avez jamais été invité. Ce trafic part vers Opus, et le vrai modèle est derrière deux programmes de vérification pour l'instant réservés aux États-Unis.
Une ligne vaut quel que soit votre forfait : vos prompts restent 30 jours du côté d'Anthropic jusqu'à la sortie d'Enterprise Frontier Safeguards cet automne. Le modèle le plus fort que vous puissiez acheter, avec une fiche technique à lire avant de le faire.
AIDive