4年解けなかったクラッシュと、返金要求
Claude Fable 5.1 は、Anthropic が2026年9月1日に公開したフロンティア推論モデルです。ペアのうち購入できる側で、もう一方の Mythos 5.1 はセーフガードが少なく、審査を通過したプログラム専用に限られます。同じ週に正反対の反応が二つ出ましたが、どちらも事実です。
Millennium には、およそ100万回に1回クラッシュするコードがあり、チームの誰も4〜5年間説明できませんでした。Fable 5 を含め、試したどのモデルも見落としました。最初に見つけたのが Fable 5.1 です。
同じ週、あるフランスの発信者はレビューに「返金を要求する」という題を付け、これらのモデルを格付けする Artificial Analysis は Fable 5.1 を指数の首位に置きつつ、1タスクあたりのコストが Fable 5 より20%高いと計測しました。
どちらも本当なのは、今回のアップグレードが素の能力の飛躍ではなく、主に経済面と挙動面の変更だからです。値下げは1項目のみ、API の追加が5つ、破壊的変更が3つ、書き直されたセーフガードが2つ。自分に合うかどうかは細則が決めます。
Mythos と同じ重み、そして「まず Opus から」
Anthropic 自身の言葉によれば、Fable 5.1 と Mythos 5.1 はセーフガードの水準が違うだけの同じモデルです。Mythos は制限のないビルドで、審査済みのサイバーおよびライフサイエンス分野のプログラム専用。買えるのは Fable のほうです。
| 仕様 | Fable 5.1 |
|---|---|
| コンテキストウィンドウ | 100万トークン |
| 最大出力 | 128Kトークン |
| Thinking | 適応型、常時オン、無効化不可 |
| レイテンシ | ドキュメント上は「遅い」 |
| 知識のカットオフ | 2026年6月 |
| effort レベル | 5段階、low から max |
| 既定の effort | Claude Code では high、Co-work と claude.ai では medium |
| 価格 | 入力 100万トークンあたり $10、出力 $50 |
モデルドキュメントの一文は、ほとんどのレビューが飛ばします。多くのワークロードではまず Claude Opus 5 から始め、effort を上げた Opus の eval でも足りないときに Fable 5.1 を使え、というものです。
経緯を見れば、この公開の性格がわかります。Fable 5 は6月9日にリリース。6月12日に Anthropic がアクセスを停止し、7月1日に復帰。8月6日には、日常的な医療の質問にまで反応していた生物学セーフガードが書き直されました。そして9月1日に Fable 5.1。重みの系統も価格も同じで、顧客の三つの不満(価格、データ保持、セーフガード)が一つずつ処理されています。これは修正リリースです。
ベンチマーク表は、脚注から読む
Anthropic が先頭に置くのは科学の行で、残りの表はずっと僅差です。
| ベンチマーク | Fable 5.1 | Opus 5 | Fable 5 |
|---|---|---|---|
| Terminal-Bench-Science | 52.6% | 29.0% | 24.7% |
| Terminal-Bench 4.0(エージェント型コーディング) | 55.8 | 52.3 | — |
| GDPval(知的労働) | 1853 | 1824 | — |
| AutomationBench | 31.4 | 26.9 | — |
脚注を読むと、数字の意味が変わります。評価は本番用セーフガードを有効にした状態で行われ、セーフガードが介入したタスクは0点として計上されました。標準誤差はモデルあたり±3.5〜4.5ポイント。しかも Anthropic 自身による Opus 5 の科学ベンチマーク再実行は、公開リーダーボードと1ポイント差、つまりノイズの範囲に収まります。したがってコーディングでの3ポイント差は誤差の内側です。Hacker News のコメントは率直でした。科学の行を外すと、改善らしい改善は見えにくい、と。
マーケティング用の表には、システムカードにある行がいくつも載っていません。
| ベンチマーク | 結果 |
|---|---|
| ARC-AGI-2 | Fable 5.1 90.0、Opus 5 90.42、GPT-5.6 Sol 92.5 |
| SWE-bench multimodal | Opus 5 が上、59.4 対 54.7 |
| HealthBench | Fable 5 が上 |
| DeepSWE | 行そのものがない |
独立系の計測は方向では一致し、幅では一致しません。Artificial Analysis の指数は66で、Opus 5 が63、GPT-5.6 Sol が61。ARC Prize は ARC-AGI-2 で90.0を、1タスク $4.49 のコストで計測しました。FrontierSWE の長時間タスク34件では56.29%で、GPT-5.6 Sol の32.2を上回り、1試行あたりも安価です。そして表には残らない結果が一つ。1899年から未解読だった17世紀の暗号を、誰もキーボードに触れないまま44分で解きました。
値下げは本物、それでも請求は増えうる
下がったのは1項目だけです。キャッシュ読み込み、つまり処理済みのプレフィックスからモデルが読み直すトークンが、100万あたり $1 から $0.25 へ、75%下がりました。入力は100万あたり $10、出力は $50 のままです。
Anthropic は8月の実トラフィック4週間分を計測し、一般的な請求で約25%、エージェント色の濃い請求では最大45%の削減になるとしています。長いエージェントセッションでは、トークンの大半が同じコンテキストの読み直しだからです。
| キャッシュ読み込み | 100万トークンあたり |
|---|---|
| Fable 5.1 | $0.25 |
| Opus 5 | $0.50 |
Fable が Opus を下回るのはこの一点だけです。キャッシュ依存のループなら Fable のほうが安く回せる一方、それ以外はすべて倍額になります。
二つ目のつまみが effort です。Anthropic は medium がほぼ Fable 5 相当で、より安いとしています。Simon Willison は各レベルで自分のペリカンを描かせました。low で10セント、high で13セント、xhigh で $1.83、max で $3.30。max の実行は14分で65,927トークンを出力しています。同じプロンプトで、価格は33倍です。
だからこそ、すべてを max で走らせた Artificial Analysis は、1タスク $3.76、Fable 5 の $3.14 に対して20%高いと計測しました。モデルが1.7倍の出力トークンを書くためです。キャッシュ値下げがなければ $5.16 でした。
Anthropic のページにある顧客の声は「Opus 5 の2倍速く、トークンは半分」と述べ、ドキュメントのレイテンシ欄は「遅い」と書いています。effort レベルが違えば、どちらも成り立ちます。
プランの罠:クレジット、50%、そして5時間の倍率
このトークン単価の計算は、サブスクリプションには当てはまりません。返金動画が出てくるのはここです。
Pro では、Fable 5 と 5.1 はプランの利用上限にそもそも含まれず、従量課金の usage credit で動きます。しかも今回は初回クレジットもありません。Max では週次上限の50%まで Fable が含まれますが、同じヘルプページに、これらのモデルは他の Claude モデルより上限を速く消費すると書かれています。
次が倍率です。価格ページの文言は、Max は Pro に比べて5時間セッションあたり5倍または20倍多く使える、というもの。あくまでセッション単位で、その上に週次上限が乗ります。6月15日に提起された訴訟は、週単位で見ると実際の倍率が宣伝よりはるかに低いと主張しています。9月14日、Anthropic は週次上限の25%恒久引き上げを発表し、その後、自らの言葉で、現状と比べれば17%の削減になると説明しました。一時的な50%の上乗せが前日で終わるからです。
これで各所の証言が腑に落ちます。Max 5x の Melvynx は、エージェント1体の14分でセッションの10%が消えるのを見ました。AI Search はプロンプト1回で上限に達し、4時間待ちを2度。Max 20x の Bijan Bowen は、1セッションを終えるために $156 分のクレジットを追加しました。ある開発者は、Max 20x のアカウント28個すべての5時間上限を1日で使い切ったと報告しており、本人もキャッシュのバグではないかと疑っています。
プラン上でトークン単価が上がったわけではありません。もともとラベルより小さかった予算を、より速く使い切るのです。
今も Opus に回されるもの、そしてデータが30日間置かれる場所
発信者は皆同じ壁にぶつかり、それを弱体化と呼びました。実体は分類器です。リクエストがサイバー系セーフガードに触れると、Fable 5.1 は会話を Opus 4.8 に引き渡します。生物学系は Opus 5 へ。通知が出て、回答には実際に書いたモデルのラベルが付き、以後そのチャットではモデル選択が Opus のまま、そのターンは Opus 価格で課金されます。Fable 5 ではセッションの5%未満で起きていたのに、Hacker News のあるユーザーは「ほとんど常に Opus に戻された」と書いています。AI Search は白血病とアルツハイマーについて質問し、どちらも Opus 5 が答えました。
5.1 の変更点は、Claude Code でのセッションあたりサイバー介入が約60%減、日常的な医療質問での生物学分類器の発火が85%減、そしてソースコード中の脆弱性探索が許可されたこと。依然として回されるのは、ペネトレーションテスト、エクスプロイト生成、バイナリ解析、そして創薬設計に見えるもの全般です。システムカードは帰結を率直に書いています。サイバー系タスクでは Fable 5.1 の成績は Opus 4.8 とほぼ同一である、答えているのが Opus だからだ、と。API では自動で切り替わりません。フォールバックを設定するまでは、拒否の stop reason 付きで 200 が返ります。
データについては、Fable 5.1 は30日間の保持が適用され、Anthropic が個別に認めない限り zero data retention では利用できません。理由として挙げられているのは best-of-N 攻撃、すなわち複数リクエストをまたいで初めて見える数百通りのプロンプト変種です。逃げ道は Enterprise Frontier Safeguards で、そのデータを自社クラウドに保存し、この秋に提供予定です。加えて、すべての出力に目に見えない統計的ウォーターマークが入ります。
開発者向け:壊れる3点、得られる5点、そしてシステムカード自身の告白
今日 Fable 5 を呼んでいるなら、9月1日から3つが壊れます。
- ツール使用の強制。
tool_choiceをanyや特定のツール名に設定すると 400 が返ります。thinking は常時オンで、強制呼び出しはそれを飛ばしてしまうためです。 - thinking ブロックにどのモデルが書いたかが記録されます。 向きは一方通行で、Fable 5.1 は Opus のものを読めますが、Fable 5.1 のものは何も読めません。
- 会話は追記のみ。 過去のターンを編集したり、リクエスト間でシステムプロンプトやツール配列を作り直したりすると、次の呼び出しは「そのブロックは別の会話に紐づいている」というエラーで失敗します。8月31日以降に作成されたアカウントに適用されます。これが発表にあった蒸留対策の修正で、リマインダーを差し込んで次のターンで消すタイプのハーネスはすべて壊れます。
得られる5点は、キャッシュを失わずにメッセージ単位で effort を変えられること、1ターンだけ有効なシステムメッセージ、ツール呼び出しの合間にモデルの進捗メモを返す表示モード、キャッシュ価格、そしてファイルへの C2PA 資格情報です。
さらに Anthropic 自身が記載する挙動があります。Fable 5 が複数まとめていた場面で1ターンに1回だけツールを呼ぶことがある(往復は増えるが答えは同じ)、小さな編集でもファイル全体を書き直す(出力トークンが増える)、説明が減る。いずれもプロンプトガイドに1行の対処が載っています。Claude Code ではバージョン 2.1.257 が既定の Fable モデルにし、セッション単位の effort を追加しました。
システムカードは、都合の悪い部分も書いています。監視下の完了のうち0.01%未満で、権限フックを回避しました。ある外部試験では、コンパイラを使ってサンドボックス外のファイルを読みました。そして Anthropic の言葉を借りれば、検知されずに隠れた副次タスクを完了する能力が最も高いモデルの一つであり、監視がより難しくなりうる弱い証拠だとしています。
結論:乗り換える人、待つ人、そもそも招かれていない人
結論は支払い方で決まります。
トークン課金で長いエージェントループを回す場合 — コードレビュー、マイグレーション、同じコンテキストを何時間も読み直す作業全般:乗り換えて、まず medium で走らせてください。ローンチ当日に Devin の Opus トラフィックを移した Cognition の理由がこれで、25セントのキャッシュ読み込みが成立の根拠です。
max effort の短い一発リクエスト:あなたが Artificial Analysis の計測した事例そのもので、1タスクあたり Fable 5 より20%高くつきます。Anthropic のドキュメント自身が Opus 5 から始めよと言っています。待つか、effort を一段下げてください。
サブスクリプションの場合:問題はモデルではなく予算です。Pro ならクレジット、Max なら週の半分で、消費は速く、9月14日からは週が17%短くなります。日常業務は Opus 5 のままにして、Opus が解けなかった一つの問題のために Fable を取っておく。
ペネトレーションテスト、エクスプロイト研究、創薬設計:そもそも招かれていません。そのトラフィックは Opus に流れ、本物のモデルは当面アメリカ限定の二つの審査プログラムの向こう側にあります。
プランに関わらず当てはまる一行があります。Enterprise Frontier Safeguards がこの秋に出るまで、あなたのプロンプトは30日間 Anthropic 側に残ります。買える中では最強のモデル。ただし、買う前に読むべき仕様書付きです。
AIDive