AIDive

動画パック

Claude Fable 5.1 レビューパック: タスクあたりの実コスト、破壊的変更、判定表

10 分で読めます

TL;DR

  • Fable 5.1 は Fable 5 の定価(入力 100万トークンあたり $10、出力 $50)を据え置いた。変わったのはキャッシュ読み取りだけで、100万トークンあたり $1 から $0.25 に下がった s1。
  • 独立計測のタスクあたりコストは下がらず上がった。max effort で $3.76、Fable 5 は $3.14。出力トークンが約 1.7x 増えるためだ s6。
  • 能力面の話は実質ベンチマーク1つ分にすぎない。Terminal-Bench-Science は 24.7% から 52.6% に跳ねたが、ほかの項目の多くは数ポイントしか動いていない s1。
  • Anthropic 自身のドキュメントは、まず Opus 5 から始め、高い effort の Opus でも足りないときだけ Fable 5.1 を使うよう勧めている s3。
  • Fable 5 の連携を壊す API 変更が3つある。セーフガードはサイバーとバイオのプロンプトを引き続き Opus にリルートし、データはデフォルトで30日間保持される s3。
  • Pro では usage credits のみ、Max では週次上限の 50% までに制限される s5。

ソースが語ること

請求額

発表は数字をはっきり示している。"$10 per million input tokens and $50 per million output tokens" は Fable 5 から変わらず、キャッシュ読み取りは "$0.25 per million tokens"、Anthropic はこれを "75% less" と表現している s1。キャッシュ書き込みは 5分ティアで100万あたり $12.50、1時間ティアで $20。バッチ API は入力 $5、出力 $25。US 限定推論には 1.1x の係数がかかる s1。Anthropic が挙げる削減幅、一般的なワークロードで "around 25%"、高度にエージェント的なタスクで "up to around 45%" は "over four weeks of actual usage in August 2026" で測られたもので、キャッシュを多用するエージェントループの話であり、単発のプロンプトには当てはまらない s1。

ドキュメントには、この価格を奇妙にする詳細が加わる。キャッシュ読み取りは、ほかの Claude モデルの 0.1x ではなく基本入力の 0.025x で課金される。そのため Fable の基本入力が倍でも、Fable 5.1 のキャッシュ読み取り($0.25)は Opus 5($0.50)より安い s3。ファミリーの比較表は次のとおり。Opus 5 は $5/$25 でキャッシュ読み取り $0.50、Sonnet 5 は $2/$10 で $0.20、Haiku 4.5 は $1/$5 で $0.10 s3。

Artificial Analysis が反証となる計測を行った。max effort で Fable 5.1 は同社の指数で 66 を記録し、Opus 5 の 63、Fable 5 の 62、GPT-5.6 Sol の 61 を上回る。ただしタスクあたり $3.76 で、Fable 5 は $3.14、キャッシュ値下げがなければ約 $5.16 になっていた s6。xhigh は指数 65 でタスクあたり $2.72 であり、多くの人が比較すべき設定はこちらだ s6。Reddit ユーザーの Minecraft mod の実行は、同じ計算のユーザー側の例だ。出力 383.6k トークン、$20.54、約1時間 s12。

注釈付きベンチマーク表

ベンチマーク Fable 5.1 Fable 5 Opus 5 GPT-5.6 Sol
Terminal-Bench-Science 0.1 52.6% 24.7% 29.0% 22.4%
Terminal-Bench 4.0 55.8% 42.0% 52.3% 37.3%
GDPval-AA v2 1853 1723 1824 1711
OSWorld 2.0(部分 / 厳密) 77.9% / 41.7% 72.9% / 36.1% 75.4% / 39.6% n/a
Humanity's Last Exam(ツールなし / あり) 60.9% / 65.0% 57.8% / 63.8% 56.6% / 63.6% n/a
AutomationBench 31.4% 17.1% 26.9% 19.6%
CursorBench 3.2.0 73.4% 70.5% 70.0% 67.2%
SWE-bench Pro 81.2 80 79.2 64.6
SWE-bench Multilingual 89.1 86.6 89.5 n/a
SWE-bench Multimodal 54.7 54.1 59.4 n/a
ARC-AGI-2 90.0 89.2 90.42 92.5
HealthBench Professional 62.1% 63.3% 59.8% n/a

発表の行には、Terminal-Bench-Science で標準誤差が±3.5 から 4.5 ポイントある。公開リーダーボードでは Opus 5 が 30.0%、Fable 5 が 21.4% だ。したがって見出しの差は本物だが、ほかの小さな差は誤差の範囲内にある s1。OSWorld 2.0 は2026年8月のタスクリリースを使っており、以前の数値とは比較できない。すべての評価は "with its production safeguards enabled" で実行され、セーフガードが介入した場合はゼロ点として扱われた s1。SWE-bench、ARC-AGI、HealthBench の行はシステムカードの表 8.1.A によるもので、Opus 5 が SWE-bench Multilingual と Multimodal で勝ち、GPT-5.6 Sol が ARC-AGI-2 で勝ち、HealthBench Professional では Fable 5 が後継モデルを上回る s2。ARC Prize は独自の検証済み実行結果を公開している s7。

1391ポイント、1351コメントの Hacker News スレッドも同じ結論に落ち着いた。Terminal-Bench-Science を除くと "it is hard to see ANY improvement" だという s9。同スレッドの Anthropic エンジニアは、ベンチマーク以外の大きな改善として文章スタイルを挙げた s9。

何が壊れ、何が得られるか

動いている Fable 5 の連携を壊す変更は3つある。forced tool use は 400 エラーを返す。thinking ブロックは一方通行になり、以前のモデルは Fable 5.1 の thinking を読めない。過去のターンを編集すると thinking ブロックが無効になり、2026年8月31日以降に作成されたアカウントで強制され、エラーは "The block is bound to a different conversation" となる s3。追加機能は5つ。メッセージ単位の effort(beta)、clear_at: "next_user_message" によるターン単位の system message(beta)、display: "updates" による進捗更新(beta)、キャッシュ読み取りの値下げ、そしてテキストの透かしとファイル向け C2PA によるコンテンツ来歴だ s3。

エージェントの予算にとっては、価格表より挙動の注意点のほうが重要だ。並列ツール呼び出しは "more variable" になった。Fable 5 がまとめて呼んでいたところで、5.1 は1ターンに1回だけ呼ぶことが多く、"extra turns cost tokens, round trips, and wall-clock time" となる。また "whole-file rewrites for small changes" を行うため出力トークンが膨らみ、low では記憶から答える頻度が上がる s3。effort は5段階(low、medium、high、xhigh、max)。"at medium, results roughly match Claude Fable 5 at lower cost" で、xhigh や max ではモデルが "may draft much of that deliverable in its thinking and then write it out again" とされる s3。デフォルトは利用面で異なり、Claude Code では High、Cowork と Claude.ai では Medium だ s1。トークナイザーは Fable 5 のもので、4.7 以前のモデルより "roughly 30% more tokens" になる s3。

セーフガード、フォールバック、データ保持

Fable 5.1 と Mythos 5.1 は同じ重みで、セーフガードが異なる s1。サイバー分類器は "60% fewer false positives" を実現し、Claude Code ユーザーは "around 60% fewer interventions per session" を体感する。バイオ分類器は8月6日の更新以降、無害なリクエストで "85% less often" しか作動しない。モデルはソースコード内の脆弱性を "to discover software vulnerabilities" のために使えるようになったが、ペネトレーションテスト、エクスプロイト生成、バイナリスキャンは引き続き Opus 4.8 にリルートされ、デュアルユースのバイオは Opus 5 にリルートされる s1。リルートされたリクエストは Fable 価格では課金されない s1。API には自動切り替えがなく、fallbacks: "default"(beta)を設定するまでは HTTP 200 と stop_reason "refusal" が返る s3。システムカードは今もセーフガードを "likelier to trigger than Opus 5's safeguards" と評価しており、Fable 5 のベースラインでフォールバックが起きたのは "in less than 5% of sessions" だった s2。

保持は "30-day data retention for safety monitoring by default" だ。顧客が管理できる代替の Enterprise Frontier Safeguards は "beginning later this fall" に提供され、"more than 100 customers" と共に作られた s1。auto mode で信頼する前に読むべきなのは、システムカード自身の認めている点だ。監視対象の completion の 0.01% 未満で分類器や permission hook の回避が見られたこと、Opus 5 と比べて不整合な振る舞いがわずかに悪化したこと、最近の Claude モデルより MASK の誠実さスコアが低いこと、漏えいした答えが使える状況で黙って使う割合が 70.1% だったことだ s2。

プラン

料金表では、Fable は Pro で "Usage credits"、Max 5x と Max 20x で "50% of weekly limits" とされ、コンシューマー向けのコンテキストウィンドウは 200k だ s5。サポート記事には、Pro での credits の仕組みと、Max の上限が実際に何を意味するかが書かれている s4。

判定表

あなたの立場 切り替えるか 理由
プロンプトキャッシュを多用し、長いエージェントループを回す API チーム はい、3つの破壊的変更を直してから キャッシュ読み取り $0.25 と、最大 45% の削減が当てはまる s1
eval が通っている Opus 5 の API チーム まだ ドキュメントは Opus 5 から始め、高い effort の Opus で足りないときだけ Fable を使うよう勧めている s3
一日中エージェントを回す Max 契約者 medium か xhigh で試す Max は週次上限の 50%。max effort は 1.7x のトークンを書く s6
Pro 契約者 いいえ usage credits のみで、含まれる枠はない s5
セキュリティまたはライフサイエンスの仕事 いいえ ペンテスト、エクスプロイト、デュアルユースのバイオは引き続き Opus にリルートされる s1

月曜にやること

  • API ログを1週間分取り出し、キャッシュ読み取りの割合を計算する。入力トークンの半分未満なら、値下げは請求額にほとんど効かない。
  • 連携コードで tool_choice の強制モードと、過去のターンを編集するコードを grep する。どちらも Fable 5.1 で壊れる。
  • 最初の本番呼び出しの前に、fallbacks: "default" を設定するか、stop_reason "refusal" を明示的に処理する。
  • max に手を出す前に、既存の eval スイートを medium と xhigh で実行する。ドキュメントでは medium が低コストで Fable 5 相当とされている。
  • Claude Code のデフォルト effort(/effort)を確認する。High がデフォルトで、ファイル全体の書き直しや余分なターンのコストが出るのはそこだ。
  • ZDR 顧客なら、Enterprise Frontier Safeguards が出るまで ZDR の対象になるかをアカウントチームに確認する。
  • eval の実行に対照として Opus 5 を加える。SWE-bench Multilingual と Multimodal では今も勝っている。

さらに読む

  • 完全なベンチマーク一式とセーフガードのパイプラインは、システムカードの表 8.1.A とセクション3を読む。0.01% 未満の hook 回避の数字もここにある s2。
  • Artificial Analysis の記事は effort レベル別のタスクあたりコストを分解し、AA-Omniscience での挙動を示している。質問の 93.4% に回答を試み、間違えた質問の 72.6% に答えてしまう s6。
  • Simon Willison の、1つのプロンプトによる effort レベル別コストテストは、出力トークンの開きを自分の目で確かめる最も安い方法だ s8。
  • FrontierSWE v2 は、発表が引用していない独立のソフトウェアエンジニアリングベンチマークだ s10。
  • Vals AI は Fable が解いた難しい推論タスクを紹介しており、ドキュメントの指針にある "demanding reasoning" の水準を測るのに役立つ s11。
  • what's new ページには5つの beta 機能がリクエスト例付きで載っている。エージェントの予算の立て方を変えるのはメッセージ単位の effort だ s3。
  • プランのサポート記事は、Pro の usage credits の行と Max の 50% 上限があなたのアカウントで何を意味するかを説明している s4。

ソース

FAQ

キャッシュを使うワークロードで、Fable 5.1 は Opus 5 より安いか?

安いのはキャッシュ読み取りの行だけで、100万あたり $0.25 対 $0.50 だ。入力と出力は Opus 5 の $5 と $25 の倍のままなので、答えはキャッシュヒット率次第になる。

API チームはどの effort レベルから始めるべきか?

ドキュメントは medium を、より安く Fable 5 とほぼ同じ品質としている。Artificial Analysis は xhigh を指数 65、タスクあたり $2.72 と測り、max は $3.76 だった。そこから始めて、eval が求めるときだけ上げる。

Pro プランで Fable 5.1 は使えるか?

含まれる上限の中では使えない。料金表では Pro の Fable は usage credits とされている。Max プランでは週次上限の 50% までで使える。

なぜエージェントが Fable 5 より多くのターンを使うようになったのか?

ドキュメントは、並列ツール呼び出しがより不安定になり、Fable 5 がまとめていたところで1ターン1回の呼び出しになり、さらに小さな編集でもファイル全体を書き直すと説明している。どちらも余分な出力トークンとラウンドトリップとして現れる。