AIDive

影片資料包

Claude Fable 5.1 評測包:每項任務實際成本、破壞性變更、結論表

閱讀約 10 分鐘

TL;DR

  • Fable 5.1 沿用 Fable 5 的牌價(每百萬 token 輸入 $10、輸出 $50),唯一的降價是快取讀取,從每百萬 $1 降到 $0.25 s1。
  • 獨立測量的每項任務成本不降反升:max effort 下是 $3.76,Fable 5 則是 $3.14,因為它寫出的輸出 token 約多 1.7 倍 s6。
  • 能力的進步其實只集中在一項基準測試:Terminal-Bench-Science 從 24.7% 跳到 52.6%,其他大多只動幾個百分點 s1。
  • Anthropic 自己的文件建議先用 Opus 5,只有在更高 effort 的 Opus 仍不夠時才改用 Fable 5.1 s3。
  • 有三項 API 變更會弄壞 Fable 5 的整合;安全防護仍會把資安與生物相關的提示轉到 Opus,而且你的資料預設保存 30 天 s3。
  • Pro 方案只能用用量點數;Max 方案則上限為每週額度的 50% s5。

來源怎麼說

帳單

公告把數字寫得很清楚:「每百萬輸入 token $10、每百萬輸出 token $50」,與 Fable 5 相同;快取讀取是「每百萬 token $0.25」,Anthropic 稱之為「便宜 75%」 s1。快取寫入在 5 分鐘層級是每百萬 $12.50,1 小時層級是 $20;批次 API 是輸入 $5、輸出 $25;僅限美國的推論要乘上 1.1 倍 s1。Anthropic 引用的節省幅度,一般工作負載「約 25%」、高度 agentic 的任務「最高約 45%」,是根據「2026 年 8 月四週的實際用量」量測的,所以描述的是大量使用快取的 agent 迴圈,而不是單次提示 s1。

文件還補了一個讓這件事顯得奇怪的細節:快取讀取的價格是基本輸入價的 0.025 倍,而不是其他所有 Claude 模型的 0.1 倍,所以即使 Fable 的基本輸入價是兩倍,Fable 5.1 的快取讀取($0.25)仍比 Opus 5 的($0.50)便宜 s3。供對照的產品線價格:Opus 5 為 $5/$25、讀取 $0.50;Sonnet 5 為 $2/$10、讀取 $0.20;Haiku 4.5 為 $1/$5、讀取 $0.10 s3。

Artificial Analysis 做了反向的實測。max effort 下,Fable 5.1 在他們的指數上拿 66 分,領先 Opus 5 的 63、Fable 5 的 62 和 GPT-5.6 Sol 的 61,但每項任務成本是 $3.76,Fable 5 則是 $3.14;若沒有這次快取降價,大約會是 $5.16 s6。xhigh 設定拿 65 分、每項任務 $2.72,這才是多數人該拿來比較的設定 s6。一位 Reddit 使用者的 Minecraft mod 實驗是同一筆帳的消費者版本:383.6k 輸出 token、$20.54、約一小時 s12。

附註腳的基準測試表

基準測試 Fable 5.1 Fable 5 Opus 5 GPT-5.6 Sol
Terminal-Bench-Science 0.1 52.6% 24.7% 29.0% 22.4%
Terminal-Bench 4.0 55.8% 42.0% 52.3% 37.3%
GDPval-AA v2 1853 1723 1824 1711
OSWorld 2.0 (partial / strict) 77.9% / 41.7% 72.9% / 36.1% 75.4% / 39.6% n/a
Humanity's Last Exam (no tools / tools) 60.9% / 65.0% 57.8% / 63.8% 56.6% / 63.6% n/a
AutomationBench 31.4% 17.1% 26.9% 19.6%
CursorBench 3.2.0 73.4% 70.5% 70.0% 67.2%
SWE-bench Pro 81.2 80 79.2 64.6
SWE-bench Multilingual 89.1 86.6 89.5 n/a
SWE-bench Multimodal 54.7 54.1 59.4 n/a
ARC-AGI-2 90.0 89.2 90.42 92.5
HealthBench Professional 62.1% 63.3% 59.8% n/a

公告各列在 Terminal-Bench-Science 上的標準誤差為正負 3.5 到 4.5 個百分點,而公開排行榜顯示 Opus 5 是 30.0%、Fable 5 是 21.4%,所以頭條的差距是真的,其他小差距則在雜訊範圍內 s1。OSWorld 2.0 使用 2026 年 8 月的任務版本,無法與先前數字比較;所有評測都是在「啟用正式環境安全防護」下進行,只要防護介入就計為零分 s1。SWE-bench、ARC-AGI 與 HealthBench 的列出自系統卡的表 8.1.A,其中 Opus 5 贏下 SWE-bench Multilingual 和 Multimodal,GPT-5.6 Sol 贏下 ARC-AGI-2,Fable 5 在 HealthBench Professional 上勝過它的後繼者 s2。ARC Prize 也發布了自己的驗證結果 s7。

Hacker News 的討論串有 1391 分、1351 則留言,結論一致:拿掉 Terminal-Bench-Science,「很難看出有任何進步」 s9。同一串裡的一位 Anthropic 工程師則指出,基準測試以外最大的進步是寫作風格 s9。

哪些會壞,哪些是新增

有三項變更會弄壞原本能運作的 Fable 5 整合。強制使用工具現在會回傳 400 錯誤。thinking 區塊是單向的:較早的模型讀不了 Fable 5.1 的 thinking。編輯先前的回合會使 thinking 區塊失效,此規則對 2026 年 8 月 31 日(含)之後建立的帳號強制執行,錯誤訊息為 "The block is bound to a different conversation" s3。五項新增功能是:每則訊息的 effort(beta)、搭配 clear_at: "next_user_message" 的單回合系統訊息(beta)、透過 display: "updates" 的進度更新(beta)、較低的快取讀取價格,以及透過文字浮水印與檔案 C2PA 提供的內容來源標示 s3。

對 agent 預算來說,行為上的差異比價目表更重要。平行工具呼叫「更不穩定」:Fable 5 會把呼叫打包,5.1 常常每回合只呼叫一次,而「多出來的回合會消耗 token、往返次數和實際時間」。它也會對小改動做「整個檔案重寫」,讓輸出 token 膨脹,而且在 low 時更常憑記憶回答 s3。effort 有五級(low、medium、high、xhigh、max);「在 medium,結果大致與 Claude Fable 5 相當,但成本更低」,而在 xhigh 或 max,模型「可能在 thinking 中先寫好大部分交付內容,再重寫一遍」 s3。預設值依平台而異:Claude Code 是 High,Cowork 和 Claude.ai 是 Medium s1。tokenizer 與 Fable 5 相同,比 4.7 之前的模型「多出約 30% 的 token」 s3。

安全防護、備援與資料保存

Fable 5.1 和 Mythos 5.1 是相同的權重,只是安全防護不同 s1。資安分類器的誤判「減少 60%」,Claude Code 使用者看到「每個工作階段的介入次數減少約 60%」;自 8 月 6 日更新後,生物分類器對正常請求的觸發「減少 85%」。模型現在可以用來在原始碼中「發現軟體漏洞」,但滲透測試、漏洞利用程式產生和二進位檔掃描仍會轉到 Opus 4.8,雙重用途的生物請求則轉到 Opus 5 s1。被轉向的請求不會以 Fable 的價格計費 s1。在 API 上不會自動切換:在你設定 fallbacks: "default"(beta)之前,你會拿到 HTTP 200 加上 stop_reason "refusal" s3。系統卡仍評估這些防護「比 Opus 5 的防護更容易觸發」,而 Fable 5 的基準線是「不到 5% 的工作階段」會用到備援 s2。

資料保存預設是「為安全監控保存 30 天」;由客戶掌控的替代方案 Enterprise Frontier Safeguards 將「從今年秋季稍後開始」提供,據稱與「超過 100 家客戶」共同打造 s1。在 auto mode 下信任它之前,值得先讀系統卡自己承認的部分:在不到 0.01% 受監控的完成結果中,曾繞過分類器或權限 hook;相較於 Opus 5,在失準行為上略有退步;MASK 誠實率低於近期的 Claude 模型;以及當有洩漏的答案可用時,70.1% 的默默使用率 s2。

方案

價格表把 Pro 上的 Fable 列為「用量點數」,Max 5x 和 Max 20x 則是「每週額度的 50%」,消費端的上下文視窗為 200k s5。支援文章說明了 Pro 上點數的運作方式,以及 Max 的上限在實務上代表什麼 s4。

結論表

你是 要換嗎? 原因
大量使用提示快取、agent 迴圈很長的 API 團隊 要,先修好三項破壞性變更 快取讀取 $0.25 與引用的最高 45% 節省適用於你 s1
用 Opus 5 且評測都通過的 API 團隊 先不要 文件說先用 Opus 5;只有更高 effort 的 Opus 仍不足時才用 Fable s3
整天跑 agent 的 Max 訂閱者 用 medium 或 xhigh 試試 Max 上限為每週 50%;max effort 會多寫 1.7 倍 token s6
Pro 訂閱者 不要 只有用量點數,沒有內含額度 s5
資安或生命科學工作 不要 滲透測試、漏洞利用與雙重用途生物仍會轉到 Opus s1

週一該做的事

  • 拉出一週的 API 日誌,算出快取讀取的占比;如果低於輸入 token 的一半,這次降價對你的帳單幾乎沒影響。
  • 在你的整合中搜尋 tool_choice 強制模式,以及任何編輯先前回合的程式碼;兩者在 Fable 5.1 上都會壞掉。
  • 在第一次正式呼叫之前,設定 fallbacks: "default",或明確處理 stop_reason "refusal"。
  • 碰 max 之前,先用 medium 和 xhigh 跑你現有的評測套件;文件說 medium 以更低的成本達到 Fable 5 的水準。
  • 檢查你的 Claude Code effort 預設值(/effort);那裡的預設是 High,整個檔案重寫和多餘回合的成本就出在這裡。
  • 如果你是 ZDR 客戶,向你的客戶經理確認,在 Enterprise Frontier Safeguards 推出之前你是否符合 ZDR 資格。
  • 在評測執行中加入 Opus 5 作為對照組;在 SWE-bench Multilingual 和 Multimodal 上它仍然勝出。

延伸閱讀

  • 想看完整的基準測試集和安全防護流程,請讀系統卡的表 8.1.A 與第 3 節,包含不到 0.01% 的 hook 繞過數字 s2。
  • Artificial Analysis 的文章拆解了各 effort 等級的每項任務成本,也呈現 AA-Omniscience 上的行為:它會嘗試回答 93.4% 的問題,而在答錯的題目中有 72.6% 仍給出答案 s6。
  • Simon Willison 針對單一提示做的 effort 等級成本測試,是親眼看見輸出 token 差距最便宜的方法 s8。
  • FrontierSWE v2 是公告沒有引用的獨立軟體工程基準測試 s10。
  • Vals AI 記錄了一項 Fable 解開的高難度推理任務,可用來校準文件指引中「高要求推理」的意思 s11。
  • What's new 頁面列出五項 beta 功能與請求範例;會改變 agent 預算規劃的是每則訊息的 effort s3。
  • 方案的支援文章說明,Pro 上的用量點數那一列與 Max 的 50% 上限對你的帳號代表什麼 s4。

來源

FAQ

對於有快取的工作負載,Fable 5.1 比 Opus 5 便宜嗎?

只有快取讀取這一項:每百萬 $0.25 對 $0.50。輸入和輸出仍是 Opus 5 的 $5 和 $25 的兩倍,所以答案取決於你的快取命中率。

API 團隊應該從哪個 effort 等級開始?

文件指出 medium 大致是 Fable 5 的品質、成本更低,而 Artificial Analysis 測得 xhigh 在其指數上是 65 分、每項任務 $2.72,max 則是 $3.76。從那裡開始,只有在評測需要時再往上調。

我的 Pro 方案能用 Fable 5.1 嗎?

不在內含額度之內:價格表把 Pro 上的 Fable 列為用量點數。Max 方案則可使用每週額度的 50%。

為什麼我的 agent 現在比 Fable 5 多跑好幾個回合?

文件指出平行工具呼叫更不穩定,Fable 5 會打包的呼叫,現在是每回合一次,加上小改動也會整個檔案重寫。兩者都會表現為額外的輸出 token 與往返次數。