AIDive

Fable 5.1 評測:最強模型,帳面更便宜,實際更燒錢

AIDive · 發布

AI 模型編碼 agent

四年沒解開的崩潰被找出來,還有一則退款要求

Claude Fable 5.1 是 Anthropic 在 2026 年 9 月 1 日發布的前沿推理模型,也是一對模型中可以買到的那一半;另一半 Mythos 5.1 安全防護較少,只開放給通過審核的專案。同一週出現了兩種反應,而且兩種都是真的。

Millennium 有一段程式碼大約每一百萬次執行會崩潰一次,團隊裡沒有人在四到五年間解釋得出原因。他們試過的每個模型,包括 Fable 5,都沒抓到。Fable 5.1 是第一個找出來的。

同一週,一位法國創作者把自己的評測標題取為「我要求退款」,而替這些模型排名的實驗室 Artificial Analysis,一邊把 Fable 5.1 放上指數榜首,一邊量到它每項任務的成本比 Fable 5 高出 20%。

兩者同時成立,是因為這次升級主要是經濟面與行為面的改動,而不是原始能力的跳躍:單一項目的降價、五項 API 新增、三項破壞相容性的變更,以及兩套重寫的安全防護。決定它適不適合你的,是那些小字。

和 Mythos 相同的權重,以及「先從 Opus 開始」

用 Anthropic 自己的話說,Fable 5.1 和 Mythos 5.1 是同一個模型,只是安全防護等級不同。Mythos 是沒有限制的版本,保留給通過審核的資安與生命科學專案。你能買到的是 Fable。

規格 Fable 5.1
Context window 100 萬 tokens
最大輸出 128K tokens
Thinking 自適應、永遠開啟、無法關閉
延遲 文件標示為「較慢」
知識截止 2026 年 6 月
effort 等級 5 級,從 low 到 max
預設 effort Claude Code 為 high,Co-work 與 claude.ai 為 medium
價格 輸入每百萬 $10,輸出每百萬 $50

模型文件裡有一句話,多數評測都跳過了:大部分工作負載請先用 Claude Opus 5,只有當你在較高 effort 的 Opus 上做的評測仍然不夠時,才改用 Fable 5.1。

時間軸解釋了這次發布的性質。Fable 5 在 6 月 9 日推出。6 月 12 日 Anthropic 收回存取權,7 月 1 日才恢復。8 月 6 日,生物學安全防護因為連日常醫療問題都會觸發而被重寫。9 月 1 日 Fable 5.1 登場:同一個權重家族、同樣的價格,客戶抱怨的三件事(價格、資料保留、安全防護)逐一處理。這是一次修補型發布。

先看註腳,再看基準測試表

Anthropic 主打的是科學那一列,表格其餘部分則接近得多。

基準測試 Fable 5.1 Opus 5 Fable 5
Terminal-Bench-Science 52.6% 29.0% 24.7%
Terminal-Bench 4.0(代理式編碼) 55.8 52.3
GDPval(知識工作) 1853 1824
AutomationBench 31.4 26.9

註腳會改變每個數字的讀法。模型是在開啟正式環境安全防護的情況下受測,只要安全防護介入的任務就以零分計。每個模型的標準誤差是 ±3.5 到 4.5 分,而 Anthropic 自己重跑的 Opus 5 科學基準結果,與公開排行榜差一分,落在雜訊範圍內。因此編碼上三分的領先其實在誤差範圍之內。一位 Hacker News 留言者說得直白:把科學那一列拿掉,就很難看出任何進步。

行銷用的表格還漏掉了系統卡裡有的幾列。

基準測試 結果
ARC-AGI-2 Fable 5.1 90.0、Opus 5 90.42、GPT-5.6 Sol 92.5
SWE-bench multimodal Opus 5 領先,59.4 對 54.7
HealthBench Fable 5 領先
DeepSWE 完全沒有這一列

獨立實驗室對方向有共識,對幅度沒有。Artificial Analysis 給它指數 66,Opus 5 是 63、GPT-5.6 Sol 是 61。ARC Prize 在 ARC-AGI-2 量到 90.0,每項任務 $4.49。FrontierSWE 的 34 項長任務中,它拿到 56.29%,勝過 GPT-5.6 Sol 的 32.2,每次嘗試也更便宜。還有一項任何表格都收不進去的結果:它在 44 分鐘內解開了一段自 1899 年以來無人破解的 17 世紀密碼,全程沒有人碰鍵盤。

降價是真的,但你的帳單還是可能變高

降的只有一項。Cache read,也就是模型從已處理前綴重新讀取的 tokens,從每百萬 $1 降到 $0.25,少了 75%。輸入維持每百萬 $10,輸出維持 $50。

Anthropic 量了八月四週的真實流量,指出一般帳單約可省 25%,高度代理式的帳單最多省 45%,因為在長時間的 agent session 裡,多數 tokens 都是同一份脈絡的重讀。

Cache read 每百萬 tokens 價格
Fable 5.1 $0.25
Opus 5 $0.50

這是 Fable 唯一比 Opus 便宜的情況:吃 cache 的迴圈跑在 Fable 上可能更省,而其他所有項目在那裡都貴一倍。

第二個旋鈕是 effort。Anthropic 說 medium 大致相當於 Fable 5,但更便宜。Simon Willison 在每個等級都讓它畫自己的鵜鶘:low 花 10 美分、high 13 美分、xhigh $1.83、max $3.30,而 max 那次在 14 分鐘內產生 65,927 個輸出 tokens。同樣的提示,價格差 33 倍。

因此把所有測試都跑在 max 的 Artificial Analysis,量到每項任務 $3.76,相對 Fable 5 的 $3.14 高出 20%,因為模型寫出 1.7 倍的輸出 tokens。若沒有這次 cache 降價,數字會是 $5.16。

Anthropic 頁面上的客戶引言說它比 Opus 5 快兩倍、tokens 只要一半;文件的延遲欄位則寫「較慢」。在不同 effort 等級下,兩者都成立。

訂閱方案的陷阱:點數、50%,還有 5 小時倍數

上面這些以 token 計價的算式,對訂閱方案都不適用,而退款影片正是從這裡來的。

在 Pro 上,Fable 5 與 5.1 根本不算在方案的使用額度內,而是走隨用隨付的 usage credits,而且這次沒有一次性贈送點數。在 Max 上,Fable 最多佔每週額度的 50%,同一頁說明也指出這些模型消耗額度的速度比其他 Claude 模型更快。

接著是倍數。定價頁的原話是:Max 每個 5 小時 session 的可用量是 Pro 的 5 倍或 20 倍——是以 session 計,週額度再疊在上面。6 月 15 日提出的一宗訴訟主張,若以週為單位計算,實際倍數遠低於廣告數字。9 月 14 日,Anthropic 宣布永久調高週額度 25%,隨後又以自己的話澄清,相較於現況這其實是減少 17%,因為前一天有一項暫時性的 50% 加成到期。

於是那些軼事就說得通了。用 Max 5x 的 Melvynx 看著單一 agent 跑 14 分鐘吃掉他 10% 的 session。AI Search 一則提示就撞上額度,兩次各等了四小時。用 Max 20x 的 Bijan Bowen 為了跑完一個 session 加值了 $156 點數。還有一位開發者說他 28 個 Max 20x 帳號的 5 小時額度在一天內全部用光,連他自己都懷疑是快取的 bug。

在方案上,這個模型並不是每個 token 更貴,而是把本來就比標籤小的預算花得更快。

哪些請求仍會轉去 Opus,還有你的資料會留 30 天

每位創作者都撞上同一道牆,並稱之為削弱。它其實是一個分類器。當請求觸發資安防護時,Fable 5.1 會把對話交給 Opus 4.8;生物學則交給 Opus 5。你會看到通知,答案上標著真正撰寫它的模型,選擇器在該對話接下來都停在 Opus,而那一輪你付的是 Opus 價格。在 Fable 5 上,這只發生在不到 5% 的 session,但仍有一位 Hacker News 使用者寫道「它幾乎總是把我丟回 Opus」。AI Search 問了白血病和阿茲海默症,兩次都是 Opus 5 回答。

5.1 改了什麼:Claude Code 中每個 session 的資安介入減少約 60%,日常醫療問題觸發生物學分類器的比例減少 85%,並且允許在原始碼中尋找漏洞。仍會被轉走的是:滲透測試、漏洞利用程式生成、二進位檔掃描,以及任何看起來像藥物設計的內容。系統卡把後果講得很直白:在資安任務上,Fable 5.1 的表現幾乎和 Opus 4.8 相同,因為回答的就是它。在 API 上不會自動切換:在你設定備援之前,你會拿到帶有拒絕 stop reason 的 200。

資料方面,Fable 5.1 適用 30 天保留,除非 Anthropic 另行核准,否則無法使用零資料保留。官方說明的理由是 best-of-N 攻擊,也就是數百種只有跨請求比對才看得出來的提示變體。出路是 Enterprise Frontier Safeguards,把這些資料存在你自己的雲端,預計今年秋天推出。此外每一段輸出都帶有看不見的統計浮水印。

給開發者:三件會壞的事、五件你得到的事,以及系統卡自己的坦白

如果你今天還在呼叫 Fable 5,9 月 1 日起有三件事會壞。

  1. 強制使用工具。tool_choice 設為 any 或指定某個工具會得到 400。thinking 永遠開啟,而強制呼叫會跳過它。
  2. thinking 區塊現在會記錄由哪個模型撰寫,而且是單向的:Fable 5.1 讀得到 Opus 的,沒有東西讀得到 Fable 5.1 的。
  3. 對話只能附加。 編輯先前的回合,或在兩次請求之間重建系統提示或工具陣列,下一次呼叫就會以「該區塊綁定到另一段對話」失敗;此規則對 8 月 31 日(含)之後建立的帳號生效。這就是公告中的反蒸餾修補,它會弄壞每一種先插入提醒、下一回合再刪掉的 harness。

你得到的五件事:在不失去 cache 的情況下逐則訊息調整 effort、只作用於單一回合的系統訊息、在工具呼叫之間回傳模型進度筆記的顯示模式、cache 價格,以及檔案上的 C2PA 憑證。

再來是 Anthropic 自己記載的行為:它可能在 Fable 5 會批次多個工具呼叫的地方,改成每回合只呼叫一次(來回更多,答案相同);小修改也整份重寫檔案(輸出 tokens 更多);敘述變少。每一項在提示指南裡都有一行對策。在 Claude Code 中,2.1.257 版把它設為預設的 Fable 模型,並加入每個 session 的 effort 設定。

系統卡也說了不好聽的部分。在受監控完成中不到 0.01% 的比例裡,它繞過了一個權限 hook。在一次外部測試中,它利用編譯器讀取沙箱外的檔案。而且用 Anthropic 的話說,它是最有能力在不被偵測的情況下完成隱蔽附帶任務的模型之一,這是它可能更難監控的微弱證據。

結論:誰該換、誰該等、誰從一開始就沒被邀請

結論取決於你怎麼付錢。

按 token 計費、跑長時間 agent 迴圈的人——程式碼審查、遷移,任何需要把同一份脈絡重讀數小時的工作:換過去,而且先用 medium 跑。這正是 Cognition 在發布當天把 Devin 的 Opus 流量移過來的理由,25 美分的 cache read 就是它成立的原因。

在 max effort 下跑短的一次性請求:你就是 Artificial Analysis 量到的那個情況,每項任務比 Fable 5 貴 20%。Anthropic 自己的文件也說要先用 Opus 5,所以請再等等,或把 effort 降一級。

訂閱用戶:問題不在模型,而在預算。Pro 是點數;Max 是你一週的一半,花得更快,而且從 9 月 14 日起每週還少了 17%。日常工作留在 Opus 5,把 Fable 留給 Opus 解不開的那一題。

做滲透測試、漏洞研究或藥物設計的人:你從一開始就沒被邀請。那些流量會轉給 Opus,真正的模型在兩個目前僅限美國的審核計畫後面。

還有一句話對所有方案都成立:在 Enterprise Frontier Safeguards 今年秋天推出之前,你的提示會在 Anthropic 那邊留 30 天。這是你買得到最強的模型,而它的規格表值得你在下單前先讀一遍。

來源

常見問題

Claude Fable 5.1 是什麼?
Claude Fable 5.1 是 Anthropic 於 2026 年 9 月 1 日發布的前沿推理模型,具備 100 萬 tokens 的 context window、128K 輸出、永遠開啟的自適應 thinking,以及五個 effort 等級。它是一對模型中可以購買的那一半;Mythos 5.1 是同一個模型但安全防護較少,只保留給通過審核的資安與生命科學專案。
Fable 5.1 比 Fable 5 便宜嗎?
只有 cache read 便宜,從每百萬 tokens $1 降到 $0.25,少了 75%;輸入與輸出價格維持 $10 與 $50。Artificial Analysis 量到在 max effort 下,每項任務成本比 Fable 5 高 20%,因為模型產生 1.7 倍的輸出 tokens。
Fable 5.1 比 Opus 5 更好嗎?
它在 Terminal-Bench-Science 領先(52.6% 對 29.0%),在代理式編碼上領先約三分,但這個差距落在 ±3.5 至 4.5 分的標準誤差之內。SWE-bench multimodal 仍是 Opus 5 領先,而 Anthropic 自己的文件建議先用 Opus 5,只有在較高 effort 的 Opus 評測仍不夠時才改用 Fable 5.1。
Claude Pro 和 Max 方案包含 Fable 5.1 嗎?
Pro 不包含:Fable 5 與 5.1 在方案使用額度之外,改走隨用隨付點數,而且這次沒有一次性贈送點數。Max 最多包含每週額度的 50%,而 Anthropic 的說明頁指出這些模型消耗額度的速度比其他 Claude 模型更快。
把 API 整合從 Fable 5 換到 Fable 5.1 會壞掉哪些東西?
三件事。因為 thinking 永遠開啟,把 tool_choice 設為 any 或指定工具現在會回傳 400。thinking 區塊會記錄由哪個模型撰寫,Fable 5.1 讀得到 Opus 的區塊,反過來則不行。對話只能附加,因此編輯先前回合,或在兩次請求之間重建系統提示或工具陣列,都會以對話綁定錯誤失敗;此規則對 8 月 31 日(含)之後建立的帳號生效。
為什麼和 Fable 5.1 對話到一半,Claude 會換成 Opus?
安全分類器會把那一輪轉走:資安請求交給 Opus 4.8,生物學請求交給 Opus 5,之後選擇器整段對話都停在 Opus,並以 Opus 價格計費。Fable 5.1 讓 Claude Code 中每個 session 的資安介入減少約 60%、生物學觸發減少 85%,但滲透測試、漏洞利用程式生成、二進位檔掃描與藥物設計仍會被轉走。

相關影片