TL;DR
- Fable 5.1 giữ nguyên giá niêm yết của Fable 5 ($10 đầu vào, $50 đầu ra cho mỗi triệu token); khoản giảm duy nhất là cache read, từ $1 xuống $0.25 cho mỗi triệu s1.
- Chi phí mỗi tác vụ theo đo độc lập tăng lên chứ không giảm: $3.76 ở mức max effort so với $3.14 của Fable 5, vì nó viết nhiều hơn khoảng 1.7x token đầu ra s6.
- Câu chuyện năng lực chỉ nằm ở một benchmark: Terminal-Bench-Science nhảy từ 24.7% lên 52.6%, hầu hết các dòng khác chỉ nhích vài điểm s1.
- Tài liệu của chính Anthropic bảo bạn bắt đầu với Opus 5 và chỉ dùng Fable 5.1 khi Opus ở effort cao hơn vẫn chưa đủ s3.
- Ba thay đổi API làm hỏng các tích hợp Fable 5; các safeguard vẫn chuyển các prompt cyber và bio sang Opus, và dữ liệu của bạn được lưu 30 ngày theo mặc định s3.
- Trên Pro chỉ dùng được bằng usage credits; trên Max bị giới hạn ở 50% giới hạn hằng tuần s5.
Các nguồn nói gì
Hóa đơn
Thông báo nêu rõ các con số: "$10 per million input tokens and $50 per million output tokens", không đổi so với Fable 5, và cache read ở mức "$0.25 per million tokens", mà Anthropic mô tả là "75% less" s1. Cache write có giá $12.50 mỗi triệu cho bậc 5 phút và $20 cho bậc 1 giờ; batch API là $5 đầu vào và $25 đầu ra; suy luận chỉ trong Mỹ có hệ số 1.1x s1. Mức tiết kiệm Anthropic nêu, "around 25%" với workload thông thường và "up to around 45%" với tác vụ agentic nặng, được đo "over four weeks of actual usage in August 2026", nên chúng mô tả các vòng lặp agent dùng nhiều cache, không phải một prompt đơn lẻ s1.
Tài liệu bổ sung chi tiết khiến chuyện này kỳ lạ: cache read được tính 0.025x giá đầu vào gốc thay vì 0.1x như mọi model Claude khác, nên một lượt cache read của Fable 5.1 ($0.25) rẻ hơn cache read của Opus 5 ($0.50) dù giá đầu vào gốc của Fable gấp đôi s3. Bảng so sánh cả họ model: Opus 5 $5/$25 với cache read $0.50, Sonnet 5 $2/$10 với cache read $0.20, Haiku 4.5 $1/$5 với cache read $0.10 s3.
Artificial Analysis đã chạy phép đo đối chứng. Ở max effort, Fable 5.1 đạt 66 trên chỉ số của họ, vượt Opus 5 ở 63, Fable 5 ở 62 và GPT-5.6 Sol ở 61, nhưng tốn $3.76 mỗi tác vụ so với $3.14 của Fable 5, và sẽ tốn khoảng $5.16 nếu không có đợt giảm giá cache s6. Mức xhigh đạt 65 với $2.72 mỗi tác vụ, đó là mức mà hầu hết mọi người nên đem ra so sánh s6. Lần chạy mod Minecraft của một người dùng Reddit là phiên bản phía người dùng của cùng phép tính này: 383.6k token đầu ra, $20.54, khoảng một giờ s12.
Bảng benchmark, kèm chú thích
| Benchmark | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Terminal-Bench-Science 0.1 | 52.6% | 24.7% | 29.0% | 22.4% |
| Terminal-Bench 4.0 | 55.8% | 42.0% | 52.3% | 37.3% |
| GDPval-AA v2 | 1853 | 1723 | 1824 | 1711 |
| OSWorld 2.0 (một phần / nghiêm ngặt) | 77.9% / 41.7% | 72.9% / 36.1% | 75.4% / 39.6% | n/a |
| Humanity's Last Exam (không công cụ / có công cụ) | 60.9% / 65.0% | 57.8% / 63.8% | 56.6% / 63.6% | n/a |
| AutomationBench | 31.4% | 17.1% | 26.9% | 19.6% |
| CursorBench 3.2.0 | 73.4% | 70.5% | 70.0% | 67.2% |
| SWE-bench Pro | 81.2 | 80 | 79.2 | 64.6 |
| SWE-bench Multilingual | 89.1 | 86.6 | 89.5 | n/a |
| SWE-bench Multimodal | 54.7 | 54.1 | 59.4 | n/a |
| ARC-AGI-2 | 90.0 | 89.2 | 90.42 | 92.5 |
| HealthBench Professional | 62.1% | 63.3% | 59.8% | n/a |
Các dòng trong thông báo có sai số chuẩn cộng trừ từ 3.5 đến 4.5 điểm trên Terminal-Bench-Science, và bảng xếp hạng công khai cho thấy Opus 5 ở 30.0% và Fable 5 ở 21.4%, nên khoảng cách ở tiêu đề là thật, còn các khoảng cách nhỏ ở những dòng khác nằm trong mức nhiễu s1. OSWorld 2.0 dùng bản task tháng 8 năm 2026 và không so sánh được với các số liệu trước đó; mọi đánh giá đều chạy "with its production safeguards enabled" và bất kỳ lần safeguard can thiệp nào cũng bị tính điểm không s1. Các dòng SWE-bench, ARC-AGI và HealthBench lấy từ bảng 8.1.A của system card, nơi Opus 5 thắng SWE-bench Multilingual và Multimodal, GPT-5.6 Sol thắng ARC-AGI-2, và Fable 5 đánh bại bản kế nhiệm ở HealthBench Professional s2. ARC Prize công bố lần chạy đã xác minh của riêng họ s7.
Thread Hacker News, 1391 điểm và 1351 bình luận, đi đến cùng một kết luận: bỏ Terminal-Bench-Science ra thì "it is hard to see ANY improvement" s9. Một kỹ sư Anthropic trong cùng thread nêu văn phong là cải tiến lớn ngoài các benchmark s9.
Cái gì hỏng và bạn được gì
Ba thay đổi làm hỏng một tích hợp Fable 5 đang chạy tốt. Forced tool use giờ trả về lỗi 400. Thinking block chỉ đi một chiều: các model cũ hơn không đọc được thinking của Fable 5.1. Sửa các lượt trước đó làm thinking block mất hiệu lực, áp dụng cho tài khoản tạo từ ngày 31 tháng 8 năm 2026 trở đi, với lỗi "The block is bound to a different conversation" s3. Năm tính năng bổ sung là effort theo từng message (beta), system message theo phạm vi lượt với clear_at: "next_user_message" (beta), cập nhật tiến độ qua display: "updates" (beta), giá cache read thấp hơn, và content provenance qua watermark văn bản cùng C2PA cho file s3.
Các ghi chú về hành vi quan trọng hơn bảng giá đối với ngân sách agent. Parallel tool calling "more variable": nơi Fable 5 gom các lệnh gọi, 5.1 thường chỉ gọi một lần mỗi lượt, và "extra turns cost tokens, round trips, and wall-clock time". Nó cũng "whole-file rewrites for small changes", làm phình token đầu ra, và ở low nó trả lời từ trí nhớ thường xuyên hơn s3. Effort có năm mức (low, medium, high, xhigh, max); "at medium, results roughly match Claude Fable 5 at lower cost", và ở xhigh hoặc max model "may draft much of that deliverable in its thinking and then write it out again" s3. Mặc định khác nhau theo nền tảng: High trong Claude Code, Medium trong Cowork và trên Claude.ai s1. Tokenizer là của Fable 5, "roughly 30% more tokens" so với các model trước 4.7 s3.
Safeguard, fallback và lưu trữ dữ liệu
Fable 5.1 và Mythos 5.1 là cùng một bộ trọng số với safeguard khác nhau s1. Các classifier cyber cho "60% fewer false positives" và người dùng Claude Code thấy "around 60% fewer interventions per session"; classifier bio kích hoạt "85% less often for benign requests" kể từ bản cập nhật ngày 6 tháng 8. Model giờ được phép dùng để "discover software vulnerabilities" trong mã nguồn, trong khi pentest, tạo exploit và quét binary vẫn chuyển sang Opus 4.8, và bio lưỡng dụng chuyển sang Opus 5 s1. Các request bị chuyển hướng không bị tính theo giá Fable s1. Trên API không có chuyển đổi tự động: bạn nhận HTTP 200 với stop_reason "refusal" cho đến khi cấu hình fallbacks: "default" (beta) s3. System card vẫn đánh giá các safeguard là "likelier to trigger than Opus 5's safeguards", và baseline Fable 5 dùng fallback "in less than 5% of sessions" s2.
Việc lưu trữ là "30-day data retention for safety monitoring by default"; phương án thay thế do khách hàng kiểm soát, Enterprise Frontier Safeguards, ra mắt "beginning later this fall" và được xây dựng cùng "more than 100 customers" s1. Những điều system card tự thừa nhận là phần đáng đọc trước khi tin dùng nó ở auto mode: vượt qua classifier hoặc permission hook trong dưới 0.01% số completion được giám sát, hồi quy nhẹ về hành vi lệch hướng so với Opus 5, tỷ lệ trung thực MASK thấp hơn các model Claude gần đây, và tỷ lệ dùng im lặng là 70.1% khi có sẵn một đáp án bị lộ s2.
Các gói
Bảng giá liệt kê Fable trên Pro là "Usage credits" và trên Max 5x và Max 20x là "50% of weekly limits", với context window phía người dùng là 200k s5. Bài hỗ trợ giải thích cách credits hoạt động trên Pro và mức giới hạn Max có ý nghĩa gì trong thực tế s4.
Bảng kết luận
| Bạn là | Nên chuyển? | Vì sao |
|---|---|---|
| Team API dùng nhiều prompt caching và vòng lặp agent dài | Có, sau khi sửa ba thay đổi gây hỏng | Cache read $0.25 và mức tiết kiệm tới 45% được nêu áp dụng cho bạn s1 |
| Team API đang dùng Opus 5 với eval đều đạt | Chưa | Tài liệu bảo bắt đầu với Opus 5; chỉ dùng Fable khi Opus ở effort cao hơn chưa đủ s3 |
| Người dùng Max chạy agent cả ngày | Thử ở medium hoặc xhigh | Giới hạn 50% hằng tuần trên Max; max effort viết nhiều hơn 1.7x token s6 |
| Người dùng Pro | Không | Chỉ có usage credits, không có hạn mức đi kèm s5 |
| Công việc bảo mật hoặc khoa học sự sống | Không | Pentest, exploit và bio lưỡng dụng vẫn chuyển sang Opus s1 |
Việc cần làm thứ Hai
- Lấy log API của một tuần và tính tỷ lệ cache read; nếu dưới một nửa số token đầu vào, đợt giảm giá hầu như không chạm tới hóa đơn của bạn.
- Grep tích hợp của bạn tìm các chế độ forced
tool_choicevà mọi đoạn code sửa các lượt trước; cả hai đều hỏng trên Fable 5.1. - Đặt
fallbacks: "default"hoặc xử lý stop_reason "refusal" một cách tường minh trước lần gọi production đầu tiên. - Chạy bộ eval hiện có ở
mediumvàxhightrước khi đụng tớimax; tài liệu xếp medium ngang Fable 5 với chi phí thấp hơn. - Kiểm tra effort mặc định của Claude Code (
/effort); High là mặc định ở đó và là nơi các lần viết lại cả file và lượt thừa gây tốn kém cho bạn. - Nếu bạn là khách hàng ZDR, hãy xác nhận với account team xem bạn có đủ điều kiện dùng ZDR cho đến khi Enterprise Frontier Safeguards ra mắt không.
- Thêm Opus 5 làm đối chứng trong các lần chạy eval; ở SWE-bench Multilingual và Multimodal nó vẫn thắng.
Đọc thêm
- Đọc bảng 8.1.A và mục 3 của system card để xem đầy đủ bộ benchmark và pipeline safeguard, gồm cả con số vượt hook dưới 0.01% s2.
- Bài của Artificial Analysis phân tích chi phí mỗi tác vụ theo từng mức effort và cho thấy hành vi AA-Omniscience: nó thử trả lời 93.4% số câu hỏi và trả lời 72.6% số câu mà nó làm sai s6.
- Bài test chi phí theo mức effort của Simon Willison trên một prompt là cách rẻ nhất để tận mắt thấy độ chênh token đầu ra s8.
- FrontierSWE v2 là benchmark kỹ nghệ phần mềm độc lập mà thông báo không trích dẫn s10.
- Vals AI ghi lại một tác vụ suy luận khó mà Fable đã giải được, hữu ích để hiệu chỉnh ý nghĩa của "demanding reasoning" trong hướng dẫn của tài liệu s11.
- Trang what's new liệt kê năm tính năng beta kèm ví dụ request; effort theo từng message là tính năng thay đổi cách lập ngân sách cho agent s3.
- Bài hỗ trợ về các gói giải thích dòng usage credits trên Pro và mức giới hạn 50% trên Max có nghĩa gì với tài khoản của bạn s4.
Nguồn
- Claude Fable 5.1 and Mythos 5.1, Anthropic. Vì sao nên đọc: bảng giá, bảng benchmark và các chú thích về mức tiết kiệm trong một trang.
- Claude Fable 5.1 and Mythos 5.1 system card, Anthropic. Vì sao nên đọc: nơi duy nhất ghi lại các dòng benchmark bổ sung và các hồi quy về alignment.
- What's new in Fable 5.1 (model docs), Anthropic. Vì sao nên đọc: các thay đổi gây hỏng, mức effort và những thay đổi hành vi bạn sẽ gặp trong code.
- Claude Fable models on your plan, Anthropic Support. Vì sao nên đọc: Pro, Max và Team thực sự nhận được gì.
- Anthropic pricing, Anthropic. Vì sao nên đọc: các dòng của từng gói và context window 200k phía người dùng.
- Claude Fable 5.1 independent analysis, Artificial Analysis. Vì sao nên đọc: chi phí mỗi tác vụ theo từng mức effort, được đo chứ không phải trích dẫn.
- Anthropic Claude Fable 5.1 on ARC-AGI-2, ARC Prize. Vì sao nên đọc: một lần chạy bên thứ ba đã xác minh trên benchmark duy nhất mà GPT-5.6 Sol thắng.
- Claude Fable 5.1 (pelican effort-level cost test), Simon Willison. Vì sao nên đọc: phép so sánh effort trên một prompt mà bạn có thể tái hiện trong vài phút.
- Claude Fable 5.1 and Claude Mythos 5.1 (Hacker News discussion), Hacker News. Vì sao nên đọc: người làm thực tế bàn về ngân sách token, tần suất fallback và mục đích thật của các thay đổi gây hỏng.
- FrontierSWE v2, FrontierSWE. Vì sao nên đọc: một benchmark SWE nằm ngoài bảng của Anthropic.
- Fable solves Cyphral Distich, Vals AI. Vì sao nên đọc: một chiến thắng cụ thể ở bài suy luận khó để cân với mức giá.
- Fable 5.1 made a Minecraft mod for $20 (r/ClaudeAI), Reddit r/ClaudeAI. Vì sao nên đọc: số token và số đô thật cho một giờ chạy agent.
FAQ
Fable 5.1 có rẻ hơn Opus 5 cho workload dùng cache không?
Chỉ ở dòng cache read: $0.25 so với $0.50 mỗi triệu. Đầu vào và đầu ra vẫn gấp đôi $5 và $25 của Opus 5, nên câu trả lời phụ thuộc vào tỷ lệ cache hit của bạn.
Team API nên bắt đầu với mức effort nào?
Tài liệu xếp medium ngang chất lượng Fable 5 với chi phí thấp hơn, và Artificial Analysis đo xhigh đạt 65 trên chỉ số với $2.72 mỗi tác vụ so với $3.76 ở max. Bắt đầu từ đó và chỉ tăng khi eval đòi hỏi.
Gói Pro của tôi có dùng được Fable 5.1 không?
Không nằm trong hạn mức đi kèm: bảng giá liệt kê Fable trên Pro là usage credits. Các gói Max có nó ở mức 50% giới hạn hằng tuần.
Vì sao agent của tôi giờ chạy nhiều lượt hơn so với Fable 5?
Tài liệu mô tả parallel tool calling là biến động hơn, một lệnh gọi mỗi lượt nơi Fable 5 gom lại, cộng với việc viết lại cả file cho các chỉnh sửa nhỏ. Cả hai đều biểu hiện thành token đầu ra và round trip thừa.
AIDive