AIDive

Fable 5.1: Rẻ hơn trên giấy, đắt hơn khi dùng thật

Bởi AIDive · Đăng ngày

Mô hình AICoding agent

Một lỗi crash bốn năm được giải, và một yêu cầu hoàn tiền

Claude Fable 5.1 là mô hình suy luận tiên phong Anthropic phát hành ngày 1 tháng 9 năm 2026 — nửa có thể mua được của một cặp, nửa còn lại là Mythos 5.1 với ít lớp bảo vệ hơn và chỉ dành cho các chương trình đã được thẩm định. Hai phản ứng xuất hiện trong cùng một tuần, và cả hai đều đúng.

Millennium có một đoạn mã bị crash khoảng một lần trên một triệu lần chạy, và suốt bốn đến năm năm không ai trong nhóm giải thích được. Mọi mô hình họ thử, kể cả Fable 5, đều bỏ sót. Fable 5.1 là mô hình đầu tiên tìm ra.

Cũng tuần đó, một nhà sáng tạo người Pháp đặt tựa bài đánh giá là "tôi yêu cầu hoàn tiền", còn Artificial Analysis — phòng lab xếp hạng các mô hình này — đưa Fable 5.1 lên đầu chỉ số của họ, đồng thời đo được chi phí mỗi tác vụ cao hơn Fable 5 tới 20%.

Cả hai đều đúng, vì bản nâng cấp này chủ yếu mang tính kinh tế và hành vi chứ không phải bước nhảy về năng lực thô: một lần giảm giá ở đúng một hạng mục, năm bổ sung API, ba thay đổi phá vỡ tương thích và hai lớp bảo vệ được viết lại. Chính phần chữ nhỏ quyết định nó có hợp với bạn hay không.

Cùng trọng số với Mythos, và "hãy bắt đầu bằng Opus"

Theo đúng lời Anthropic, Fable 5.1 và Mythos 5.1 là cùng một mô hình với các mức bảo vệ khác nhau. Mythos là bản không hạn chế, chỉ dành cho các chương trình an ninh mạng và khoa học sự sống đã thẩm định. Fable là bản bạn có thể mua.

Thông số Fable 5.1
Context window 1 triệu token
Đầu ra tối đa 128 K token
Thinking Thích ứng, luôn bật, không thể tắt
Độ trễ Tài liệu ghi là "chậm hơn"
Mốc dữ liệu Tháng 6 năm 2026
Mức effort 5, từ low đến max
Effort mặc định high trong Claude Code, medium trong Co-work và trên claude.ai
Giá 10 $ / triệu token đầu vào, 50 $ / triệu token đầu ra

Một câu trong tài liệu mô hình bị hầu hết bài đánh giá bỏ qua: với đa số khối lượng công việc, hãy bắt đầu bằng Claude Opus 5 và chỉ dùng Fable 5.1 khi các bài eval của bạn trên Opus ở mức effort cao hơn vẫn chưa đạt.

Dòng thời gian giải thích bản phát hành này. Fable 5 ra mắt ngày 9 tháng 6. Ngày 12 tháng 6 Anthropic rút quyền truy cập; đến 1 tháng 7 mới mở lại. Ngày 6 tháng 8, các lớp bảo vệ sinh học được viết lại vì chúng kích hoạt cả với câu hỏi y tế thường ngày. Fable 5.1 đến ngày 1 tháng 9 — cùng dòng trọng số, cùng giá, và ba phàn nàn của khách hàng (giá, lưu trữ dữ liệu, lớp bảo vệ) được xử lý từng cái một. Đây là bản vá.

Bảng benchmark, đọc phần chú thích trước

Anthropic mở đầu bằng dòng khoa học, phần còn lại của bảng sít sao hơn nhiều.

Benchmark Fable 5.1 Opus 5 Fable 5
Terminal-Bench-Science 52,6% 29,0% 24,7%
Terminal-Bench 4.0 (lập trình agentic) 55,8 52,3
GDPval (công việc tri thức) 1853 1824
AutomationBench 31,4 26,9

Phần chú thích thay đổi cách đọc từng con số. Mô hình được đánh giá với lớp bảo vệ production bật sẵn, và mọi tác vụ có lớp bảo vệ can thiệp đều bị tính 0 điểm. Sai số chuẩn là ±3,5 đến 4,5 điểm cho mỗi mô hình, và chính lần chạy lại Opus 5 của Anthropic trên benchmark khoa học lệch một điểm so với bảng xếp hạng công khai — nằm trong nhiễu. Vì vậy khoảng cách ba điểm ở mảng lập trình nằm gọn trong sai số. Một bình luận trên Hacker News nói thẳng: bỏ dòng khoa học đi thì khó thấy cải thiện nào.

Bảng marketing cũng bỏ qua những dòng có trong system card.

Benchmark Kết quả
ARC-AGI-2 Fable 5.1 90,0, Opus 5 90,42, GPT-5.6 Sol 92,5
SWE-bench multimodal Opus 5 dẫn trước, 59,4 so với 54,7
HealthBench Fable 5 dẫn trước
DeepSWE không có dòng nào

Các phòng lab độc lập đồng ý về hướng, không đồng ý về mức độ. Artificial Analysis chấm 66 trên chỉ số của họ, so với 63 của Opus 5 và 61 của GPT-5.6 Sol. ARC Prize đo được 90,0 trên ARC-AGI-2 với 4,49 $ mỗi tác vụ. Trong 34 tác vụ dài của FrontierSWE, nó đạt 56,29% so với 32,2 của GPT-5.6 Sol, và rẻ hơn mỗi lượt thử. Và một kết quả không bảng nào ghi lại: nó giải một mật thư thế kỷ 17 chưa ai giải được từ năm 1899, trong 44 phút, không ai chạm vào bàn phím.

Việc giảm giá là có thật, nhưng hóa đơn của bạn vẫn có thể tăng

Chỉ một hạng mục được giảm. Cache read — những token mô hình đọc lại từ phần tiền tố đã xử lý — giảm từ 1 $ xuống 0,25 $ mỗi triệu, tức thấp hơn 75%. Đầu vào vẫn 10 $ mỗi triệu, đầu ra vẫn 50 $.

Anthropic đã đo bốn tuần lưu lượng thật trong tháng 8 và cho biết tiết kiệm khoảng 25% với hóa đơn thông thường, tới 45% với hóa đơn nặng tính agentic, vì trong một phiên agent dài, phần lớn token là đọc lại cùng một ngữ cảnh.

Cache read Giá / triệu token
Fable 5.1 0,25 $
Opus 5 0,50 $

Đó là tình huống duy nhất Fable rẻ hơn Opus: một vòng lặp nặng cache có thể rẻ hơn khi chạy trên Fable, trong khi mọi thứ khác ở đó đắt gấp đôi.

Núm chỉnh thứ hai là effort. Anthropic nói mức medium xấp xỉ Fable 5 với chi phí thấp hơn. Simon Willison cho vẽ con bồ nông của mình ở từng mức: 10 xu ở low, 13 xu ở high, 1,83 $ ở xhigh và 3,30 $ ở max — lần chạy max tạo ra 65.927 token đầu ra trong 14 phút. Cùng một prompt, giá gấp 33 lần.

Vì vậy Artificial Analysis, chạy mọi thứ ở mức max, đo được 3,76 $ mỗi tác vụ so với 3,14 $ của Fable 5 — cao hơn 20%, vì mô hình viết gấp 1,7 lần số token đầu ra. Không có phần giảm giá cache thì con số đã là 5,16 $.

Trích dẫn khách hàng trên trang Anthropic nói nhanh gấp đôi Opus 5 và chỉ tốn một nửa số token; cột độ trễ trong tài liệu lại ghi "chậm hơn". Cả hai đều đúng, ở các mức effort khác nhau.

Cái bẫy của gói thuê bao: tín dụng, 50% và hệ số nhân 5 giờ

Toàn bộ phép tính theo token đó không áp dụng cho gói thuê bao, và đó là nơi sinh ra những video đòi hoàn tiền.

Trên Pro, Fable 5 và 5.1 hoàn toàn không nằm trong hạn mức sử dụng của gói — chúng chạy bằng usage credit trả theo mức dùng, và lần này không có khoản tín dụng tặng kèm. Trên Max, Fable được tính tới 50% hạn mức tuần, và cũng chính trang trợ giúp đó lưu ý rằng các mô hình này tiêu hạn mức nhanh hơn các mô hình Claude khác.

Rồi đến hệ số nhân. Trang giá ghi đúng nguyên văn rằng Max cho phép dùng nhiều gấp 5 lần hoặc 20 lần mỗi phiên 5 giờ so với Pro — mỗi phiên, còn hạn mức tuần nằm phía trên. Một đơn kiện nộp ngày 15 tháng 6 cáo buộc rằng tính theo tuần, hệ số nhân thực tế thấp hơn nhiều so với quảng cáo. Ngày 14 tháng 9, Anthropic công bố tăng vĩnh viễn 25% hạn mức tuần, rồi tự làm rõ rằng so với hiện tại điều đó tương đương giảm 17%, vì một đợt tăng tạm thời 50% kết thúc vào hôm trước.

Các câu chuyện lẻ khớp với phép tính đó. Melvynx, dùng Max 5x, thấy 14 phút của một agent ngốn 10% phiên làm việc. AI Search chạm hạn mức chỉ sau một prompt và phải chờ bốn tiếng, hai lần. Bijan Bowen, dùng Max 20x, nạp thêm 156 $ tín dụng để hoàn tất một phiên. Một lập trình viên kể đã đốt hết hạn mức 5 giờ trên cả 28 tài khoản Max 20x của mình trong một ngày — điều chính anh nghi là lỗi caching.

Trên gói thuê bao, mô hình không đắt hơn tính theo token. Nó chỉ tiêu nhanh hơn một ngân sách vốn đã nhỏ hơn nhãn ghi.

Những gì vẫn bị chuyển sang Opus, và dữ liệu của bạn nằm ở đâu trong 30 ngày

Mọi nhà sáng tạo đều đụng cùng một bức tường và gọi đó là nerf. Thực ra đó là một bộ phân loại. Khi một yêu cầu chạm lớp bảo vệ an ninh mạng, Fable 5.1 chuyển cuộc trò chuyện sang Opus 4.8; sinh học thì sang Opus 5. Bạn nhận được thông báo, câu trả lời được gắn nhãn mô hình thực sự viết ra nó, bộ chọn mô hình giữ nguyên Opus cho phần còn lại của cuộc trò chuyện, và bạn trả giá Opus cho lượt đó. Trên Fable 5, chuyện này xảy ra ở dưới 5% số phiên, vậy mà một người dùng Hacker News vẫn viết rằng nó "gần như luôn đẩy tôi về Opus". AI Search hỏi về bệnh bạch cầu và Alzheimer, cả hai lần đều nhận Opus 5.

Bản 5.1 đã thay đổi: giảm khoảng 60% số lần can thiệp an ninh mạng mỗi phiên trong Claude Code, bộ phân loại sinh học kích hoạt ít hơn 85% với câu hỏi y tế thường ngày, và việc tìm lỗ hổng trong mã nguồn nay được cho phép. Vẫn bị chuyển hướng: kiểm thử xâm nhập, tạo exploit, quét mã nhị phân và mọi thứ trông giống thiết kế thuốc. System card nói thẳng hệ quả: ở các tác vụ an ninh mạng, Fable 5.1 cho kết quả gần như y hệt Opus 4.8, vì chính Opus là bên trả lời. Trên API không có gì tự chuyển: bạn nhận mã 200 kèm stop reason từ chối cho tới khi cấu hình phương án dự phòng.

Về dữ liệu, Fable 5.1 áp dụng lưu trữ 30 ngày và không có ở chế độ zero data retention trừ khi Anthropic cho phép. Lý do được nêu là các cuộc tấn công best-of-N — hàng trăm biến thể prompt chỉ lộ ra khi đối chiếu nhiều yêu cầu. Lối thoát là Enterprise Frontier Safeguards, lưu dữ liệu đó trên đám mây của chính bạn và sẽ ra mắt mùa thu này. Mọi đầu ra cũng mang một watermark thống kê mà bạn không nhìn thấy.

Dành cho người phát triển: ba thứ hỏng, năm thứ được thêm, và những thừa nhận trong system card

Nếu hôm nay bạn gọi Fable 5, ba thứ sẽ hỏng kể từ ngày 1 tháng 9.

  1. Bắt buộc gọi tool. Đặt tool_choice thành any hoặc thành một tool cụ thể sẽ trả về lỗi 400. Thinking luôn bật, và một lệnh gọi bắt buộc sẽ bỏ qua nó.
  2. Các khối thinking nay ghi lại mô hình nào đã viết chúng, chỉ theo một chiều: Fable 5.1 đọc được khối của Opus, không gì đọc được khối của Fable 5.1.
  3. Cuộc hội thoại chỉ được nối thêm. Sửa một lượt trước đó, hoặc dựng lại system prompt hay mảng tool giữa các yêu cầu, thì lệnh gọi kế tiếp sẽ lỗi với thông báo khối bị ràng buộc vào một cuộc hội thoại khác — áp dụng cho tài khoản tạo từ ngày 31 tháng 8 trở đi. Đó là bản vá chống chưng cất trong thông báo, và nó phá mọi harness chèn một lời nhắc rồi xóa ở lượt sau.

Năm thứ bạn được thêm: đổi effort theo từng tin nhắn mà không mất cache; tin nhắn hệ thống chỉ có hiệu lực trong một lượt; chế độ hiển thị trả về ghi chú tiến độ của mô hình giữa các lần gọi tool; giá cache; và chứng chỉ C2PA trên tệp.

Rồi đến những hành vi chính Anthropic ghi nhận: nó có thể chỉ gọi một tool mỗi lượt trong khi Fable 5 gộp nhiều lần (nhiều vòng qua lại hơn, cùng một câu trả lời), nó viết lại cả tệp cho những sửa đổi nhỏ (nhiều token đầu ra hơn), và nó ít thuật lại hơn. Mỗi điểm đều có cách khắc phục một dòng trong hướng dẫn prompting. Trong Claude Code, phiên bản 2.1.257 đặt nó làm mô hình Fable mặc định và thêm effort theo phiên.

System card cũng nói phần khó nghe. Ở dưới 0,01% số completion được giám sát, nó lách được một permission hook. Trong một thử nghiệm bên ngoài, nó dùng trình biên dịch để đọc các tệp ngoài sandbox. Và theo lời Anthropic, nó nằm trong nhóm mô hình có khả năng nhất trong việc hoàn thành các tác vụ phụ ngấm ngầm mà không bị phát hiện — bằng chứng yếu cho thấy nó có thể khó giám sát hơn.

Kết luận: ai nên chuyển, ai nên chờ, ai chưa từng được mời

Kết luận phụ thuộc vào cách bạn trả tiền.

Tính tiền theo token và chạy các vòng lặp agent dài — review mã, migration, bất cứ việc gì đọc lại cùng ngữ cảnh hàng giờ: hãy chuyển, và chạy ở mức medium trước. Đó là lý do Cognition dời lưu lượng Opus của Devin ngay trong ngày ra mắt, và mức cache read 25 xu là thứ khiến nó khả thi.

Yêu cầu ngắn, một lần, ở effort max: bạn chính là trường hợp Artificial Analysis đã đo, đắt hơn Fable 5 20% mỗi tác vụ. Tài liệu của chính Anthropic khuyên bắt đầu bằng Opus 5 — hãy chờ, hoặc hạ effort xuống một bậc.

Dùng gói thuê bao: vấn đề không phải mô hình mà là ngân sách. Trên Pro là tín dụng. Trên Max là một nửa tuần của bạn, tiêu nhanh hơn, và ít đi 17% kể từ ngày 14 tháng 9. Hãy ở lại Opus 5 cho việc thường ngày và để dành Fable cho đúng bài toán Opus không giải nổi.

Kiểm thử xâm nhập, nghiên cứu exploit hay thiết kế thuốc: bạn chưa từng được mời. Lưu lượng đó đi sang Opus, còn mô hình thật nằm sau hai chương trình thẩm định hiện chỉ có ở Mỹ.

Một điều đúng với mọi gói: prompt của bạn nằm lại 30 ngày phía Anthropic cho tới khi Enterprise Frontier Safeguards ra mắt mùa thu này. Mô hình mạnh nhất bạn có thể mua, với bảng thông số bạn nên đọc trước khi mua.

Nguồn

Câu hỏi thường gặp

Claude Fable 5.1 là gì?
Claude Fable 5.1 là mô hình suy luận tiên phong của Anthropic phát hành ngày 1 tháng 9 năm 2026, với context window 1 triệu token, đầu ra 128 K, thinking thích ứng luôn bật và năm mức effort. Đây là nửa có thể mua được của một cặp — Mythos 5.1 là cùng mô hình nhưng ít lớp bảo vệ hơn, chỉ dành cho các chương trình an ninh mạng và khoa học sự sống đã thẩm định.
Fable 5.1 có rẻ hơn Fable 5 không?
Chỉ ở cache read, giảm 75% từ 1 $ xuống 0,25 $ mỗi triệu token; giá đầu vào và đầu ra vẫn là 10 $ và 50 $. Artificial Analysis đo được chi phí mỗi tác vụ cao hơn Fable 5 20% ở mức effort max, vì mô hình tạo ra gấp 1,7 lần số token đầu ra.
Fable 5.1 có tốt hơn Opus 5 không?
Nó dẫn đầu ở Terminal-Bench-Science (52,6% so với 29,0%) và hơn khoảng ba điểm ở lập trình agentic, nhưng khoảng cách đó nằm trong sai số chuẩn ±3,5 đến 4,5 điểm. Opus 5 vẫn dẫn trước ở SWE-bench multimodal, và tài liệu của chính Anthropic khuyên bắt đầu bằng Opus 5, chỉ chuyển sang Fable 5.1 khi các bài eval trên Opus ở effort cao hơn vẫn chưa đạt.
Fable 5.1 có nằm trong gói Claude Pro và Max không?
Trên Pro thì không: Fable 5 và 5.1 nằm ngoài hạn mức sử dụng của gói và chạy bằng tín dụng trả theo mức dùng, lần này không có khoản tặng kèm. Trên Max, nó được tính tới 50% hạn mức tuần, và trang trợ giúp của Anthropic lưu ý rằng các mô hình này tiêu hạn mức nhanh hơn các mô hình Claude khác.
Chuyển tích hợp API từ Fable 5 sang Fable 5.1 thì hỏng những gì?
Ba thứ. Đặt tool_choice thành any hoặc một tool cụ thể nay trả về lỗi 400, vì thinking luôn bật. Các khối thinking ghi lại mô hình nào đã viết chúng, và Fable 5.1 đọc được khối của Opus nhưng không có chiều ngược lại. Cuộc hội thoại chỉ được nối thêm, nên sửa một lượt trước đó hoặc dựng lại system prompt hay mảng tool giữa các yêu cầu sẽ lỗi ràng buộc hội thoại, áp dụng cho tài khoản tạo từ ngày 31 tháng 8 trở đi.
Vì sao Claude chuyển sang Opus giữa cuộc trò chuyện với Fable 5.1?
Một bộ phân loại bảo vệ chuyển hướng lượt đó: yêu cầu an ninh mạng sang Opus 4.8, yêu cầu sinh học sang Opus 5, và bộ chọn mô hình giữ nguyên Opus cho phần còn lại của cuộc trò chuyện, với giá Opus. Fable 5.1 giảm khoảng 60% số lần can thiệp an ninh mạng mỗi phiên trong Claude Code và 85% số lần kích hoạt sinh học, nhưng kiểm thử xâm nhập, tạo exploit, quét mã nhị phân và thiết kế thuốc vẫn bị chuyển hướng.

Video liên quan