TL;DR
- Fable 5.1 mempertahankan harga list Fable 5 ($10 input, $50 output per juta token); satu-satunya pemotongan ada di cache read, dari $1 menjadi $0.25 per juta s1.
- Biaya per tugas dari pengukuran independen justru naik: $3.76 pada max effort, dibanding $3.14 untuk Fable 5, karena modelnya menulis sekitar 1.7x token output s6.
- Cerita kemampuannya hanya selebar satu benchmark: Terminal-Bench-Science melonjak dari 24.7% ke 52.6%, sebagian besar baris lain hanya bergerak beberapa poin s1.
- Dokumentasi Anthropic sendiri menyuruh Anda mulai dari Opus 5 dan baru memakai Fable 5.1 kalau Opus pada effort lebih tinggi masih kurang s3.
- Tiga perubahan API merusak integrasi Fable 5; safeguard masih mengalihkan prompt cyber dan bio ke Opus, dan data Anda disimpan 30 hari secara default s3.
- Di Pro hanya lewat usage credits; di Max dibatasi 50% dari batas mingguan s5.
Apa kata sumber-sumbernya
Tagihannya
Pengumuman menyebut angkanya dengan jelas: "$10 per million input tokens and $50 per million output tokens", tidak berubah dari Fable 5, dan cache read "$0.25 per million tokens", yang oleh Anthropic disebut "75% less" s1. Cache write berharga $12.50 per juta untuk tier 5 menit dan $20 untuk tier 1 jam; batch API $5 input dan $25 output; inferensi khusus AS dikenai pengali 1.1x s1. Penghematan yang dikutip Anthropic, "around 25%" pada beban kerja tipikal dan "up to around 45%" pada tugas yang sangat agentic, diukur "over four weeks of actual usage in August 2026", jadi angka itu menggambarkan loop agent yang banyak memakai cache, bukan satu prompt sekali jalan s1.
Dokumentasi menambahkan detail yang membuat ini aneh: cache read dihargai 0.025x input dasar, bukan 0.1x seperti model Claude lain, sehingga cache read Fable 5.1 ($0.25) lebih murah daripada cache read Opus 5 ($0.50) padahal input dasar Fable dua kali lipat s3. Tabel keluarga model sebagai pembanding: Opus 5 $5/$25 dengan read $0.50, Sonnet 5 $2/$10 dengan read $0.20, Haiku 4.5 $1/$5 dengan read $0.10 s3.
Artificial Analysis menjalankan pengukuran tandingan. Pada max effort Fable 5.1 mendapat skor 66 di indeks mereka, di atas Opus 5 dengan 63, Fable 5 dengan 62 dan GPT-5.6 Sol dengan 61, tetapi biayanya $3.76 per tugas dibanding $3.14 untuk Fable 5, dan akan menjadi sekitar $5.16 tanpa pemotongan cache s6. Setelan xhigh mendapat 65 dengan $2.72 per tugas, dan itulah setelan yang seharusnya dibandingkan kebanyakan orang s6. Proyek mod Minecraft seorang pengguna Reddit adalah versi sisi konsumen dari hitungan yang sama: 383.6k token output, $20.54, sekitar satu jam s12.
Tabel benchmark, lengkap dengan catatan kaki
| Benchmark | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Terminal-Bench-Science 0.1 | 52.6% | 24.7% | 29.0% | 22.4% |
| Terminal-Bench 4.0 | 55.8% | 42.0% | 52.3% | 37.3% |
| GDPval-AA v2 | 1853 | 1723 | 1824 | 1711 |
| OSWorld 2.0 (parsial / ketat) | 77.9% / 41.7% | 72.9% / 36.1% | 75.4% / 39.6% | n/a |
| Humanity's Last Exam (tanpa tool / dengan tool) | 60.9% / 65.0% | 57.8% / 63.8% | 56.6% / 63.6% | n/a |
| AutomationBench | 31.4% | 17.1% | 26.9% | 19.6% |
| CursorBench 3.2.0 | 73.4% | 70.5% | 70.0% | 67.2% |
| SWE-bench Pro | 81.2 | 80 | 79.2 | 64.6 |
| SWE-bench Multilingual | 89.1 | 86.6 | 89.5 | n/a |
| SWE-bench Multimodal | 54.7 | 54.1 | 59.4 | n/a |
| ARC-AGI-2 | 90.0 | 89.2 | 90.42 | 92.5 |
| HealthBench Professional | 62.1% | 63.3% | 59.8% | n/a |
Baris-baris pengumuman memiliki standard error plus minus 3.5 sampai 4.5 poin pada Terminal-Bench-Science, dan leaderboard publik menunjukkan Opus 5 di 30.0% dan Fable 5 di 21.4%, jadi selisih utamanya nyata tetapi selisih kecil di tempat lain masih dalam batas noise s1. OSWorld 2.0 memakai rilis tugas Agustus 2026 dan tidak sebanding dengan angka sebelumnya; semua evaluasi dijalankan "with its production safeguards enabled" dan setiap intervensi safeguard diberi skor nol s1. Baris SWE-bench, ARC-AGI, dan HealthBench berasal dari tabel 8.1.A system card, di mana Opus 5 unggul di SWE-bench Multilingual dan Multimodal, GPT-5.6 Sol unggul di ARC-AGI-2, dan Fable 5 mengalahkan penerusnya di HealthBench Professional s2. ARC Prize menerbitkan run terverifikasi miliknya sendiri s7.
Thread Hacker News, 1391 poin dan 1351 komentar, sampai pada pembacaan yang sama: singkirkan Terminal-Bench-Science dan "it is hard to see ANY improvement" s9. Seorang engineer Anthropic di thread yang sama menyebut gaya penulisan sebagai peningkatan besar di luar benchmark s9.
Apa yang rusak dan apa yang didapat
Tiga perubahan merusak integrasi Fable 5 yang sudah berjalan. Forced tool use sekarang mengembalikan error 400. Thinking block bersifat satu arah: model lama tidak bisa membaca thinking Fable 5.1. Mengedit giliran sebelumnya membuat thinking block tidak valid, diberlakukan untuk akun yang dibuat pada atau setelah 31 Agustus 2026, dengan error "The block is bound to a different conversation" s3. Lima tambahannya adalah effort per pesan (beta), system message bercakupan giliran dengan clear_at: "next_user_message" (beta), pembaruan progres lewat display: "updates" (beta), harga cache read yang lebih rendah, dan provenance konten lewat watermark teks plus C2PA pada file s3.
Catatan perilaku lebih penting untuk anggaran agent daripada tabel harga. Parallel tool calling "more variable": di mana Fable 5 mengelompokkan panggilan, 5.1 sering hanya membuat satu panggilan per giliran, dan "extra turns cost tokens, round trips, and wall-clock time". Model ini juga melakukan "whole-file rewrites for small changes", yang menggembungkan token output, dan pada low ia lebih sering menjawab dari memori s3. Effort punya lima level (low, medium, high, xhigh, max); "at medium, results roughly match Claude Fable 5 at lower cost", dan pada xhigh atau max model "may draft much of that deliverable in its thinking and then write it out again" s3. Default berbeda per surface: High di Claude Code, Medium di Cowork dan Claude.ai s1. Tokenizer-nya sama dengan Fable 5, "roughly 30% more tokens" dibanding model sebelum 4.7 s3.
Safeguard, fallback, dan retensi
Fable 5.1 dan Mythos 5.1 memakai weights yang sama dengan safeguard berbeda s1. Classifier cyber menghasilkan "60% fewer false positives" dan pengguna Claude Code melihat "around 60% fewer interventions per session"; classifier bio aktif "85% less often for benign requests" sejak pembaruan 6 Agustus. Model kini boleh dipakai "to discover software vulnerabilities" di source code, sementara penetration testing, pembuatan exploit, dan pemindaian binary tetap dialihkan ke Opus 4.8, dan bio dual-use dialihkan ke Opus 5 s1. Request yang dialihkan tidak ditagih dengan harga Fable s1. Di API tidak ada peralihan otomatis: Anda mendapat HTTP 200 dengan stop_reason "refusal" sampai Anda mengonfigurasi fallbacks: "default" (beta) s3. System card masih menilai safeguard-nya "likelier to trigger than Opus 5's safeguards", dan baseline Fable 5 memakai fallback "in less than 5% of sessions" s2.
Retensinya adalah "30-day data retention for safety monitoring by default"; penggantinya yang dikendalikan pelanggan, Enterprise Frontier Safeguards, hadir "beginning later this fall" dan dibangun bersama "more than 100 customers" s1. Pengakuan system card sendiri adalah bagian yang layak dibaca sebelum mempercayainya di auto mode: menyiasati classifier atau permission hook pada kurang dari 0.01% completion yang dipantau, sedikit regresi pada perilaku misaligned dibanding Opus 5, tingkat kejujuran MASK yang lebih rendah daripada model Claude terbaru, dan silent use rate 70.1% ketika jawaban yang bocor tersedia s2.
Paket langganan
Tabel harga mencantumkan Fable di Pro sebagai "Usage credits" dan di Max 5x dan Max 20x sebagai "50% of weekly limits", dengan context window konsumen 200k s5. Artikel support menjelaskan cara kerja alur credits di Pro dan arti nyata batas di Max s4.
Tabel keputusan
| Anda adalah | Pindah? | Alasan |
|---|---|---|
| Tim API dengan prompt caching berat dan loop agent panjang | Ya, setelah memperbaiki tiga perubahan yang merusak | Cache read $0.25 dan penghematan hingga 45% yang dikutip berlaku untuk Anda s1 |
| Tim API di Opus 5 dengan eval yang lolos | Belum | Dokumentasi: mulai dari Opus 5; Fable hanya bila Opus pada effort lebih tinggi kurang s3 |
| Pelanggan Max yang menjalankan agent sepanjang hari | Coba di medium atau xhigh | Batas mingguan 50% di Max; max effort menulis 1.7x token s6 |
| Pelanggan Pro | Tidak | Hanya usage credits, tanpa jatah termasuk s5 |
| Pekerjaan keamanan atau life sciences | Tidak | Pentesting, exploit, dan bio dual-use tetap dialihkan ke Opus s1 |
Kerjakan Senin ini
- Ambil log API satu minggu dan hitung porsi cache read; kalau di bawah setengah dari token input Anda, pemotongan harga nyaris tidak menyentuh tagihan Anda.
- Grep integrasi Anda untuk mode forced
tool_choicedan kode apa pun yang mengedit giliran sebelumnya; keduanya rusak di Fable 5.1. - Setel
fallbacks: "default"atau tangani stop_reason "refusal" secara eksplisit sebelum panggilan produksi pertama. - Jalankan eval suite Anda di
mediumdanxhighsebelum menyentuhmax; dokumentasi menempatkan medium setara Fable 5 dengan biaya lebih rendah. - Periksa default effort Claude Code Anda (
/effort); High adalah default di sana dan di situlah penulisan ulang seluruh file dan giliran tambahan membuat Anda rugi. - Kalau Anda pelanggan ZDR, konfirmasi ke tim akun Anda apakah Anda memenuhi syarat ZDR sampai Enterprise Frontier Safeguards rilis.
- Tambahkan Opus 5 sebagai kontrol di run eval Anda; di SWE-bench Multilingual dan Multimodal ia masih menang.
Bacaan lanjutan
- Baca tabel 8.1.A dan bagian 3 system card untuk set benchmark lengkap dan pipeline safeguard, termasuk angka hook-bypass di bawah 0.01% s2.
- Artikel Artificial Analysis merinci biaya per tugas menurut level effort dan menunjukkan perilaku AA-Omniscience: model mencoba menjawab 93.4% pertanyaan dan menjawab 72.6% dari yang ia jawab salah s6.
- Tes biaya level effort Simon Willison pada satu prompt adalah cara termurah untuk melihat sebaran token output dengan mata sendiri s8.
- FrontierSWE v2 adalah benchmark software engineering independen yang tidak dikutip pengumuman s10.
- Vals AI mendokumentasikan tugas penalaran sulit yang berhasil diselesaikan Fable, berguna untuk mengkalibrasi arti "demanding reasoning" dalam panduan dokumentasi s11.
- Halaman what's new mencantumkan lima fitur beta dengan contoh request; effort per pesan adalah yang mengubah anggaran agent s3.
- Artikel support tentang paket menjelaskan arti baris usage credits di Pro dan batas 50% di Max untuk akun Anda s4.
Sumber
- Claude Fable 5.1 and Mythos 5.1, Anthropic. Mengapa dibaca: tabel harga, tabel benchmark, dan catatan kaki penghematan dalam satu halaman.
- Claude Fable 5.1 and Mythos 5.1 system card, Anthropic. Mengapa dibaca: satu-satunya tempat baris benchmark tambahan dan regresi alignment dituliskan.
- What's new in Fable 5.1 (model docs), Anthropic. Mengapa dibaca: perubahan yang merusak, level effort, dan pergeseran perilaku yang akan Anda temui di kode.
- Claude Fable models on your plan, Anthropic Support. Mengapa dibaca: apa yang sebenarnya didapat Pro, Max, dan Team.
- Anthropic pricing, Anthropic. Mengapa dibaca: baris paket dan context window konsumen 200k.
- Claude Fable 5.1 independent analysis, Artificial Analysis. Mengapa dibaca: biaya per tugas di tiap level effort, diukur dan bukan sekadar dikutip.
- Anthropic Claude Fable 5.1 on ARC-AGI-2, ARC Prize. Mengapa dibaca: run pihak ketiga terverifikasi untuk satu-satunya benchmark yang dimenangkan GPT-5.6 Sol.
- Claude Fable 5.1 (pelican effort-level cost test), Simon Willison. Mengapa dibaca: perbandingan effort dengan satu prompt yang bisa Anda reproduksi dalam hitungan menit.
- Claude Fable 5.1 and Claude Mythos 5.1 (Hacker News discussion), Hacker News. Mengapa dibaca: praktisi membahas anggaran token, frekuensi fallback, dan tujuan sebenarnya dari perubahan yang merusak.
- FrontierSWE v2, FrontierSWE. Mengapa dibaca: benchmark SWE di luar tabel Anthropic.
- Fable solves Cyphral Distich, Vals AI. Mengapa dibaca: kemenangan penalaran sulit yang konkret untuk ditimbang terhadap harganya.
- Fable 5.1 made a Minecraft mod for $20 (r/ClaudeAI), Reddit r/ClaudeAI. Mengapa dibaca: hitungan token dan dolar nyata untuk satu jam kerja agentic.
FAQ
Apakah Fable 5.1 lebih murah daripada Opus 5 untuk beban kerja yang banyak di-cache?
Hanya di baris cache read: $0.25 dibanding $0.50 per juta. Input dan output tetap dua kali lipat $5 dan $25 milik Opus 5, jadi jawabannya bergantung pada cache hit ratio Anda.
Level effort mana yang sebaiknya dipakai tim API untuk memulai?
Dokumentasi menempatkan medium pada kualitas kira-kira setara Fable 5 dengan biaya lebih rendah, dan Artificial Analysis mengukur xhigh di 65 pada indeksnya dengan $2.72 per tugas, dibanding $3.76 di max. Mulai dari sana dan naik hanya jika eval Anda menuntut.
Apakah saya mendapat Fable 5.1 di paket Pro?
Tidak di dalam batas yang termasuk: tabel harga mencantumkan Fable di Pro sebagai usage credits. Paket Max mendapatkannya pada 50% dari batas mingguan.
Mengapa agent saya sekarang membuat lebih banyak giliran daripada di Fable 5?
Dokumentasi menggambarkan parallel tool calling sebagai lebih bervariasi, dengan satu panggilan per giliran di mana Fable 5 mengelompokkannya, ditambah penulisan ulang seluruh file untuk edit kecil. Keduanya muncul sebagai token output dan round trip tambahan.
AIDive