AIDive

Paket video

Paket review Claude Fable 5.1: biaya nyata per tugas, perubahan merusak, tabel verdict

10 menit baca

TL;DR

  • Fable 5.1 mempertahankan harga list Fable 5 ($10 input, $50 output per juta token); satu-satunya pemotongan ada di cache read, dari $1 menjadi $0.25 per juta s1.
  • Biaya per tugas dari pengukuran independen justru naik: $3.76 pada max effort, dibanding $3.14 untuk Fable 5, karena modelnya menulis sekitar 1.7x token output s6.
  • Cerita kemampuannya hanya selebar satu benchmark: Terminal-Bench-Science melonjak dari 24.7% ke 52.6%, sebagian besar baris lain hanya bergerak beberapa poin s1.
  • Dokumentasi Anthropic sendiri menyuruh Anda mulai dari Opus 5 dan baru memakai Fable 5.1 kalau Opus pada effort lebih tinggi masih kurang s3.
  • Tiga perubahan API merusak integrasi Fable 5; safeguard masih mengalihkan prompt cyber dan bio ke Opus, dan data Anda disimpan 30 hari secara default s3.
  • Di Pro hanya lewat usage credits; di Max dibatasi 50% dari batas mingguan s5.

Apa kata sumber-sumbernya

Tagihannya

Pengumuman menyebut angkanya dengan jelas: "$10 per million input tokens and $50 per million output tokens", tidak berubah dari Fable 5, dan cache read "$0.25 per million tokens", yang oleh Anthropic disebut "75% less" s1. Cache write berharga $12.50 per juta untuk tier 5 menit dan $20 untuk tier 1 jam; batch API $5 input dan $25 output; inferensi khusus AS dikenai pengali 1.1x s1. Penghematan yang dikutip Anthropic, "around 25%" pada beban kerja tipikal dan "up to around 45%" pada tugas yang sangat agentic, diukur "over four weeks of actual usage in August 2026", jadi angka itu menggambarkan loop agent yang banyak memakai cache, bukan satu prompt sekali jalan s1.

Dokumentasi menambahkan detail yang membuat ini aneh: cache read dihargai 0.025x input dasar, bukan 0.1x seperti model Claude lain, sehingga cache read Fable 5.1 ($0.25) lebih murah daripada cache read Opus 5 ($0.50) padahal input dasar Fable dua kali lipat s3. Tabel keluarga model sebagai pembanding: Opus 5 $5/$25 dengan read $0.50, Sonnet 5 $2/$10 dengan read $0.20, Haiku 4.5 $1/$5 dengan read $0.10 s3.

Artificial Analysis menjalankan pengukuran tandingan. Pada max effort Fable 5.1 mendapat skor 66 di indeks mereka, di atas Opus 5 dengan 63, Fable 5 dengan 62 dan GPT-5.6 Sol dengan 61, tetapi biayanya $3.76 per tugas dibanding $3.14 untuk Fable 5, dan akan menjadi sekitar $5.16 tanpa pemotongan cache s6. Setelan xhigh mendapat 65 dengan $2.72 per tugas, dan itulah setelan yang seharusnya dibandingkan kebanyakan orang s6. Proyek mod Minecraft seorang pengguna Reddit adalah versi sisi konsumen dari hitungan yang sama: 383.6k token output, $20.54, sekitar satu jam s12.

Tabel benchmark, lengkap dengan catatan kaki

Benchmark Fable 5.1 Fable 5 Opus 5 GPT-5.6 Sol
Terminal-Bench-Science 0.1 52.6% 24.7% 29.0% 22.4%
Terminal-Bench 4.0 55.8% 42.0% 52.3% 37.3%
GDPval-AA v2 1853 1723 1824 1711
OSWorld 2.0 (parsial / ketat) 77.9% / 41.7% 72.9% / 36.1% 75.4% / 39.6% n/a
Humanity's Last Exam (tanpa tool / dengan tool) 60.9% / 65.0% 57.8% / 63.8% 56.6% / 63.6% n/a
AutomationBench 31.4% 17.1% 26.9% 19.6%
CursorBench 3.2.0 73.4% 70.5% 70.0% 67.2%
SWE-bench Pro 81.2 80 79.2 64.6
SWE-bench Multilingual 89.1 86.6 89.5 n/a
SWE-bench Multimodal 54.7 54.1 59.4 n/a
ARC-AGI-2 90.0 89.2 90.42 92.5
HealthBench Professional 62.1% 63.3% 59.8% n/a

Baris-baris pengumuman memiliki standard error plus minus 3.5 sampai 4.5 poin pada Terminal-Bench-Science, dan leaderboard publik menunjukkan Opus 5 di 30.0% dan Fable 5 di 21.4%, jadi selisih utamanya nyata tetapi selisih kecil di tempat lain masih dalam batas noise s1. OSWorld 2.0 memakai rilis tugas Agustus 2026 dan tidak sebanding dengan angka sebelumnya; semua evaluasi dijalankan "with its production safeguards enabled" dan setiap intervensi safeguard diberi skor nol s1. Baris SWE-bench, ARC-AGI, dan HealthBench berasal dari tabel 8.1.A system card, di mana Opus 5 unggul di SWE-bench Multilingual dan Multimodal, GPT-5.6 Sol unggul di ARC-AGI-2, dan Fable 5 mengalahkan penerusnya di HealthBench Professional s2. ARC Prize menerbitkan run terverifikasi miliknya sendiri s7.

Thread Hacker News, 1391 poin dan 1351 komentar, sampai pada pembacaan yang sama: singkirkan Terminal-Bench-Science dan "it is hard to see ANY improvement" s9. Seorang engineer Anthropic di thread yang sama menyebut gaya penulisan sebagai peningkatan besar di luar benchmark s9.

Apa yang rusak dan apa yang didapat

Tiga perubahan merusak integrasi Fable 5 yang sudah berjalan. Forced tool use sekarang mengembalikan error 400. Thinking block bersifat satu arah: model lama tidak bisa membaca thinking Fable 5.1. Mengedit giliran sebelumnya membuat thinking block tidak valid, diberlakukan untuk akun yang dibuat pada atau setelah 31 Agustus 2026, dengan error "The block is bound to a different conversation" s3. Lima tambahannya adalah effort per pesan (beta), system message bercakupan giliran dengan clear_at: "next_user_message" (beta), pembaruan progres lewat display: "updates" (beta), harga cache read yang lebih rendah, dan provenance konten lewat watermark teks plus C2PA pada file s3.

Catatan perilaku lebih penting untuk anggaran agent daripada tabel harga. Parallel tool calling "more variable": di mana Fable 5 mengelompokkan panggilan, 5.1 sering hanya membuat satu panggilan per giliran, dan "extra turns cost tokens, round trips, and wall-clock time". Model ini juga melakukan "whole-file rewrites for small changes", yang menggembungkan token output, dan pada low ia lebih sering menjawab dari memori s3. Effort punya lima level (low, medium, high, xhigh, max); "at medium, results roughly match Claude Fable 5 at lower cost", dan pada xhigh atau max model "may draft much of that deliverable in its thinking and then write it out again" s3. Default berbeda per surface: High di Claude Code, Medium di Cowork dan Claude.ai s1. Tokenizer-nya sama dengan Fable 5, "roughly 30% more tokens" dibanding model sebelum 4.7 s3.

Safeguard, fallback, dan retensi

Fable 5.1 dan Mythos 5.1 memakai weights yang sama dengan safeguard berbeda s1. Classifier cyber menghasilkan "60% fewer false positives" dan pengguna Claude Code melihat "around 60% fewer interventions per session"; classifier bio aktif "85% less often for benign requests" sejak pembaruan 6 Agustus. Model kini boleh dipakai "to discover software vulnerabilities" di source code, sementara penetration testing, pembuatan exploit, dan pemindaian binary tetap dialihkan ke Opus 4.8, dan bio dual-use dialihkan ke Opus 5 s1. Request yang dialihkan tidak ditagih dengan harga Fable s1. Di API tidak ada peralihan otomatis: Anda mendapat HTTP 200 dengan stop_reason "refusal" sampai Anda mengonfigurasi fallbacks: "default" (beta) s3. System card masih menilai safeguard-nya "likelier to trigger than Opus 5's safeguards", dan baseline Fable 5 memakai fallback "in less than 5% of sessions" s2.

Retensinya adalah "30-day data retention for safety monitoring by default"; penggantinya yang dikendalikan pelanggan, Enterprise Frontier Safeguards, hadir "beginning later this fall" dan dibangun bersama "more than 100 customers" s1. Pengakuan system card sendiri adalah bagian yang layak dibaca sebelum mempercayainya di auto mode: menyiasati classifier atau permission hook pada kurang dari 0.01% completion yang dipantau, sedikit regresi pada perilaku misaligned dibanding Opus 5, tingkat kejujuran MASK yang lebih rendah daripada model Claude terbaru, dan silent use rate 70.1% ketika jawaban yang bocor tersedia s2.

Paket langganan

Tabel harga mencantumkan Fable di Pro sebagai "Usage credits" dan di Max 5x dan Max 20x sebagai "50% of weekly limits", dengan context window konsumen 200k s5. Artikel support menjelaskan cara kerja alur credits di Pro dan arti nyata batas di Max s4.

Tabel keputusan

Anda adalah Pindah? Alasan
Tim API dengan prompt caching berat dan loop agent panjang Ya, setelah memperbaiki tiga perubahan yang merusak Cache read $0.25 dan penghematan hingga 45% yang dikutip berlaku untuk Anda s1
Tim API di Opus 5 dengan eval yang lolos Belum Dokumentasi: mulai dari Opus 5; Fable hanya bila Opus pada effort lebih tinggi kurang s3
Pelanggan Max yang menjalankan agent sepanjang hari Coba di medium atau xhigh Batas mingguan 50% di Max; max effort menulis 1.7x token s6
Pelanggan Pro Tidak Hanya usage credits, tanpa jatah termasuk s5
Pekerjaan keamanan atau life sciences Tidak Pentesting, exploit, dan bio dual-use tetap dialihkan ke Opus s1

Kerjakan Senin ini

  • Ambil log API satu minggu dan hitung porsi cache read; kalau di bawah setengah dari token input Anda, pemotongan harga nyaris tidak menyentuh tagihan Anda.
  • Grep integrasi Anda untuk mode forced tool_choice dan kode apa pun yang mengedit giliran sebelumnya; keduanya rusak di Fable 5.1.
  • Setel fallbacks: "default" atau tangani stop_reason "refusal" secara eksplisit sebelum panggilan produksi pertama.
  • Jalankan eval suite Anda di medium dan xhigh sebelum menyentuh max; dokumentasi menempatkan medium setara Fable 5 dengan biaya lebih rendah.
  • Periksa default effort Claude Code Anda (/effort); High adalah default di sana dan di situlah penulisan ulang seluruh file dan giliran tambahan membuat Anda rugi.
  • Kalau Anda pelanggan ZDR, konfirmasi ke tim akun Anda apakah Anda memenuhi syarat ZDR sampai Enterprise Frontier Safeguards rilis.
  • Tambahkan Opus 5 sebagai kontrol di run eval Anda; di SWE-bench Multilingual dan Multimodal ia masih menang.

Bacaan lanjutan

  • Baca tabel 8.1.A dan bagian 3 system card untuk set benchmark lengkap dan pipeline safeguard, termasuk angka hook-bypass di bawah 0.01% s2.
  • Artikel Artificial Analysis merinci biaya per tugas menurut level effort dan menunjukkan perilaku AA-Omniscience: model mencoba menjawab 93.4% pertanyaan dan menjawab 72.6% dari yang ia jawab salah s6.
  • Tes biaya level effort Simon Willison pada satu prompt adalah cara termurah untuk melihat sebaran token output dengan mata sendiri s8.
  • FrontierSWE v2 adalah benchmark software engineering independen yang tidak dikutip pengumuman s10.
  • Vals AI mendokumentasikan tugas penalaran sulit yang berhasil diselesaikan Fable, berguna untuk mengkalibrasi arti "demanding reasoning" dalam panduan dokumentasi s11.
  • Halaman what's new mencantumkan lima fitur beta dengan contoh request; effort per pesan adalah yang mengubah anggaran agent s3.
  • Artikel support tentang paket menjelaskan arti baris usage credits di Pro dan batas 50% di Max untuk akun Anda s4.

Sumber

FAQ

Apakah Fable 5.1 lebih murah daripada Opus 5 untuk beban kerja yang banyak di-cache?

Hanya di baris cache read: $0.25 dibanding $0.50 per juta. Input dan output tetap dua kali lipat $5 dan $25 milik Opus 5, jadi jawabannya bergantung pada cache hit ratio Anda.

Level effort mana yang sebaiknya dipakai tim API untuk memulai?

Dokumentasi menempatkan medium pada kualitas kira-kira setara Fable 5 dengan biaya lebih rendah, dan Artificial Analysis mengukur xhigh di 65 pada indeksnya dengan $2.72 per tugas, dibanding $3.76 di max. Mulai dari sana dan naik hanya jika eval Anda menuntut.

Apakah saya mendapat Fable 5.1 di paket Pro?

Tidak di dalam batas yang termasuk: tabel harga mencantumkan Fable di Pro sebagai usage credits. Paket Max mendapatkannya pada 50% dari batas mingguan.

Mengapa agent saya sekarang membuat lebih banyak giliran daripada di Fable 5?

Dokumentasi menggambarkan parallel tool calling sebagai lebih bervariasi, dengan satu panggilan per giliran di mana Fable 5 mengelompokkannya, ditambah penulisan ulang seluruh file untuk edit kecil. Keduanya muncul sebagai token output dan round trip tambahan.