Intro: minggu yang jadi lebih pendek
Batas mingguan Claude Code turun 17% pada pertengahan September 2026, saat promo musim panas berakhir. Pengguna paket terbesar kini melaporkan jatah minggunya sudah kosong di hari Rabu. Pengumuman resmi Anthropic menyebut batas itu dinaikkan permanen sebesar 25%, sementara postingan tepat sesudahnya menyebut perubahan yang sama sebagai pengurangan 17%.
Setiap daftar tips untuk menghemat batas ini datang tanpa satu pun angka. Artikel ini memberi tiap solusi satu angka terukur dan mengurutkannya. Dua hasil paling menonjol: hampir separuh token sebulan terpakai oleh subagent, dan satu jeda panjang saja membuat pesan berikutnya menulis ulang sebagian besar sesi.
Apa yang berubah, dan cara menghitungnya
Pengukuran di sini berasal dari log Claude Code selama sebulan milik satu developer: 455 sesi dan 63.398 request, dari 3 September sampai 3 Oktober.
Promo berjalan dari Mei sampai 13 September dan membuat batas mingguan 50% lebih tinggi. Batas tiap jendela lima jam tidak pernah berubah. Di akhir Agustus, akun developer Anthropic mengumumkan kenaikan permanen 25%, dan satu postingan kemudian thread yang sama bilang hasilnya adalah pengurangan 17%. Keduanya benar:
| Periode | Batas mingguan (batas lama = 100) |
|---|---|
| Sebelum promo | 100 |
| Selama promo (Mei sampai 13 September) | 150 |
| Level permanen sejak 14 September | 125 |
Dari 150 turun ke 125, itulah 17% yang dirasakan orang. Seorang pengguna dengan dua paket terbesar menulis bahwa mencapai 100% di hari Rabu belum pernah terjadi sebelumnya. Pengguna lain, di paket yang sama, sudah di 86% pada Selasa pagi. Pemotongan ini bukan satu-satunya penyebab: model yang lebih rakus dirilis di awal September, jadi tidak semua minggu yang kosong berasal dari perubahan ini.
Dari sisi Anda, yang terlihat hanya persentase. Layar /usage membagi pemakaian terbaru antara skill, subagent, plugin, dan tiap server MCP yang terhubung, serta menandai cache miss. Satu tombol berpindah antara satu hari terakhir dan tujuh hari terakhir. Yang tidak bisa Anda lihat adalah ukuran batas dalam token: Anthropic menerbitkan persentase dan pengali, tidak pernah jumlah token. Jadi semua yang diukur di bawah ini dalam token, dari satu beban kerja, dan bukan porsi dari minggu Anda.
Menghitung token dari log punya jebakan. Log menulis jawaban yang sama beberapa kali, jadi menjumlahkan setiap baris menghasilkan 18,6 miliar token. Dihitung sekali, hasilnya 9,3 miliar. Hitungan naif hampir menggandakan semuanya.
Subagent: hampir setengah tagihan
Subagent adalah Claude lain yang dijalankan sesi Anda untuk pekerjaan sampingan, lalu melapor kembali saat selesai. Dalam sebulan yang diukur, subagent memakai 48,1% dari semua token di 2.631 run.
| Ukuran | Porsi subagent |
|---|---|
| Semua token | 48,1% |
| Token output | 63,9% |
| Ditimbang seperti daftar harga publik menimbang output dan cache write | 55,3% |
Tiap subagent juga membayar harga masuk. Sebelum melakukan apa pun, request pembukanya sudah membawa median 47.117 token: instruksi, daftar tool, dan daftar skill, semuanya dikirim lagi. Orang lain mengukurnya di mesin berbeda dan menemukan 16.000 sampai 21.000 token per peluncuran untuk agent yang prompt-nya sendiri sangat kecil. Seperti kata artikel itu, file agent hanyalah kesalahan pembulatan di dalam biaya peluncurannya sendiri.
Model adalah separuh lainnya. Secara default subagent mewarisi model dari percakapan utama, jadi memindahkan sesi ke model terbesar menaruh semua pembantu di model itu juga. Dalam log yang diukur, model terkecil menangani kurang dari 1% request subagent. Perbaikannya satu baris di file agent: field model diisi model yang lebih kecil untuk pekerjaan seperti menjalankan tes atau mencari file.
Itu memberi dua kebiasaan. Lewati subagent untuk pekerjaan kecil yang bisa Anda kerjakan langsung, dan pasang model kecil pada yang Anda pertahankan.
Batas hasil ini: belum ada yang mengukur berapa porsi minggu yang dihemat dengan memasang model kecil, dan model kecil yang butuh lebih banyak giliran bisa lebih mahal. Angka 48% berasal dari pekerjaan yang banyak bercabang. Porsi Anda sendiri ada di layar /usage.
Cache lima menit yang tak ada di daftar
Claude Code menyimpan percakapan Anda di prompt cache di server, dan membacanya kembali hanya berbiaya sebagian kecil dari mengirimnya ulang. Untuk sesi utama, cache itu hidup satu jam. Untuk subagent, hidupnya lima menit.
Dokumentasinya menyatakannya dengan jelas: subagent mendapat lima menit, bahkan di langganan, sampai Anda memilih lebih lama. Hal yang sama berlaku untuk semua yang berada di luar percakapan utama, termasuk pekerjaan latar belakang dan compaction. Log yang diukur sejalan: setiap cache write dari subagent mendarat di tier lima menit, dan setiap cache write dari sesi utama di tier satu jam.
Seorang developer di Reddit menyadari dampaknya: salah satu subagent-nya menulis ulang seluruh konteksnya delapan kali dalam sehari. Perbaikannya satu baris di file pengaturan, "subagentPromptCacheTtl": "1h".
| Pengukurannya | Sebelum | Sesudah |
|---|---|---|
| Cache write | 12,2 juta token | 3,0 juta token |
| Jendela lima jam dengan empat subagent | dari 2% ke 100% | dari 0% ke 22% |
Ini satu pengguna yang membandingkan dua hari berbeda, bukan tes terkontrol. Di log yang diukur di sini, pengaruhnya hampir tidak terasa: hanya 95 dari 41.790 request lanjutan subagent (sekitar dua per seribu) datang setelah jeda lebih dari lima menit, meski masing-masing menulis ulang sekitar 75.000 token.
Jadi tergantung cara kerja subagent Anda. Kalau mereka menunggu build yang panjang, sebuah review, atau Anda, aktifkan. Kalau mereka berjalan dalam ledakan singkat, biarkan saja, karena cache yang bertahan satu jam lebih mahal untuk ditulis.
Jeda yang menulis ulang seluruh sesi
Cache sesi utama bertahan satu jam. Setelah jeda yang lebih lama, cache itu hilang, dan pesan berikutnya tidak bisa membaca apa pun kembali. Dokumentasi menyebutkannya terang-terangan: pesan yang Anda kirim setelah jeda melewatkan cache dan memproses ulang seluruh konteks Anda.
| Jeda sebelum pesan | Request | Cache ditulis ulang (median) |
|---|---|---|
| Di bawah 5 menit | 18.029 | 1.176 token |
| 5 sampai 60 menit | 414 | 1.327 token |
| Lebih dari 60 menit | 79 | 130.332 token |
Sesi yang khas pada saat itu berisi 175.523 token, jadi sebagian besarnya ditulis lagi. Meteran juga tidak memperlakukan write sama dengan read. Seorang developer memasang proxy logging di depan Claude Code dan mengamati jendela lima jamnya: menurut rasionya, satu token yang ditulis ke cache bobotnya sekitar empat puluh kali token yang dibaca darinya.
Claude Code tahu hal ini. Saat Anda melanjutkan sesi besar setelah jeda panjang, ia menawarkan untuk melanjutkan dari ringkasan. Terima tawaran itu.
Kebiasaan yang lebih murah datang lebih awal. Saat tugas selesai, clear sesi selagi cache masih hangat. Clear tidak memakan biaya dan tugas berikutnya mulai kecil. Compact juga berhasil, tetapi meng-compact sesi yang sangat besar sendiri adalah request yang sangat besar.
Jeda bukan satu-satunya cara kehilangan cache. Berganti model di tengah sesi mengosongkannya, karena tiap model menyimpan cache-nya sendiri. Di model terbaru, mengubah effort tidak mengosongkannya. Claude Code meminta Anda mengonfirmasi pergantian model selagi cache hangat, dan prompt itu adalah peringatannya.
Batasnya: 79 kembalinya sesi dingin adalah sampel kecil, dan sebagian mengikuti sebuah compaction. Ringkasan juga kehilangan detail, jadi perbaikan ini mengorbankan sedikit kesinambungan.
Effort: solusi yang bisa mengorbankan kualitas
Effort adalah seberapa lama model boleh berpikir sebelum menjawab. Ada lima level, dari low sampai max, dan proses berpikir itu ditagih sebagai output. Defaultnya high di sebagian besar model dan medium di dua model terbaru.
Dokumentasi menyatakan anggaran berpikir bisa mencapai puluhan ribu token per request dan bahwa level teratas rawan berpikir berlebihan. Di model terbaru, proses berpikir tidak bisa dimatikan sama sekali, jadi level itu satu-satunya kendali.
Seorang developer menjalankan 29 tugas nyata yang sama di kelima level:
| Level effort | Biaya rata-rata per tugas | Tugas lulus (dari 29) |
|---|---|---|
| low | $2,50 | 23 |
| medium | $3,15 | 28 |
| high | $5,01 | 26 |
| xhigh | $6,51 | 25 |
| max | $8,84 | 27 |
Kualitas tidak mengikuti biaya. Medium meluluskan lebih banyak tugas daripada level mana pun di atasnya, dan per dolar juga memberi lulus terbanyak. Menurut kata-katanya, kurvanya tampak memuncak di medium. Tim Claude Code bekerja dengan cara yang sama: salah satu engineer-nya membangun di low atau medium, mereview, dan hanya menjalankan verifikasi di high.
Kelemahannya adalah alasan solusi ini bisa mengorbankan kualitas. Pada masalah sulit yang ia pilih, effort low lulus nol dari lima kali dan high lulus lima dari lima. Satu percobaan low memakan dua menit, satu percobaan high tiga puluh tiga menit.
Jadi sesuaikan effort dengan langkahnya: medium untuk membangun, high saat kesalahan mahal (bug di kode lama, migrasi, pemeriksaan penutup), max hampir tidak pernah. Log sesi mencatat effort tiap request, jadi Anda bisa memeriksa apa yang benar-benar Anda jalankan.
Biaya itu dalam dolar di model yang lebih lama, bukan porsi dari minggu; belum ada yang menerbitkannya. Dan percobaan murah yang gagal lalu dijalankan dua kali lebih mahal daripada satu yang berhasil.
Tips yang lebih ringan dari klaimnya
Beberapa solusi ada di setiap daftar dan nyaris tidak menggeser jarum. Gratis untuk dicoba. Hanya saja bukan di sanalah minggu Anda habis.
Yang dimuat di awal adalah yang paling nyata dalam kelompok ini. Satu artikel mengukur request pembuka dari folder kosong sebesar 29.061 token, dan hampir 39.000 di dalam proyek sungguhan. Di log yang diukur di sini, median request pembuka adalah 55.989 token, berkisar dari 15.764 sampai 105.020 tergantung proyeknya. Perintah /context menunjukkan apa isinya (file memori, skill, daftar tool) dan menyebut tiap file memori yang dimuat. Pangkas yang tidak pernah Anda pakai. Hasilnya sederhana karena blok itu ditulis sekali dan dibaca dari cache di setiap giliran sesudahnya. Dampaknya terasa pada cold start dan pada setiap peluncuran subagent.
| Tips populer | Terukur |
|---|---|
| Menghapus server MCP | 1.350 token untuk 51 tool di tiga server; 18 token untuk satu server dengan satu tool |
| Mematikan prompt suggestions | 3 sampai 4% untuk satu pengguna; klaim "sampai 10%" berasal dari satu akun dengan konteks yang sangat besar |
| Memfilter output shell | sekitar 0,1% dari total volume, diukur oleh seorang kontributor salah satu filter itu |
Definisi tool kini ditunda (deferred) secara default, itulah sebabnya server MCP bobotnya sangat kecil. Dokumentasi menyebut biaya prompt suggestions kecil. Ketiganya tumbuh seiring ukuran konteks Anda, dan server lebih mahal di model lama tempat penundaan tidak aktif. Matikan kalau mau, tetapi jangan berharap minggu Anda kembali.
Tabel peringkat
Diurutkan menurut yang terukur:
| Peringkat | Solusi | Terukur | Kelemahan |
|---|---|---|---|
| 1 | Subagent lebih sedikit dan lebih murah | 48,1% token; 47.117 per peluncuran | Paralelisme berkurang |
| 2 | Jangan lanjutkan sesi yang dingin | 130.332 token ditulis ulang dibanding 1.176 | Ringkasan kehilangan detail |
| 3 | Effort: medium untuk membangun | $3,15 dibanding $5,01 per tugas; 28 dari 29 lulus | Low gagal pada masalah sulit |
| 4 | Cache subagent satu jam | 12,2 juta jadi 3,0 juta token cache write | Hanya berguna jika subagent menunggu |
| 5 | Pangkas yang dimuat di awal | +9.744 token pada baseline 29.061 | Dibayar sekali per sesi |
Tiga yang populer (server MCP, prompt suggestions, output shell) bukan tempat minggu Anda habis.
Batasnya, terus terang: peringkat ini dalam token, dari sebulan kerja satu orang, ditambah pengukuran orang lain. Anthropic tidak menerbitkan ukuran batas dalam token, jadi tidak ada orang luar yang bisa mengubahnya menjadi porsi dari minggu Anda. Urutan Anda mungkin berbeda, dan layar /usage akan memberi tahu.
Dua solusi terbesar adalah kebiasaan, bukan pengaturan, dan keduanya gratis: luncurkan lebih sedikit subagent, dan jangan pernah melanjutkan sesi dingin secara penuh.
AIDive