AIDive

Batas Mingguan Claude Code Turun 17%: 5 Solusi Terukur

Oleh AIDive · Terbit · Diperbarui

Coding agent

Intro: minggu yang jadi lebih pendek

Batas mingguan Claude Code turun 17% pada pertengahan September 2026, saat promo musim panas berakhir. Pengguna paket terbesar kini melaporkan jatah minggunya sudah kosong di hari Rabu. Pengumuman resmi Anthropic menyebut batas itu dinaikkan permanen sebesar 25%, sementara postingan tepat sesudahnya menyebut perubahan yang sama sebagai pengurangan 17%.

Setiap daftar tips untuk menghemat batas ini datang tanpa satu pun angka. Artikel ini memberi tiap solusi satu angka terukur dan mengurutkannya. Dua hasil paling menonjol: hampir separuh token sebulan terpakai oleh subagent, dan satu jeda panjang saja membuat pesan berikutnya menulis ulang sebagian besar sesi.

Apa yang berubah, dan cara menghitungnya

Pengukuran di sini berasal dari log Claude Code selama sebulan milik satu developer: 455 sesi dan 63.398 request, dari 3 September sampai 3 Oktober.

Promo berjalan dari Mei sampai 13 September dan membuat batas mingguan 50% lebih tinggi. Batas tiap jendela lima jam tidak pernah berubah. Di akhir Agustus, akun developer Anthropic mengumumkan kenaikan permanen 25%, dan satu postingan kemudian thread yang sama bilang hasilnya adalah pengurangan 17%. Keduanya benar:

Periode Batas mingguan (batas lama = 100)
Sebelum promo 100
Selama promo (Mei sampai 13 September) 150
Level permanen sejak 14 September 125

Dari 150 turun ke 125, itulah 17% yang dirasakan orang. Seorang pengguna dengan dua paket terbesar menulis bahwa mencapai 100% di hari Rabu belum pernah terjadi sebelumnya. Pengguna lain, di paket yang sama, sudah di 86% pada Selasa pagi. Pemotongan ini bukan satu-satunya penyebab: model yang lebih rakus dirilis di awal September, jadi tidak semua minggu yang kosong berasal dari perubahan ini.

Dari sisi Anda, yang terlihat hanya persentase. Layar /usage membagi pemakaian terbaru antara skill, subagent, plugin, dan tiap server MCP yang terhubung, serta menandai cache miss. Satu tombol berpindah antara satu hari terakhir dan tujuh hari terakhir. Yang tidak bisa Anda lihat adalah ukuran batas dalam token: Anthropic menerbitkan persentase dan pengali, tidak pernah jumlah token. Jadi semua yang diukur di bawah ini dalam token, dari satu beban kerja, dan bukan porsi dari minggu Anda.

Menghitung token dari log punya jebakan. Log menulis jawaban yang sama beberapa kali, jadi menjumlahkan setiap baris menghasilkan 18,6 miliar token. Dihitung sekali, hasilnya 9,3 miliar. Hitungan naif hampir menggandakan semuanya.

Subagent: hampir setengah tagihan

Subagent adalah Claude lain yang dijalankan sesi Anda untuk pekerjaan sampingan, lalu melapor kembali saat selesai. Dalam sebulan yang diukur, subagent memakai 48,1% dari semua token di 2.631 run.

Ukuran Porsi subagent
Semua token 48,1%
Token output 63,9%
Ditimbang seperti daftar harga publik menimbang output dan cache write 55,3%

Tiap subagent juga membayar harga masuk. Sebelum melakukan apa pun, request pembukanya sudah membawa median 47.117 token: instruksi, daftar tool, dan daftar skill, semuanya dikirim lagi. Orang lain mengukurnya di mesin berbeda dan menemukan 16.000 sampai 21.000 token per peluncuran untuk agent yang prompt-nya sendiri sangat kecil. Seperti kata artikel itu, file agent hanyalah kesalahan pembulatan di dalam biaya peluncurannya sendiri.

Model adalah separuh lainnya. Secara default subagent mewarisi model dari percakapan utama, jadi memindahkan sesi ke model terbesar menaruh semua pembantu di model itu juga. Dalam log yang diukur, model terkecil menangani kurang dari 1% request subagent. Perbaikannya satu baris di file agent: field model diisi model yang lebih kecil untuk pekerjaan seperti menjalankan tes atau mencari file.

Itu memberi dua kebiasaan. Lewati subagent untuk pekerjaan kecil yang bisa Anda kerjakan langsung, dan pasang model kecil pada yang Anda pertahankan.

Batas hasil ini: belum ada yang mengukur berapa porsi minggu yang dihemat dengan memasang model kecil, dan model kecil yang butuh lebih banyak giliran bisa lebih mahal. Angka 48% berasal dari pekerjaan yang banyak bercabang. Porsi Anda sendiri ada di layar /usage.

Cache lima menit yang tak ada di daftar

Claude Code menyimpan percakapan Anda di prompt cache di server, dan membacanya kembali hanya berbiaya sebagian kecil dari mengirimnya ulang. Untuk sesi utama, cache itu hidup satu jam. Untuk subagent, hidupnya lima menit.

Dokumentasinya menyatakannya dengan jelas: subagent mendapat lima menit, bahkan di langganan, sampai Anda memilih lebih lama. Hal yang sama berlaku untuk semua yang berada di luar percakapan utama, termasuk pekerjaan latar belakang dan compaction. Log yang diukur sejalan: setiap cache write dari subagent mendarat di tier lima menit, dan setiap cache write dari sesi utama di tier satu jam.

Seorang developer di Reddit menyadari dampaknya: salah satu subagent-nya menulis ulang seluruh konteksnya delapan kali dalam sehari. Perbaikannya satu baris di file pengaturan, "subagentPromptCacheTtl": "1h".

Pengukurannya Sebelum Sesudah
Cache write 12,2 juta token 3,0 juta token
Jendela lima jam dengan empat subagent dari 2% ke 100% dari 0% ke 22%

Ini satu pengguna yang membandingkan dua hari berbeda, bukan tes terkontrol. Di log yang diukur di sini, pengaruhnya hampir tidak terasa: hanya 95 dari 41.790 request lanjutan subagent (sekitar dua per seribu) datang setelah jeda lebih dari lima menit, meski masing-masing menulis ulang sekitar 75.000 token.

Jadi tergantung cara kerja subagent Anda. Kalau mereka menunggu build yang panjang, sebuah review, atau Anda, aktifkan. Kalau mereka berjalan dalam ledakan singkat, biarkan saja, karena cache yang bertahan satu jam lebih mahal untuk ditulis.

Jeda yang menulis ulang seluruh sesi

Cache sesi utama bertahan satu jam. Setelah jeda yang lebih lama, cache itu hilang, dan pesan berikutnya tidak bisa membaca apa pun kembali. Dokumentasi menyebutkannya terang-terangan: pesan yang Anda kirim setelah jeda melewatkan cache dan memproses ulang seluruh konteks Anda.

Jeda sebelum pesan Request Cache ditulis ulang (median)
Di bawah 5 menit 18.029 1.176 token
5 sampai 60 menit 414 1.327 token
Lebih dari 60 menit 79 130.332 token

Sesi yang khas pada saat itu berisi 175.523 token, jadi sebagian besarnya ditulis lagi. Meteran juga tidak memperlakukan write sama dengan read. Seorang developer memasang proxy logging di depan Claude Code dan mengamati jendela lima jamnya: menurut rasionya, satu token yang ditulis ke cache bobotnya sekitar empat puluh kali token yang dibaca darinya.

Claude Code tahu hal ini. Saat Anda melanjutkan sesi besar setelah jeda panjang, ia menawarkan untuk melanjutkan dari ringkasan. Terima tawaran itu.

Kebiasaan yang lebih murah datang lebih awal. Saat tugas selesai, clear sesi selagi cache masih hangat. Clear tidak memakan biaya dan tugas berikutnya mulai kecil. Compact juga berhasil, tetapi meng-compact sesi yang sangat besar sendiri adalah request yang sangat besar.

Jeda bukan satu-satunya cara kehilangan cache. Berganti model di tengah sesi mengosongkannya, karena tiap model menyimpan cache-nya sendiri. Di model terbaru, mengubah effort tidak mengosongkannya. Claude Code meminta Anda mengonfirmasi pergantian model selagi cache hangat, dan prompt itu adalah peringatannya.

Batasnya: 79 kembalinya sesi dingin adalah sampel kecil, dan sebagian mengikuti sebuah compaction. Ringkasan juga kehilangan detail, jadi perbaikan ini mengorbankan sedikit kesinambungan.

Effort: solusi yang bisa mengorbankan kualitas

Effort adalah seberapa lama model boleh berpikir sebelum menjawab. Ada lima level, dari low sampai max, dan proses berpikir itu ditagih sebagai output. Defaultnya high di sebagian besar model dan medium di dua model terbaru.

Dokumentasi menyatakan anggaran berpikir bisa mencapai puluhan ribu token per request dan bahwa level teratas rawan berpikir berlebihan. Di model terbaru, proses berpikir tidak bisa dimatikan sama sekali, jadi level itu satu-satunya kendali.

Seorang developer menjalankan 29 tugas nyata yang sama di kelima level:

Level effort Biaya rata-rata per tugas Tugas lulus (dari 29)
low $2,50 23
medium $3,15 28
high $5,01 26
xhigh $6,51 25
max $8,84 27

Kualitas tidak mengikuti biaya. Medium meluluskan lebih banyak tugas daripada level mana pun di atasnya, dan per dolar juga memberi lulus terbanyak. Menurut kata-katanya, kurvanya tampak memuncak di medium. Tim Claude Code bekerja dengan cara yang sama: salah satu engineer-nya membangun di low atau medium, mereview, dan hanya menjalankan verifikasi di high.

Kelemahannya adalah alasan solusi ini bisa mengorbankan kualitas. Pada masalah sulit yang ia pilih, effort low lulus nol dari lima kali dan high lulus lima dari lima. Satu percobaan low memakan dua menit, satu percobaan high tiga puluh tiga menit.

Jadi sesuaikan effort dengan langkahnya: medium untuk membangun, high saat kesalahan mahal (bug di kode lama, migrasi, pemeriksaan penutup), max hampir tidak pernah. Log sesi mencatat effort tiap request, jadi Anda bisa memeriksa apa yang benar-benar Anda jalankan.

Biaya itu dalam dolar di model yang lebih lama, bukan porsi dari minggu; belum ada yang menerbitkannya. Dan percobaan murah yang gagal lalu dijalankan dua kali lebih mahal daripada satu yang berhasil.

Tips yang lebih ringan dari klaimnya

Beberapa solusi ada di setiap daftar dan nyaris tidak menggeser jarum. Gratis untuk dicoba. Hanya saja bukan di sanalah minggu Anda habis.

Yang dimuat di awal adalah yang paling nyata dalam kelompok ini. Satu artikel mengukur request pembuka dari folder kosong sebesar 29.061 token, dan hampir 39.000 di dalam proyek sungguhan. Di log yang diukur di sini, median request pembuka adalah 55.989 token, berkisar dari 15.764 sampai 105.020 tergantung proyeknya. Perintah /context menunjukkan apa isinya (file memori, skill, daftar tool) dan menyebut tiap file memori yang dimuat. Pangkas yang tidak pernah Anda pakai. Hasilnya sederhana karena blok itu ditulis sekali dan dibaca dari cache di setiap giliran sesudahnya. Dampaknya terasa pada cold start dan pada setiap peluncuran subagent.

Tips populer Terukur
Menghapus server MCP 1.350 token untuk 51 tool di tiga server; 18 token untuk satu server dengan satu tool
Mematikan prompt suggestions 3 sampai 4% untuk satu pengguna; klaim "sampai 10%" berasal dari satu akun dengan konteks yang sangat besar
Memfilter output shell sekitar 0,1% dari total volume, diukur oleh seorang kontributor salah satu filter itu

Definisi tool kini ditunda (deferred) secara default, itulah sebabnya server MCP bobotnya sangat kecil. Dokumentasi menyebut biaya prompt suggestions kecil. Ketiganya tumbuh seiring ukuran konteks Anda, dan server lebih mahal di model lama tempat penundaan tidak aktif. Matikan kalau mau, tetapi jangan berharap minggu Anda kembali.

Tabel peringkat

Diurutkan menurut yang terukur:

Peringkat Solusi Terukur Kelemahan
1 Subagent lebih sedikit dan lebih murah 48,1% token; 47.117 per peluncuran Paralelisme berkurang
2 Jangan lanjutkan sesi yang dingin 130.332 token ditulis ulang dibanding 1.176 Ringkasan kehilangan detail
3 Effort: medium untuk membangun $3,15 dibanding $5,01 per tugas; 28 dari 29 lulus Low gagal pada masalah sulit
4 Cache subagent satu jam 12,2 juta jadi 3,0 juta token cache write Hanya berguna jika subagent menunggu
5 Pangkas yang dimuat di awal +9.744 token pada baseline 29.061 Dibayar sekali per sesi

Tiga yang populer (server MCP, prompt suggestions, output shell) bukan tempat minggu Anda habis.

Batasnya, terus terang: peringkat ini dalam token, dari sebulan kerja satu orang, ditambah pengukuran orang lain. Anthropic tidak menerbitkan ukuran batas dalam token, jadi tidak ada orang luar yang bisa mengubahnya menjadi porsi dari minggu Anda. Urutan Anda mungkin berbeda, dan layar /usage akan memberi tahu.

Dua solusi terbesar adalah kebiasaan, bukan pengaturan, dan keduanya gratis: luncurkan lebih sedikit subagent, dan jangan pernah melanjutkan sesi dingin secara penuh.

Sumber daya gratis

Sumber

Pertanyaan yang sering diajukan

Mengapa batas mingguan Claude Code turun pada September 2026?
Promo yang berjalan dari Mei sampai 13 September menaikkan batas mingguan 50%. Saat promo berakhir, Anthropic menetapkan level permanen 25% di atas batas lama, yaitu 17% di bawah level promo yang selama ini dipakai orang. Batas jendela lima jam tidak berubah.
Apa yang paling banyak memakai jatah Claude Code?
Dalam log sebulan yang diukur, subagent memakai 48,1% dari semua token dan 63,9% dari token output. Tiap peluncuran subagent juga membawa median 47.117 token instruksi dan daftar tool sebelum mengerjakan apa pun. Pembagian milik Anda sendiri ditampilkan di layar /usage.
Bagaimana membuat subagent Claude Code memakai model yang lebih murah?
Tambahkan field model di file agent, misalnya model: haiku. Secara default subagent mewarisi model dari percakapan utama, jadi sesi di model terbesar menjalankan semua pembantunya di model itu juga.
Apa yang terjadi saat saya melanjutkan sesi Claude Code setelah jeda panjang?
Prompt cache sesi utama bertahan satu jam. Setelah itu, pesan berikutnya melewatkan cache dan memproses ulang seluruh konteks: di log yang diukur, median 130.332 token ditulis ulang, dibanding 1.176 jika dikirim dalam lima menit. Claude Code menawarkan untuk melanjutkan dari ringkasan, yang menghindari penulisan ulang itu.
Level effort Claude Code mana yang sebaiknya dipakai?
Medium untuk membangun, high saat kesalahan mahal, max hampir tidak pernah. Dalam tes satu developer atas 29 tugas nyata, medium meluluskan 28 dengan $3,15 per tugas, sedangkan max meluluskan 27 dengan $8,84. Pada masalah sulit, effort low lulus 0 dari 5 dan high lulus 5 dari 5.
Apakah menghapus server MCP menghemat pemakaian Claude Code?
Sangat sedikit. Definisi tool ditunda secara default, jadi hanya nama yang dimuat di awal: satu pengukuran menghitung 1.350 token untuk 51 tool di tiga server, dan 18 token untuk satu server dengan satu tool.

Video terkait