TL;DR
- Batas mingguan Claude Code naik dari basis 100 ke level promo 150, lalu menetap permanen di 125 pada 14 September 2026. Dibanding level promo, itu pemotongan 17%; dibanding basis lama, kenaikan 25%. Keduanya benar sekaligus.
- Dalam sebulan log lokal, subagent memakai 48,1% dari semua token dan 55,3% dari biaya terbobot. Tuas terbesar: luncurkan lebih sedikit subagent dan kunci model kecil pada yang tetap kamu pakai.
- Subagent menulis cache 5 menit, sedangkan sesi utama menulis cache 1 jam. Permintaan lanjutan setelah jeda dingin menulis ulang cache sekitar 19 kali lebih banyak daripada yang hangat.
- Jeda lebih dari 60 menit di sesi utama memakan median 130.332 token untuk menulis ulang cache pada permintaan berikutnya, dibanding 1.176 bila jedanya di bawah 5 menit.
- Menurunkan effort tidak menurunkan output per permintaan di log ini (rata-rata 778 token pada high vs 837 pada medium di sesi utama), jadi anggap ini pertukaran kualitas, bukan penghematan gratis.
- Mematikan saran prompt dan menyaring output shell memang nyata tetapi kecil. Hitung paling akhir.
Apa kata pengukurannya
Hitungan di balik judulnya: basis 100, level promo 150, level permanen 125. 125 / 150 = 0,8333, jadi pemotongannya 16,67% dan dibulatkan menjadi 17%. Salah bila mengurangkan kenaikannya (50% turun ke 25%) lalu menyebutnya pemotongan 25%. s2
Promo berjalan dari 13 Mei 2026 sampai 13 September 2026, menaikkan batas mingguan 50% hanya di Claude Code, dan tidak menyentuh batas 5 jam. Promo berlaku untuk paket Pro, Max, Team, dan Enterprise berbasis seat. s1
Pengukuran di bawah berasal dari log Claude Code satu mesin: 455 sesi utama, 2.631 run subagent, 63.398 permintaan yang sudah di-deduplikasi antara 2026-09-03 dan 2026-10-03. Temuan pertama menyangkut cara menghitung: tiap permintaan muncul rata-rata di 1,96 baris log, sehingga menjumlahkan semua baris melebih-lebihkan total token sebesar 99,3%. Skrip apa pun yang membaca log ini harus mendeduplikasi dulu berdasarkan (message.id, requestId). s11
Subagent adalah pos terbesar. Setelah deduplikasi, subagent menyumbang 48,1% dari total token, 63,9% dari token output, dan 55,3% dari biaya terbobot. Permintaan pertama sebuah run subagent membawa prompt median 47.117 token sebelum melakukan apa pun; p90-nya 52.681 dan maksimumnya 126.769. Agent dengan set tool terbatas mulai jauh lebih rendah (min 5.295). s8
Pilihan model memperparahnya. Subagent mewarisi model percakapan utama kecuali frontmatter model, parameter model per pemanggilan, atau CLAUDE_CODE_SUBAGENT_MODEL menentukan lain, dan sejak v2.1.251 env var saja tidak lagi menimpa frontmatter: kamu butuh CLAUDE_CODE_SUBAGENT_MODEL_FORCE=1. Di log, claude-opus-5 saja menyumbang 31,5% dari semua token dan 35,8% dari biaya terbobot, dengan 63,2% di antaranya terpakai di dalam subagent. s3
Tingkat cache ditentukan oleh tempat permintaan berjalan. Pada data ini, 100,0% penulisan cache subagent berdurasi 5 menit dan 100,0% penulisan cache sesi utama berdurasi 1 jam; tidak ada permintaan dengan pembagian campuran. Di dalam run subagent, hanya 95 dari 41.790 permintaan lanjutan (0,2%) datang setelah jeda di atas 5 menit, tetapi permintaan itu menulis rata-rata 74.582 token cache_creation dibanding 3.886 untuk permintaan hangat. Setelan subagentPromptCacheTtl dan env var CLAUDE_CODE_SUBAGENT_PROMPT_CACHE_TTL menerima 5m atau 1h dan membutuhkan Claude Code v2.1.242 atau lebih baru. s4
Uji independen melihat pembagian yang sama: setiap permintaan subagent ditulis di bawah ephemeral_5m_input_tokens sementara parent memakai ephemeral_1h_input_tokens, dan satu agent menulis ulang seluruh 20.971 token prefiksnya pada permintaan yang datang setelah jendela lima menit. s6
Padanannya di sesi utama adalah jeda panjang. Permintaan yang datang kurang dari 5 menit setelah sebelumnya menulis median 1.176 token cache_creation (n = 18.029). Antara 5 dan 60 menit, 1.327 (n = 414). Di atas 60 menit, 130.332 (n = 79), dengan prompt median 175.523 token dan p90 674.348. Dokumentasi mengonfirmasi bahwa penagihan overage juga menurunkan percakapan utama ke tingkat lima menit. s3
Awal sesi adalah biaya tetap: permintaan pertama sesi utama membawa median 55.989 token (p90 72.000), dengan sebaran per proyek dari 15.764 sampai 105.020 tergantung ukuran CLAUDE.md dan memori. Pengukuran publik sebelumnya menempatkan batas bawah di sekitar 29k pada direktori kosong, 30,4k dengan 3 server MCP, dan 38,8k di repo sungguhan. s9
Effort adalah tuas yang didorong dokumentasi tetapi tidak dibalas oleh log. Di sesi utama, permintaan high menghasilkan rata-rata 778 token output dibanding 837 pada medium; subagent pada high menghasilkan 323 dibanding 642. Perbandingan ini bias (tugas, model, dan proyek berbeda), jadi ini alasan untuk skeptis, bukan bukti. Panduan tim Claude Code sendiri membingkai effort sebagai tempat membelanjakan penalaran, bukan tombol anggaran. s10
Dua tips populer terukur kecil. Saran prompt memakan permintaan tambahan, dan angka "hemat ~10%" yang ramai dibagikan adalah batas atas, bukan penghematan tipikal; setelannya promptSuggestionEnabled: false atau CLAUDE_CODE_ENABLE_PROMPT_SUGGESTION=false. s12 Penyaringan output shell selama dua puluh hari memangkas 66,7 juta token output menjadi 24,1 juta, tetapi 66,7 juta itu hanya 7,4% dari token baru yang dikonsumsi pada jendela yang sama. s11
Pengukuran
Biaya peluncuran subagent, prompt permintaan pertama dalam token, per model:
| Model | n | min | median | p90 | maks |
|---|---|---|---|---|---|
| Semua | 2,631 | 5,295 | 47,117 | 52,681 | 126,769 |
| claude-opus-5 | 1,262 | 36,864 | 43,905 | 48,032 | 50,398 |
| claude-sonnet-5 | 633 | 5,916 | 52,409 | 53,961 | 126,769 |
| claude-opus-5-5 | 426 | 39,408 | 47,189 | 48,362 | 48,883 |
| claude-sonnet-5-5 | 165 | 44,471 | 47,348 | 50,197 | 50,863 |
| claude-fable-5-1 | 102 | 36,551 | 42,593 | 44,286 | 47,385 |
| claude-haiku-4-5 | 42 | 5,295 | 29,636 | 36,714 | 79,190 |
Penulisan ulang cache saat melanjutkan, sesi utama, menurut jeda sebelum permintaan:
| Jeda | n | median cache_creation | rata-rata | median cache_read | median prompt |
|---|---|---|---|---|---|
| < 5 mnt | 18,029 | 1,176 | 2,391 | 184,169 | 186,412 |
| 5 sampai 60 mnt | 414 | 1,327 | 5,575 | 221,857 | 225,168 |
| > 60 mnt | 79 | 130,332 | 241,499 | 25,264 | 175,523 |
Protokol: baca setiap sesi utama ~/.claude/projects/*/<uuid>.jsonl dan setiap run subagent */<uuid>/subagents/agent-*.jsonl, permintaan sejak 2026-09-01. Deduplikasi baris assistant berdasarkan (message.id, requestId) dan simpan satu catatan usage per permintaan. Total token = input + output + cache_read + cache_creation; ukuran prompt = input + cache_read + cache_creation. Jeda = waktu dari baris log terakhir permintaan sebelumnya sampai baris pertama permintaan ini, di dalam satu sesi atau run. Biaya terbobot memakai bobot relatif input 1, tulis cache 5m 1,25, tulis cache 1h 2, cache read 0,1, output 5; bobot ini asumsi, bukan tarif yang dipublikasikan.
Lakukan ini hari Senin
- Jalankan
/usagedi paketmu dan baca rincian per skill, subagent, plugin, dan MCP, plus flag perilaku yang muncul pada 10% atau lebih dari pemakaian terbaru. - Daftar definisi subagent-mu dan tambahkan frontmatter
model: haikuataumodel: sonnetke setiap subagent yang hanya mencari, memeriksa, atau merangkum. - Bila ingin satu model untuk semua subagent apa pun frontmatter-nya, setel
CLAUDE_CODE_SUBAGENT_MODELdanCLAUDE_CODE_SUBAGENT_MODEL_FORCE=1. - Pastikan versi Claude Code-mu 2.1.242 atau lebih baru, lalu putuskan per workflow apakah
subagentPromptCacheTtl: "1h"sepadan: ini membantu subagent yang diam di antara pemanggilan tool, bukan yang singkat. - Sebelum jeda lebih dari satu jam, selesaikan tugas di sesi saat ini dan tulis file serah terima; buka sesi baru saat kembali alih-alih melanjutkan prompt 175k token.
- Tulis skrip read-only di atas log-mu sendiri, dideduplikasi berdasarkan (message.id, requestId), dan bandingkan porsi sesi utama vs subagent sebelum mengubah hal lain.
- Setel
promptSuggestionEnabled: falsebila kamu tak pernah memakai sarannya, dan anggap penghematannya paling banyak beberapa persen.
Bacaan lanjutan
- Max 5x vs Max 20x: rasio kapasitas yang diukur pengguna setelah pemotongan adalah soal pemilihan paket yang tidak dibahas video. s7
- Rantai prioritas lengkap untuk TTL cache (env force, env bucket, setelan bucket,
experimental.cacheTtlsubagent) dan apa yang berubah di bawah penagihan overage. s4 - Mengapa mengubah effort di tengah sesi bisa membaca seluruh riwayat tanpa cache hit pada sebagian besar model, dan model mana yang dikecualikan. s3
- Cara membaca field
usagedan tingkat cache di log sesimu sendiri, dan pendekatan ccboard untuk tampilan anggaran harian. s11 - Tiga file subagent dengan tiga model dan apa yang sebenarnya ditulis tiap peluncuran ke cache, lengkap dengan koreksi penulis di bagian akhir. s8
- Definisi tool MCP yang ditunda dan
ENABLE_TOOL_SEARCH=auto:Nuntuk mengatur kapan skema tool dimuat ke konteks. s3
Sumber
- Claude Code May to August 2026 weekly limits promotion, Anthropic help center. Mengapa dibaca: tanggal pasti, paket, dan cakupan promo 50%, dalam kata-kata Anthropic sendiri.
- Anthropic is cutting Claude Code's current weekly limits by 17 percent, BleepingComputer. Mengapa dibaca: kenaikan 25% dan pemotongan 17% berdampingan, dengan kutipan pengumumannya.
- Manage costs effectively, Claude Code docs. Mengapa dibaca: rincian
/usage, pewarisan model subagent, dan aturan cache untuk effort dan MCP. - How Claude Code uses prompt caching, Claude Code docs. Mengapa dibaca: satu-satunya deskripsi otoritatif tentang tingkat 5m dan 1h serta setelan TTL.
- Sub-agents burning your Claude Code 5-hour window? Check the cache TTL, Reddit r/ClaudeAI. Mengapa dibaca: thread yang mengungkap cache 5 menit subagent, beserta setelan yang mengubahnya.
- Max20x is now just 1.5 times better than Max5x, Reddit r/ClaudeCode. Mengapa dibaca: perbandingan kapasitas dari sisi pengguna antara dua tingkat Max setelah pemotongan.
- Three Claude Code subagent files, three models in frontmatter, dev.to. Mengapa dibaca: eksperimen biaya peluncuran yang bisa direproduksi dengan field usage mentah dan koreksi yang jujur.
- Claude Code token overhead: what 33k actually costs, devaireviews.com. Mengapa dibaca: pengukuran overhead awal pada direktori kosong, dengan server MCP, dan di repo sungguhan.
- Using Claude Code: Spending your effort, X, Claude Code team. Mengapa dibaca: cara tim memandang level effort; tidak ada hitungan token di dalamnya, dan itulah intinya.
- The real cost of AI, part 9: measure your own usage, florian.bruniaux.com. Mengapa dibaca: studi log dua puluh hari yang menempatkan penyaringan output shell dalam proporsi terhadap total konsumsi.
- PSA: Turn off Prompt Suggestions, save ~10% of your limits/spend, Reddit r/ClaudeAI. Mengapa dibaca: klaim aslinya dan thread yang mempersempit 10% menjadi batas atas.
FAQ
Apakah ini pemotongan 17% atau kenaikan 25%?
Keduanya, diukur dari basis yang berbeda. Terhadap basis pra-promo 100, level permanen 125 adalah kenaikan 25%. Terhadap level promo 150 yang dimiliki pengguna dari 13 Mei sampai 13 September 2026, itu pemotongan 17%.
Haruskah saya menyetel subagentPromptCacheTtl ke 1h di mana-mana?
Hanya bila subagent-mu diam lebih dari lima menit di antara permintaan. Di log, 0,2% permintaan lanjutan mengalami kasus itu, jadi tingkat 1h menyeluruh kebanyakan hanya membayar harga tulis lebih tinggi tanpa hasil. Ukur dulu distribusi jedamu sendiri.
Apakah menurunkan effort menghemat token?
Tidak terlihat di log ini: permintaan sesi utama pada high menghasilkan rata-rata 778 token output dibanding 837 pada medium. Datanya bias, jadi jawaban jujurnya, effort adalah tombol kualitas yang penghematannya harus kamu ukur pada tugasmu sendiri.
Mengapa prompt pertama saya setelah makan siang begitu mahal?
Sesi utama menulis cache 1 jam. Setelah jeda di atas 60 menit, permintaan berikutnya menulis ulang prefiks: median 130.332 token cache_creation di log, dibanding 1.176 untuk permintaan hangat. Selesaikan tugas sebelum jeda panjang dan mulai sesi baru sesudahnya.
AIDive