Özet
- Claude Code haftalık limiti 100 tabanından 150 promosyon seviyesine çıktı, ardından 14 Eylül 2026'da kalıcı 125'e oturdu. Promosyon seviyesine göre bu %17'lik bir kesinti, eski tabana göre %25'lik bir artış. İkisi aynı anda doğru.
- Bir aylık yerel loglarda subagent'lar tüm token'ların %48,1'ini ve ağırlıklı maliyetin %55,3'ünü aldı. En büyük tek kaldıraç, daha az subagent başlatmak ve tuttuklarınıza küçük bir model sabitlemek.
- Subagent'lar 5 dakikalık, ana oturum 1 saatlik cache yazar. Soğuk bir aradan sonraki istek, sıcak bir isteğe göre yaklaşık 19 kat daha fazla cache yeniden yazar.
- Ana oturumda 60 dakikadan uzun bir mola, sonraki istekte medyan 130.332 token cache yeniden yazımına mal olur; ara 5 dakikanın altındaysa bu 1.176.
- Bu loglarda effort'u düşürmek istek başına çıktıyı düşürmedi (ana oturumlarda high'da ortalama 778 token, medium'da 837), yani bunu bedava tasarruf değil, kalite takası olarak görün.
- Prompt önerilerini kapatmak ve shell çıktısını filtrelemek gerçek ama küçük kaldıraçlar. En sona bırakın.
Ölçümler ne diyor
Başlıktaki sayının hesabı: taban 100, promosyon seviyesi 150, kalıcı seviye 125. 125 / 150 = 0,8333, yani kesinti %16,67 ve %17'ye yuvarlanır. Yanlış okuma, artışları çıkarıp (%50'den %25'e) buna %25'lik kesinti demektir. s2
Promosyon 13 Mayıs 2026'dan 13 Eylül 2026'ya kadar sürdü, haftalık limitleri yalnızca Claude Code'da %50 artırdı ve 5 saatlik limitlere dokunmadı. Pro, Max, Team ve koltuk bazlı Enterprise planlarına uygulandı. s1
Aşağıdaki ölçümler tek bir makinenin Claude Code loglarından geliyor: 455 ana oturum, 2.631 subagent çalıştırması, 2026-09-03 ile 2026-10-03 arasında tekilleştirilmiş 63.398 istek. İlk bulgu sayımın kendisiyle ilgili: her istek ortalama 1,96 log satırında görünüyor, bu yüzden tüm satırları toplamak toplam token'ı %99,3 fazla gösteriyor. Bu logları okuyan her betik önce (message.id, requestId) üzerinden tekilleştirmeli. s11
En büyük kalem subagent'lar. Tekilleştirilince toplam token'ın %48,1'ini, çıktı token'ının %63,9'unu ve ağırlıklı maliyetin %55,3'ünü oluşturuyorlar. Bir subagent çalıştırmasının ilk isteği, daha hiçbir şey yapmadan medyan 47.117 token'lık bir prompt taşıyor; p90 52.681, maksimum 126.769. Araç seti kısıtlı agent'lar çok daha düşük başlıyor (minimum 5.295). s8
Model seçimi bunu büyütür. Subagent'lar, bir model frontmatter'ı, çağrı başına model parametresi veya CLAUDE_CODE_SUBAGENT_MODEL aksini söylemedikçe ana konuşmanın modelini devralır; v2.1.251'den beri env değişkeni tek başına frontmatter'ı artık ezmiyor: CLAUDE_CODE_SUBAGENT_MODEL_FORCE=1 gerekiyor. Loglarda yalnızca claude-opus-5 tüm token'ların %31,5'i ve ağırlıklı maliyetin %35,8'iydi; bunun %63,2'si subagent'larda harcandı. s3
Cache seviyesini isteğin nerede çalıştığı belirler. Bu veride subagent cache yazımlarının %100,0'ı 5 dakikalık, ana oturum cache yazımlarının %100,0'ı 1 saatlikti; hiçbir istek karışık değildi. Subagent çalıştırmalarında 41.790 devam isteğinin yalnızca 95'i (%0,2) 5 dakikadan uzun bir aradan sonra geldi, ama bunlar ortalama 74.582 cache_creation token'ı yazdı; sıcak istekler için bu 3.886. subagentPromptCacheTtl ayarı ve CLAUDE_CODE_SUBAGENT_PROMPT_CACHE_TTL env değişkeni 5m veya 1h kabul eder ve Claude Code v2.1.242 veya üstünü gerektirir. s4
Bağımsız bir deneme aynı ayrımı gördü: her subagent isteği ephemeral_5m_input_tokens altına yazılırken üst oturum ephemeral_1h_input_tokens kullandı ve bir agent, beş dakikalık pencereden sonra gelen bir istekte önekinin tamamı olan 20.971 token'ı yeniden yazdı. s6
Ana oturumdaki karşılığı uzun moladır. Bir öncekinden 5 dakikadan az sonra gelen istekler medyan 1.176 cache_creation token'ı yazdı (n = 18.029). 5 ile 60 dakika arası 1.327 (n = 414). 60 dakikanın üstü 130.332 (n = 79), medyan prompt 175.523 token ve p90 674.348. Dokümanlar, aşım faturalandırmasında da ana konuşmanın beş dakikalık seviyeye düştüğünü doğruluyor. s3
Oturum başlangıcı sabit maliyettir: bir ana oturumun ilk isteği medyan 55.989 token taşıdı (p90 72.000); CLAUDE.md ve bellek boyutuna göre proje başına 15.764 ile 105.020 arası değişiyor. Daha önceki bir kamuya açık ölçüm, boş bir dizinde tabanı yaklaşık 29k, 3 MCP sunucusuyla 30,4k ve gerçek bir repoda 38,8k olarak verdi. s9
Effort, dokümanların öne çıkardığı ama logların ödüllendirmediği kaldıraçtır. Ana oturumlarda high istekleri ortalama 778 çıktı token'ı üretti, medium 837; high'daki subagent'lar 323'e karşı 642 üretti. Karşılaştırma bulandırılmış (farklı görevler, modeller, projeler), yani bu kanıt değil, şüphe için bir neden. Claude Code ekibinin kendi rehberi effort'u bir bütçe düğmesi değil, muhakemeyi nereye harcayacağınız olarak çerçeveliyor. s10
İki popüler ipucu küçük çıktı. Prompt önerileri ek istek maliyeti getirir ve yaygın paylaşılan "yaklaşık %10 tasarruf" rakamı bir tavandır, tipik tasarruf değil; ayar promptSuggestionEnabled: false veya CLAUDE_CODE_ENABLE_PROMPT_SUGGESTION=false. s12 Yirmi günde shell çıktısı filtrelemesi 66,7 milyon token'lık çıktıyı 24,1 milyona indirdi, ama bu 66,7 milyon aynı pencerede tüketilen yeni token'ların %7,4'üydü. s11
Ölçümler
Subagent başlatma maliyeti, ilk istek prompt'u token olarak, modele göre:
| Model | n | min | median | p90 | max |
|---|---|---|---|---|---|
| All | 2.631 | 5.295 | 47.117 | 52.681 | 126.769 |
| claude-opus-5 | 1.262 | 36.864 | 43.905 | 48.032 | 50.398 |
| claude-sonnet-5 | 633 | 5.916 | 52.409 | 53.961 | 126.769 |
| claude-opus-5-5 | 426 | 39.408 | 47.189 | 48.362 | 48.883 |
| claude-sonnet-5-5 | 165 | 44.471 | 47.348 | 50.197 | 50.863 |
| claude-fable-5-1 | 102 | 36.551 | 42.593 | 44.286 | 47.385 |
| claude-haiku-4-5 | 42 | 5.295 | 29.636 | 36.714 | 79.190 |
Devam ederken cache yeniden yazımı, ana oturumlar, istekten önceki aralığa göre:
| Aralık | n | cache_creation median | mean | cache_read median | prompt median |
|---|---|---|---|---|---|
| < 5 min | 18.029 | 1.176 | 2.391 | 184.169 | 186.412 |
| 5 to 60 min | 414 | 1.327 | 5.575 | 221.857 | 225.168 |
| > 60 min | 79 | 130.332 | 241.499 | 25.264 | 175.523 |
Protokol: her ~/.claude/projects/*/<uuid>.jsonl ana oturumunu ve her */<uuid>/subagents/agent-*.jsonl çalıştırmasını oku, istekler 2026-09-01'den itibaren. assistant satırlarını (message.id, requestId) üzerinden tekilleştir ve istek başına tek bir usage kaydı tut. Toplam token = input + output + cache_read + cache_creation; prompt boyutu = input + cache_read + cache_creation. Aralık = aynı oturum veya çalıştırma içinde, önceki isteğin son log satırından bu isteğin ilk satırına kadar geçen süre. Ağırlıklı maliyet göreli ağırlıkları kullanır: input 1, 5m cache yazımı 1,25, 1h cache yazımı 2, cache okuması 0,1, output 5; bu ağırlıklar bir varsayımdır, yayımlanmış bir tarife değil.
Pazartesi bunu yapın
- Planınızda
/usageçalıştırın ve skill, subagent, plugin ve MCP kırılımını, ayrıca son kullanımın %10 veya fazlasında yükselen davranış bayraklarını okuyun. - Subagent tanımlarınızı listeleyin ve yalnızca arama, kontrol ya da özetleme yapan her birine
model: haikuveyamodel: sonnetfrontmatter'ı ekleyin. - Frontmatter ne olursa olsun tüm subagent'larda tek model istiyorsanız
CLAUDE_CODE_SUBAGENT_MODELveCLAUDE_CODE_SUBAGENT_MODEL_FORCE=1ayarlayın. - Claude Code sürümünüzün 2.1.242 veya üstü olduğunu kontrol edin, sonra iş akışı başına
subagentPromptCacheTtl: "1h"değer mi karar verin: araç çağrıları arasında bekleyen subagent'lara yardım eder, kısa olanlara etmez. - Bir saatten uzun bir moladan önce görevi mevcut oturumda bitirin ve bir devir dosyası yazın; döndüğünüzde 175k token'lık bir prompt'u sürdürmek yerine yeni oturum açın.
- Kendi loglarınız üzerinde (message.id, requestId) ile tekilleştiren salt okunur bir betik yazın ve başka bir şeyi değiştirmeden önce ana oturum ile subagent payını karşılaştırın.
- Önerileri hiç kullanmıyorsanız
promptSuggestionEnabled: falseayarlayın ve tasarrufu en fazla birkaç yüzde olarak sayın.
Daha fazlası
- Max 5x ile Max 20x: kesintiden sonra kullanıcıların ölçtüğü kapasite oranı, videonun dışarıda bıraktığı bir plan seçimi sorusu. s7
- Cache TTL için tam öncelik zinciri (force env, bucket env, bucket ayarı, subagent
experimental.cacheTtl) ve aşım faturalandırmasında neyin değiştiği. s4 - Oturum ortasında effort değiştirmenin neden çoğu modelde cache isabeti olmadan tüm geçmişi okutabildiği ve hangi modellerin muaf olduğu. s3
- Kendi oturum loglarınızda
usagealanlarını ve cache seviyelerini nasıl okuyacağınız ve günlük bütçe görünümü için ccboard yaklaşımı. s11 - Üç model içeren üç subagent dosyası ve her başlatmanın cache'e gerçekte ne yazdığı, yazarın kendi düzeltmeleriyle. s8
- Ertelenmiş MCP araç tanımları ve araç şemalarının context'e ne zaman yükleneceğini denetleyen
ENABLE_TOOL_SEARCH=auto:N. s3
Kaynaklar
- Claude Code May to August 2026 weekly limits promotion, Anthropic help center. Neden okunmalı: %50'lik promosyonun kesin tarihleri, planları ve kapsamı, Anthropic'in kendi ifadesiyle.
- Anthropic is cutting Claude Code's current weekly limits by 17 percent, BleepingComputer. Neden okunmalı: %25'lik artış ve %17'lik kesinti yan yana, duyurudan alıntıyla.
- Manage costs effectively, Claude Code docs. Neden okunmalı:
/usagekırılımı, subagent model devralma ve effort ile MCP cache kuralları. - How Claude Code uses prompt caching, Claude Code docs. Neden okunmalı: 5m ve 1h seviyelerinin ve TTL ayarlarının tek yetkili açıklaması.
- Sub-agents burning your Claude Code 5-hour window? Check the cache TTL, Reddit r/ClaudeAI. Neden okunmalı: subagent 5 dakikalık cache'ini ortaya çıkaran konu, onu değiştiren ayarla birlikte.
- Max20x is now just 1.5 times better than Max5x, Reddit r/ClaudeCode. Neden okunmalı: kesintiden sonra iki Max seviyesi arasında kullanıcı tarafı kapasite karşılaştırması.
- Three Claude Code subagent files, three models in frontmatter, dev.to. Neden okunmalı: ham usage alanları ve dürüst düzeltmelerle tekrarlanabilir bir başlatma maliyeti deneyi.
- Claude Code token overhead: what 33k actually costs, devaireviews.com. Neden okunmalı: boş dizinde, MCP sunucularıyla ve gerçek repoda başlangıç yükü ölçümü.
- Using Claude Code: Spending your effort, X, Claude Code team. Neden okunmalı: ekibin effort seviyelerini nasıl düşündüğü; içinde token sayısı yok, asıl nokta bu.
- The real cost of AI, part 9: measure your own usage, florian.bruniaux.com. Neden okunmalı: shell çıktısı filtrelemesini toplam tüketime oranlayan yirmi günlük bir log çalışması.
- PSA: Turn off Prompt Suggestions, save ~10% of your limits/spend, Reddit r/ClaudeAI. Neden okunmalı: özgün iddia ve %10'u bir tavana indiren konu.
SSS
Bu %17'lik kesinti mi, %25'lik artış mı?
İkisi de, farklı tabanlardan ölçülünce. Promosyon öncesi 100 tabanına göre kalıcı 125 seviyesi %25'lik bir artış. Kullanıcıların 13 Mayıs ile 13 Eylül 2026 arasında sahip olduğu 150 promosyon seviyesine göre ise %17'lik bir kesinti.
subagentPromptCacheTtl'yi her yerde 1h yapmalı mıyım?
Yalnızca subagent'larınız istekler arasında beş dakikadan uzun bekliyorsa. Loglarda devam isteklerinin %0,2'si bu durumdaydı, yani toptan 1h seviyesi çoğunlukla boşuna daha yüksek bir yazma fiyatı öder. Önce kendi aralık dağılımınızı ölçün.
Effort'u düşürmek token tasarruf ettirir mi?
Bu loglarda gözle görülür biçimde hayır: ana oturum istekleri high'da ortalama 778 çıktı token'ı üretti, medium'da 837. Veri bulandırılmış, bu yüzden dürüst cevap şu: effort bir kalite düğmesi ve tasarrufunu kendi görevlerinizde ölçmeniz gerekiyor.
Öğle arasından sonraki ilk prompt'um neden bu kadar pahalı?
Ana oturum 1 saatlik cache yazar. 60 dakikadan uzun bir aradan sonra sonraki istek öneki yeniden yazar: loglarda medyan 130.332 cache_creation token'ı, sıcak bir istek için 1.176. Uzun molalardan önce görevleri bitirin, sonrasında yeniden başlayın.
AIDive