Giriş: kısalan hafta
Claude Code'un haftalık limiti, yaz kampanyasının bittiği Eylül 2026 ortasında %17 düştü. En büyük planlardaki kullanıcılar artık çarşambaya haftanın bittiğini söylüyor. Anthropic'in kendi duyurusu limitlerin kalıcı olarak %25 artırıldığını yazıyor, hemen ardından gelen paylaşım ise aynı değişikliğe %17'lik bir düşüş diyor.
Limiti uzatmaya yönelik her ipucu listesi tek bir rakam olmadan geliyor. Bu yazı her çözüme ölçülmüş bir rakam veriyor ve hepsini sıralıyor. İki sonuç öne çıkıyor: bir aylık token'ın neredeyse yarısı subagent'lara gitti ve tek bir uzun mola, sonraki mesajın oturumun büyük kısmını yeniden yazmasına yol açıyor.
Ne değişti ve nasıl sayılır
Buradaki ölçümler tek bir geliştiricinin bir aylık Claude Code loglarından geliyor: 3 Eylül ile 3 Ekim arasında 455 oturum ve 63,398 istek.
Kampanya Mayıs'tan 13 Eylül'e kadar sürdü ve haftalık limiti %50 yükseltti. Beş saatlik pencerelerin limiti hiç değişmedi. Ağustos sonunda Anthropic'in geliştirici hesabı %25'lik kalıcı bir artış duyurdu, aynı akışta bir paylaşım sonra bunun %17'lik bir düşüşe denk geldiği söyleniyor. İkisi de doğru:
| Dönem | Haftalık limit (eski limit = 100) |
|---|---|
| Kampanyadan önce | 100 |
| Kampanya sırasında (Mayıs'tan 13 Eylül'e) | 150 |
| 14 Eylül'den beri kalıcı seviye | 125 |
150'den 125'e düşüş, insanların hissettiği %17. İki büyük plana sahip bir kullanıcı, çarşamba günü %100'e gelmenin daha önce hiç olmadığını yazdı. Aynı plandaki bir başkası salı sabahı %86'daydı. Tek neden bu kesinti değil: Eylül başında daha aç bir model çıktı, yani her boş hafta bu değişiklikten gelmiyor.
Sizin tarafınızdan görünen şey bir yüzde. /usage ekranı son kullanımı skill'ler, subagent'lar, eklentiler ve bağlı her MCP sunucusu arasında bölüyor ve cache miss'leri işaretliyor. Tek bir tuş ekranı son gün ile son yedi gün arasında değiştiriyor. Görünmeyen şey ise limitin token cinsinden büyüklüğü: Anthropic yüzdeleri ve çarpanları yayınlıyor, token sayısını asla. Bu yüzden aşağıda ölçülen her şey tek bir iş yükünden gelen token'lardır, haftanızın payı değil.
Logdan token saymanın bir tuzağı var. Log aynı cevabı birkaç kez yazıyor, bu yüzden her satırı toplamak 18.6 milyar token veriyor. Bir kez sayınca 9.3 milyar çıkıyor. Naif bir sayım her şeyi neredeyse ikiye katlıyor.
Subagent'lar: faturanın neredeyse yarısı
Subagent, oturumunuzun yan bir iş için başlattığı başka bir Claude'dur ve iş bitince rapor verir. Ölçülen ayda subagent'lar 2,631 çalıştırmada tüm token'ların %48.1'ini aldı.
| Ölçü | Subagent'ların payı |
|---|---|
| Tüm token'lar | %48.1 |
| Çıktı token'ları | %63.9 |
| Herkese açık fiyat listesinin çıktıyı ve cache yazımlarını tarttığı gibi ağırlıklandırılmış | %55.3 |
Her subagent ayrıca bir giriş bedeli öder. Daha bir şey yapmadan, açılış isteği medyan 47,117 token taşıyor: talimatlar, araç listesi ve skill listesi, hepsi yeniden gönderilir. Başka biri bunu farklı bir makinede ölçtü ve kendi prompt'u çok küçük olan agent'lar için açılış başına 16,000 ile 21,000 token buldu. O yazının dediği gibi, agent dosyası kendi açılış maliyetinin içinde yuvarlama hatasıdır.
Öbür yarısı model. Varsayılan olarak bir subagent ana konuşmanın modelini devralır, yani oturumu en büyük modele almak her yardımcıyı da ona koyar. Ölçülen loglarda en küçük model subagent isteklerinin %1'inden azını işledi. Çözüm agent dosyasında tek satır: testleri çalıştırmak ya da dosya aramak gibi işler için model alanını daha küçük bir modele ayarlamak.
Bu iki alışkanlık demek. Yerinde yapabileceğiniz küçük bir iş için subagent açmayın ve tuttuklarınıza küçük bir model sabitleyin.
Bu sonucun sınırı: sabitlemenin haftanın yüzde kaçını kurtardığını kimse ölçmedi ve daha fazla tur gerektiren küçük bir model daha pahalıya gelebilir. %48, çok dallanan işten geliyor. Kendi payınız /usage ekranında.
Kimsenin listelemediği beş dakikalık cache
Claude Code konuşmanızı sunucuda bir prompt cache'inde tutar ve onu geri okumak yeniden göndermenin çok küçük bir kısmına mal olur. Ana oturum için bu cache bir saat yaşar. Subagent için beş dakika.
Dokümantasyon bunu açıkça söylüyor: abonelikte bile, siz daha uzununu seçene kadar subagent'lara beş dakika verilir. Aynısı ana konuşmanın dışındaki her şey için geçerli, arka plan işleri ve compaction dahil. Ölçülen loglar da aynı fikirde: subagent'tan gelen her cache yazımı beş dakikalık katmana, ana oturumdan gelen her yazım bir saatlik katmana düştü.
Reddit'te bir geliştirici bunun ne yaptığını fark etti: subagent'larından biri tek günde bütün bağlamını sekiz kez yeniden yazmış. Çözüm ayar dosyasında tek satır, "subagentPromptCacheTtl": "1h".
| Onun ölçümü | Önce | Sonra |
|---|---|---|
| Cache yazımları | 12.2 milyon token | 3.0 milyon token |
| Dört subagent'lı beş saatlik pencere | %2'den %100'e | %0'dan %22'ye |
Bu, iki farklı günü karşılaştıran tek bir kullanıcı, kontrollü bir test değil. Burada ölçülen loglarda neredeyse hiç fark etmiyor: 41,790 subagent takip isteğinden yalnızca 95'i (binde ikiye yakın) beş dakikadan uzun bir beklemeden sonra geldi, ama her biri yaklaşık 75,000 token yeniden yazdı.
Yani subagent'larınızın nasıl çalıştığına bağlı. Uzun bir build'i, bir review'u ya da sizi bekliyorlarsa açın. Kısa seriler halinde çalışıyorlarsa dokunmayın, çünkü bir saat yaşayan cache'i yazmak daha pahalıya gelir.
Tüm oturumu yeniden yazdıran mola
Ana oturumun cache'i bir saat dayanır. Daha uzun bir moladan sonra gitmiştir ve sonraki mesaj hiçbir şeyi geri okuyamaz. Dokümantasyon bunu açıkça yazıyor: moladan sonra gönderdiğiniz mesaj cache'i ıskalar ve tüm bağlamınızı yeniden işler.
| Mesajdan önceki duraklama | İstek sayısı | Yeniden yazılan cache (medyan) |
|---|---|---|
| 5 dakikadan az | 18,029 | 1,176 token |
| 5 ile 60 dakika | 414 | 1,327 token |
| 60 dakikadan fazla | 79 | 130,332 token |
O andaki tipik oturum 175,523 token taşıyordu, yani büyük kısmı yeniden yazıldı. Sayaç yazımı da okuma ile aynı tartmıyor. Bir geliştirici Claude Code'un önüne bir loglama proxy'si koyup beş saatlik penceresini izledi: onun oranlarına göre cache'e yazılan bir token, ondan okunan bir token'ın yaklaşık kırk katı ağırlığında.
Claude Code bunu biliyor. Uzun bir moladan sonra büyük bir oturumu sürdürürken, bunun yerine özetten devam etmeyi öneriyor. Kabul edin.
Daha ucuz alışkanlık daha önce geliyor. Bir görev bitince, cache hâlâ sıcakken oturumu temizleyin. Temizlemek hiçbir şeye mal olmaz ve sonraki görev küçük başlar. Compact etmek de işe yarar, ama kocaman bir oturumu compact etmek başlı başına kocaman bir istektir.
Mola, cache'i kaybetmenin tek yolu değil. Oturumun ortasında model değiştirmek de onu boşaltır, çünkü her model kendi cache'ini tutar. En yeni modellerde effort değiştirmek boşaltmaz. Claude Code, cache sıcakken model geçişini onaylamanızı ister ve bu soru uyarının kendisidir.
Sınırlar: 79 soğuk dönüş küçük bir örnek ve bir kısmı bir compaction'dan sonra geliyor. Özet de ayrıntı kaybeder, yani bu çözüm biraz süreklilikten ödün verir.
Effort: kaliteye mal olabilen çözüm
Effort, modelin cevaplamadan önce ne kadar düşünmesine izin verildiğidir. Low'dan max'e beş seviye var ve düşünme çıktı olarak faturalanır. Varsayılan çoğu modelde high, en yeni ikisinde medium.
Dokümantasyon, düşünme bütçesinin istek başına on binlerce token'a çıkabildiğini ve en üst seviyenin aşırı düşünmeye yatkın olduğunu söylüyor. En yeni modellerde düşünme hiç kapatılamıyor, bu yüzden tek kontrol seviye.
Bir geliştirici aynı 29 gerçek görevi beş seviyenin hepsinde çalıştırdı:
| Effort seviyesi | Görev başına ortalama maliyet | Geçilen görevler (29 üzerinden) |
|---|---|---|
| low | $2.50 | 23 |
| medium | $3.15 | 28 |
| high | $5.01 | 26 |
| xhigh | $6.51 | 25 |
| max | $8.84 | 27 |
Kalite maliyeti izlemedi. Medium, üstündeki her seviyeden daha fazla görev geçti ve dolar başına da en çok geçişi verdi. Onun sözleriyle, eğri medium'da tepe yapıyor gibi görünüyor. Claude Code ekibi de aynı şekilde çalışıyor: mühendislerinden biri low ya da medium ile geliştiriyor, review yapıyor ve doğrulamayı yalnızca high'da çalıştırıyor.
Bu çözümün kaliteye neden mal olabildiği işte burada. Seçtiği zor problemlerde low effort beşte sıfır geçti, high beşte beş. Bir low denemesi iki dakika sürdü, bir high denemesi otuz üç.
Yani effort'u adıma göre seçin: geliştirmek için medium, bir hatanın pahalı olduğu yerde high (eski koddaki bir bug, bir migration, kapanış kontrolü), max'i neredeyse hiç. Oturum logları her isteğin effort'unu kaydeder, böylece gerçekte ne çalıştırdığınızı kontrol edebilirsiniz.
Bu maliyetler eski bir modelde dolar cinsinden, haftanın payı değil: bunu kimse yayınlamadı. Üstelik başarısız olup iki kez çalışan ucuz bir deneme, işe yarayan bir denemeden pahalıya gelir.
Reklamı yapıldığından daha hafif ipuçları
Bazı çözümler her listede var ve ibreyi pek oynatmıyor. Denemek bedava. Sadece haftanın gittiği yer orası değil.
Bu gruptaki gerçek olan, başlangıçta yüklenenler. Bir yazı açılış isteğini boş bir klasörde 29,061 token, gerçek bir projenin içinde ise neredeyse 39,000 olarak ölçtü. Burada ölçülen loglarda medyan açılış isteği 55,989 token, projeye göre 15,764 ile 105,020 arasında değişiyor. /context komutu içeride neyin olduğunu gösterir (bellek dosyaları, skill'ler, araç listeleri) ve yüklediği her bellek dosyasını adıyla belirtir. Hiç kullanmadığınızı ayıklayın. Kazanç mütevazı, çünkü o blok bir kez yazılıyor ve sonraki her turda cache'ten okunuyor. Soğuk başlangıçta ve her subagent açılışında can yakıyor.
| Popüler ipucu | Ölçülen |
|---|---|
| MCP sunucularını kaldırmak | üç sunucudaki 51 araç için 1,350 token; tek araçlı bir sunucu için 18 token |
| Prompt önerilerini kapatmak | bir kullanıcıda %3 ile 4; "%10'a kadar" iddiası devasa bağlamlara sahip tek bir hesaptan geldi |
| Shell çıktısını filtrelemek | toplam hacmin yaklaşık %0.1'i, o filtrelerden birine katkıda bulunan biri tarafından ölçüldü |
Araç tanımları artık varsayılan olarak ertelenir ve MCP sunucularının bu kadar az tutmasının sebebi bu. Dokümantasyon prompt önerilerinin maliyetini küçük olarak niteliyor. Üçü de bağlamınızın büyüklüğüyle artar ve ertelemenin kapalı olduğu eski modellerde sunucular daha pahalıdır. İsterseniz kapatın, ama haftayı geri almayı beklemeyin.
Sıralı tablo
Ölçülene göre sıralı:
| Sıra | Çözüm | Ölçülen | Püf nokta |
|---|---|---|---|
| 1 | Daha az ve daha ucuz subagent | token'ların %48.1'i; açılış başına 47,117 | Daha az paralellik |
| 2 | Soğuk oturumu sürdürmeyin | 1,176'ya karşı 130,332 token yeniden yazıldı | Özet ayrıntı kaybeder |
| 3 | Effort: geliştirmek için medium | görev başına $5.01'e karşı $3.15; 29'dan 28'i geçti | Low zor problemlerde başarısız olur |
| 4 | Subagent cache'i bir saat | 12.2 milyondan 3.0 milyona cache yazım token'ı | Yalnızca subagent'lar beklerse karşılığını verir |
| 5 | Başlangıçta yüklenenleri ayıklayın | 29,061'lik tabana +9,744 token | Oturum başına bir kez ödenir |
Popüler üçlü (MCP sunucuları, prompt önerileri, shell çıktısı) haftanın gittiği yer değil.
Sınırlar, açıkça: bu sıralama token cinsinden, tek bir kişinin bir aylık işinden ve başkalarının ölçümlerinden geliyor. Anthropic limitin token cinsinden büyüklüğünü yayınlamıyor, bu yüzden dışarıdan hiç kimse bunları haftanızın payına çeviremez. Sizin sıranız farklı olabilir ve /usage ekranı size söyleyecektir.
En büyük iki çözüm ayar değil alışkanlık ve ikisi de bedava: daha az subagent açın ve soğumuş bir oturumu asla tam olarak sürdürmeyin.
AIDive