AIDive

Video paketi

Claude Code haftalık limit kesintisi: ölçülmüş kaldıraçlar, cache tabloları, liste

10 dk okuma

Özet

  • Claude Code haftalık limiti 100 tabanından 150 promosyon seviyesine çıktı, ardından 14 Eylül 2026'da kalıcı 125'e oturdu. Promosyon seviyesine göre bu %17'lik bir kesinti, eski tabana göre %25'lik bir artış. İkisi aynı anda doğru.
  • Bir aylık yerel loglarda subagent'lar tüm token'ların %48,1'ini ve ağırlıklı maliyetin %55,3'ünü aldı. En büyük tek kaldıraç, daha az subagent başlatmak ve tuttuklarınıza küçük bir model sabitlemek.
  • Subagent'lar 5 dakikalık, ana oturum 1 saatlik cache yazar. Soğuk bir aradan sonraki istek, sıcak bir isteğe göre yaklaşık 19 kat daha fazla cache yeniden yazar.
  • Ana oturumda 60 dakikadan uzun bir mola, sonraki istekte medyan 130.332 token cache yeniden yazımına mal olur; ara 5 dakikanın altındaysa bu 1.176.
  • Bu loglarda effort'u düşürmek istek başına çıktıyı düşürmedi (ana oturumlarda high'da ortalama 778 token, medium'da 837), yani bunu bedava tasarruf değil, kalite takası olarak görün.
  • Prompt önerilerini kapatmak ve shell çıktısını filtrelemek gerçek ama küçük kaldıraçlar. En sona bırakın.

Ölçümler ne diyor

Başlıktaki sayının hesabı: taban 100, promosyon seviyesi 150, kalıcı seviye 125. 125 / 150 = 0,8333, yani kesinti %16,67 ve %17'ye yuvarlanır. Yanlış okuma, artışları çıkarıp (%50'den %25'e) buna %25'lik kesinti demektir. s2

Promosyon 13 Mayıs 2026'dan 13 Eylül 2026'ya kadar sürdü, haftalık limitleri yalnızca Claude Code'da %50 artırdı ve 5 saatlik limitlere dokunmadı. Pro, Max, Team ve koltuk bazlı Enterprise planlarına uygulandı. s1

Aşağıdaki ölçümler tek bir makinenin Claude Code loglarından geliyor: 455 ana oturum, 2.631 subagent çalıştırması, 2026-09-03 ile 2026-10-03 arasında tekilleştirilmiş 63.398 istek. İlk bulgu sayımın kendisiyle ilgili: her istek ortalama 1,96 log satırında görünüyor, bu yüzden tüm satırları toplamak toplam token'ı %99,3 fazla gösteriyor. Bu logları okuyan her betik önce (message.id, requestId) üzerinden tekilleştirmeli. s11

En büyük kalem subagent'lar. Tekilleştirilince toplam token'ın %48,1'ini, çıktı token'ının %63,9'unu ve ağırlıklı maliyetin %55,3'ünü oluşturuyorlar. Bir subagent çalıştırmasının ilk isteği, daha hiçbir şey yapmadan medyan 47.117 token'lık bir prompt taşıyor; p90 52.681, maksimum 126.769. Araç seti kısıtlı agent'lar çok daha düşük başlıyor (minimum 5.295). s8

Model seçimi bunu büyütür. Subagent'lar, bir model frontmatter'ı, çağrı başına model parametresi veya CLAUDE_CODE_SUBAGENT_MODEL aksini söylemedikçe ana konuşmanın modelini devralır; v2.1.251'den beri env değişkeni tek başına frontmatter'ı artık ezmiyor: CLAUDE_CODE_SUBAGENT_MODEL_FORCE=1 gerekiyor. Loglarda yalnızca claude-opus-5 tüm token'ların %31,5'i ve ağırlıklı maliyetin %35,8'iydi; bunun %63,2'si subagent'larda harcandı. s3

Cache seviyesini isteğin nerede çalıştığı belirler. Bu veride subagent cache yazımlarının %100,0'ı 5 dakikalık, ana oturum cache yazımlarının %100,0'ı 1 saatlikti; hiçbir istek karışık değildi. Subagent çalıştırmalarında 41.790 devam isteğinin yalnızca 95'i (%0,2) 5 dakikadan uzun bir aradan sonra geldi, ama bunlar ortalama 74.582 cache_creation token'ı yazdı; sıcak istekler için bu 3.886. subagentPromptCacheTtl ayarı ve CLAUDE_CODE_SUBAGENT_PROMPT_CACHE_TTL env değişkeni 5m veya 1h kabul eder ve Claude Code v2.1.242 veya üstünü gerektirir. s4

Bağımsız bir deneme aynı ayrımı gördü: her subagent isteği ephemeral_5m_input_tokens altına yazılırken üst oturum ephemeral_1h_input_tokens kullandı ve bir agent, beş dakikalık pencereden sonra gelen bir istekte önekinin tamamı olan 20.971 token'ı yeniden yazdı. s6

Ana oturumdaki karşılığı uzun moladır. Bir öncekinden 5 dakikadan az sonra gelen istekler medyan 1.176 cache_creation token'ı yazdı (n = 18.029). 5 ile 60 dakika arası 1.327 (n = 414). 60 dakikanın üstü 130.332 (n = 79), medyan prompt 175.523 token ve p90 674.348. Dokümanlar, aşım faturalandırmasında da ana konuşmanın beş dakikalık seviyeye düştüğünü doğruluyor. s3

Oturum başlangıcı sabit maliyettir: bir ana oturumun ilk isteği medyan 55.989 token taşıdı (p90 72.000); CLAUDE.md ve bellek boyutuna göre proje başına 15.764 ile 105.020 arası değişiyor. Daha önceki bir kamuya açık ölçüm, boş bir dizinde tabanı yaklaşık 29k, 3 MCP sunucusuyla 30,4k ve gerçek bir repoda 38,8k olarak verdi. s9

Effort, dokümanların öne çıkardığı ama logların ödüllendirmediği kaldıraçtır. Ana oturumlarda high istekleri ortalama 778 çıktı token'ı üretti, medium 837; high'daki subagent'lar 323'e karşı 642 üretti. Karşılaştırma bulandırılmış (farklı görevler, modeller, projeler), yani bu kanıt değil, şüphe için bir neden. Claude Code ekibinin kendi rehberi effort'u bir bütçe düğmesi değil, muhakemeyi nereye harcayacağınız olarak çerçeveliyor. s10

İki popüler ipucu küçük çıktı. Prompt önerileri ek istek maliyeti getirir ve yaygın paylaşılan "yaklaşık %10 tasarruf" rakamı bir tavandır, tipik tasarruf değil; ayar promptSuggestionEnabled: false veya CLAUDE_CODE_ENABLE_PROMPT_SUGGESTION=false. s12 Yirmi günde shell çıktısı filtrelemesi 66,7 milyon token'lık çıktıyı 24,1 milyona indirdi, ama bu 66,7 milyon aynı pencerede tüketilen yeni token'ların %7,4'üydü. s11

Ölçümler

Subagent başlatma maliyeti, ilk istek prompt'u token olarak, modele göre:

Model n min median p90 max
All 2.631 5.295 47.117 52.681 126.769
claude-opus-5 1.262 36.864 43.905 48.032 50.398
claude-sonnet-5 633 5.916 52.409 53.961 126.769
claude-opus-5-5 426 39.408 47.189 48.362 48.883
claude-sonnet-5-5 165 44.471 47.348 50.197 50.863
claude-fable-5-1 102 36.551 42.593 44.286 47.385
claude-haiku-4-5 42 5.295 29.636 36.714 79.190

Devam ederken cache yeniden yazımı, ana oturumlar, istekten önceki aralığa göre:

Aralık n cache_creation median mean cache_read median prompt median
< 5 min 18.029 1.176 2.391 184.169 186.412
5 to 60 min 414 1.327 5.575 221.857 225.168
> 60 min 79 130.332 241.499 25.264 175.523

Protokol: her ~/.claude/projects/*/<uuid>.jsonl ana oturumunu ve her */<uuid>/subagents/agent-*.jsonl çalıştırmasını oku, istekler 2026-09-01'den itibaren. assistant satırlarını (message.id, requestId) üzerinden tekilleştir ve istek başına tek bir usage kaydı tut. Toplam token = input + output + cache_read + cache_creation; prompt boyutu = input + cache_read + cache_creation. Aralık = aynı oturum veya çalıştırma içinde, önceki isteğin son log satırından bu isteğin ilk satırına kadar geçen süre. Ağırlıklı maliyet göreli ağırlıkları kullanır: input 1, 5m cache yazımı 1,25, 1h cache yazımı 2, cache okuması 0,1, output 5; bu ağırlıklar bir varsayımdır, yayımlanmış bir tarife değil.

Pazartesi bunu yapın

  • Planınızda /usage çalıştırın ve skill, subagent, plugin ve MCP kırılımını, ayrıca son kullanımın %10 veya fazlasında yükselen davranış bayraklarını okuyun.
  • Subagent tanımlarınızı listeleyin ve yalnızca arama, kontrol ya da özetleme yapan her birine model: haiku veya model: sonnet frontmatter'ı ekleyin.
  • Frontmatter ne olursa olsun tüm subagent'larda tek model istiyorsanız CLAUDE_CODE_SUBAGENT_MODEL ve CLAUDE_CODE_SUBAGENT_MODEL_FORCE=1 ayarlayın.
  • Claude Code sürümünüzün 2.1.242 veya üstü olduğunu kontrol edin, sonra iş akışı başına subagentPromptCacheTtl: "1h" değer mi karar verin: araç çağrıları arasında bekleyen subagent'lara yardım eder, kısa olanlara etmez.
  • Bir saatten uzun bir moladan önce görevi mevcut oturumda bitirin ve bir devir dosyası yazın; döndüğünüzde 175k token'lık bir prompt'u sürdürmek yerine yeni oturum açın.
  • Kendi loglarınız üzerinde (message.id, requestId) ile tekilleştiren salt okunur bir betik yazın ve başka bir şeyi değiştirmeden önce ana oturum ile subagent payını karşılaştırın.
  • Önerileri hiç kullanmıyorsanız promptSuggestionEnabled: false ayarlayın ve tasarrufu en fazla birkaç yüzde olarak sayın.

Daha fazlası

  • Max 5x ile Max 20x: kesintiden sonra kullanıcıların ölçtüğü kapasite oranı, videonun dışarıda bıraktığı bir plan seçimi sorusu. s7
  • Cache TTL için tam öncelik zinciri (force env, bucket env, bucket ayarı, subagent experimental.cacheTtl) ve aşım faturalandırmasında neyin değiştiği. s4
  • Oturum ortasında effort değiştirmenin neden çoğu modelde cache isabeti olmadan tüm geçmişi okutabildiği ve hangi modellerin muaf olduğu. s3
  • Kendi oturum loglarınızda usage alanlarını ve cache seviyelerini nasıl okuyacağınız ve günlük bütçe görünümü için ccboard yaklaşımı. s11
  • Üç model içeren üç subagent dosyası ve her başlatmanın cache'e gerçekte ne yazdığı, yazarın kendi düzeltmeleriyle. s8
  • Ertelenmiş MCP araç tanımları ve araç şemalarının context'e ne zaman yükleneceğini denetleyen ENABLE_TOOL_SEARCH=auto:N. s3

Kaynaklar

SSS

Bu %17'lik kesinti mi, %25'lik artış mı?

İkisi de, farklı tabanlardan ölçülünce. Promosyon öncesi 100 tabanına göre kalıcı 125 seviyesi %25'lik bir artış. Kullanıcıların 13 Mayıs ile 13 Eylül 2026 arasında sahip olduğu 150 promosyon seviyesine göre ise %17'lik bir kesinti.

subagentPromptCacheTtl'yi her yerde 1h yapmalı mıyım?

Yalnızca subagent'larınız istekler arasında beş dakikadan uzun bekliyorsa. Loglarda devam isteklerinin %0,2'si bu durumdaydı, yani toptan 1h seviyesi çoğunlukla boşuna daha yüksek bir yazma fiyatı öder. Önce kendi aralık dağılımınızı ölçün.

Effort'u düşürmek token tasarruf ettirir mi?

Bu loglarda gözle görülür biçimde hayır: ana oturum istekleri high'da ortalama 778 çıktı token'ı üretti, medium'da 837. Veri bulandırılmış, bu yüzden dürüst cevap şu: effort bir kalite düğmesi ve tasarrufunu kendi görevlerinizde ölçmeniz gerekiyor.

Öğle arasından sonraki ilk prompt'um neden bu kadar pahalı?

Ana oturum 1 saatlik cache yazar. 60 dakikadan uzun bir aradan sonra sonraki istek öneki yeniden yazar: loglarda medyan 130.332 cache_creation token'ı, sıcak bir istek için 1.176. Uzun molalardan önce görevleri bitirin, sonrasında yeniden başlayın.