AIDive

4 Claude Code Token Aracı Test Ettik, Biri Pahalıya Geldi

AIDive tarafından · Yayın

Kodlama agent'ları

JetBrains hayır diyor, makinem 11,6 milyon diyor

Temmuz 2026'da JetBrains, on binlerce geliştiricinin Claude Code'da token biriktirmek için kurduğu shell proxy'si rtk'yi sınamak için yaklaşık 320 $ API kredisi — 425 faturalanan deneme — harcadı. Sonuç: oturumlar görev başına %7,6 daha pahalıya çıktı. İki hafta önce aynı ekip, tokenların %65'ini kestiğini iddia eden caveman skill'ini ölçmüş ve %8,5 bulmuştu. Kendi makinemde ise rtk gain, 25.599 komutta 11,6 milyon token tasarrufu bildiriyor.

Her iki sayı da gerçek. Sadece aynı şeyi ölçmüyorlar: biri tamamlanan görev başına maliyet, diğeri bash çıktısının byte'ları.

Sayı Neyi ölçüyor Kaynak
Görev başına +%7,6 (p=0,004) rtk kuruluyken bir görevin uçtan uca maliyeti JetBrains, 425 deneme, ~320 $
Çıktı token'larının %8,5'i caveman'ın agentic işte ölçülen tasarrufu JetBrains, 82 eşleştirilmiş görev
%65 caveman'ın ilan ettiği tasarruf caveman README
11,6 M tasarruf (%41,6) rtk'nin sıkıştırdığı bash çıktı byte'ları rtk gain, 25.599 komut

İşte dört araçlık yığın: graphify, rtk, Superpowers ve caveman; 2026-09-02 itibarıyla toplam 575.612 GitHub yıldızı. Her biri faturanın farklı bir dilimine dokunuyor.

Araç Yıldız (2026-09-02) Dil Lisans
Superpowers 280.792 Markdown skill MIT
graphify 113.946 Python Apache-2.0
caveman 102.548 Go MIT (skill)
rtk 78.326 Rust Apache-2.0

Token'lar aslında nereye gidiyor

Claude Code faturasının iki yüzü var. Girdi token'ları modelin okuduğu her şeydir: her shell komutunun çıktısı, sizin prompt'unuz, sistem prompt'u ve her çağrıda yeniden gönderilen tüm konuşma geçmişi. Çıktı token'ları modelin yazdığı her şeydir.

rtk'nin kendi dokümantasyonu tam olarak bu ağacı çiziyor ve lansman yazısında hiç bulunmayan bir cümle ekliyor: "Çıktı byte'larını %90 azaltan bir komut, oturumunuzu %90 ucuzlatmaz."

JetBrains, 83 temel oturumu yeniden oynatıp 1,9 milyon karakterlik araç çıktısını ayrıştırarak okuma tarafına sayı koydu.

Modelin okuduğunun dilimi Karakter Pay
rtk'nin sıkıştırabildiği shell çıktısı 373.339 %19,7
rtk'nin kuralı olmayan shell çıktısı 879.326 %46,3
rtk'yi tamamen atlayan dosya okuma ve arama araçları 646.613 %34,0

Modelin okuduğunun yalnızca beşte biri bir shell proxy'siyle sıkıştırılabilir — Claude Code'un yerleşik Read, Grep ve Glob araçları Bash hook'undan hiç geçmez.

Buradan dört aracın haritası çıkıyor: graphify agent'ın okuduğunu küçültür, rtk shell'in geri döndürdüğünü küçültür, Superpowers her görevin taşıdığı geçmişi küçültür ve onu hangi modelin taşıyacağını seçer, caveman ise agent'ın söylediğini küçültür. Okuma tarafı faturanın büyük yarısı olduğundan sıralama oradan başlıyor.

graphify: satır değil, düğüm gez

graphify, bir kod tabanını — dokümanları, SQL şemaları, config dosyaları ve PDF'leriyle birlikte — sorgulanabilir bir bilgi grafiğine çeviren bir skill. Claude Code, Cursor, Codex veya Gemini CLI'da /graphify . yazıyorsunuz, proje bir kez haritalanıyor ve agent bundan sonra dosyaları grep'lemek yerine grafiği sorguluyor.

Kod, yaklaşık 40 dilde tree-sitter AST ile ayrıştırılıyor: deterministik, LLM çağrısı yok, hiçbir şey makineden çıkmıyor. Kurulum sıfır LLM kredisi harcıyor. Üç dosya üretiyor: tıklayarak gezilebilen graph.html, GRAPH_REPORT.md ve grafiğin kendisi olan graph.json — dosyalarınızı yeniden okumadan sorgulanabilir. Her düğüm bir kavram (bir dosya, bir fonksiyon, bir sınıf) ve her kenar etiketli: kaynakta açıkça varsa EXTRACTED, graphify çözdüyse INFERRED. Düğümler Leiden algoritmasıyla alt sistemlere kümeleniyor.

Yerleşik benchmark, kendi projelerimizden birinde çalıştırıldığında:

Metrik Değer
Düğüm 34.031
Kenar 56.865
Tespit edilen topluluk 967
Kenar kökeni %76 EXTRACTED · %24 INFERRED
Tüm külliyatın naif okunması 1.701.550 kelime ≈ 2.268.733 token
Ortalama grafik sorgusu ~24.702 token
Azalma Sorgu başına 91,8× daha az token

Soru bazında aralık geniş: "what is the main entry point" için 679,1×, "what connects the data layer to the api" için 34,0×.

İki sınır. Karşılaştırma her şeyi okumaya karşı yapılıyor ve grep'le yürüyen bir oturum zaten o kadar pahalı değildi, yani gerçek kazanç daha küçük. Ayrıca grafik eskiyor — graphify update <path>, --watch veya git hook'larıyla tazeleyin — ve dokümanlar, PDF'ler ile görseller üzerindeki anlamsal geçiş gerçekten bir model çağırıyor ve gerçekten token harcıyor.

Kurulum: uv tool install graphifyy (paket adında çift y var), ardından graphify install.

rtk: shell proxy'si sınavda

rtk, Claude Code ile shell'iniz arasında duran bir CLI proxy'si. ls, cat veya git status gibi sıradan komutlar, agent'ın girdi token'ı olarak okumak zorunda kaldığı bir sürü gürültü döndürür: dosya izinleri, ilerleme çubukları, geçen yüz satır test. rtk aynı komutu çalıştırır ve kompakt bir sürüm verir: tek bir Rust binary'si, 100'den fazla desteklenen komut, 10 ms'nin altında ek yük. Bir PreToolUse hook'u, uygun her Bash çağrısını çalışmadan önce yeniden yazar (git statusrtk git status), böylece agent'ın bunu hatırlaması gerekmez.

Yazarın lansman yazısı iki haftada 10,2 M token tasarrufu, %89,2 iddia ediyordu; cargo test'in 155 satırdan 3 satıra inmesi gibi örneklerle. 25.599 komut sonrası bizim panelimiz:

Komut Çağrı Kazanılan token Oran
rtk find 354 2,2 M %46,6
rtk read 3.504 2,2 M %10,4
rtk grep 2.760 1,9 M %47,7
rtk ps aux 24 1,1 M %98,0
rtk diff 39 541,1 B %92,2
Toplam 25.599 11,6 M %41,6

Şimdi duruşma. JetBrains rtk'yi tam geldiği haliyle kurdu ve claude-sonnet-5 üzerinde 86 görevi iki kez çalıştırdı.

JetBrains bulgusu Değer
rtk'nin yeniden yazabildiği shell komutları 1.056'nın 349'u (üçte bir)
Toplam tasarrufun tavanı Faturanın ~%3'ü
Görev başına maliyet, düşük reasoning effort +%7,6 (p=0,004)
Görev başına tur +%13,8 (p=0,03)
Görev başına maliyet, yüksek effort ±%0
Görev kalitesi Değişmedi

rtk'nin README'si artık açıkça söylüyor: bash çıktısının %90'ına kadarı, "ki bu faturanızı %90 kesmekle aynı şey değil" ve kendi sayımları bytes / 4 ile tahmin ediliyor.

Karar: ücretsiz, sıkıştırma gerçek ve JetBrains'in deyimiyle "çoğu zaman zevkli". bash ağırlıklı oturumlar için tutun; faturayı oynatmasını beklemeyin.

Superpowers: önce çerçeve, sonra hata yapamayacak kadar küçük görevler

Superpowers, Jesse Vincent'ın Claude Code eklentisi — 280.792 yıldız, on dört skill, tek kurulum komutu (/plugin install superpowers@claude-plugins-official). Hiçbir şeyi sıkıştırmadan token kazandırıyor.

Her şey brainstorming skill'iyle başlıyor; dosya sert bir kapıyla açılıyor: açık bir niyet onaylanana kadar kod yok, iskelet yok, hiçbir uygulama skill'i yok. Skill yüklendiğinde agent bir beyin fırtınası ortağına dönüşüyor ve pratikte, herhangi bir şey inşa edilmeden önce projenin bazı parçaları yeniden düşünülüyor. En önemli aşama bu, çünkü en pahalı token'lar yanlış şeyi inşa etmek için harcananlardır.

Skill işi spike, sınırlı değişiklik veya mimari değişiklik olarak sınıflandırıyor ve kural dosyada yazılı: "İki yol arasında tereddüt edersen ağır olanı seç." Hata biçimine de isim veriyor: "Too Simple To Need Approval" başlıklı bir anti-desen bölümü var. Mimari yol, sizin onayladığınız bir spec ve ardından bir uygulama planı üretiyor.

Güvenilirlik plandan geliyor. writing-plans skill'i işi tek eylemlik, 2 ila 5 dakikalık adımlara bölüyor: başarısız testi yaz, çalıştırıp başarısız olduğunu doğrula, geçiren minimum kodu yaz, testleri tekrar çalıştır, commit et. Planlar, mühendisin sıfır bağlamı olduğu varsayılarak yazılıyor. Bu kadar küçük bir görev taze bir context window'a bolca sığıyor, dolayısıyla agent bir görevin sonuna doymuş bir pencereyle asla varmıyor — ve halüsinasyon kod tam da doymuş pencereden çıkıyor.

Sınır, tören. Dosya bunun göreve göre ölçeklendiğini söylüyor ama kapı tek satırlık bir düzeltmede de devreye giriyor ve o da token demek.

Superpowers: bir görev, bir subagent, uyan bir model

Sonra plan çalışıyor ve token matematiği değişiyor. Bir görev, bir subagent. Her subagent yalnızca kendi görevini içeren taze bir bağlamla başlıyor, oturum geçmişini asla almıyor; böylece orkestratörün penceresi küçük, subagent'ınki temiz kalıyor. Her görevden sonra orkestratör sonucu inceliyor: tamam, sıradaki görev; değilse düzeltme bir subagent'a geri gidiyor. Görev başına en fazla beş tur — 1'den 3'e kadar olan turlar asıl uygulayıcıyla devam ediyor, 4. turda iş daha yetenekli bir modeldeki yeni bir uygulayıcıya geçiyor, 5. turda orkestratör kendisi karar veriyor.

Her şeyin bedelini ödeyen kural model seçimi: "Maliyeti kısmak için her rolü kaldırabilecek en zayıf modeli kullan." Orkestratör her görevin zorluğunu puanlıyor ve ona uyan modeli seçiyor.

Görev tipi Model katmanı
Mekanik, iyi tanımlanmış; kod zaten planda En ucuz / küçük model
Çok dosyalı koordinasyon, hata ayıklama Standart model
Mimari, son branch incelemesi En yetenekli model
Model belirtilmemiş Oturumun modelini devralır

Aynı dosyadan bir nüans: "Tur sayısı, token fiyatını yener." Üç tur süren ucuz bir model ucuz değildir. Pratikte Opus ve Fable'ı 20 $'lık Pro planında kullanılabilir kılan da budur: pahalı model tüm oturum yerine bir avuç göreve dokunur.

Son kazanç dokümantasyon. Her spec ve plan, docs/superpowers/specs/ ve docs/superpowers/plans/YYYY-MM-DD-<feature-name>.md altına kaydedilen ve iş bitiminde commit edilen bir markdown dosyası. Bu kanalın kendi pipeline'ında, mevcut video motorumuza geçiş hâlâ açıp yeni bir oturumda anabileceğiniz ve üzerine ekleyebileceğiniz bir spec ile on dört görevlik bir plan olarak duruyor. Agent'ların yaptığı hiçbir şey kayıt dışı değil.

caveman ve Concise stil: daha az söyle

Son dilim, agent'ın ne söylediği. Agent'lar anlatır — "tabii ki", "yardımcı olmaktan memnuniyet duyarım", "yaşadığınız sorun muhtemelen şundan kaynaklanıyor" — ve bunlar boşa giden çıktı token'larıdır.

caveman, Julius Brussee'nin 102.548 yıldızlı skill'i; agent'ı mağara adamı gibi konuşturuyor: artikelleri, doldurmayı, nezaket kalıplarını ve çekinceleri at, [şey] [eylem] [neden]. [sonraki adım]. kalıbını izle. Kod, komutlar, dosya yolları ve tam hata mesajları asla dokunulmaz; yalnızca etraflarındaki düzyazı kısalır. Üç seviyesi (/caveman lite|full|ultra) ve başlangıçta devreye giren bir SessionStart hook'u var.

Kendi tablosu, Claude API üzerinden on prompt: skill olmadan ortalama 1.214 çıktı token'ı, skill'le 294 — %65, en iyi durum %87, en kötü %22.

Gerçeklik payını README'nin kendisi veriyor: skill yalnızca çıktıyı kısaltıyor, girdi ve akıl yürütme token'ları değişmiyor ve kendi kuralları her turda yaklaşık 1–1,5 bin girdi token'ı yiyor. JetBrains bunu 82 eşleştirilmiş agentic görevde, yaklaşık 106 $ kredi harcayarak ölçtü.

caveman İlan edilen Ölçülen (JetBrains)
Çıktı token tasarrufu %65 %8,5 (592 b → 542 b)
Kaliteye etkisi Tespit edilebilir bozulma yok (işaret testi p=0,82)

Fark yapısal: bir agent'ın çıktısı çoğunlukla kod ve araç çağrılarıdır, caveman da bunlara haklı olarak dokunmaz. JetBrains'in tavsiyesi: "hoşunuza gidiyorsa kullanın. Eğlenceli ve kalite açısından ölçülebilir hiçbir bedeli yok."

Ayrıca Claude Code v2.1.237'den beri yerleşik bir karşılığı var: Concise çıktı stili. Claude "sonuçla başlar, girizgâhı ve anlatımı atlar ve yanıtları varsayılan olarak kısa tutar". /config → Output style'dan seçilir; .claude/settings.local.json dosyasına kaydedilir ve /clear sonrası veya yeni bir oturumda etkili olur. İkisinin ortak sınırı: çıktı stilleri yalnızca ana konuşmaya uygulanır — bir subagent kendi sistem prompt'uyla çalışır.

Karar: faturayı ne oynatıyor, kenarları ne oynatıyor

Her aracın gerçekte neyi oynattığına göre sıralama ve taşıdığı bedel.

Sıra Araç Neyi oynatıyor Ölçülen etki Bedeli
1 Superpowers Görev başına geçmiş + onu hangi modelin okuduğu Pahalı model tüm oturum yerine bir avuç görevde Her görevde bir kapı, tek satırlık düzeltmelerde bile
2 graphify Agent'ın okuduğu Külliyatın naif okunmasına göre sorgu başına 91,8× daha az token (bizim projemiz) Grafik eskiyor; anlamsal geçiş token harcıyor
3 rtk bash çıktı byte'ları Tavan faturanın ~%3'ü; JetBrains testinde düşük effort'ta görev başına +%7,6 Shell komutlarının yalnızca üçte birinin kuralı var
4 caveman / Concise Agent'ın yazdığı düzyazı Çıktı token'larının %8,5'i, kalite kaybı yok Her turda ~1–1,5 bin girdi token'ı

Superpowers kazanıyor ve bunu herhangi bir sıkıştırma sayesinde yapmıyor: görev başına taze bağlam ve işi yapabilecek en ucuz model, neyin okunduğunu ve kimin okuduğunu değiştiriyor. graphify ikinci, çünkü daha az okumak faturanın büyük yarısı. rtk gerçek, ücretsiz ve zararsız, ama shell komutlarının üçte ikisi ve tüm dosya okumaları onun yanından geçiyor. caveman veya Claude Code'un artık birlikte getirdiği Concise stili en küçük dilimi buduyor.

Dördü de ücretsiz kurulur — graphify ve rtk Apache-2.0, Superpowers MIT, caveman skill'i MIT. 570.000'den fazla yıldız, insanların bir mucize istediğini söylüyor. Dürüst sürümü bir sıralama.

Kaynaklar

Sık sorulan sorular

Claude Code'da token biriktirmenin en iyi yolu nedir?
Metni sıkıştırmak yerine agent'ın neyi okuduğunu ve hangi modelin okuduğunu değiştirmek. Superpowers eklentisi her göreve yalnızca o görevi içeren taze bir subagent bağlamı verir ve işi kaldırabilecek en zayıf modeli atar. Bu, herhangi bir çıktı sıkıştırıcısından çok daha fazla faturayı oynatır.
rtk gerçekten Claude Code maliyetini düşürüyor mu?
Neredeyse hiç. Shell çıktısını sıkıştırması gerçek, ama JetBrains shell komutlarının yalnızca üçte birinin kuralı olduğunu ve modelin okuduğunun yalnızca beşte birinin sıkıştırılabilir olduğunu buldu; bu da tasarrufu faturanın yaklaşık %3'ünde sınırlıyor. 86 görevlik A/B testlerinde rtk düşük reasoning effort'ta görev başına %7,6 daha pahalı, yüksek effort'ta ise eşit çıktı, kalite değişmedi.
Fatura düşmüyorsa rtk neden milyonlarca token tasarrufu bildiriyor?
rtk, kaldırdığı bash çıktı byte'larını bytes/4 tahminiyle sayıyor, parayı değil. Panelimiz 25.599 komutta 11,6 M token tasarrufu (%41,6) gösteriyor. Kendi dokümantasyonu bunu doğrudan söylüyor: %90 daha az byte gösteren bir komut oturumunuzu %90 ucuzlatmaz.
graphify nedir ve token kazandırır mı?
graphify, bir kod tabanını tree-sitter ile yerelde ayrıştırıp sorgulanabilir bir bilgi grafiğine çeviren bir /graphify skill'i; LLM çağrısı yok ve kurulum sıfır kredi. Agent bundan sonra dosyaları grep'lemek yerine mantıksal düğümleri geziyor. Projemizde yerleşik benchmark, tüm külliyatı okumaya kıyasla sorgu başına 91,8× daha az token ölçtü; ancak bu referans naif bir tam okuma, grep'le yürüyen bir oturum değil.
caveman skill'i kurmaya değer mi?
Yalnızca hoşunuza gidiyorsa. %65 kesinti ilan ediyor ama JetBrains 82 eşleştirilmiş görevde çıktı token'larının %8,5'ini ölçtü ve tespit edilebilir bir kalite kaybı bulmadı; çünkü kod ve araç çağrıları haklı olarak dokunulmadan bırakılıyor. Ayrıca kendi kuralları her turda yaklaşık 1 ila 1,5 bin girdi token'ı ekliyor.
Claude Code'daki Concise çıktı stili nedir?
Claude Code v2.1.237'den beri gelen yerleşik bir çıktı stili: Claude sonuçla başlar, girizgâhı ve anlatımı atlar ve yanıtları kısa tutar. /config üzerinden seçilir, .claude/settings.local.json dosyasına kaydedilir ve yalnızca ana konuşmaya uygulanır — subagent'lar kendi sistem prompt'unu korur.
Superpowers, Opus veya Fable'ı 20 $'lık planda nasıl kullanılabilir kılıyor?
subagent-driven-development skill'i orkestratöre her rolü kaldırabilecek en zayıf modeli kullanmasını söylüyor: iyi tanımlanmış mekanik görevler için en ucuz katman, çok dosyalı iş ve hata ayıklama için standart model, mimari ve son inceleme için ise en yetenekli model. Böylece pahalı model tüm oturum yerine bir avuç göreve dokunuyor.

İlgili videolar