JetBrains hayır diyor, makinem 11,6 milyon diyor
Temmuz 2026'da JetBrains, on binlerce geliştiricinin Claude Code'da token biriktirmek için kurduğu shell proxy'si rtk'yi sınamak için yaklaşık 320 $ API kredisi — 425 faturalanan deneme — harcadı. Sonuç: oturumlar görev başına %7,6 daha pahalıya çıktı. İki hafta önce aynı ekip, tokenların %65'ini kestiğini iddia eden caveman skill'ini ölçmüş ve %8,5 bulmuştu. Kendi makinemde ise rtk gain, 25.599 komutta 11,6 milyon token tasarrufu bildiriyor.
Her iki sayı da gerçek. Sadece aynı şeyi ölçmüyorlar: biri tamamlanan görev başına maliyet, diğeri bash çıktısının byte'ları.
| Sayı | Neyi ölçüyor | Kaynak |
|---|---|---|
| Görev başına +%7,6 (p=0,004) | rtk kuruluyken bir görevin uçtan uca maliyeti | JetBrains, 425 deneme, ~320 $ |
| Çıktı token'larının %8,5'i | caveman'ın agentic işte ölçülen tasarrufu | JetBrains, 82 eşleştirilmiş görev |
| %65 | caveman'ın ilan ettiği tasarruf | caveman README |
| 11,6 M tasarruf (%41,6) | rtk'nin sıkıştırdığı bash çıktı byte'ları | rtk gain, 25.599 komut |
İşte dört araçlık yığın: graphify, rtk, Superpowers ve caveman; 2026-09-02 itibarıyla toplam 575.612 GitHub yıldızı. Her biri faturanın farklı bir dilimine dokunuyor.
| Araç | Yıldız (2026-09-02) | Dil | Lisans |
|---|---|---|---|
| Superpowers | 280.792 | Markdown skill | MIT |
| graphify | 113.946 | Python | Apache-2.0 |
| caveman | 102.548 | Go | MIT (skill) |
| rtk | 78.326 | Rust | Apache-2.0 |
Token'lar aslında nereye gidiyor
Claude Code faturasının iki yüzü var. Girdi token'ları modelin okuduğu her şeydir: her shell komutunun çıktısı, sizin prompt'unuz, sistem prompt'u ve her çağrıda yeniden gönderilen tüm konuşma geçmişi. Çıktı token'ları modelin yazdığı her şeydir.
rtk'nin kendi dokümantasyonu tam olarak bu ağacı çiziyor ve lansman yazısında hiç bulunmayan bir cümle ekliyor: "Çıktı byte'larını %90 azaltan bir komut, oturumunuzu %90 ucuzlatmaz."
JetBrains, 83 temel oturumu yeniden oynatıp 1,9 milyon karakterlik araç çıktısını ayrıştırarak okuma tarafına sayı koydu.
| Modelin okuduğunun dilimi | Karakter | Pay |
|---|---|---|
| rtk'nin sıkıştırabildiği shell çıktısı | 373.339 | %19,7 |
| rtk'nin kuralı olmayan shell çıktısı | 879.326 | %46,3 |
| rtk'yi tamamen atlayan dosya okuma ve arama araçları | 646.613 | %34,0 |
Modelin okuduğunun yalnızca beşte biri bir shell proxy'siyle sıkıştırılabilir — Claude Code'un yerleşik Read, Grep ve Glob araçları Bash hook'undan hiç geçmez.
Buradan dört aracın haritası çıkıyor: graphify agent'ın okuduğunu küçültür, rtk shell'in geri döndürdüğünü küçültür, Superpowers her görevin taşıdığı geçmişi küçültür ve onu hangi modelin taşıyacağını seçer, caveman ise agent'ın söylediğini küçültür. Okuma tarafı faturanın büyük yarısı olduğundan sıralama oradan başlıyor.
graphify: satır değil, düğüm gez
graphify, bir kod tabanını — dokümanları, SQL şemaları, config dosyaları ve PDF'leriyle birlikte — sorgulanabilir bir bilgi grafiğine çeviren bir skill. Claude Code, Cursor, Codex veya Gemini CLI'da /graphify . yazıyorsunuz, proje bir kez haritalanıyor ve agent bundan sonra dosyaları grep'lemek yerine grafiği sorguluyor.
Kod, yaklaşık 40 dilde tree-sitter AST ile ayrıştırılıyor: deterministik, LLM çağrısı yok, hiçbir şey makineden çıkmıyor. Kurulum sıfır LLM kredisi harcıyor. Üç dosya üretiyor: tıklayarak gezilebilen graph.html, GRAPH_REPORT.md ve grafiğin kendisi olan graph.json — dosyalarınızı yeniden okumadan sorgulanabilir. Her düğüm bir kavram (bir dosya, bir fonksiyon, bir sınıf) ve her kenar etiketli: kaynakta açıkça varsa EXTRACTED, graphify çözdüyse INFERRED. Düğümler Leiden algoritmasıyla alt sistemlere kümeleniyor.
Yerleşik benchmark, kendi projelerimizden birinde çalıştırıldığında:
| Metrik | Değer |
|---|---|
| Düğüm | 34.031 |
| Kenar | 56.865 |
| Tespit edilen topluluk | 967 |
| Kenar kökeni | %76 EXTRACTED · %24 INFERRED |
| Tüm külliyatın naif okunması | 1.701.550 kelime ≈ 2.268.733 token |
| Ortalama grafik sorgusu | ~24.702 token |
| Azalma | Sorgu başına 91,8× daha az token |
Soru bazında aralık geniş: "what is the main entry point" için 679,1×, "what connects the data layer to the api" için 34,0×.
İki sınır. Karşılaştırma her şeyi okumaya karşı yapılıyor ve grep'le yürüyen bir oturum zaten o kadar pahalı değildi, yani gerçek kazanç daha küçük. Ayrıca grafik eskiyor — graphify update <path>, --watch veya git hook'larıyla tazeleyin — ve dokümanlar, PDF'ler ile görseller üzerindeki anlamsal geçiş gerçekten bir model çağırıyor ve gerçekten token harcıyor.
Kurulum: uv tool install graphifyy (paket adında çift y var), ardından graphify install.
rtk: shell proxy'si sınavda
rtk, Claude Code ile shell'iniz arasında duran bir CLI proxy'si. ls, cat veya git status gibi sıradan komutlar, agent'ın girdi token'ı olarak okumak zorunda kaldığı bir sürü gürültü döndürür: dosya izinleri, ilerleme çubukları, geçen yüz satır test. rtk aynı komutu çalıştırır ve kompakt bir sürüm verir: tek bir Rust binary'si, 100'den fazla desteklenen komut, 10 ms'nin altında ek yük. Bir PreToolUse hook'u, uygun her Bash çağrısını çalışmadan önce yeniden yazar (git status → rtk git status), böylece agent'ın bunu hatırlaması gerekmez.
Yazarın lansman yazısı iki haftada 10,2 M token tasarrufu, %89,2 iddia ediyordu; cargo test'in 155 satırdan 3 satıra inmesi gibi örneklerle. 25.599 komut sonrası bizim panelimiz:
| Komut | Çağrı | Kazanılan token | Oran |
|---|---|---|---|
rtk find |
354 | 2,2 M | %46,6 |
rtk read |
3.504 | 2,2 M | %10,4 |
rtk grep |
2.760 | 1,9 M | %47,7 |
rtk ps aux |
24 | 1,1 M | %98,0 |
rtk diff |
39 | 541,1 B | %92,2 |
| Toplam | 25.599 | 11,6 M | %41,6 |
Şimdi duruşma. JetBrains rtk'yi tam geldiği haliyle kurdu ve claude-sonnet-5 üzerinde 86 görevi iki kez çalıştırdı.
| JetBrains bulgusu | Değer |
|---|---|
| rtk'nin yeniden yazabildiği shell komutları | 1.056'nın 349'u (üçte bir) |
| Toplam tasarrufun tavanı | Faturanın ~%3'ü |
| Görev başına maliyet, düşük reasoning effort | +%7,6 (p=0,004) |
| Görev başına tur | +%13,8 (p=0,03) |
| Görev başına maliyet, yüksek effort | ±%0 |
| Görev kalitesi | Değişmedi |
rtk'nin README'si artık açıkça söylüyor: bash çıktısının %90'ına kadarı, "ki bu faturanızı %90 kesmekle aynı şey değil" ve kendi sayımları bytes / 4 ile tahmin ediliyor.
Karar: ücretsiz, sıkıştırma gerçek ve JetBrains'in deyimiyle "çoğu zaman zevkli". bash ağırlıklı oturumlar için tutun; faturayı oynatmasını beklemeyin.
Superpowers: önce çerçeve, sonra hata yapamayacak kadar küçük görevler
Superpowers, Jesse Vincent'ın Claude Code eklentisi — 280.792 yıldız, on dört skill, tek kurulum komutu (/plugin install superpowers@claude-plugins-official). Hiçbir şeyi sıkıştırmadan token kazandırıyor.
Her şey brainstorming skill'iyle başlıyor; dosya sert bir kapıyla açılıyor: açık bir niyet onaylanana kadar kod yok, iskelet yok, hiçbir uygulama skill'i yok. Skill yüklendiğinde agent bir beyin fırtınası ortağına dönüşüyor ve pratikte, herhangi bir şey inşa edilmeden önce projenin bazı parçaları yeniden düşünülüyor. En önemli aşama bu, çünkü en pahalı token'lar yanlış şeyi inşa etmek için harcananlardır.
Skill işi spike, sınırlı değişiklik veya mimari değişiklik olarak sınıflandırıyor ve kural dosyada yazılı: "İki yol arasında tereddüt edersen ağır olanı seç." Hata biçimine de isim veriyor: "Too Simple To Need Approval" başlıklı bir anti-desen bölümü var. Mimari yol, sizin onayladığınız bir spec ve ardından bir uygulama planı üretiyor.
Güvenilirlik plandan geliyor. writing-plans skill'i işi tek eylemlik, 2 ila 5 dakikalık adımlara bölüyor: başarısız testi yaz, çalıştırıp başarısız olduğunu doğrula, geçiren minimum kodu yaz, testleri tekrar çalıştır, commit et. Planlar, mühendisin sıfır bağlamı olduğu varsayılarak yazılıyor. Bu kadar küçük bir görev taze bir context window'a bolca sığıyor, dolayısıyla agent bir görevin sonuna doymuş bir pencereyle asla varmıyor — ve halüsinasyon kod tam da doymuş pencereden çıkıyor.
Sınır, tören. Dosya bunun göreve göre ölçeklendiğini söylüyor ama kapı tek satırlık bir düzeltmede de devreye giriyor ve o da token demek.
Superpowers: bir görev, bir subagent, uyan bir model
Sonra plan çalışıyor ve token matematiği değişiyor. Bir görev, bir subagent. Her subagent yalnızca kendi görevini içeren taze bir bağlamla başlıyor, oturum geçmişini asla almıyor; böylece orkestratörün penceresi küçük, subagent'ınki temiz kalıyor. Her görevden sonra orkestratör sonucu inceliyor: tamam, sıradaki görev; değilse düzeltme bir subagent'a geri gidiyor. Görev başına en fazla beş tur — 1'den 3'e kadar olan turlar asıl uygulayıcıyla devam ediyor, 4. turda iş daha yetenekli bir modeldeki yeni bir uygulayıcıya geçiyor, 5. turda orkestratör kendisi karar veriyor.
Her şeyin bedelini ödeyen kural model seçimi: "Maliyeti kısmak için her rolü kaldırabilecek en zayıf modeli kullan." Orkestratör her görevin zorluğunu puanlıyor ve ona uyan modeli seçiyor.
| Görev tipi | Model katmanı |
|---|---|
| Mekanik, iyi tanımlanmış; kod zaten planda | En ucuz / küçük model |
| Çok dosyalı koordinasyon, hata ayıklama | Standart model |
| Mimari, son branch incelemesi | En yetenekli model |
| Model belirtilmemiş | Oturumun modelini devralır |
Aynı dosyadan bir nüans: "Tur sayısı, token fiyatını yener." Üç tur süren ucuz bir model ucuz değildir. Pratikte Opus ve Fable'ı 20 $'lık Pro planında kullanılabilir kılan da budur: pahalı model tüm oturum yerine bir avuç göreve dokunur.
Son kazanç dokümantasyon. Her spec ve plan, docs/superpowers/specs/ ve docs/superpowers/plans/YYYY-MM-DD-<feature-name>.md altına kaydedilen ve iş bitiminde commit edilen bir markdown dosyası. Bu kanalın kendi pipeline'ında, mevcut video motorumuza geçiş hâlâ açıp yeni bir oturumda anabileceğiniz ve üzerine ekleyebileceğiniz bir spec ile on dört görevlik bir plan olarak duruyor. Agent'ların yaptığı hiçbir şey kayıt dışı değil.
caveman ve Concise stil: daha az söyle
Son dilim, agent'ın ne söylediği. Agent'lar anlatır — "tabii ki", "yardımcı olmaktan memnuniyet duyarım", "yaşadığınız sorun muhtemelen şundan kaynaklanıyor" — ve bunlar boşa giden çıktı token'larıdır.
caveman, Julius Brussee'nin 102.548 yıldızlı skill'i; agent'ı mağara adamı gibi konuşturuyor: artikelleri, doldurmayı, nezaket kalıplarını ve çekinceleri at, [şey] [eylem] [neden]. [sonraki adım]. kalıbını izle. Kod, komutlar, dosya yolları ve tam hata mesajları asla dokunulmaz; yalnızca etraflarındaki düzyazı kısalır. Üç seviyesi (/caveman lite|full|ultra) ve başlangıçta devreye giren bir SessionStart hook'u var.
Kendi tablosu, Claude API üzerinden on prompt: skill olmadan ortalama 1.214 çıktı token'ı, skill'le 294 — %65, en iyi durum %87, en kötü %22.
Gerçeklik payını README'nin kendisi veriyor: skill yalnızca çıktıyı kısaltıyor, girdi ve akıl yürütme token'ları değişmiyor ve kendi kuralları her turda yaklaşık 1–1,5 bin girdi token'ı yiyor. JetBrains bunu 82 eşleştirilmiş agentic görevde, yaklaşık 106 $ kredi harcayarak ölçtü.
| caveman | İlan edilen | Ölçülen (JetBrains) |
|---|---|---|
| Çıktı token tasarrufu | %65 | %8,5 (592 b → 542 b) |
| Kaliteye etkisi | — | Tespit edilebilir bozulma yok (işaret testi p=0,82) |
Fark yapısal: bir agent'ın çıktısı çoğunlukla kod ve araç çağrılarıdır, caveman da bunlara haklı olarak dokunmaz. JetBrains'in tavsiyesi: "hoşunuza gidiyorsa kullanın. Eğlenceli ve kalite açısından ölçülebilir hiçbir bedeli yok."
Ayrıca Claude Code v2.1.237'den beri yerleşik bir karşılığı var: Concise çıktı stili. Claude "sonuçla başlar, girizgâhı ve anlatımı atlar ve yanıtları varsayılan olarak kısa tutar". /config → Output style'dan seçilir; .claude/settings.local.json dosyasına kaydedilir ve /clear sonrası veya yeni bir oturumda etkili olur. İkisinin ortak sınırı: çıktı stilleri yalnızca ana konuşmaya uygulanır — bir subagent kendi sistem prompt'uyla çalışır.
Karar: faturayı ne oynatıyor, kenarları ne oynatıyor
Her aracın gerçekte neyi oynattığına göre sıralama ve taşıdığı bedel.
| Sıra | Araç | Neyi oynatıyor | Ölçülen etki | Bedeli |
|---|---|---|---|---|
| 1 | Superpowers | Görev başına geçmiş + onu hangi modelin okuduğu | Pahalı model tüm oturum yerine bir avuç görevde | Her görevde bir kapı, tek satırlık düzeltmelerde bile |
| 2 | graphify | Agent'ın okuduğu | Külliyatın naif okunmasına göre sorgu başına 91,8× daha az token (bizim projemiz) | Grafik eskiyor; anlamsal geçiş token harcıyor |
| 3 | rtk | bash çıktı byte'ları | Tavan faturanın ~%3'ü; JetBrains testinde düşük effort'ta görev başına +%7,6 | Shell komutlarının yalnızca üçte birinin kuralı var |
| 4 | caveman / Concise | Agent'ın yazdığı düzyazı | Çıktı token'larının %8,5'i, kalite kaybı yok | Her turda ~1–1,5 bin girdi token'ı |
Superpowers kazanıyor ve bunu herhangi bir sıkıştırma sayesinde yapmıyor: görev başına taze bağlam ve işi yapabilecek en ucuz model, neyin okunduğunu ve kimin okuduğunu değiştiriyor. graphify ikinci, çünkü daha az okumak faturanın büyük yarısı. rtk gerçek, ücretsiz ve zararsız, ama shell komutlarının üçte ikisi ve tüm dosya okumaları onun yanından geçiyor. caveman veya Claude Code'un artık birlikte getirdiği Concise stili en küçük dilimi buduyor.
Dördü de ücretsiz kurulur — graphify ve rtk Apache-2.0, Superpowers MIT, caveman skill'i MIT. 570.000'den fazla yıldız, insanların bir mucize istediğini söylüyor. Dürüst sürümü bir sıralama.
AIDive