Sekiz repo, bir proje, 87 çalıştırma
Bu ay Claude Code temel araçları listelerinin hepsinde sekiz GitHub reposu var: Chisle, Ouroboros, Reticle, Caliper, Anti-Slop, UI Skills, img2threejs ve FWC SwiftUI Skills. Toplamda 37.000'in üzerinde yıldızları var. Bu listeler her reponun ne vaat ettiğini ve nasıl kurulduğunu anlatıyor. Kimse bunların hepsini birlikte kurup ölçmüyor.
Bu yüzden sekizi de tek bir gerçek projeye kuruldu: 111 testi geçen bir React uygulaması. Bunlardan biri kendini makinedeki dokuz başka AI aracının ayarlarına yazdı. Biri kaynak kodundaki tek bir satır yüzünden hiç çalıştırılmadı. Ve üçü, 63 çalıştırma boyunca bir kez bile çağrılmayan bir sunucuyu Claude Code'a bağladı.
| Test | Değer |
|---|---|
| Kurulan repo sayısı | 8 |
| Toplam çalıştırma | 87 |
| Toplam harcama | yaklaşık 6 dolar |
| Proje | 1 React uygulaması, 111 geçen test |
| Model | 1 |
| Süre | 1 gün |
Gerisini üç soru yönlendiriyor: her reponun başlangıçta neye mal olduğu, çıktıda gerçekten neyin değiştiği ve hangilerinin tutmaya değdiği.
Yazmadan önce her birinin maliyeti
Başlangıç maliyeti, Claude Code'un ilk mesajından önce context'e yüklediği şeydir. Boş bir projede bu yaklaşık 17.000 token'dır ve bunun bedelini her turda ödersiniz. Bir kurulumu ölçmek için Claude'a tek bir kelimeyle yanıt vermesi söylendi ve fatura okundu. Birim token'dır, dolar değil: iki özdeş çalıştırma, sadece önbellekleme yüzünden fiyatta 10 kat fark edebilir.
| Kurulum | Eklenen başlangıç token'ı |
|---|---|
| Chisle | yaklaşık 3.500 |
| Ouroboros | yaklaşık 1.600 |
| Reticle | yaklaşık 900 |
| img2threejs (33 KB talimat dosyası) | 107 |
| Anti-Slop (yardımcı skill) | 95 |
| UI Skills | 37 |
| Geri kalan her biri | 100 ila 300 arası |
| Sekizi birlikte | 7.000'in altında |
Sekizden ikisi zaten bir web geliştiricisi için değil. img2threejs bir fotoğrafı 3D sahneye çeviriyor, FWC SwiftUI Skills ise Apple uygulamaları için. Sadece maliyetleri ölçüldü. 3D skill'i 33 kilobaytlık bir talimat dosyası taşıyor ve yine de 107 token'a mal oluyor, çünkü siz çağırana kadar sadece bir skill'in açıklaması yükleniyor.
Sunucular da ucuzladı. Claude Code artık bir sunucunun sadece araç isimlerini yüklüyor ve ayrıntıları talep üzerine getiriyor. Bu, araç başına yaklaşık 45 token demek, aracın ne yaptığından bağımsız olarak. Sekizi de kurulunca maliyetler basitçe toplanıyor. Hiçbir şey çarpılmıyor.
Claude Code'un bir plugin için bu maliyeti öngören bir komutu var ve hook'ları ücretsiz olarak listeliyor. Bu makinede her gün kullanılan bir plugin için yaklaşık 540 token öngördü. Ölçüm 744 çıktı, çünkü başlangıç hook'u doğrudan oturuma yazdırıyor.
Başlangıç, bu reponların pahalılaştığı yer değil. Turlar öyle.
Aynı görevler, kurulu ve kurulu değilken
Bu karşılaştırma, bir geliştiricinin gerçekten devredeceği üç görev üzerine kuruldu: bir web adresinin oluşturulmasındaki bir hata, okuma süresini gösteren bir özellik ve bir formda karakter sayacı. Her görev bir repo kurulu, sekizi de kurulu ve hiçbiri kurulu değilken çalıştırıldı, her seferinde üç kez. Hakem, ajanın hiç görmediği bir test artı projenin kendi test paketi artı tip denetleyicisi. Her çalıştırma izin atlaması olmadan aynı sabit izinli araç listesini kullandı.
| Sonuç | Değer |
|---|---|
| Görev çalıştırması | 63 |
| Geçen | 63 |
| Yeni tip hatası | 0 |
| Bağlı üç sunucuya yapılan çağrı | 0 |
| Hata düzeltme, referans | 7 tur, 27 saniye |
| Form görevi, referans | 22 tur, yaklaşık 1 dakika |
Hiçbir şey Claude'un bir görevi başarısız olmasına neden olmadı, hiçbir şey de onsuz başarısız olacağı bir görevi geçmesini sağlamadı.
Bu reponlardan üçü araçlarla dolu bir sunucuya bağlanıyor. 63 çalıştırmada Claude bu araçları sıfır kez çağırdı. Buna, tasarım tavsiyesi ve görsel testin bir işi olsun diye yazılan form görevi de dahil. Adil olmak gerekirse, ikisi hiç gerçek işini yapamadı. Reticle, çalışan uygulamanıza eşlenmiş bir tarayıcıya ihtiyaç duyuyor ve o eşleşme çöktü. Ouroboros ise tüm makine genelinde bir kuruluma ihtiyaç duyuyor ve buna izin verilmedi.
Gürültü çok büyük. Aynı prompt, aynı kurulum: bir çalıştırma 4.300 token yazdı, bir diğeri 7.100. Sadece iki sonuç kendi gürültüsünü yendi, ikisi de en kısa görevde. Tek bir öncesi-sonrası gösterimi hiçbir şey kanıtlamaz.
Chisle'ın yüzde 52'si, gerçek kodlama işinde
Chisle bir çıktı sıkıştırma plugin'i ve sekizden bir rakam vaat eden tek repo: benchmark'ı faturanızın yüzde 52'ye düştüğünü söylüyor. Üç görevde çıktı, referansın yüzde 94'ünde geldi. README bunun nedenini kendi sözleriyle açıklıyor: bu rakamlar araçsız tekil promptlar, tüm oturum maliyeti değil.
| Ölçüm | Değer |
|---|---|
| Chisle'ın benchmark iddiası | çıktı %52 |
| Chisle'ın üç görevdeki sonucu | referansın %94'ü |
| Günlük kullanılan özetleme plugin'i, aynı görevler | %113, gürültü sınırları içinde |
| Bir hata düzeltmesi: okunan token | 95.000 |
| Bir hata düzeltmesi: yazılan token | 1.700 |
Gerçek bir kodlama oturumunda çıktı, faturanın küçük tarafı. Chisle kurallarını başlangıçta yüklüyor ve gönderdiğiniz her prompta bir hatırlatma ekliyor, bu yüzden çalıştırmaları üç görevden ikisinde referanstan daha pahalıya mal oluyor. Kurallar, tasarruf ettirdikleri kelimelerden daha ağır basıyor. Araç çıktısı için sıkıştırıcısı her oturumda çalıştı ve hiç tasarruf kaydetmedi.
Hiçbir plugin ölçülebilir bir şey tasarruf etmedi. Bir Chisle kullanıcısı 173 oturum boyunca aynı şeyi buldu, yazar da bu hatanın düzeltildiğini söylüyor. Hakkını vermek gerekirse, Chisle kendi kayıplarını da yayınlıyor ve dosya işleme kısmı özenle sağlamlaştırılmış.
Buradan çıkarılacak kural: her turda konuşan bir plugin, en pahalı türdür.
Projenin dışına taşan kurulumlar
Kurulum kapsamı, bir reponun kurulumunun çalıştırdığınız klasörün ötesine ne kadar uzandığıdır. Buradaki her şey, makinenin geri kalanına dokunulmasın diye bilerek tek bir klasörün içine kuruldu.
Reticle'ın kurulum komutunun başka planları vardı. Kendi kaydı 8 ajana daha kaydolduğunu söylüyor: VS Code, Copilot, Warp, Kiro, Amazon Q, Cline, Amp ve bir tane daha. Gemini'de kendini önceden onayladı. Claude Code ayarlarında ise kendi araçlarını onaylayan bir kural ekledi. Bunların hiçbiri gizli değil, hepsi doğrudan kaynak kodunda, kurulum programı ne yaptığı konusunda açık sözlü ve bir kaldırma komutu da sunuyor. Ama ona tek bir proje için tek bir "evet" bayrağı verildi.
Caliper'ın ölçüm aracı olması bekleniyordu. Harness'i, değiştirme seçeneği olmadan her izin kontrolünü kapatarak Claude'u başlatıyor ve giriş bilgilerinizi her test çalıştırmasına kopyalıyor. Hiç çalıştırılmadı; onun yerine özel bir çalıştırıcı kullanıldı.
| Repo | Bir proje içinde temiz kuruluyor mu? | Notlar |
|---|---|---|
| Anti-Slop | Evet | Sadece dosya kopyalıyor, başka bir şey yapmıyor |
| UI Skills | Evet | Uzaktan skill kütüphanesi |
| img2threejs | Evet | Bir skill |
| FWC SwiftUI Skills | Evet | Düz metin |
| Reticle | Kısmen | 8 başka ajana kaydoldu, kendi kendini onaylayan kural |
| Chisle | Hayır | Sadece global, başlangıçta güncelleme kontrolü yapıyor, ham araç çıktısını diske kaydediyor |
| Ouroboros | Hayır | Sadece makine geneli, varsayılan olarak kullanım raporluyor, kurulum programı internetten bir betiği shell'inize aktarabiliyor |
| Caliper | Çalıştırılmadı | İzin kontrolleri kapalı, giriş bilgileri her çalıştırmaya kopyalanıyor |
Bunların hiçbiri kötü amaçlı yazılım değil. Aracı her yerde istediğinizi varsayan bir kolaylık. Herhangi bir kurulumdan önce üç şeyi açın: hook'ları, kurulum betiğini ve sunucu ayarlarını.
Sekizi bir arada ne yapıyor
Yığılma, sekizinin de birlikte kurulması demek: çökme yok, hata yok ve maliyetler neredeyse tam olarak toplanıyor. Bir tuzak bir saat kaybettirdi. Betikli çalıştırmalarda, bir proje sunucusu kimsenin veremeyeceği bir onayı bekliyor, bu yüzden neredeyse bedavaymış gibi görünüyor. Buradaki her sunucu rakamı, bu düzeltildikten sonra yeniden ölçüldü.
Repolar hook'larda buluşuyor. Hook, Claude Code'un belirli bir anda çalıştırdığı bir betik ve yazdırdığı her şey modelin önüne düşebiliyor. Bu araçlardan üçü bağlıyken, başlangıçta üç betik ve her promptta üç betik daha çalışıyor. Sıradan yazılmış bir cümle, modele iki not eklenmiş şekilde ulaştı: biri kısa yazmasını söylüyor, diğeri bir proje içinde tamamlanamayacak bir kurulum adımı talep ediyor. O ikinci not, anahtar kelimelerinden birini içeren her promptta geri geliyor.
Araç isimleri çakışamaz, çünkü her sunucu kendi ismini önek olarak ekliyor. Hook'lar için dokümantasyon bunu doğruluyor: birden fazla hook context ekleyince, Claude bunların hepsini alıyor.
Mayıs 2026'dan bir çalışma, büyük bir skill yığınının bir ajana ne yaptığını ölçtü. Yaklaşık 200 skill'le geçme oranı yüzde 21'e kadar düştü ve bu kaybın çoğu ajanın doğru skill yerine benzer görünen bir tanesini seçmesinden kaynaklanıyor. Sekiz repo, 10 skill demek, buna hiç yaklaşmıyor bile. Onlarca skill kurulu olanlar için durum farklı.
Kodu değiştiren tek repo
Anti-Slop, projenize kopyaladığınız bir dizi lint kuralı, bir plugin değil. Kurulacak bir paket yok; yazar kuralları kopyalayıp değiştirmenizi istiyor. Bir linter kodunuzu modelin dışında okur, bu yüzden context'e mal olmaz: yardımcı skill'i için 95 token, tur başına ise hiç.
Form görevinde Claude'un yeni bir alanı bir bileşen boyunca bağlaması gerekiyordu. Üstteki satırı, güvensiz tip dönüşümüyle birlikte kopyaladı. Anti-Slop bunu üç çalıştırmanın üçünde de işaretledi. Bu, bir incelemecinin komşularına benzediği için göz ardı edeceği türden bir şey.
| Anti-Slop bulgusu | Değer |
|---|---|
| İşaretlenen güvensiz tip dönüşümü | 3 çalıştırmanın 3'ü |
| Doğru altı satırlık bir fonksiyonda işaretlenen eksik boş satır | 3 çalıştırmanın 2'si |
| Dokunulmamış projedeki bulgular | 109 |
| Bunların iki stil kuralından gelen payı | %83 |
| Diğer kurallar | %16 |
Boş satır bulgusu bir hata değil, bir zevk meselesi ve linter aynı anda sadece bir dosya okuyor. Maliyet ilk günden ortaya çıkıyor: diğer 16 kuralı yargılamadan önce bu iki stil kuralına karar verin. Bir tuzak: kurallar modül olarak paketleniyor, bu yüzden projenizin de kendini modül olarak tanımlaması gerekiyor, yoksa linter çöküyor.
UI Skills tutması en ucuz olanı: 37 token karşılığında uzaktan bir tasarım skill kütüphanesi ve bu çalıştırmalarda sıfır çağrı. Temmuz'da 18 ölü bağlantısı vardı. Videonun çekildiği sabah 300'ünün hepsi test edildi ve hiçbiri kırık değil.
Neyi tutuyorum, kendi kurulumunu nasıl denetlersin
Sekiz repo sıralandı. Beklenti üç tane hak edeni bulmaktı. Veri bir tane hak edeni ve tutulması serbest üç tane veriyor.
| Repo | Karar |
|---|---|
| Anti-Slop | Hak etti: neredeyse bedavaya gerçek bir hatayı her seferinde yakaladı |
| UI Skills | Tutulması serbest: 37 token, hiçbir şeyle çakışmıyor |
| img2threejs, FWC SwiftUI Skills | Onları hiç çağıracaksanız tutulması serbest: birlikte birkaç yüz token |
| Chisle | Gerçek kodlama işinde tasarruf ettirdiğinden daha çok maliyete neden oldu |
| Caliper | Hiç çalıştırılmadı |
| Reticle, Ouroboros | Tüm makineyi istiyor, gerçek işlerini yaparken hiç görülmediler, ne için oldukları konusunda karar yok |
Ouroboros'un kendi bakımcısı, çalıştırmalarının yaklaşık yüzde 40'ının başarısız olduğunu sayıyor.
Sınırlar önemli: bir React projesi, bir model, üç görev, her biri üç çalıştırma. Bu kadar geniş bir gürültüyle küçük etkiler görünmez oluyor. Verinin belirlediği şey ise tabanın yüksek olduğu. Claude bu araçlarla ya da onlarsız her şeyi geçti ve context'te çağrılmayı bekleyen araçlar çoğunlukla çağrılmıyor. Onlara uzanan bir iş akışına ihtiyaçları var.
Kendi kurulumunuzu iki dakikada denetleyebilirsiniz. Bir komut şu anda neyin yüklü olduğunu gösteriyor. Bir tanesi bir plugin'in maliyetini öngörüyor ve unutmayın, hook'ları bedava sayıyor. Bir tanesi her skill'in neye mal olduğunu ve ne sıklıkta kullanıldığını raporluyor. Ve herhangi bir kurulumdan önce hook'ları, kurulum betiğini ve sunucu ayarlarını açın.
AIDive