AIDive

Pack video

Quattro risparmiatori di token per Claude Code misurati: verdetti, checklist e fonti

11 min di lettura

TL;DR

  • Quattro strumenti agiscono su quattro parti diverse di una bolletta Claude Code: graphify su ciò che viene letto, rtk sull'output della shell, Superpowers su cronologia e scelta del modello, caveman su ciò che l'agente scrive. Ordinali per la dimensione della parte che toccano, non per la percentuale sul loro README.
  • Superpowers è l'unico che sposta davvero la bolletta: un subagente nuovo per ogni task e il modello meno potente che basta cambiano ciò che si legge e chi lo legge. Il costo è un gate su ogni task, anche i più piccoli.
  • graphify è secondo: un grafo tree-sitter locale costruito con zero crediti LLM, 91.8x meno token per query rispetto a una lettura ingenua del nostro corpus.
  • rtk comprime l'unica parte che un hook Bash riesce a vedere. JetBrains ha misurato che il 19.7% di ciò che il modello legge è comprimibile, un tetto intorno al 3% della bolletta, e +7.6% per task nel test end-to-end.
  • caveman promette il 65% e ha misurato l'8.5% dei token di output sul lavoro agentico. Claude Code include la stessa idea come stile di output Concise.
  • I due numeri che tutti citano, 11.6M di token risparmiati e +7.6% per task, misurano cose diverse: byte di output bash contro il costo di un task finito.

Cosa dicono le misure

Prima la mappa. Il documento sui risparmi di rtk disegna l'albero di ciò che una sessione legge e segna l'output bash come unica parte filtrata dal proxy, poi lo dice chiaramente: "A command showing 90% fewer output bytes does not make your session 90% cheaper" s3. JetBrains ha rigiocato 83 sessioni di riferimento, 1,9 milioni di caratteri di output degli strumenti, e le ha divise in tre: output shell che rtk può comprimere 373,339 (19.7%), output shell senza regola 879,326 (46.3%), strumenti di lettura file e ricerca che saltano rtk 646,613 (34.0%) s1. Read e Grep non passano mai dall'hook Bash. Il README di caveman arriva alla stessa conclusione dall'altro lato: la lettura è di solito la metà più grossa della bolletta s7.

graphify. Il repo è stato creato il 2026-04-03 e il 2026-09-02 contava 113,946 stelle e 11,078 fork, ultima release v0.9.53, Python, Apache-2.0 s5. La riga di benchmark del README dice "Graph build | LLM credits | 0": il codice viene analizzato in locale con tree-sitter su ~40 linguaggi, le community sono separate con Leiden, niente lascia la macchina s5. Il post dell'autore su r/ClaudeAI riportava 73k stelle e 2.2M di download in 2.5 mesi s10. Il nostro graphify benchmark su un progetto di 1,701,550 parole (circa 2,268,733 token con lettura ingenua) ha costruito 34,031 nodi e 56,865 archi, un costo medio per query di circa 24,702 token, 91.8x meno token per query; per singola domanda il range andava da 679.1x per "what is the main entry point" a 34.0x per "what connects the data layer to the api" s5. Il 91.8x è rispetto a una lettura completa ingenua, che nessuno fa di proposito; inoltre il grafo invecchia man mano che il codice si muove e il passaggio semantico opzionale è l'unico che costa chiamate al modello.

rtk. Creato il 2026-01-22, 78,326 stelle e 4,942 fork il 2026-09-02, release v0.47.0, Rust, Apache-2.0, "100+ supported commands, <10ms overhead" s4. Il post di lancio dichiarava "cargo test: 155 lines → 3 lines (-98%)", "git status: 119 chars → 28 chars (-76%)" e "Total over 2 weeks: 10.2M tokens saved (89.2%)" s9. Sulla nostra macchina rtk 0.42.3 riportava 25599 comandi e 11.6M di token risparmiati (41.6%), con find, read e grep in cima alla tabella By Command s4. JetBrains ha installato rtk v0.43.0 esattamente come lo distribuisce rtk init -g, su Claude Code 2.1.201 e claude-sonnet-5, ed ha eseguito 86 task due volte. Solo 1 comando shell su 3 è qualcosa che rtk può riscrivere (349 riscrivibili, 525 senza regola, 182 saltati, su 1,056 comandi). Comprimendo del 70% tutto l'output comprimibile, il risparmio arriva al massimo a circa il 3% della bolletta; il risultato misurato è stato +7.6% di costo per task, senza differenze a effort alto s1. Il README ora lo ammette: "RTK cuts up to 90% of the bash output your agent reads. That is what RTK measures, and it is not the same as cutting your bill by 90%", e i conteggi riportati sono stimati come bytes / 4 s4.

Superpowers. Creato il 2025-10-09, 280,792 stelle e 25,164 fork il 2026-09-02, release v6.3.0 con quattordici skill, MIT, un solo comando di installazione: /plugin install superpowers@claude-plugins-official s6. La skill brainstorming si apre con un gate rigido: niente codice, niente scaffolding, nessuna skill di implementazione finché non è approvata un'intenzione esplicita; tre percorsi (spike, circoscritto, architetturale) e la regola "When in doubt between two paths, take the heavier one" s12. writing-plans parte dal presupposto che l'ingegnere abbia zero contesto e taglia il lavoro in passi in cui "Each step is one action (2-5 minutes)" s13. subagent-driven-development dà a ogni task un subagente nuovo che riceve solo il contesto del proprio task, mai la cronologia della sessione, con una review dopo ogni task e una review ampia del branch alla fine. La sua sezione sui modelli dice "Use the least powerful model that can handle each role to conserve cost", avverte che un modello omesso eredita quello della sessione e afferma "Turn count beats token price". Massimo cinque round per task: i round da 1 a 3 riprendono l'implementatore, il round 4 porta un implementatore nuovo su un modello più capace, al round 5 decide l'orchestratore s14. Nessuna compressione da nessuna parte: il risparmio viene dal leggere meno cronologia e dal pagare un modello più piccolo per i passi meccanici. Il percorso completo è nel nostro video precedente s11.

caveman. Creato il 2026-04-04, 102,548 stelle e 5,967 fork il 2026-09-02, release bin-v1.1.5, Go; la skill è MIT, il runtime del proxy BSL-1.1 s7. La sua tabella, dieci prompt via API Claude, mostra una media di 1214 token di output senza e 294 con, cioè 65%, caso migliore 87% e peggiore 22% s7. Il blocco IMPORTANT del README è onesto: la skill accorcia solo l'output, i token di input e di ragionamento non cambiano, e le regole costano circa 1-1.5k token di input a ogni turno, quindi il risparmio sull'intera sessione resta sotto quello del grafico s7. JetBrains ha eseguito 82 task appaiati su Claude Code 2.1.200 con claude-sonnet-5 a effort low, circa 106 USD: "Advertised saving: 65%. Measured saving: 8.5%", da 592k a 542k token di output, nessun degrado di qualità rilevabile (test dei segni p = 0.82), raccomandazione "use it if you like it" s2. Lo stile Concise integrato in Claude Code fa lo stesso lavoro: "Claude leads with the result, skips preamble and narration, and keeps responses short by default", richiede la v2.1.237 o successiva, si sceglie con /config e viene salvato come outputStyle in .claude/settings.local.json. Gli stili si applicano solo alla conversazione principale; un subagente usa il proprio prompt di sistema s8.

Tabella dei verdetti

Strumento Parte della bolletta Dichiarato Misurato Sposta
Superpowers cronologia + modello per task nessun numero contesto nuovo per task, modello meno potente per ruolo la bolletta
graphify ciò che viene letto 0 crediti LLM per costruire 91.8x meno token per query rispetto alla lettura ingenua (nostro) la bolletta, sulle letture
rtk output shell comprimibile 60-90% sui comandi 19.7% comprimibile, tetto intorno al 3%, +7.6% per task (JetBrains) i margini
caveman / Concise ciò che l'agente scrive 65% 8.5% dei token di output (JetBrains) i margini

Da fare lunedì

  • Apri la tua ultima sessione lunga e conta dove è andato l'input: quanto Read e Grep, quanto output shell, quanta cronologia riletta. Colloca ogni strumento sulla sua parte prima di installare qualsiasi cosa.
  • Installa Superpowers con /plugin install superpowers@claude-plugins-official e fai passare una feature reale da brainstorming, writing-plans e subagent-driven-development. Guarda l'indicatore di contesto dell'orchestratore restare piatto.
  • Imposta un modello esplicito su ogni subagente che lanci. Un modello omesso eredita quello della sessione e paghi la fascia dell'orchestratore per lavoro meccanico.
  • Esegui /graphify . sul tuo repo più grande, poi graphify benchmark, e confronta il costo per query con la dimensione del corpus ingenuo che stampa. Ricostruisci il grafo quando il codice si muove.
  • Se usi già rtk, leggi rtk gain come byte di output shell, non come denaro. Affiancagli la ripartizione di JetBrains: qualunque cosa risparmino find, read e grep, gli strumenti Read e Grep non sono mai passati dall'hook.
  • Passa allo stile di output Concise tramite /config prima di aggiungere caveman; è incluso in Claude Code e non costa regole di skill a ogni turno.
  • Tieni una misura tua: costo del task prima e dopo ogni modifica, stesso insieme di task, non il conteggio di byte di un singolo comando.

Per approfondire

  • La metodologia completa di JetBrains su rtk, con la riproduzione di 83 sessioni e la ripartizione dei 1,056 comandi, è il riferimento per misurare qualsiasi proxy shell s1.
  • Il benchmark di caveman spiega come 82 task appaiati e un test dei segni trasformino un grafico del 65% nell'8.5% dei token di output s2.
  • La pagina savings-explained di rtk è l'albero più chiaro di ciò che una sessione legge davvero; leggila prima di fidarti di qualunque contatore "tokens saved" s3.
  • La sezione benchmark del README di graphify documenta la build a zero crediti e il passaggio semantico, l'unico che costa chiamate al modello s5.
  • La sezione sulla scelta del modello di Superpowers, con "Turn count beats token price" e il limite di cinque round, è la parte da copiare nelle tue definizioni di agente s14.
  • Il gate rigido del brainstorming e i tre percorsi mostrano come la cerimonia scala con il task, e dove scatta anche su fix troppo piccoli per meritarla s12.
  • Gli stili di output nella documentazione di Claude Code: lo stile Concise, la soglia v2.1.237 e perché i subagenti lo ignorano s8.

Fonti

FAQ

Perché rtk mostra 11.6M di token risparmiati se la bolletta si muove appena?

Il contatore misura i byte di output shell divisi per 4, sui comandi passati dall'hook. Le chiamate agli strumenti Read e Grep, il prompt di sistema e la cronologia riletta non vi passano mai, e JetBrains ha trovato che solo il 19.7% di ciò che il modello legge è comprimibile così.

Superpowers comprime qualcosa?

No. Legge meno dando a ogni task un subagente nuovo con solo il contesto di quel task, e paga meno assegnando il modello meno potente in grado di gestire il ruolo. Il costo è un gate su ogni task.

Vale la pena installare caveman?

JetBrains non ha trovato perdite di qualità e l'8.5% di token di output in meno, quindi usalo se ti piace lo stile. Lo stile di output Concise in Claude Code v2.1.237 o successiva dà lo stesso effetto senza i 1-1.5k token di input che le regole della skill costano a ogni turno.

Quando graphify smette di convenire?

Quando il grafo è vecchio o la domanda richiede il passaggio semantico, che costa chiamate al modello. Il 91.8x confronta una query con la lettura dell'intero corpus, quindi i repo più piccoli vedono un divario minore.