AIDive

Pack de vídeo

Quatro economizadores de tokens do Claude Code medidos: veredictos, checklist e fontes

11 min de leitura

TL;DR

  • Quatro ferramentas atuam em quatro partes diferentes de uma fatura do Claude Code: graphify no que é lido, rtk na saída do shell, Superpowers no histórico e na escolha do modelo, caveman no que o agente escreve. Ordene pelo tamanho da parte que cada uma toca, não pela porcentagem do README.
  • Superpowers é o único que mexe na fatura: um subagente novo por tarefa e o modelo menos potente que dá conta mudam o que é lido e quem lê. O custo é uma trava em toda tarefa, até nas minúsculas.
  • graphify vem em segundo: um grafo tree-sitter local, construído com zero crédito de LLM, 91.8x menos tokens por consulta do que uma leitura ingênua do nosso próprio corpus.
  • rtk comprime a única parte que um hook de Bash enxerga. A JetBrains mediu 19.7% do que o modelo lê como comprimível, um teto perto de 3% da fatura, e +7.6% por tarefa no teste de ponta a ponta.
  • caveman anuncia 65% e mediu 8.5% dos tokens de saída em trabalho agêntico. O Claude Code já traz a mesma ideia como o estilo de saída Concise.
  • Os dois números que todo mundo cita, 11.6M de tokens economizados e +7.6% por tarefa, medem coisas diferentes: bytes de saída do bash versus o custo de uma tarefa concluída.

O que as medições dizem

Primeiro o mapa. O documento de economia do próprio rtk desenha a árvore do que uma sessão lê e marca a saída do bash como a única parte que o proxy filtra, e diz sem rodeios: "A command showing 90% fewer output bytes does not make your session 90% cheaper" s3. A JetBrains reproduziu 83 sessões de referência, 1.9 milhão de caracteres de saída de ferramentas, e dividiu em três: saída de shell que o rtk consegue comprimir 373,339 (19.7%), saída de shell sem regra 879,326 (46.3%), leitura de arquivos e ferramentas de busca que pulam o rtk 646,613 (34.0%) s1. Read e Grep nunca passam pelo hook de Bash. O README do caveman chega à mesma conclusão pelo outro lado: a leitura costuma ser a metade maior da fatura s7.

graphify. O repositório foi criado em 2026-04-03 e tinha 113,946 estrelas e 11,078 forks em 2026-09-02, última versão v0.9.53, Python, Apache-2.0 s5. A linha de benchmark do README diz "Graph build | LLM credits | 0": o código é analisado localmente com tree-sitter em ~40 linguagens, as comunidades são separadas com Leiden e nada sai da máquina s5. O post do autor no r/ClaudeAI relatava 73k estrelas e 2.2M de downloads em 2.5 meses s10. Nosso próprio graphify benchmark num projeto de 1,701,550 palavras (cerca de 2,268,733 tokens como leitura ingênua) construiu 34,031 nós e 56,865 arestas, um custo médio por consulta de cerca de 24,702 tokens, 91.8x menos tokens por consulta; por pergunta, a variação foi de 679.1x para "what is the main entry point" a 34.0x para "what connects the data layer to the api" s5. O 91.8x é contra uma leitura completa ingênua, que ninguém faz de propósito; o grafo também fica desatualizado conforme o código muda, e a passada semântica opcional é a única etapa que gasta chamadas ao modelo.

rtk. Criado em 2026-01-22, 78,326 estrelas e 4,942 forks em 2026-09-02, versão v0.47.0, Rust, Apache-2.0, "100+ supported commands, <10ms overhead" s4. O post de lançamento afirmava "cargo test: 155 lines → 3 lines (-98%)", "git status: 119 chars → 28 chars (-76%)" e "Total over 2 weeks: 10.2M tokens saved (89.2%)" s9. Na nossa máquina, o rtk 0.42.3 reportou 25599 comandos e 11.6M de tokens economizados (41.6%), com find, read e grep no topo da tabela By Command s4. A JetBrains instalou o rtk v0.43.0 exatamente como o rtk init -g entrega, no Claude Code 2.1.201 e claude-sonnet-5, e rodou 86 tarefas duas vezes. Só 1 em cada 3 comandos de shell é algo que o rtk consegue reescrever (349 reescrevíveis, 525 sem regra, 182 ignorados, de 1,056 comandos). Mesmo reduzindo em 70% toda a saída comprimível, a economia total fica em torno de 3% da fatura; o resultado medido foi +7.6% mais caro por tarefa, sem diferença em esforço alto s1. O README agora admite o ponto: "RTK cuts up to 90% of the bash output your agent reads. That is what RTK measures, and it is not the same as cutting your bill by 90%", e as contagens que ele reporta são estimadas como bytes / 4 s4.

Superpowers. Criado em 2025-10-09, 280,792 estrelas e 25,164 forks em 2026-09-02, versão v6.3.0 com quatorze skills, MIT, um único comando de instalação: /plugin install superpowers@claude-plugins-official s6. O skill brainstorming abre com uma trava rígida: nada de código, scaffolding ou skill de implementação até que uma intenção explícita seja aprovada; três caminhos (spike, bounded, architectural) e a regra "When in doubt between two paths, take the heavier one" s12. writing-plans assume que o engenheiro não tem nenhum contexto e corta o trabalho em passos em que "Each step is one action (2-5 minutes)" s13. subagent-driven-development dá a cada tarefa um subagente novo que recebe só o contexto da própria tarefa, nunca o histórico da sessão, com uma revisão após cada tarefa e uma revisão ampla da branch no fim. A seção de modelos diz "Use the least powerful model that can handle each role to conserve cost", avisa que um modelo omitido herda o da sessão e crava "Turn count beats token price". No máximo cinco rodadas por tarefa: as rodadas 1 a 3 retomam o implementador, a rodada 4 traz um implementador novo num modelo mais capaz, na rodada 5 o próprio orquestrador decide s14. Nenhuma compressão em lugar nenhum: a economia vem de ler menos histórico e pagar um modelo menor pelos passos mecânicos. O passo a passo completo está no nosso vídeo anterior s11.

caveman. Criado em 2026-04-04, 102,548 estrelas e 5,967 forks em 2026-09-02, versão bin-v1.1.5, Go; o skill é MIT, o runtime do proxy é BSL-1.1 s7. A própria tabela, dez prompts pela API do Claude, mostra média de 1214 tokens de saída sem e 294 com, 65%, melhor caso 87% e pior caso 22% s7. O bloco IMPORTANT do README é honesto: o skill só encurta a saída, os tokens de entrada e de raciocínio não mudam, e as regras custam cerca de 1 a 1.5k tokens de entrada a cada turno, então a economia da sessão inteira fica abaixo do gráfico s7. A JetBrains rodou 82 tarefas pareadas no Claude Code 2.1.200 com claude-sonnet-5 em esforço low, cerca de 106 USD: "Advertised saving: 65%. Measured saving: 8.5%", de 592k para 542k tokens de saída, sem degradação de qualidade detectável (teste do sinal p = 0.82), recomendação "use it if you like it" s2. O estilo Concise embutido no Claude Code faz o mesmo trabalho: "Claude leads with the result, skips preamble and narration, and keeps responses short by default", exige a v2.1.237 ou posterior, é escolhido em /config e salvo como outputStyle em .claude/settings.local.json. Os estilos valem só para a conversa principal; um subagente roda com o próprio prompt de sistema s8.

Tabela de veredictos

Ferramenta Parte da fatura Anunciado Medido Mexe em
Superpowers histórico + modelo por tarefa sem número contexto novo por tarefa, modelo menos potente por papel a fatura
graphify o que é lido 0 crédito LLM para construir 91.8x menos tokens por consulta vs leitura ingênua (nosso) a fatura, nas leituras
rtk saída de shell comprimível 60-90% em comandos 19.7% comprimível, teto perto de 3%, +7.6% por tarefa (JetBrains) as margens
caveman / Concise o que o agente escreve 65% 8.5% dos tokens de saída (JetBrains) as margens

Faça isto na segunda

  • Abra sua última sessão longa e conte para onde a entrada foi: quanto foi Read e Grep, quanto foi saída de shell, quanto foi histórico reenviado. Coloque cada ferramenta na sua parte antes de instalar qualquer coisa.
  • Instale o Superpowers com /plugin install superpowers@claude-plugins-official e passe uma funcionalidade real por brainstorming, writing-plans e subagent-driven-development. Veja o medidor de contexto do orquestrador ficar estável.
  • Defina um modelo explícito em cada subagente que você despachar. Um modelo omitido herda o da sessão e você paga a faixa do orquestrador por trabalho mecânico.
  • Rode /graphify . no seu maior repositório, depois graphify benchmark, e compare o custo por consulta com o tamanho do corpus ingênuo que ele imprime. Reconstrua o grafo quando o código mudar.
  • Se você já usa o rtk, leia rtk gain como bytes de saída de shell, não como dinheiro. Cruze com a divisão da JetBrains: o que find, read e grep economizarem, as ferramentas Read e Grep nunca passaram pelo hook.
  • Troque para o estilo de saída Concise em /config antes de adicionar o caveman; ele já vem com o Claude Code e não custa regras de skill a cada turno.
  • Mantenha uma medição sua: custo da tarefa antes e depois de cada mudança, no mesmo conjunto de tarefas, não a contagem de bytes de um único comando.

Para ir além

  • A metodologia completa da JetBrains sobre o rtk, com a reprodução de 83 sessões e a divisão dos 1,056 comandos, é a referência para medir qualquer proxy de shell s1.
  • O benchmark do caveman explica como 82 tarefas pareadas e um teste do sinal transformam um gráfico de 65% em 8.5% dos tokens de saída s2.
  • A página savings-explained do rtk é a árvore mais clara do que uma sessão realmente lê; leia antes de confiar em qualquer contador de "tokens saved" s3.
  • A seção de benchmarks do README do graphify documenta a construção sem crédito e a passada semântica, a única etapa que gasta chamadas ao modelo s5.
  • A seção de seleção de modelo do Superpowers, com "Turn count beats token price" e o limite de cinco rodadas, é a parte que vale copiar para as suas próprias definições de agente s14.
  • A trava do brainstorming e os três caminhos mostram como a cerimônia escala com a tarefa, e onde ela dispara até em correções pequenas demais para merecê-la s12.
  • Estilos de saída na documentação do Claude Code: o estilo Concise, o piso v2.1.237 e por que os subagentes o ignoram s8.

Fontes

FAQ

Por que o rtk mostra 11.6M de tokens economizados se mal mexe na fatura?

O contador mede bytes de saída de shell divididos por 4, nos comandos que passaram pelo hook. As chamadas às ferramentas Read e Grep, o prompt de sistema e o histórico reenviado nunca passam por ele, e a JetBrains descobriu que só 19.7% do que o modelo lê é comprimível assim.

O Superpowers comprime alguma coisa?

Não. Ele lê menos dando a cada tarefa um subagente novo com só o contexto daquela tarefa, e paga menos atribuindo o modelo menos potente que dá conta do papel. O custo é uma trava em toda tarefa.

Vale instalar o caveman?

A JetBrains não achou perda de qualidade e viu 8.5% menos tokens de saída, então use se gostar do estilo. O estilo de saída Concise do Claude Code v2.1.237 ou posterior dá o mesmo efeito sem os 1 a 1.5k tokens de entrada que as regras do skill custam a cada turno.

Quando o graphify deixa de compensar?

Quando o grafo está desatualizado ou a pergunta precisa da passada semântica, que de fato gasta chamadas ao modelo. O número 91.8x compara uma consulta com a leitura do corpus inteiro, então repositórios menores veem uma diferença menor.