TL;DR
- Quatro ferramentas atuam em quatro partes diferentes de uma fatura do Claude Code: graphify no que é lido, rtk na saída do shell, Superpowers no histórico e na escolha do modelo, caveman no que o agente escreve. Ordene pelo tamanho da parte que cada uma toca, não pela porcentagem do README.
- Superpowers é o único que mexe na fatura: um subagente novo por tarefa e o modelo menos potente que dá conta mudam o que é lido e quem lê. O custo é uma trava em toda tarefa, até nas minúsculas.
- graphify vem em segundo: um grafo tree-sitter local, construído com zero crédito de LLM, 91.8x menos tokens por consulta do que uma leitura ingênua do nosso próprio corpus.
- rtk comprime a única parte que um hook de Bash enxerga. A JetBrains mediu 19.7% do que o modelo lê como comprimível, um teto perto de 3% da fatura, e +7.6% por tarefa no teste de ponta a ponta.
- caveman anuncia 65% e mediu 8.5% dos tokens de saída em trabalho agêntico. O Claude Code já traz a mesma ideia como o estilo de saída Concise.
- Os dois números que todo mundo cita, 11.6M de tokens economizados e +7.6% por tarefa, medem coisas diferentes: bytes de saída do bash versus o custo de uma tarefa concluída.
O que as medições dizem
Primeiro o mapa. O documento de economia do próprio rtk desenha a árvore do que uma sessão lê e marca a saída do bash como a única parte que o proxy filtra, e diz sem rodeios: "A command showing 90% fewer output bytes does not make your session 90% cheaper" s3. A JetBrains reproduziu 83 sessões de referência, 1.9 milhão de caracteres de saída de ferramentas, e dividiu em três: saída de shell que o rtk consegue comprimir 373,339 (19.7%), saída de shell sem regra 879,326 (46.3%), leitura de arquivos e ferramentas de busca que pulam o rtk 646,613 (34.0%) s1. Read e Grep nunca passam pelo hook de Bash. O README do caveman chega à mesma conclusão pelo outro lado: a leitura costuma ser a metade maior da fatura s7.
graphify. O repositório foi criado em 2026-04-03 e tinha 113,946 estrelas e 11,078 forks em 2026-09-02, última versão v0.9.53, Python, Apache-2.0 s5. A linha de benchmark do README diz "Graph build | LLM credits | 0": o código é analisado localmente com tree-sitter em ~40 linguagens, as comunidades são separadas com Leiden e nada sai da máquina s5. O post do autor no r/ClaudeAI relatava 73k estrelas e 2.2M de downloads em 2.5 meses s10. Nosso próprio graphify benchmark num projeto de 1,701,550 palavras (cerca de 2,268,733 tokens como leitura ingênua) construiu 34,031 nós e 56,865 arestas, um custo médio por consulta de cerca de 24,702 tokens, 91.8x menos tokens por consulta; por pergunta, a variação foi de 679.1x para "what is the main entry point" a 34.0x para "what connects the data layer to the api" s5. O 91.8x é contra uma leitura completa ingênua, que ninguém faz de propósito; o grafo também fica desatualizado conforme o código muda, e a passada semântica opcional é a única etapa que gasta chamadas ao modelo.
rtk. Criado em 2026-01-22, 78,326 estrelas e 4,942 forks em 2026-09-02, versão v0.47.0, Rust, Apache-2.0, "100+ supported commands, <10ms overhead" s4. O post de lançamento afirmava "cargo test: 155 lines → 3 lines (-98%)", "git status: 119 chars → 28 chars (-76%)" e "Total over 2 weeks: 10.2M tokens saved (89.2%)" s9. Na nossa máquina, o rtk 0.42.3 reportou 25599 comandos e 11.6M de tokens economizados (41.6%), com find, read e grep no topo da tabela By Command s4. A JetBrains instalou o rtk v0.43.0 exatamente como o rtk init -g entrega, no Claude Code 2.1.201 e claude-sonnet-5, e rodou 86 tarefas duas vezes. Só 1 em cada 3 comandos de shell é algo que o rtk consegue reescrever (349 reescrevíveis, 525 sem regra, 182 ignorados, de 1,056 comandos). Mesmo reduzindo em 70% toda a saída comprimível, a economia total fica em torno de 3% da fatura; o resultado medido foi +7.6% mais caro por tarefa, sem diferença em esforço alto s1. O README agora admite o ponto: "RTK cuts up to 90% of the bash output your agent reads. That is what RTK measures, and it is not the same as cutting your bill by 90%", e as contagens que ele reporta são estimadas como bytes / 4 s4.
Superpowers. Criado em 2025-10-09, 280,792 estrelas e 25,164 forks em 2026-09-02, versão v6.3.0 com quatorze skills, MIT, um único comando de instalação: /plugin install superpowers@claude-plugins-official s6. O skill brainstorming abre com uma trava rígida: nada de código, scaffolding ou skill de implementação até que uma intenção explícita seja aprovada; três caminhos (spike, bounded, architectural) e a regra "When in doubt between two paths, take the heavier one" s12. writing-plans assume que o engenheiro não tem nenhum contexto e corta o trabalho em passos em que "Each step is one action (2-5 minutes)" s13. subagent-driven-development dá a cada tarefa um subagente novo que recebe só o contexto da própria tarefa, nunca o histórico da sessão, com uma revisão após cada tarefa e uma revisão ampla da branch no fim. A seção de modelos diz "Use the least powerful model that can handle each role to conserve cost", avisa que um modelo omitido herda o da sessão e crava "Turn count beats token price". No máximo cinco rodadas por tarefa: as rodadas 1 a 3 retomam o implementador, a rodada 4 traz um implementador novo num modelo mais capaz, na rodada 5 o próprio orquestrador decide s14. Nenhuma compressão em lugar nenhum: a economia vem de ler menos histórico e pagar um modelo menor pelos passos mecânicos. O passo a passo completo está no nosso vídeo anterior s11.
caveman. Criado em 2026-04-04, 102,548 estrelas e 5,967 forks em 2026-09-02, versão bin-v1.1.5, Go; o skill é MIT, o runtime do proxy é BSL-1.1 s7. A própria tabela, dez prompts pela API do Claude, mostra média de 1214 tokens de saída sem e 294 com, 65%, melhor caso 87% e pior caso 22% s7. O bloco IMPORTANT do README é honesto: o skill só encurta a saída, os tokens de entrada e de raciocínio não mudam, e as regras custam cerca de 1 a 1.5k tokens de entrada a cada turno, então a economia da sessão inteira fica abaixo do gráfico s7. A JetBrains rodou 82 tarefas pareadas no Claude Code 2.1.200 com claude-sonnet-5 em esforço low, cerca de 106 USD: "Advertised saving: 65%. Measured saving: 8.5%", de 592k para 542k tokens de saída, sem degradação de qualidade detectável (teste do sinal p = 0.82), recomendação "use it if you like it" s2. O estilo Concise embutido no Claude Code faz o mesmo trabalho: "Claude leads with the result, skips preamble and narration, and keeps responses short by default", exige a v2.1.237 ou posterior, é escolhido em /config e salvo como outputStyle em .claude/settings.local.json. Os estilos valem só para a conversa principal; um subagente roda com o próprio prompt de sistema s8.
Tabela de veredictos
| Ferramenta | Parte da fatura | Anunciado | Medido | Mexe em |
|---|---|---|---|---|
| Superpowers | histórico + modelo por tarefa | sem número | contexto novo por tarefa, modelo menos potente por papel | a fatura |
| graphify | o que é lido | 0 crédito LLM para construir | 91.8x menos tokens por consulta vs leitura ingênua (nosso) | a fatura, nas leituras |
| rtk | saída de shell comprimível | 60-90% em comandos | 19.7% comprimível, teto perto de 3%, +7.6% por tarefa (JetBrains) | as margens |
| caveman / Concise | o que o agente escreve | 65% | 8.5% dos tokens de saída (JetBrains) | as margens |
Faça isto na segunda
- Abra sua última sessão longa e conte para onde a entrada foi: quanto foi Read e Grep, quanto foi saída de shell, quanto foi histórico reenviado. Coloque cada ferramenta na sua parte antes de instalar qualquer coisa.
- Instale o Superpowers com
/plugin install superpowers@claude-plugins-officiale passe uma funcionalidade real por brainstorming, writing-plans e subagent-driven-development. Veja o medidor de contexto do orquestrador ficar estável. - Defina um modelo explícito em cada subagente que você despachar. Um modelo omitido herda o da sessão e você paga a faixa do orquestrador por trabalho mecânico.
- Rode
/graphify .no seu maior repositório, depoisgraphify benchmark, e compare o custo por consulta com o tamanho do corpus ingênuo que ele imprime. Reconstrua o grafo quando o código mudar. - Se você já usa o rtk, leia
rtk gaincomo bytes de saída de shell, não como dinheiro. Cruze com a divisão da JetBrains: o quefind,readegrepeconomizarem, as ferramentas Read e Grep nunca passaram pelo hook. - Troque para o estilo de saída Concise em
/configantes de adicionar o caveman; ele já vem com o Claude Code e não custa regras de skill a cada turno. - Mantenha uma medição sua: custo da tarefa antes e depois de cada mudança, no mesmo conjunto de tarefas, não a contagem de bytes de um único comando.
Para ir além
- A metodologia completa da JetBrains sobre o rtk, com a reprodução de 83 sessões e a divisão dos 1,056 comandos, é a referência para medir qualquer proxy de shell s1.
- O benchmark do caveman explica como 82 tarefas pareadas e um teste do sinal transformam um gráfico de 65% em 8.5% dos tokens de saída s2.
- A página savings-explained do rtk é a árvore mais clara do que uma sessão realmente lê; leia antes de confiar em qualquer contador de "tokens saved" s3.
- A seção de benchmarks do README do graphify documenta a construção sem crédito e a passada semântica, a única etapa que gasta chamadas ao modelo s5.
- A seção de seleção de modelo do Superpowers, com "Turn count beats token price" e o limite de cinco rodadas, é a parte que vale copiar para as suas próprias definições de agente s14.
- A trava do brainstorming e os três caminhos mostram como a cerimônia escala com a tarefa, e onde ela dispara até em correções pequenas demais para merecê-la s12.
- Estilos de saída na documentação do Claude Code: o estilo Concise, o piso v2.1.237 e por que os subagentes o ignoram s8.
Fontes
- Does rtk really save tokens in Claude Code?, JetBrains. Por que ler: o único teste de ponta a ponta do rtk, com a divisão 19.7% / 46.3% / 34.0% do que um agente lê.
- Speak to AI agents like cavemen to save tokens, JetBrains. Por que ler: 82 tarefas pareadas que reduzem a alegação de 65% para 8.5% sem achar perda de qualidade.
- How RTK savings work, GitHub. Por que ler: a árvore da fatura feita pelos próprios mantenedores e a frase sobre 90% menos bytes.
- rtk-ai/rtk on GitHub, GitHub. Por que ler: o README agora diz o que o rtk mede e como as contagens são estimadas.
- Graphify-Labs/graphify on GitHub, GitHub. Por que ler: tabela de benchmarks, a construção sem crédito e o comando
graphify benchmarkusado aqui. - obra/superpowers on GitHub, GitHub. Por que ler: o plugin que muda o que é lido e qual modelo lê.
- JuliusBrussee/caveman on GitHub, GitHub. Por que ler: a tabela de economia e o bloco IMPORTANT que a enfraquece.
- Output styles, Claude Code docs. Por que ler: o estilo Concise embutido e seus limites com subagentes.
- rtk launch post on r/ClaudeAI, Reddit. Por que ler: a alegação original dos 10.2M, útil para comparar com o que a JetBrains mediu.
- Graphify hit 73k stars and 2.2M downloads (r/ClaudeAI), Reddit. Por que ler: o autor sobre a adoção e para que serve o grafo.
- Superpowers: The Plugin That Disciplines Claude Code, AIDive. Por que ler: nosso passo a passo completo do plugin, skill por skill.
- Superpowers brainstorming skill (SKILL.md), GitHub. Por que ler: a trava rígida e os três caminhos, literais.
- Superpowers writing-plans skill (SKILL.md), GitHub. Por que ler: a granularidade de 2 a 5 minutos que mantém pequenos os contextos dos subagentes.
- Superpowers subagent-driven-development skill (SKILL.md), GitHub. Por que ler: a seleção de modelo por papel e o limite de cinco rodadas.
FAQ
Por que o rtk mostra 11.6M de tokens economizados se mal mexe na fatura?
O contador mede bytes de saída de shell divididos por 4, nos comandos que passaram pelo hook. As chamadas às ferramentas Read e Grep, o prompt de sistema e o histórico reenviado nunca passam por ele, e a JetBrains descobriu que só 19.7% do que o modelo lê é comprimível assim.
O Superpowers comprime alguma coisa?
Não. Ele lê menos dando a cada tarefa um subagente novo com só o contexto daquela tarefa, e paga menos atribuindo o modelo menos potente que dá conta do papel. O custo é uma trava em toda tarefa.
Vale instalar o caveman?
A JetBrains não achou perda de qualidade e viu 8.5% menos tokens de saída, então use se gostar do estilo. O estilo de saída Concise do Claude Code v2.1.237 ou posterior dá o mesmo efeito sem os 1 a 1.5k tokens de entrada que as regras do skill custam a cada turno.
Quando o graphify deixa de compensar?
Quando o grafo está desatualizado ou a pergunta precisa da passada semântica, que de fato gasta chamadas ao modelo. O número 91.8x compara uma consulta com a leitura do corpus inteiro, então repositórios menores veem uma diferença menor.
AIDive