AIDive

Pack de vídeo

Cuatro ahorradores de tokens de Claude Code medidos: veredictos, checklist y fuentes

11 min de lectura

TL;DR

  • Cuatro herramientas actúan sobre cuatro partes distintas de una factura de Claude Code: graphify sobre lo que se lee, rtk sobre la salida del shell, Superpowers sobre el historial y la elección de modelo, caveman sobre lo que escribe el agente. Ordénalas por el tamaño de la parte que tocan, no por el porcentaje de su README.
  • Superpowers es el único que mueve la factura: un subagente nuevo por tarea y el modelo menos potente que sirva cambian lo que se lee y quién lo lee. Su coste es una compuerta en cada tarea, incluso las diminutas.
  • graphify es el segundo: un grafo tree-sitter local, construido con cero créditos de LLM, 91.8x menos tokens por consulta que una lectura ingenua de nuestro propio corpus.
  • rtk comprime la única parte que un hook de Bash puede ver. JetBrains midió que el 19.7% de lo que lee el modelo es comprimible, un techo cercano al 3% de la factura, y +7.6% por tarea en la prueba de extremo a extremo.
  • caveman anuncia 65% y midió 8.5% de los tokens de salida en trabajo agéntico. Claude Code incluye la misma idea como el estilo de salida Concise.
  • Las dos cifras que todo el mundo cita, 11.6M de tokens ahorrados y +7.6% por tarea, miden cosas distintas: bytes de salida de bash frente al coste de una tarea terminada.

Qué dicen las mediciones

Primero el mapa. El documento de ahorros de rtk dibuja el árbol de lo que lee una sesión y marca la salida de bash como la única parte que filtra el proxy, y lo dice sin rodeos: "A command showing 90% fewer output bytes does not make your session 90% cheaper" s3. JetBrains reprodujo 83 sesiones base, 1.9 millones de caracteres de salida de herramientas, y las dividió en tres: salida de shell que rtk puede comprimir 373,339 (19.7%), salida de shell sin regla 879,326 (46.3%), lectura de archivos y herramientas de búsqueda que se saltan rtk 646,613 (34.0%) s1. Read y Grep nunca pasan por el hook de Bash. El README de caveman llega a la misma conclusión desde el otro lado: la lectura suele ser la mitad más grande de la factura s7.

graphify. El repositorio se creó el 2026-04-03 y tenía 113,946 estrellas y 11,078 forks el 2026-09-02, última versión v0.9.53, Python, Apache-2.0 s5. La fila de benchmark del README dice "Graph build | LLM credits | 0": el código se analiza en local con tree-sitter en ~40 lenguajes, las comunidades se separan con Leiden y nada sale de la máquina s5. El post del autor en r/ClaudeAI contaba 73k estrellas y 2.2M de descargas en 2.5 meses s10. Nuestro propio graphify benchmark en un proyecto de 1,701,550 palabras (unos 2,268,733 tokens como lectura ingenua) construyó 34,031 nodos y 56,865 aristas, un coste medio por consulta de unos 24,702 tokens, 91.8x menos tokens por consulta; por pregunta, la diferencia fue de 679.1x para "what is the main entry point" a 34.0x para "what connects the data layer to the api" s5. El 91.8x se compara con una lectura completa ingenua, que nadie hace a propósito; además el grafo se queda obsoleto cuando el código cambia y el paso semántico opcional es el único que cuesta llamadas al modelo.

rtk. Creado el 2026-01-22, 78,326 estrellas y 4,942 forks el 2026-09-02, versión v0.47.0, Rust, Apache-2.0, "100+ supported commands, <10ms overhead" s4. El post de lanzamiento afirmaba "cargo test: 155 lines → 3 lines (-98%)", "git status: 119 chars → 28 chars (-76%)" y "Total over 2 weeks: 10.2M tokens saved (89.2%)" s9. En nuestra máquina, rtk 0.42.3 informó 25599 comandos y 11.6M de tokens ahorrados (41.6%), con find, read y grep arriba en la tabla By Command s4. JetBrains instaló rtk v0.43.0 exactamente como lo deja rtk init -g, en Claude Code 2.1.201 y claude-sonnet-5, y ejecutó 86 tareas dos veces. Solo 1 de cada 3 comandos de shell es algo que rtk puede reescribir (349 reescribibles, 525 sin regla, 182 omitidos, de 1,056 comandos). Aunque se reduzca un 70% toda la salida comprimible, el ahorro total llega como mucho a un 3% de la factura; el resultado medido fue +7.6% más caro por tarea, sin diferencia con esfuerzo alto s1. El README ahora concede el punto: "RTK cuts up to 90% of the bash output your agent reads. That is what RTK measures, and it is not the same as cutting your bill by 90%", y los recuentos que informa se estiman como bytes / 4 s4.

Superpowers. Creado el 2025-10-09, 280,792 estrellas y 25,164 forks el 2026-09-02, versión v6.3.0 con catorce skills, MIT, un solo comando de instalación: /plugin install superpowers@claude-plugins-official s6. El skill brainstorming abre con una compuerta dura: nada de código, andamiaje ni skill de implementación hasta que se apruebe una intención explícita; tres caminos (spike, bounded, architectural) y la regla "When in doubt between two paths, take the heavier one" s12. writing-plans asume que el ingeniero no tiene contexto y corta el trabajo en pasos donde "Each step is one action (2-5 minutes)" s13. subagent-driven-development da a cada tarea un subagente nuevo que recibe solo el contexto de su tarea, nunca el historial de la sesión, con una revisión tras cada tarea y una revisión amplia de la rama al final. Su sección de modelos dice "Use the least powerful model that can handle each role to conserve cost", avisa de que un modelo omitido hereda el de la sesión y sentencia "Turn count beats token price". Máximo cinco rondas por tarea: las rondas 1 a 3 retoman al implementador, la ronda 4 trae un implementador nuevo con un modelo más capaz, en la ronda 5 decide el propio orquestador s14. No hay compresión en ningún sitio: el ahorro viene de leer menos historial y pagar un modelo más pequeño por los pasos mecánicos. El recorrido completo está en nuestro vídeo anterior s11.

caveman. Creado el 2026-04-04, 102,548 estrellas y 5,967 forks el 2026-09-02, versión bin-v1.1.5, Go; el skill es MIT, el runtime del proxy BSL-1.1 s7. Su propia tabla, diez prompts por la API de Claude, muestra una media de 1214 tokens de salida sin y 294 con, 65%, mejor caso 87% y peor caso 22% s7. El bloque IMPORTANT del README es honesto: el skill solo acorta la salida, los tokens de entrada y de razonamiento no cambian, y las reglas cuestan unos 1 a 1.5k tokens de entrada en cada turno, así que el ahorro de toda la sesión queda por debajo del gráfico s7. JetBrains ejecutó 82 tareas emparejadas en Claude Code 2.1.200 con claude-sonnet-5 a esfuerzo low, unos 106 USD: "Advertised saving: 65%. Measured saving: 8.5%", de 592k a 542k tokens de salida, sin degradación de calidad detectable (prueba de los signos p = 0.82), recomendación "use it if you like it" s2. El estilo Concise integrado en Claude Code hace el mismo trabajo: "Claude leads with the result, skips preamble and narration, and keeps responses short by default", requiere v2.1.237 o posterior, se elige con /config y se guarda como outputStyle en .claude/settings.local.json. Los estilos solo se aplican a la conversación principal; un subagente usa su propio prompt de sistema s8.

Tabla de veredictos

Herramienta Parte de la factura Anunciado Medido Mueve
Superpowers historial + modelo por tarea sin cifra contexto nuevo por tarea, modelo menos potente por rol la factura
graphify lo que se lee 0 créditos LLM para construir 91.8x menos tokens por consulta vs lectura ingenua (nuestro) la factura, en lecturas
rtk salida de shell comprimible 60-90% en comandos 19.7% comprimible, techo cercano al 3%, +7.6% por tarea (JetBrains) los márgenes
caveman / Concise lo que escribe el agente 65% 8.5% de los tokens de salida (JetBrains) los márgenes

Haz esto el lunes

  • Abre tu última sesión larga y cuenta adónde fue la entrada: cuánto fue Read y Grep, cuánto salida de shell, cuánto historial repetido. Ubica cada herramienta en su parte antes de instalar nada.
  • Instala Superpowers con /plugin install superpowers@claude-plugins-official y pasa una funcionalidad real por brainstorming, writing-plans y subagent-driven-development. Observa cómo el indicador de contexto del orquestador se mantiene plano.
  • Fija un modelo explícito en cada subagente que lances. Un modelo omitido hereda el de la sesión y pagas el nivel del orquestador por trabajo mecánico.
  • Ejecuta /graphify . en tu repositorio más grande, luego graphify benchmark, y compara el coste por consulta con el tamaño del corpus ingenuo que imprime. Reconstruye el grafo cuando el código cambie.
  • Si ya usas rtk, lee rtk gain como bytes de salida de shell, no como dinero. Combínalo con el desglose de JetBrains: lo que ahorren find, read y grep, las herramientas Read y Grep nunca pasaron por el hook.
  • Cambia al estilo de salida Concise con /config antes de añadir caveman; viene con Claude Code y no cuesta reglas de skill en cada turno.
  • Guarda una medición propia: coste de la tarea antes y después de cada cambio, con el mismo conjunto de tareas, no el recuento de bytes de un solo comando.

Para ir más lejos

  • La metodología completa de JetBrains sobre rtk, con la reproducción de 83 sesiones y el desglose de 1,056 comandos, es la referencia para medir cualquier proxy de shell s1.
  • El benchmark de caveman explica cómo 82 tareas emparejadas y una prueba de los signos convierten un gráfico del 65% en 8.5% de los tokens de salida s2.
  • La página savings-explained de rtk es el árbol más claro de lo que realmente lee una sesión; léela antes de fiarte de cualquier contador de "tokens saved" s3.
  • La sección de benchmarks del README de graphify documenta la construcción sin créditos y el paso semántico, el único que cuesta llamadas al modelo s5.
  • La sección de selección de modelo de Superpowers, con "Turn count beats token price" y el tope de cinco rondas, es la parte que vale la pena copiar en tus propias definiciones de agentes s14.
  • La compuerta del brainstorming y los tres caminos muestran cómo la ceremonia escala con la tarea, y dónde se dispara también en arreglos demasiado pequeños para merecerla s12.
  • Los estilos de salida en la documentación de Claude Code: el estilo Concise, el mínimo v2.1.237 y por qué los subagentes lo ignoran s8.

Fuentes

FAQ

¿Por qué rtk muestra 11.6M de tokens ahorrados si apenas mueve la factura?

El contador mide bytes de salida de shell divididos entre 4, en los comandos que pasaron por el hook. Las llamadas a las herramientas Read y Grep, el prompt de sistema y el historial repetido nunca pasan por él, y JetBrains encontró que solo el 19.7% de lo que lee el modelo se puede comprimir así.

¿Superpowers comprime algo?

No. Lee menos dando a cada tarea un subagente nuevo con solo el contexto de esa tarea, y paga menos asignando el modelo menos potente que sirva para el rol. El coste es una compuerta en cada tarea.

¿Vale la pena instalar caveman?

JetBrains no encontró pérdida de calidad y sí 8.5% menos tokens de salida, así que úsalo si te gusta el estilo. El estilo de salida Concise de Claude Code v2.1.237 o posterior da el mismo efecto sin los 1 a 1.5k tokens de entrada que cuestan las reglas del skill en cada turno.

¿Cuándo deja graphify de compensar?

Cuando el grafo está obsoleto o la pregunta necesita el paso semántico, que sí cuesta llamadas al modelo. La cifra de 91.8x compara una consulta con leer todo el corpus, así que los repositorios pequeños ven una diferencia menor.