TL;DR
- Четыре инструмента работают с четырьмя разными частями счёта Claude Code: graphify с тем, что читается, rtk с выводом shell, Superpowers с историей и выбором модели, caveman с тем, что пишет агент. Ранжируйте их по размеру части, которую они затрагивают, а не по проценту из их README.
- Только Superpowers реально сдвигает счёт: свежий субагент на каждую задачу и наименее мощная подходящая модель меняют то, что читается, и то, кто это читает. Цена: проверка на входе каждой задачи, даже самой мелкой.
- graphify на втором месте: локальный граф на tree-sitter, собранный без единого LLM-кредита, в 91.8x меньше токенов на запрос, чем наивное чтение нашего собственного корпуса.
- rtk сжимает единственную часть, которую видит хук Bash. JetBrains измерили 19.7% того, что читает модель, как сжимаемое, потолок около 3% счёта и +7.6% на задачу в сквозном тесте.
- caveman обещает 65%, а на агентной работе измерено 8.5% выходных токенов. В Claude Code та же идея поставляется как стиль вывода Concise.
- Две цитируемые цифры, 11.6M сэкономленных токенов и +7.6% на задачу, измеряют разное: байты вывода bash против стоимости законченной задачи.
Что говорят измерения
Сначала карта. В собственном документе rtk о savings нарисовано дерево того, что читает сессия, и отмечено, что вывод bash это единственная часть, которую фильтрует прокси. Затем прямо сказано: «Команда, дающая на 90% меньше байт вывода, не делает вашу сессию на 90% дешевле» s3. JetBrains воспроизвели 83 базовые сессии, 1.9 миллиона символов вывода инструментов, и разделили их на три части: вывод shell, который rtk может сжать, 373,339 (19.7%), вывод shell, для которого у него нет правила, 879,326 (46.3%), чтение файлов и инструменты поиска, которые обходят rtk, 646,613 (34.0%) s1. Read и Grep никогда не проходят через хук Bash. README caveman приходит к тому же выводу с другой стороны: чтение обычно составляет бóльшую половину счёта s7.
graphify. Репозиторий создан 2026-04-03, на 2026-09-02 в нём 113,946 звёзд и 11,078 форков, последний релиз v0.9.53, Python, Apache-2.0 s5. Строка бенчмарка в README гласит «Graph build | LLM credits | 0»: код разбирается локально через tree-sitter для ~40 языков, сообщества выделяются алгоритмом Лейдена, ничего не покидает машину s5. Автор в посте на r/ClaudeAI сообщил о 73k звёзд и 2.2M загрузок за 2.5 месяца s10. Наш собственный graphify benchmark на проекте в 1,701,550 слов (около 2,268,733 токенов при наивном чтении) построил 34,031 узел и 56,865 рёбер, средняя стоимость запроса около 24,702 токенов, в 91.8x меньше токенов на запрос; по отдельным вопросам разброс шёл от 679.1x для «what is the main entry point» до 34.0x для «what connects the data layer to the api» s5. Цифра 91.8x сравнивается с наивным полным чтением, которое никто не делает намеренно; к тому же граф устаревает по мере изменений кода, а необязательный семантический проход это единственный шаг, который стоит вызовов модели.
rtk. Создан 2026-01-22, на 2026-09-02 78,326 звёзд и 4,942 форка, релиз v0.47.0, Rust, Apache-2.0, «100+ supported commands, <10ms overhead» s4. Пост о запуске заявлял «cargo test: 155 lines → 3 lines (-98%)», «git status: 119 chars → 28 chars (-76%)» и «Total over 2 weeks: 10.2M tokens saved (89.2%)» s9. На нашей машине rtk 0.42.3 показал 25599 команд и 11.6M сэкономленных токенов (41.6%), причём find, read и grep оказались наверху таблицы By Command s4. JetBrains установили rtk v0.43.0 ровно так, как его ставит rtk init -g, на Claude Code 2.1.201 и claude-sonnet-5, и дважды прогнали 86 задач. Только 1 из 3 команд shell rtk способен переписать (349 переписываемых, 525 без правила, 182 пропущено, из 1,056 команд). Сожмите весь сжимаемый вывод на 70%, и экономия упрётся примерно в 3% счёта; измеренный результат: +7.6% дороже на задачу, без разницы при высоком effort s1. README теперь признаёт это: «RTK cuts up to 90% of the bash output your agent reads. That is what RTK measures, and it is not the same as cutting your bill by 90%», а приводимые счётчики оцениваются как байты / 4 s4.
Superpowers. Создан 2025-10-09, на 2026-09-02 280,792 звезды и 25,164 форка, релиз v6.3.0 с четырнадцатью навыками, MIT, одна команда установки: /plugin install superpowers@claude-plugins-official s6. Навык brainstorming открывается жёстким барьером: никакого кода, каркаса или навыка реализации, пока не утверждено явное намерение; три пути (spike, bounded, architectural) и правило «When in doubt between two paths, take the heavier one» s12. writing-plans исходит из того, что у инженера нулевой контекст, и режет работу на шаги, где «Each step is one action (2-5 minutes)» s13. subagent-driven-development даёт каждой задаче свежего субагента, который получает только контекст своей задачи, но не историю сессии, с ревью после каждой задачи и общим ревью ветки в конце. Раздел о моделях гласит «Use the least powerful model that can handle each role to conserve cost», предупреждает, что пропущенная модель наследуется от сессии, и утверждает «Turn count beats token price». Максимум пять раундов на задачу: раунды с 1 по 3 возобновляют исполнителя, в раунде 4 приходит новый исполнитель на более мощной модели, в раунде 5 решает сам оркестратор s14. Никакого сжатия: экономия идёт от чтения меньшей истории и оплаты более дешёвой модели за механические шаги. Полный разбор есть в нашем прошлом видео s11.
caveman. Создан 2026-04-04, на 2026-09-02 102,548 звёзд и 5,967 форков, релиз bin-v1.1.5, Go; навык под MIT, рантайм прокси под BSL-1.1 s7. Его собственная таблица, десять промптов через Claude API, показывает в среднем 1214 выходных токенов без него и 294 с ним, то есть 65%, лучший случай 87%, худший 22% s7. Блок IMPORTANT в README честен: навык лишь укорачивает вывод, входные токены и токены рассуждений не меняются, а правила стоят около 1 to 1.5k входных токенов на каждый ход, поэтому экономия по всей сессии оказывается ниже, чем на графике s7. JetBrains прогнали 82 парные задачи на Claude Code 2.1.200 с claude-sonnet-5 на effort low, около USD 106: «Advertised saving: 65%. Measured saving: 8.5%», с 592k до 542k выходных токенов, без заметного ухудшения качества (sign test p = 0.82), рекомендация «use it if you like it» s2. Встроенный стиль Concise в Claude Code делает ту же работу: «Claude leads with the result, skips preamble and narration, and keeps responses short by default», требует v2.1.237 или новее, выбирается через /config и сохраняется как outputStyle в .claude/settings.local.json. Стили применяются только к основному разговору; субагент работает со своим системным промптом s8.
Таблица вердиктов
| Инструмент | Часть счёта | Заявлено | Измерено | Что двигает |
|---|---|---|---|---|
| Superpowers | история + модель на задачу | без цифры | свежий контекст на задачу, наименее мощная модель на роль | счёт |
| graphify | то, что читается | 0 LLM-кредитов на сборку | в 91.8x меньше токенов на запрос против наивного чтения (наш замер) | счёт, в части чтения |
| rtk | сжимаемый вывод shell | 60-90% на команды | 19.7% сжимаемо, потолок около 3%, +7.6% на задачу (JetBrains) | поля |
| caveman / Concise | то, что пишет агент | 65% | 8.5% выходных токенов (JetBrains) | поля |
Сделайте в понедельник
- Откройте свою последнюю длинную сессию и посчитайте, откуда пришёл вход: сколько было Read и Grep, сколько вывода shell, сколько повторно отправленной истории. Поставьте каждый инструмент на его часть, прежде чем что-либо устанавливать.
- Установите Superpowers командой
/plugin install superpowers@claude-plugins-officialи проведите одну реальную фичу через brainstorming, writing-plans и subagent-driven-development. Следите, чтобы индикатор контекста оркестратора оставался ровным. - Задавайте явную модель каждому субагенту, которого запускаете. Пропущенная модель наследуется от сессии, и вы платите по тарифу оркестратора за механическую работу.
- Запустите
/graphify .на самом большом репозитории, затемgraphify benchmark, и сравните стоимость запроса с размером наивного корпуса, который он выводит. Пересобирайте граф, когда код меняется. - Если вы уже используете rtk, читайте
rtk gainкак байты вывода shell, а не деньги. Сопоставьте это с разбивкой JetBrains: что бы ни сэкономилиfind,readиgrep, инструменты Read и Grep через хук никогда не проходили. - Переключитесь на стиль вывода Concise через
/config, прежде чем добавлять caveman; он идёт в комплекте с Claude Code и не требует правил навыка на каждый ход. - Ведите собственный замер: стоимость задачи до и после каждого изменения, на одном и том же наборе задач, а не байты одной команды.
Читать дальше
- Полная методология JetBrains по rtk, с повтором 83 сессий и разбивкой 1,056 команд, это эталон для измерения любого shell-прокси s1.
- Бенчмарк caveman объясняет, как 82 парные задачи и sign test превращают график 65% в 8.5% выходных токенов s2.
- Страница rtk savings-explained это самое ясное дерево того, что сессия реально читает; прочтите её, прежде чем верить любому счётчику «tokens saved» s3.
- Раздел benchmarks в README graphify описывает сборку без кредитов и семантический проход, единственный шаг, стоящий вызовов модели s5.
- Раздел Superpowers о выборе модели, с «Turn count beats token price» и лимитом в пять раундов, стоит скопировать в собственные определения агентов s14.
- Жёсткий барьер brainstorming и три пути показывают, как церемония масштабируется под задачу и где она срабатывает даже на правках, которые её не заслуживают s12.
- Стили вывода в документации Claude Code: стиль Concise, порог v2.1.237 и почему субагенты его игнорируют s8.
Источники
- Does rtk really save tokens in Claude Code?, JetBrains. Зачем читать: единственный сквозной тест rtk, с разбивкой 19.7% / 46.3% / 34.0% того, что читает агент.
- Speak to AI agents like cavemen to save tokens, JetBrains. Зачем читать: 82 парные задачи, которые сводят заявленные 65% к 8.5% и не находят потери качества.
- How RTK savings work, GitHub. Зачем читать: собственное дерево счёта от мейнтейнеров и фраза про 90% меньше байт.
- rtk-ai/rtk on GitHub, GitHub. Зачем читать: README теперь говорит, что именно измеряет rtk и как оцениваются счётчики.
- Graphify-Labs/graphify on GitHub, GitHub. Зачем читать: таблица бенчмарков, сборка без кредитов и команда
graphify benchmark, использованная здесь. - obra/superpowers on GitHub, GitHub. Зачем читать: плагин, который меняет то, что читается, и то, какая модель это читает.
- JuliusBrussee/caveman on GitHub, GitHub. Зачем читать: таблица экономии и блок IMPORTANT, который её подрывает.
- Output styles, Claude Code docs. Зачем читать: встроенный стиль Concise и его ограничения с субагентами.
- rtk launch post on r/ClaudeAI, Reddit. Зачем читать: исходное заявление про 10.2M, полезно сравнить с тем, что измерили JetBrains.
- Graphify hit 73k stars and 2.2M downloads (r/ClaudeAI), Reddit. Зачем читать: автор об adoption и о том, для чего нужен граф.
- Superpowers: The Plugin That Disciplines Claude Code, AIDive. Зачем читать: наш полный разбор плагина, навык за навыком.
- Superpowers brainstorming skill (SKILL.md), GitHub. Зачем читать: жёсткий барьер и три пути, дословно.
- Superpowers writing-plans skill (SKILL.md), GitHub. Зачем читать: гранулярность шагов в 2 to 5 минут, которая держит контексты субагентов маленькими.
- Superpowers subagent-driven-development skill (SKILL.md), GitHub. Зачем читать: выбор модели по ролям и лимит в пять раундов.
FAQ
Почему rtk показывает 11.6M сэкономленных токенов, если счёт почти не меняется?
Счётчик измеряет байты вывода shell, делённые на 4, по командам, прошедшим через хук. Вызовы инструментов Read и Grep, системный промпт и повторно отправляемая история через него не проходят, а JetBrains выяснили, что таким способом сжимаемо лишь 19.7% того, что читает модель.
Сжимает ли Superpowers что-нибудь?
Нет. Он читает меньше, потому что даёт каждой задаче свежего субагента только с контекстом этой задачи, и платит меньше, назначая наименее мощную модель, которая справляется с ролью. Цена: проверка на входе каждой задачи.
Стоит ли ставить caveman?
JetBrains не нашли потери качества и получили на 8.5% меньше выходных токенов, так что используйте его, если нравится стиль. Стиль вывода Concise в Claude Code v2.1.237 или новее даёт тот же эффект без 1 to 1.5k входных токенов, которые правила навыка стоят на каждом ходу.
Когда graphify перестаёт окупаться?
Когда граф устарел или вопрос требует семантического прохода, который стоит вызовов модели. Цифра 91.8x сравнивает запрос с чтением всего корпуса, поэтому на небольших репозиториях разрыв меньше.
AIDive