TL;DR
- 네 가지 도구는 Claude Code 비용의 서로 다른 구간을 다룹니다. graphify는 읽는 내용, rtk는 셸 출력, Superpowers는 히스토리와 모델 선택, caveman은 에이전트가 쓰는 내용입니다. README에 적힌 퍼센트가 아니라 각 도구가 건드리는 구간의 크기로 순위를 매기세요.
- 실제로 비용을 움직이는 것은 Superpowers뿐입니다. 작업마다 새 서브에이전트를 쓰고 맞는 범위에서 가장 약한 모델을 쓰면, 무엇을 읽는지와 누가 읽는지가 바뀝니다. 대신 아주 작은 작업에도 매번 게이트를 거쳐야 하는 비용이 따릅니다.
- graphify가 두 번째입니다. LLM 크레딧 0으로 로컬에서 tree-sitter 그래프를 만들고, 우리 코퍼스에서 단순 전체 읽기보다 쿼리당 토큰이 91.8x 적었습니다.
- rtk는 Bash 훅이 볼 수 있는 구간 하나만 압축합니다. JetBrains는 모델이 읽는 내용의 19.7%만 압축 가능하다고 측정했고, 비용 기준 상한은 약 3%, 엔드투엔드 테스트에서는 작업당 +7.6%였습니다.
- caveman은 65%를 내세우지만 에이전트 작업에서 측정된 출력 토큰 절감은 8.5%였습니다. Claude Code는 같은 발상을 Concise 출력 스타일로 기본 제공합니다.
- 흔히 인용되는 두 숫자, 11.6M 토큰 절감과 작업당 +7.6%는 서로 다른 것을 잽니다. 하나는 bash 출력의 바이트이고, 다른 하나는 끝난 작업의 비용입니다.
측정 결과가 말해 주는 것
먼저 지도입니다. rtk의 savings 문서는 세션이 읽는 내용을 트리로 그리고, 프록시가 필터링하는 부분은 bash 출력뿐이라고 표시한 뒤 이렇게 분명히 말합니다. "A command showing 90% fewer output bytes does not make your session 90% cheaper" s3. JetBrains는 기준 세션 83개, 도구 출력 190만 자를 재생해 세 갈래로 나눴습니다. rtk가 압축할 수 있는 셸 출력 373,339 (19.7%), 규칙이 없는 셸 출력 879,326 (46.3%), rtk를 거치지 않는 파일 읽기와 검색 도구 646,613 (34.0%) s1. Read와 Grep은 Bash 훅을 지나지 않습니다. caveman README도 반대편에서 같은 결론에 도달합니다. 비용의 더 큰 절반은 대개 읽기입니다 s7.
graphify. 저장소는 2026-04-03에 만들어졌고, 2026-09-02 기준 별 113,946개, 포크 11,078개, 최신 릴리스 v0.9.53, Python, Apache-2.0입니다 s5. README 벤치마크 행에는 "Graph build | LLM credits | 0"이라고 적혀 있습니다. 코드는 tree-sitter로 약 40개 언어를 로컬에서 파싱하고, 커뮤니티는 Leiden으로 나누며, 어떤 것도 머신 밖으로 나가지 않습니다 s5. 작성자가 r/ClaudeAI에 올린 글에는 2.5개월 만에 별 73k, 다운로드 2.2M이라고 나와 있습니다 s10. 우리가 1,701,550단어 프로젝트(단순 전체 읽기 기준 약 2,268,733 토큰)에서 돌린 graphify benchmark는 노드 34,031개, 엣지 56,865개를 만들었고, 쿼리당 평균 비용은 약 24,702 토큰, 즉 쿼리당 토큰이 91.8x 적었습니다. 질문별 편차는 "what is the main entry point"의 679.1x부터 "what connects the data layer to the api"의 34.0x까지였습니다 s5. 91.8x는 아무도 일부러 하지 않는 단순 전체 읽기와 비교한 값입니다. 또 코드가 바뀌면 그래프는 낡고, 선택 사항인 시맨틱 패스는 모델 호출 비용이 드는 유일한 단계입니다.
rtk. 2026-01-22 생성, 2026-09-02 기준 별 78,326개, 포크 4,942개, 릴리스 v0.47.0, Rust, Apache-2.0, "100+ supported commands, <10ms overhead"입니다 s4. 출시 글은 "cargo test: 155 lines → 3 lines (-98%)", "git status: 119 chars → 28 chars (-76%)", "Total over 2 weeks: 10.2M tokens saved (89.2%)"를 주장했습니다 s9. 우리 머신에서 rtk 0.42.3은 명령 25599개, 절감 토큰 11.6M (41.6%)을 보고했고, By Command 표 상위는 find, read, grep이었습니다 s4. JetBrains는 rtk v0.43.0을 rtk init -g가 설치하는 그대로 Claude Code 2.1.201, claude-sonnet-5에서 돌려 86개 작업을 두 번씩 실행했습니다. rtk가 다시 쓸 수 있는 셸 명령은 3개 중 1개뿐입니다(전체 1,056개 명령 중 다시 쓸 수 있는 것 349, 규칙 없음 525, 건너뜀 182). 압축 가능한 출력을 전부 70% 줄여도 절감은 비용의 약 3%에서 멈추고, 실제 측정 결과는 작업당 +7.6% 더 비쌌으며 높은 effort에서는 차이가 없었습니다 s1. README도 이제 이 점을 인정합니다. "RTK cuts up to 90% of the bash output your agent reads. That is what RTK measures, and it is not the same as cutting your bill by 90%", 그리고 보고되는 수치는 bytes / 4로 추정한 값입니다 s4.
Superpowers. 2025-10-09 생성, 2026-09-02 기준 별 280,792개, 포크 25,164개, 릴리스 v6.3.0, 스킬 14개, MIT, 설치 명령은 하나입니다. /plugin install superpowers@claude-plugins-official s6. brainstorming 스킬은 하드 게이트로 시작합니다. 명시적인 의도가 승인되기 전에는 코드도, 스캐폴딩도, 구현 스킬도 없습니다. 경로는 세 가지(spike, bounded, architectural)이고 규칙은 "When in doubt between two paths, take the heavier one"입니다 s12. writing-plans는 엔지니어에게 컨텍스트가 전혀 없다고 가정하고, 작업을 "Each step is one action (2-5 minutes)"인 단계로 쪼갭니다 s13. subagent-driven-development는 작업마다 새 서브에이전트를 주고, 그 에이전트는 세션 히스토리가 아닌 해당 작업의 컨텍스트만 받습니다. 작업마다 리뷰가 있고, 마지막에 브랜치 전체에 대한 폭넓은 리뷰가 있습니다. 모델 섹션은 "Use the least powerful model that can handle each role to conserve cost"라고 말하고, 모델을 생략하면 세션의 모델을 상속한다고 경고하며, "Turn count beats token price"라고 못박습니다. 작업당 최대 다섯 라운드입니다. 1~3라운드는 구현자를 재개하고, 4라운드는 더 강력한 모델의 새 구현자를 투입하며, 5라운드는 오케스트레이터가 직접 판정합니다 s14. 어디에도 압축은 없습니다. 절감은 히스토리를 덜 읽고, 기계적인 단계에 더 작은 모델을 쓰는 데서 나옵니다. 전체 설명은 우리 이전 영상에 있습니다 s11.
caveman. 2026-04-04 생성, 2026-09-02 기준 별 102,548개, 포크 5,967개, 릴리스 bin-v1.1.5, Go이며, 스킬은 MIT, 프록시 런타임은 BSL-1.1입니다 s7. Claude API로 프롬프트 열 개를 돌린 자체 표에서 출력 토큰 평균은 적용 전 1214, 적용 후 294로 65%, 최선은 87%, 최악은 22%입니다 s7. README의 IMPORTANT 블록은 솔직합니다. 스킬은 출력만 줄이고 입력과 추론 토큰은 바뀌지 않으며, 규칙이 매 턴 입력 토큰을 약 1~1.5k 쓰기 때문에 세션 전체 절감은 차트보다 낮아집니다 s7. JetBrains는 effort low의 claude-sonnet-5, Claude Code 2.1.200에서 쌍을 이룬 작업 82개를 약 USD 106로 돌렸습니다. "Advertised saving: 65%. Measured saving: 8.5%", 출력 토큰은 592k에서 542k, 감지 가능한 품질 저하는 없었고(부호 검정 p = 0.82), 권고는 "use it if you like it"이었습니다 s2. Claude Code의 내장 Concise 스타일도 같은 일을 합니다. "Claude leads with the result, skips preamble and narration, and keeps responses short by default", v2.1.237 이상이 필요하고, /config로 고르며 .claude/settings.local.json에 outputStyle로 저장됩니다. 스타일은 메인 대화에만 적용되고, 서브에이전트는 자체 시스템 프롬프트로 실행됩니다 s8.
판정 표
| 도구 | 비용에서 다루는 구간 | 광고 수치 | 측정 결과 | 움직이는 것 |
|---|---|---|---|---|
| Superpowers | 히스토리 + 작업별 모델 | 수치 없음 | 작업마다 새 컨텍스트, 역할별 가장 약한 모델 | 비용 자체 |
| graphify | 읽는 내용 | 빌드에 LLM 크레딧 0 | 단순 읽기 대비 쿼리당 토큰 91.8x 적음 (우리 측정) | 읽기 부분의 비용 |
| rtk | 압축 가능한 셸 출력 | 명령에서 60-90% | 압축 가능 19.7%, 상한 약 3%, 작업당 +7.6% (JetBrains) | 가장자리 |
| caveman / Concise | 에이전트가 쓰는 내용 | 65% | 출력 토큰 8.5% (JetBrains) | 가장자리 |
월요일에 할 일
- 가장 최근의 긴 세션을 열어 입력이 어디에 쓰였는지 세어 보세요. Read와 Grep이 얼마인지, 셸 출력이 얼마인지, 재생된 히스토리가 얼마인지. 무엇을 설치하기 전에 각 도구를 해당 구간에 놓아 보세요.
-
/plugin install superpowers@claude-plugins-official로 Superpowers를 설치하고, 실제 기능 하나를 brainstorming, writing-plans, subagent-driven-development로 끝까지 진행해 보세요. 오케스트레이터의 컨텍스트 게이지가 일정하게 유지되는지 지켜보세요. - 디스패치하는 모든 서브에이전트에 모델을 명시하세요. 모델을 생략하면 세션의 모델을 상속해서, 기계적인 작업에 오케스트레이터 등급의 비용을 내게 됩니다.
- 가장 큰 저장소에서
/graphify .를 실행한 뒤graphify benchmark를 돌리고, 쿼리당 비용을 출력된 단순 코퍼스 크기와 비교하세요. 코드가 바뀌면 그래프를 다시 빌드하세요. - 이미 rtk를 쓰고 있다면
rtk gain을 돈이 아니라 셸 출력의 바이트로 읽으세요. JetBrains의 분할과 함께 보세요.find,read,grep이 아무리 줄여도 Read와 Grep 도구는 훅을 지난 적이 없습니다. - caveman을 추가하기 전에
/config에서 Concise 출력 스타일로 바꿔 보세요. Claude Code에 포함되어 있고 턴마다 스킬 규칙 비용이 들지 않습니다. - 자신만의 측정을 하나 유지하세요. 단일 명령의 바이트 수가 아니라, 같은 작업 세트로 변경 전후의 작업당 비용을 비교하세요.
더 읽을거리
- JetBrains의 rtk 전체 방법론(세션 83개 재생, 명령 1,056개 분할)은 모든 셸 프록시를 측정할 때의 기준입니다 s1.
- caveman 벤치마크는 쌍을 이룬 작업 82개와 부호 검정이 어떻게 65% 차트를 출력 토큰 8.5%로 바꾸는지 설명합니다 s2.
- rtk의 savings-explained 페이지는 세션이 실제로 무엇을 읽는지를 가장 명확하게 보여 주는 트리입니다. 어떤 "tokens saved" 카운터든 믿기 전에 읽어 보세요 s3.
- graphify README의 벤치마크 섹션은 크레딧 0 빌드와, 모델 호출 비용이 드는 유일한 단계인 시맨틱 패스를 설명합니다 s5.
- "Turn count beats token price"와 다섯 라운드 상한이 있는 Superpowers의 모델 선택 섹션은 자신의 에이전트 정의에 가져다 쓸 만합니다 s14.
- brainstorming 하드 게이트와 세 가지 경로는 작업 크기에 따라 절차가 어떻게 달라지는지, 그리고 그럴 만하지 않은 작은 수정에도 어디서 작동하는지 보여 줍니다 s12.
- Claude Code 문서의 출력 스타일: Concise 스타일, v2.1.237이라는 최소 버전, 그리고 서브에이전트가 이를 무시하는 이유 s8.
출처
- Does rtk really save tokens in Claude Code?, JetBrains. 읽어야 하는 이유: rtk에 대한 유일한 엔드투엔드 테스트이며, 에이전트가 읽는 내용을 19.7% / 46.3% / 34.0%로 나눈 분할이 들어 있습니다.
- Speak to AI agents like cavemen to save tokens, JetBrains. 읽어야 하는 이유: 쌍을 이룬 작업 82개로 65% 주장을 품질 저하 없이 8.5%로 줄여 보여 줍니다.
- How RTK savings work, GitHub. 읽어야 하는 이유: 유지보수자들이 직접 그린 비용 트리와 "출력 바이트 90% 감소" 문장이 있습니다.
- rtk-ai/rtk on GitHub, GitHub. 읽어야 하는 이유: README가 이제 rtk가 무엇을 측정하는지, 수치를 어떻게 추정하는지 밝힙니다.
- Graphify-Labs/graphify on GitHub, GitHub. 읽어야 하는 이유: 벤치마크 표, 크레딧 0 빌드, 그리고 여기서 쓴
graphify benchmark명령이 있습니다. - obra/superpowers on GitHub, GitHub. 읽어야 하는 이유: 무엇을 읽는지와 어떤 모델이 읽는지를 바꾸는 플러그인입니다.
- JuliusBrussee/caveman on GitHub, GitHub. 읽어야 하는 이유: 절감 표와, 그것을 깎아내리는 IMPORTANT 블록이 있습니다.
- Output styles, Claude Code docs. 읽어야 하는 이유: 내장 Concise 스타일과 서브에이전트에서의 한계를 다룹니다.
- rtk launch post on r/ClaudeAI, Reddit. 읽어야 하는 이유: 원래의 10.2M 주장이며, JetBrains가 측정한 것과 비교하기 좋습니다.
- Graphify hit 73k stars and 2.2M downloads (r/ClaudeAI), Reddit. 읽어야 하는 이유: 작성자가 직접 말하는 도입 현황과 그래프의 용도입니다.
- Superpowers: The Plugin That Disciplines Claude Code, AIDive. 읽어야 하는 이유: 스킬별로 플러그인을 끝까지 다룬 우리 영상입니다.
- Superpowers brainstorming skill (SKILL.md), GitHub. 읽어야 하는 이유: 하드 게이트와 세 가지 경로 원문입니다.
- Superpowers writing-plans skill (SKILL.md), GitHub. 읽어야 하는 이유: 서브에이전트 컨텍스트를 작게 유지하는 2~5분 단위 단계 규칙입니다.
- Superpowers subagent-driven-development skill (SKILL.md), GitHub. 읽어야 하는 이유: 역할별 모델 선택과 다섯 라운드 상한입니다.
FAQ
rtk가 비용을 거의 못 줄이는데 왜 11.6M 토큰 절감이라고 표시되나요?
카운터는 훅을 지난 명령의 셸 출력 바이트를 4로 나눈 값입니다. Read와 Grep 도구 호출, 시스템 프롬프트, 재생되는 히스토리는 훅을 지나지 않으며, JetBrains는 모델이 읽는 내용 중 그렇게 압축할 수 있는 것은 19.7%뿐이라고 확인했습니다.
Superpowers는 무언가를 압축하나요?
아니요. 작업마다 그 작업의 컨텍스트만 가진 새 서브에이전트를 줘서 덜 읽고, 해당 역할을 처리할 수 있는 가장 약한 모델을 배정해서 덜 지불합니다. 대가는 모든 작업에 거는 게이트입니다.
caveman은 설치할 가치가 있나요?
JetBrains는 품질 저하 없이 출력 토큰이 8.5% 줄었다고 확인했으니, 스타일이 마음에 들면 쓰세요. Claude Code v2.1.237 이상의 Concise 출력 스타일은 스킬 규칙이 매 턴 쓰는 입력 토큰 1~1.5k 없이 같은 효과를 냅니다.
graphify는 언제부터 효과가 떨어지나요?
그래프가 낡았거나, 모델 호출 비용이 드는 시맨틱 패스가 필요한 질문일 때입니다. 91.8x는 쿼리 하나를 전체 코퍼스 읽기와 비교한 값이므로, 작은 저장소일수록 격차도 작아집니다.
AIDive