TL;DR
- Bốn công cụ nằm trên bốn phần khác nhau của hóa đơn Claude Code: graphify ở phần được đọc vào, rtk ở output của shell, Superpowers ở lịch sử và việc chọn model, caveman ở những gì agent viết ra. Hãy xếp hạng chúng theo kích thước phần mà chúng tác động, không theo con số phần trăm trong README.
- Superpowers là công cụ duy nhất làm hóa đơn thay đổi thật: một subagent mới cho mỗi task và model yếu nhất vẫn đủ dùng sẽ thay đổi thứ được đọc và người đọc nó. Cái giá là một cổng kiểm soát ở mọi task, kể cả task nhỏ xíu.
- graphify đứng thứ hai: một graph tree-sitter chạy local, dựng với 0 LLM credit, ít hơn 91.8x token mỗi truy vấn so với việc đọc thô corpus của chính chúng tôi.
- rtk nén đúng một phần mà Bash hook nhìn thấy được. JetBrains đo được 19.7% những gì model đọc là nén được, trần khoảng 3% hóa đơn, và +7.6% mỗi task trong bài test đầu cuối.
- caveman quảng cáo 65% và đo được 8.5% output token trên công việc agentic. Claude Code có sẵn cùng ý tưởng đó dưới dạng output style Concise.
- Hai con số mà mọi người hay trích, 11.6M token tiết kiệm và +7.6% mỗi task, đo hai thứ khác nhau: số byte của output bash so với chi phí của một task hoàn chỉnh.
Các phép đo nói gì
Trước hết là bản đồ. Tài liệu savings của rtk vẽ cây những thứ một session đọc vào và đánh dấu output bash là phần duy nhất proxy lọc được, rồi nói thẳng: "A command showing 90% fewer output bytes does not make your session 90% cheaper" s3. JetBrains chạy lại 83 session gốc, 1.9 triệu ký tự output của tool, và chia làm ba phần: output shell rtk nén được 373,339 (19.7%), output shell không có rule 879,326 (46.3%), đọc file và tool tìm kiếm bỏ qua rtk 646,613 (34.0%) s1. Read và Grep không bao giờ đi qua Bash hook. README của caveman đi đến cùng kết luận từ hướng ngược lại: phần đọc thường là nửa lớn hơn của hóa đơn s7.
graphify. Repo được tạo ngày 2026-04-03 và có 113,946 star cùng 11,078 fork vào 2026-09-02, bản phát hành mới nhất v0.9.53, Python, Apache-2.0 s5. Dòng benchmark trong README ghi "Graph build | LLM credits | 0": code được parse local bằng tree-sitter cho ~40 ngôn ngữ, cộng đồng được tách bằng Leiden, không có gì rời khỏi máy s5. Bài của tác giả trên r/ClaudeAI báo cáo 73k star và 2.2M lượt tải trong 2.5 tháng s10. graphify benchmark của chúng tôi trên một project 1,701,550 từ (khoảng 2,268,733 token nếu đọc thô) dựng ra 34,031 node và 56,865 edge, chi phí truy vấn trung bình khoảng 24,702 token, ít hơn 91.8x token mỗi truy vấn; theo từng câu hỏi, mức chênh dao động từ 679.1x cho "what is the main entry point" đến 34.0x cho "what connects the data layer to the api" s5. Con số 91.8x so với việc đọc thô toàn bộ, thứ không ai cố ý làm; graph cũng lỗi thời khi code thay đổi, và bước semantic tùy chọn là bước duy nhất tốn lượt gọi model.
rtk. Tạo ngày 2026-01-22, 78,326 star và 4,942 fork vào 2026-09-02, bản phát hành v0.47.0, Rust, Apache-2.0, "100+ supported commands, <10ms overhead" s4. Bài ra mắt tuyên bố "cargo test: 155 lines → 3 lines (-98%)", "git status: 119 chars → 28 chars (-76%)" và "Total over 2 weeks: 10.2M tokens saved (89.2%)" s9. Trên máy của chúng tôi, rtk 0.42.3 báo 25599 lệnh và 11.6M token tiết kiệm (41.6%), với find, read và grep đứng đầu bảng By Command s4. JetBrains cài rtk v0.43.0 đúng như rtk init -g cung cấp, trên Claude Code 2.1.201 và claude-sonnet-5, và chạy 86 task hai lần. Chỉ 1 trong 3 lệnh shell là thứ rtk viết lại được (349 viết lại được, 525 không có rule, 182 bị bỏ qua, trên tổng 1,056 lệnh). Nén 70% toàn bộ output nén được thì mức tiết kiệm tổng tối đa khoảng 3% hóa đơn; kết quả đo được là đắt hơn +7.6% mỗi task, không khác biệt ở effort cao s1. README giờ đã thừa nhận điểm này: "RTK cuts up to 90% of the bash output your agent reads. That is what RTK measures, and it is not the same as cutting your bill by 90%", và các số đếm được ước tính bằng bytes / 4 s4.
Superpowers. Tạo ngày 2025-10-09, 280,792 star và 25,164 fork vào 2026-09-02, bản phát hành v6.3.0 với mười bốn skill, MIT, một lệnh cài đặt: /plugin install superpowers@claude-plugins-official s6. Skill brainstorming mở đầu bằng một hard gate: không code, không scaffolding, không implementation skill nào cho đến khi một ý định rõ ràng được duyệt; ba đường (spike, bounded, architectural) và quy tắc "When in doubt between two paths, take the heavier one" s12. writing-plans giả định engineer có zero context và chia công việc thành các bước mà "Each step is one action (2-5 minutes)" s13. subagent-driven-development giao mỗi task cho một subagent mới, chỉ nhận context của task đó, không bao giờ nhận lịch sử session, có review sau mỗi task và một review rộng cho cả branch ở cuối. Phần model của nó nói "Use the least powerful model that can handle each role to conserve cost", cảnh báo rằng model bị bỏ trống sẽ kế thừa model của session, và khẳng định "Turn count beats token price". Tối đa năm vòng mỗi task: vòng 1 đến 3 tiếp tục với implementer, vòng 4 đưa vào một implementer mới trên model mạnh hơn, vòng 5 orchestrator tự quyết s14. Không có nén ở đâu cả: mức tiết kiệm đến từ việc đọc ít lịch sử hơn và trả tiền cho model nhỏ hơn ở các bước cơ học. Bản walkthrough đầy đủ nằm trong video trước của chúng tôi s11.
caveman. Tạo ngày 2026-04-04, 102,548 star và 5,967 fork vào 2026-09-02, bản phát hành bin-v1.1.5, Go; skill dùng MIT, runtime proxy dùng BSL-1.1 s7. Bảng của chính nó, mười prompt qua Claude API, cho trung bình 1214 output token khi không dùng và 294 khi dùng, tức 65%, trường hợp tốt nhất 87% và tệ nhất 22% s7. Khối IMPORTANT của README rất thẳng thắn: skill chỉ rút ngắn output, input và reasoning token không đổi, và các rule tốn khoảng 1 đến 1.5k input token mỗi lượt, nên mức tiết kiệm của cả session thấp hơn biểu đồ s7. JetBrains chạy 82 task ghép cặp trên Claude Code 2.1.200 với claude-sonnet-5 ở effort low, khoảng USD 106: "Advertised saving: 65%. Measured saving: 8.5%", 592k xuống 542k output token, không phát hiện suy giảm chất lượng (sign test p = 0.82), khuyến nghị "use it if you like it" s2. Style Concise có sẵn của Claude Code làm cùng việc: "Claude leads with the result, skips preamble and narration, and keeps responses short by default", yêu cầu v2.1.237 trở lên, chọn qua /config và lưu thành outputStyle trong .claude/settings.local.json. Style chỉ áp dụng cho cuộc hội thoại chính; subagent chạy system prompt riêng của nó s8.
Bảng kết luận
| Công cụ | Phần của hóa đơn | Quảng cáo | Đo được | Tác động |
|---|---|---|---|---|
| Superpowers | lịch sử + model cho mỗi task | không có số | context mới cho mỗi task, model yếu nhất cho mỗi vai trò | hóa đơn |
| graphify | những gì được đọc | 0 LLM credit để dựng | ít hơn 91.8x token mỗi truy vấn so với đọc thô (của chúng tôi) | hóa đơn, ở phần đọc |
| rtk | output shell nén được | 60-90% trên các lệnh | 19.7% nén được, trần khoảng 3%, +7.6% mỗi task (JetBrains) | phần lề |
| caveman / Concise | những gì agent viết ra | 65% | 8.5% output token (JetBrains) | phần lề |
Làm việc này vào thứ Hai
- Mở session dài gần nhất của bạn và đếm xem input đi đâu: bao nhiêu là Read và Grep, bao nhiêu là output shell, bao nhiêu là lịch sử được phát lại. Đặt từng công cụ vào đúng phần của nó trước khi cài bất cứ thứ gì.
- Cài Superpowers bằng
/plugin install superpowers@claude-plugins-officialvà chạy một feature thật qua brainstorming, writing-plans và subagent-driven-development. Quan sát đồng hồ context của orchestrator giữ phẳng. - Đặt model tường minh cho mọi subagent bạn giao việc. Model bị bỏ trống sẽ kế thừa model của session và bạn trả giá của orchestrator cho công việc cơ học.
- Chạy
/graphify .trên repo lớn nhất của bạn, rồigraphify benchmark, và so sánh chi phí mỗi truy vấn với kích thước corpus đọc thô mà nó in ra. Dựng lại graph khi code thay đổi. - Nếu bạn đã chạy rtk, hãy đọc
rtk gainnhư số byte output shell, không phải tiền. Ghép nó với cách chia của JetBrains: dùfind,readvàgreptiết kiệm được bao nhiêu, các tool Read và Grep chưa bao giờ đi qua hook. - Chuyển sang output style Concise qua
/configtrước khi thêm caveman; nó có sẵn trong Claude Code và không tốn rule của skill ở mỗi lượt. - Giữ một phép đo của riêng bạn: chi phí task trước và sau mỗi thay đổi, cùng một bộ task, không phải số byte của một lệnh đơn lẻ.
Đọc tiếp
- Phương pháp luận đầy đủ của JetBrains về rtk, với bản replay 83 session và cách chia 1,056 lệnh, là tài liệu tham chiếu để đo bất kỳ shell proxy nào s1.
- Benchmark caveman giải thích cách 82 task ghép cặp và một sign test biến biểu đồ 65% thành 8.5% output token s2.
- Trang savings-explained của rtk là cây rõ ràng nhất về những gì một session thực sự đọc; hãy đọc nó trước khi tin bất kỳ bộ đếm "tokens saved" nào s3.
- Phần benchmarks trong README của graphify mô tả bản dựng không tốn credit và bước semantic, bước duy nhất tốn lượt gọi model s5.
- Phần chọn model của Superpowers, với "Turn count beats token price" và giới hạn năm vòng, là phần đáng chép vào định nghĩa agent của bạn s14.
- Hard gate của brainstorming và ba đường cho thấy mức nghi thức co giãn theo task thế nào, và chỗ nó kích hoạt cả với những bản sửa quá nhỏ để đáng có s12.
- Output styles trong tài liệu Claude Code: style Concise, ngưỡng v2.1.237, và lý do subagent bỏ qua nó s8.
Nguồn
- Does rtk really save tokens in Claude Code?, JetBrains. Vì sao nên đọc: bài test đầu cuối duy nhất của rtk, với cách chia 19.7% / 46.3% / 34.0% những gì một agent đọc.
- Speak to AI agents like cavemen to save tokens, JetBrains. Vì sao nên đọc: 82 task ghép cặp đưa tuyên bố 65% xuống 8.5% mà không thấy mất chất lượng.
- How RTK savings work, GitHub. Vì sao nên đọc: cây hóa đơn do chính maintainer vẽ và câu nói về 90% ít byte hơn.
- rtk-ai/rtk on GitHub, GitHub. Vì sao nên đọc: README giờ nêu rõ rtk đo cái gì và các số đếm được ước tính ra sao.
- Graphify-Labs/graphify on GitHub, GitHub. Vì sao nên đọc: bảng benchmark, bản dựng không tốn credit và lệnh
graphify benchmarkđược dùng ở đây. - obra/superpowers on GitHub, GitHub. Vì sao nên đọc: plugin thay đổi thứ được đọc và model nào đọc nó.
- JuliusBrussee/caveman on GitHub, GitHub. Vì sao nên đọc: bảng savings và khối IMPORTANT làm yếu nó đi.
- Output styles, Claude Code docs. Vì sao nên đọc: style Concise có sẵn và giới hạn của nó với subagent.
- rtk launch post on r/ClaudeAI, Reddit. Vì sao nên đọc: tuyên bố 10.2M ban đầu, hữu ích để so với những gì JetBrains đo được.
- Graphify hit 73k stars and 2.2M downloads (r/ClaudeAI), Reddit. Vì sao nên đọc: tác giả nói về mức độ được dùng và graph dùng để làm gì.
- Superpowers: The Plugin That Disciplines Claude Code, AIDive. Vì sao nên đọc: bản walkthrough đầy đủ của chúng tôi về plugin, từng skill một.
- Superpowers brainstorming skill (SKILL.md), GitHub. Vì sao nên đọc: hard gate và ba đường, nguyên văn.
- Superpowers writing-plans skill (SKILL.md), GitHub. Vì sao nên đọc: độ chi tiết 2 đến 5 phút mỗi bước giúp context của subagent nhỏ.
- Superpowers subagent-driven-development skill (SKILL.md), GitHub. Vì sao nên đọc: chọn model theo vai trò và giới hạn năm vòng.
FAQ
Vì sao rtk hiện 11.6M token tiết kiệm trong khi gần như không làm hóa đơn nhúc nhích?
Bộ đếm đo số byte output shell chia cho 4, trên các lệnh đã đi qua hook. Các lệnh gọi tool Read và Grep, system prompt và lịch sử phát lại không bao giờ đi qua nó, và JetBrains thấy chỉ 19.7% những gì model đọc là nén được theo cách đó.
Superpowers có nén gì không?
Không. Nó đọc ít hơn bằng cách giao mỗi task cho một subagent mới chỉ có context của task đó, và trả ít hơn bằng cách gán model yếu nhất đủ sức đảm nhận vai trò. Cái giá là một cổng kiểm soát ở mọi task.
caveman có đáng cài không?
JetBrains không thấy mất chất lượng và thấy giảm 8.5% output token, nên cứ dùng nếu bạn thích phong cách đó. Output style Concise trong Claude Code v2.1.237 trở lên cho hiệu quả tương tự mà không tốn 1 đến 1.5k input token cho rule của skill ở mỗi lượt.
Khi nào graphify không còn đáng giá?
Khi graph đã lỗi thời hoặc câu hỏi cần bước semantic, bước này có tốn lượt gọi model. Con số 91.8x so sánh một truy vấn với việc đọc toàn bộ corpus, nên repo nhỏ hơn sẽ thấy mức chênh nhỏ hơn.
AIDive