JetBrains nói không, máy tôi nói 11,6 triệu
Tháng 7/2026, JetBrains chi khoảng 320 $ tín dụng API — 425 lượt chạy tính phí — để kiểm nghiệm rtk, một proxy shell mà hàng chục nghìn lập trình viên cài để tiết kiệm token trong Claude Code. Kết quả: các phiên làm việc đắt hơn 7,6% cho mỗi tác vụ. Hai tuần trước đó, cũng đội ngũ này đo caveman, skill quảng cáo cắt 65% token, và nhận được 8,5%. Trên máy của tôi, rtk gain báo 11,6 triệu token tiết kiệm được sau 25.599 lệnh.
Cả hai bộ số đều thật. Chúng chỉ không đo cùng một thứ: một bên là chi phí cho mỗi tác vụ hoàn thành, bên kia là số byte đầu ra của bash.
| Con số | Đo cái gì | Nguồn |
|---|---|---|
| +7,6% mỗi tác vụ (p=0,004) | Chi phí đầu-cuối của một tác vụ khi có rtk | JetBrains, 425 lượt chạy, ~320 $ |
| 8,5% token đầu ra | Mức tiết kiệm đo được của caveman trong công việc agentic | JetBrains, 82 tác vụ ghép cặp |
| 65% | Mức tiết kiệm caveman quảng cáo | README caveman |
| 11,6 tr tiết kiệm (41,6%) | Byte đầu ra bash được rtk nén | rtk gain, 25.599 lệnh |
Đây là bộ bốn công cụ: graphify, rtk, Superpowers và caveman, tổng cộng 575.612 sao GitHub tính đến 2026-09-02. Mỗi cái chạm vào một lát khác nhau của hóa đơn.
| Công cụ | Sao (2026-09-02) | Ngôn ngữ | Giấy phép |
|---|---|---|---|
| Superpowers | 280.792 | Skill Markdown | MIT |
| graphify | 113.946 | Python | Apache-2.0 |
| caveman | 102.548 | Go | MIT (skill) |
| rtk | 78.326 | Rust | Apache-2.0 |
Token thực sự đi đâu
Hóa đơn Claude Code có hai mặt. Token đầu vào là tất cả những gì mô hình đọc: đầu ra của mọi lệnh shell, prompt của bạn, prompt hệ thống, và toàn bộ lịch sử hội thoại được gửi lại ở mỗi lượt gọi. Token đầu ra là tất cả những gì mô hình viết.
Tài liệu của chính rtk vẽ đúng cái cây đó, và thêm một câu mà bài đăng ra mắt của nó chưa từng có: "Một lệnh hiển thị ít hơn 90% byte đầu ra không làm phiên của bạn rẻ đi 90%."
JetBrains đưa con số cho mặt đọc bằng cách chạy lại 83 phiên nền, 1,9 triệu ký tự đầu ra từ các tool.
| Lát của thứ mô hình đọc | Ký tự | Tỷ trọng |
|---|---|---|
| Đầu ra shell rtk nén được | 373.339 | 19,7% |
| Đầu ra shell rtk không có quy tắc | 879.326 | 46,3% |
| Tool đọc và tìm kiếm hoàn toàn không qua rtk | 646.613 | 34,0% |
Chỉ một phần năm những gì mô hình đọc là nén được bằng proxy shell — các tool tích hợp Read, Grep và Glob của Claude Code không bao giờ đi qua hook Bash.
Từ đó có bản đồ cho bốn công cụ: graphify thu nhỏ thứ agent đọc, rtk thu nhỏ thứ shell trả về, Superpowers thu nhỏ lịch sử mà mỗi task mang theo và chọn model nào mang nó, còn caveman thu nhỏ thứ agent nói. Mặt đọc là nửa lớn hơn của hóa đơn, nên bảng xếp hạng bắt đầu từ đó.
graphify: đi theo node, không phải dòng
graphify là một skill biến cả codebase — cùng tài liệu, schema SQL, config và PDF — thành một knowledge graph truy vấn được. Bạn gõ /graphify . trong Claude Code, Cursor, Codex hay Gemini CLI, dự án được lập bản đồ một lần để agent truy vấn graph thay vì grep qua các file.
Code được phân tích bằng AST của tree-sitter trên khoảng 40 ngôn ngữ: tất định, không gọi LLM, không có gì rời khỏi máy. Việc dựng graph tốn không tín dụng LLM nào. Nó tạo ba file: graph.html để bấm xem, GRAPH_REPORT.md, và graph.json — chính là graph, truy vấn được mà không phải đọc lại file của bạn. Mỗi node là một khái niệm (một file, một hàm, một class), và mỗi cạnh được gắn nhãn EXTRACTED khi nó hiện diện rõ trong mã nguồn, hoặc INFERRED khi graphify tự suy ra. Các node được gom thành hệ con bằng thuật toán Leiden.
Benchmark tích hợp, chạy trên một dự án của chúng tôi:
| Chỉ số | Giá trị |
|---|---|
| Node | 34.031 |
| Cạnh | 56.865 |
| Cộng đồng phát hiện được | 967 |
| Nguồn gốc cạnh | 76% EXTRACTED · 24% INFERRED |
| Đọc thô toàn bộ corpus | 1.701.550 từ ≈ 2.268.733 token |
| Truy vấn graph trung bình | ~24.702 token |
| Mức giảm | ít hơn 91,8× token mỗi truy vấn |
Theo từng câu hỏi, khoảng dao động rất rộng: 679,1× với "what is the main entry point", 34,0× với "what connects the data layer to the api".
Hai giới hạn. Phép so sánh là với việc đọc tất cả, mà một phiên làm việc dựa trên grep chưa bao giờ đắt đến thế, nên lợi ích thực tế nhỏ hơn. Và graph sẽ cũ đi — làm mới bằng graphify update <path>, --watch hoặc các git hook — trong khi lượt quét ngữ nghĩa trên tài liệu, PDF và ảnh thì có gọi mô hình và có tốn token.
Cài đặt: uv tool install graphifyy (tên gói có hai chữ y), rồi graphify install.
rtk: shell proxy ra phiên xử
rtk là một proxy CLI nằm giữa Claude Code và shell của bạn. Những lệnh thường ngày như ls, cat hay git status trả về rất nhiều nhiễu mà agent phải đọc dưới dạng token đầu vào: quyền file, thanh tiến trình, một trăm dòng test xanh. rtk chạy đúng lệnh đó và trả lại bản gọn: một binary Rust duy nhất, hơn 100 lệnh được hỗ trợ, độ trễ thêm dưới 10 ms. Một hook PreToolUse viết lại mọi lệnh Bash đủ điều kiện (git status → rtk git status) trước khi chạy, nên agent không bao giờ phải nhớ.
Bài đăng ra mắt của tác giả tuyên bố tiết kiệm 10,2 tr token trong hai tuần, 89,2%, với ví dụ như cargo test từ 155 dòng còn 3. Bảng điều khiển của chúng tôi sau 25.599 lệnh:
| Lệnh | Lượt gọi | Token tiết kiệm | Tỷ lệ |
|---|---|---|---|
rtk find |
354 | 2,2 tr | 46,6% |
rtk read |
3.504 | 2,2 tr | 10,4% |
rtk grep |
2.760 | 1,9 tr | 47,7% |
rtk ps aux |
24 | 1,1 tr | 98,0% |
rtk diff |
39 | 541,1 N | 92,2% |
| Tổng | 25.599 | 11,6 tr | 41,6% |
Rồi đến phiên xử. JetBrains cài rtk đúng như nó được phát hành và chạy 86 tác vụ hai lần trên claude-sonnet-5.
| Phát hiện của JetBrains | Giá trị |
|---|---|
| Lệnh shell rtk viết lại được | 349 trên 1.056 (1 trong 3) |
| Trần của mức tiết kiệm tổng | ~3% hóa đơn |
| Chi phí mỗi tác vụ, reasoning effort thấp | +7,6% (p=0,004) |
| Số lượt mỗi tác vụ | +13,8% (p=0,03) |
| Chi phí mỗi tác vụ, effort cao | ±0% |
| Chất lượng tác vụ | Không đổi |
README của rtk nay nói thẳng: tới 90% đầu ra bash, "không giống với việc cắt 90% hóa đơn của bạn", và các con số của chính nó được ước tính bằng bytes / 4.
Phán quyết: miễn phí, khả năng nén là thật và, theo lời JetBrains, "thường rất khéo". Giữ nó cho các phiên nặng bash; đừng mong nó xoay chuyển hóa đơn.
Superpowers: định khung trước, rồi task nhỏ đến mức không thể fail
Superpowers là plugin Claude Code của Jesse Vincent — 280.792 sao, mười bốn skill, một lệnh cài đặt duy nhất (/plugin install superpowers@claude-plugins-official). Nó tiết kiệm token mà không nén bất cứ thứ gì.
Mọi thứ bắt đầu từ skill brainstorming, mở đầu bằng một cổng cứng: không code, không scaffolding, không skill triển khai nào cho tới khi một ý định rõ ràng được duyệt. Khi skill nạp vào, agent trở thành đối tác brainstorming, và trên thực tế nhiều phần của dự án được nghĩ lại trước khi xây bất cứ thứ gì. Đây là giai đoạn quan trọng nhất, vì những token đắt nhất là token bỏ ra để xây sai thứ.
Skill phân loại công việc thành spike, thay đổi giới hạn, hay thay đổi kiến trúc, và quy tắc được ghi thẳng trong file: "Khi phân vân giữa hai hướng, chọn hướng nặng hơn." Nó thậm chí gọi tên kiểu thất bại, với một mục anti-pattern tên "Too Simple To Need Approval". Hướng kiến trúc sinh ra một spec để bạn duyệt, rồi một kế hoạch triển khai.
Độ tin cậy đến từ kế hoạch. Skill writing-plans cắt công việc thành từng bước một hành động, 2 đến 5 phút: viết test thất bại, chạy để xác nhận nó fail, viết đoạn code tối thiểu để nó pass, chạy lại test, commit. Kế hoạch được viết với giả định người thực hiện không có chút ngữ cảnh nào. Một task nhỏ như vậy nằm gọn trong cửa sổ ngữ cảnh mới còn dư chỗ, nên agent không bao giờ tới cuối task với cửa sổ bão hòa — mà cửa sổ bão hòa chính là nơi sinh ra code bịa.
Giới hạn là phần nghi thức. File nói nó co giãn theo task, nhưng cổng vẫn kích hoạt với một bản vá một dòng, và đó cũng là token.
Superpowers: một task, một subagent, một model vừa vặn
Rồi kế hoạch chạy, và phép tính token thay đổi. Một task, một subagent. Mỗi subagent khởi động với ngữ cảnh mới chỉ chứa task của nó, không bao giờ có lịch sử phiên, nên cửa sổ của orchestrator vẫn nhỏ còn cửa sổ của subagent vẫn sạch. Sau mỗi task, orchestrator xem lại kết quả: OK, sang task tiếp; chưa OK, bản sửa quay lại một subagent. Tối đa năm vòng cho mỗi task — vòng 1 đến 3 tiếp tục với người triển khai ban đầu, vòng 4 giao việc cho một người triển khai mới trên model mạnh hơn, vòng 5 orchestrator tự quyết.
Quy tắc chi trả cho mọi thứ là việc chọn model: "Dùng model yếu nhất có thể đảm đương từng vai trò để tiết kiệm chi phí." Orchestrator chấm độ khó của từng task và chọn model tương xứng.
| Loại task | Bậc model |
|---|---|
| Máy móc, đặc tả rõ; kế hoạch đã có sẵn code | Model rẻ nhất / nhỏ |
| Phối hợp nhiều file, gỡ lỗi | Model tiêu chuẩn |
| Kiến trúc, review nhánh cuối cùng | Model mạnh nhất |
| Không nêu model | Kế thừa model của phiên |
Một sắc thái từ cùng file đó: "Số lượt thắng giá token." Một model rẻ mà mất ba lượt thì không rẻ. Trên thực tế, đây là điều khiến Opus và Fable dùng được trên gói Pro 20 $ — model đắt chỉ chạm vào một nhúm task thay vì cả phiên.
Cái được cuối cùng là tài liệu. Mỗi spec và kế hoạch là một file markdown lưu trong docs/superpowers/specs/ và docs/superpowers/plans/YYYY-MM-DD-<feature-name>.md, commit khi xong việc. Trong chính pipeline của kênh này, việc chuyển sang engine video hiện tại là một spec cộng một kế hoạch mười bốn task mà bạn vẫn mở ra được, nhắc lại trong phiên mới và xây tiếp. Không có gì các agent làm mà không được ghi lại.
caveman và kiểu Concise: nói ít lại
Lát cuối cùng là thứ agent nói. Agent hay kể lể — "chắc chắn rồi", "rất vui được giúp", "vấn đề bạn gặp phải có lẽ do" — và đó là token đầu ra cho chẳng gì cả.
caveman là skill của Julius Brussee, 102.548 sao, khiến agent nói như người tiền sử: bỏ mạo từ, chữ đệm, khách sáo và rào đón, theo mẫu [thứ] [hành động] [lý do]. [bước tiếp theo]. Code, lệnh, đường dẫn file và thông báo lỗi chính xác thì không bao giờ bị đụng tới; chỉ phần văn xuôi quanh chúng bị rút gọn. Nó có ba mức (/caveman lite|full|ultra) và một hook SessionStart bật sẵn khi khởi động.
Bảng của chính nó, mười prompt qua API Claude, trung bình 1.214 token đầu ra khi không có skill và 294 khi có — 65%, tốt nhất 87% và tệ nhất 22%.
README tự đưa ra phần đối chiếu thực tế: skill chỉ rút ngắn đầu ra, token đầu vào và reasoning không đổi, còn bộ quy tắc của nó tốn khoảng 1–1,5 nghìn token đầu vào mỗi lượt. JetBrains đo nó trên 82 tác vụ agentic ghép cặp, tốn khoảng 106 $ tín dụng.
| caveman | Quảng cáo | Đo được (JetBrains) |
|---|---|---|
| Tiết kiệm token đầu ra | 65% | 8,5% (592 N → 542 N) |
| Ảnh hưởng chất lượng | — | Không phát hiện suy giảm (kiểm định dấu p=0,82) |
Khoảng cách này mang tính cấu trúc: đầu ra của agent chủ yếu là code và lệnh gọi tool, thứ mà caveman để yên một cách đúng đắn. Khuyến nghị của JetBrains: "dùng nếu bạn thích. Nó vui, và không lấy đi thứ gì đo được về chất lượng."
Từ Claude Code v2.1.237 đã có bản tương đương tích hợp sẵn, kiểu đầu ra Concise: Claude "mở đầu bằng kết quả, bỏ phần rào đón và kể lể, và mặc định giữ câu trả lời ngắn". Chọn trong /config → Output style; nó lưu vào .claude/settings.local.json và có hiệu lực sau /clear hoặc ở phiên mới. Một giới hạn chung: kiểu đầu ra chỉ áp dụng cho hội thoại chính — subagent chạy prompt hệ thống riêng.
Phán quyết: cái gì xoay chuyển hóa đơn, cái gì chỉ nhích ở rìa
Xếp hạng theo thứ mỗi công cụ thực sự làm dịch chuyển, kèm cái giá nó mang theo.
| Hạng | Công cụ | Dịch chuyển cái gì | Hiệu quả đo được | Cái giá |
|---|---|---|---|---|
| 1 | Superpowers | Lịch sử mỗi task + model nào đọc nó | Model đắt chỉ chạm vài task thay vì cả phiên | Một cổng ở mọi task, kể cả bản vá một dòng |
| 2 | graphify | Thứ agent đọc | ít hơn 91,8× token mỗi truy vấn so với đọc thô toàn corpus (dự án của chúng tôi) | Graph cũ đi; lượt quét ngữ nghĩa tốn token |
| 3 | rtk | Byte đầu ra bash | Trần ~3% hóa đơn; +7,6% mỗi task ở effort thấp trong bài kiểm của JetBrains | Chỉ 1 trong 3 lệnh shell có quy tắc |
| 4 | caveman / Concise | Văn xuôi agent viết | 8,5% token đầu ra, không mất chất lượng | ~1–1,5 nghìn token đầu vào mỗi lượt |
Superpowers thắng, và không phải nhờ nén gì cả: ngữ cảnh mới cho mỗi task và model rẻ nhất đủ sức làm việc đã thay đổi thứ được đọc và ai đọc nó. graphify đứng thứ hai vì đọc ít hơn là nửa lớn hơn của hóa đơn. rtk là thật, miễn phí và vô hại, nhưng hai phần ba lệnh shell và mọi thao tác đọc file đều không đi qua nó. caveman, hay kiểu Concise nay có sẵn trong Claude Code, tỉa lát nhỏ nhất.
Cả bốn đều miễn phí — graphify và rtk theo Apache-2.0, Superpowers theo MIT, skill caveman theo MIT. Hơn 570.000 sao cho thấy người ta muốn một phép màu. Phiên bản trung thực là một bảng xếp hạng.
AIDive