AIDive

Thử 4 công cụ tiết kiệm token Claude Code: 1 cái tốn hơn

Bởi AIDive · Đăng ngày

Coding agent

JetBrains nói không, máy tôi nói 11,6 triệu

Tháng 7/2026, JetBrains chi khoảng 320 $ tín dụng API — 425 lượt chạy tính phí — để kiểm nghiệm rtk, một proxy shell mà hàng chục nghìn lập trình viên cài để tiết kiệm token trong Claude Code. Kết quả: các phiên làm việc đắt hơn 7,6% cho mỗi tác vụ. Hai tuần trước đó, cũng đội ngũ này đo caveman, skill quảng cáo cắt 65% token, và nhận được 8,5%. Trên máy của tôi, rtk gain báo 11,6 triệu token tiết kiệm được sau 25.599 lệnh.

Cả hai bộ số đều thật. Chúng chỉ không đo cùng một thứ: một bên là chi phí cho mỗi tác vụ hoàn thành, bên kia là số byte đầu ra của bash.

Con số Đo cái gì Nguồn
+7,6% mỗi tác vụ (p=0,004) Chi phí đầu-cuối của một tác vụ khi có rtk JetBrains, 425 lượt chạy, ~320 $
8,5% token đầu ra Mức tiết kiệm đo được của caveman trong công việc agentic JetBrains, 82 tác vụ ghép cặp
65% Mức tiết kiệm caveman quảng cáo README caveman
11,6 tr tiết kiệm (41,6%) Byte đầu ra bash được rtk nén rtk gain, 25.599 lệnh

Đây là bộ bốn công cụ: graphify, rtk, Superpowers và caveman, tổng cộng 575.612 sao GitHub tính đến 2026-09-02. Mỗi cái chạm vào một lát khác nhau của hóa đơn.

Công cụ Sao (2026-09-02) Ngôn ngữ Giấy phép
Superpowers 280.792 Skill Markdown MIT
graphify 113.946 Python Apache-2.0
caveman 102.548 Go MIT (skill)
rtk 78.326 Rust Apache-2.0

Token thực sự đi đâu

Hóa đơn Claude Code có hai mặt. Token đầu vào là tất cả những gì mô hình đọc: đầu ra của mọi lệnh shell, prompt của bạn, prompt hệ thống, và toàn bộ lịch sử hội thoại được gửi lại ở mỗi lượt gọi. Token đầu ra là tất cả những gì mô hình viết.

Tài liệu của chính rtk vẽ đúng cái cây đó, và thêm một câu mà bài đăng ra mắt của nó chưa từng có: "Một lệnh hiển thị ít hơn 90% byte đầu ra không làm phiên của bạn rẻ đi 90%."

JetBrains đưa con số cho mặt đọc bằng cách chạy lại 83 phiên nền, 1,9 triệu ký tự đầu ra từ các tool.

Lát của thứ mô hình đọc Ký tự Tỷ trọng
Đầu ra shell rtk nén được 373.339 19,7%
Đầu ra shell rtk không có quy tắc 879.326 46,3%
Tool đọc và tìm kiếm hoàn toàn không qua rtk 646.613 34,0%

Chỉ một phần năm những gì mô hình đọc là nén được bằng proxy shell — các tool tích hợp Read, GrepGlob của Claude Code không bao giờ đi qua hook Bash.

Từ đó có bản đồ cho bốn công cụ: graphify thu nhỏ thứ agent đọc, rtk thu nhỏ thứ shell trả về, Superpowers thu nhỏ lịch sử mà mỗi task mang theo và chọn model nào mang nó, còn caveman thu nhỏ thứ agent nói. Mặt đọc là nửa lớn hơn của hóa đơn, nên bảng xếp hạng bắt đầu từ đó.

graphify: đi theo node, không phải dòng

graphify là một skill biến cả codebase — cùng tài liệu, schema SQL, config và PDF — thành một knowledge graph truy vấn được. Bạn gõ /graphify . trong Claude Code, Cursor, Codex hay Gemini CLI, dự án được lập bản đồ một lần để agent truy vấn graph thay vì grep qua các file.

Code được phân tích bằng AST của tree-sitter trên khoảng 40 ngôn ngữ: tất định, không gọi LLM, không có gì rời khỏi máy. Việc dựng graph tốn không tín dụng LLM nào. Nó tạo ba file: graph.html để bấm xem, GRAPH_REPORT.md, và graph.json — chính là graph, truy vấn được mà không phải đọc lại file của bạn. Mỗi node là một khái niệm (một file, một hàm, một class), và mỗi cạnh được gắn nhãn EXTRACTED khi nó hiện diện rõ trong mã nguồn, hoặc INFERRED khi graphify tự suy ra. Các node được gom thành hệ con bằng thuật toán Leiden.

Benchmark tích hợp, chạy trên một dự án của chúng tôi:

Chỉ số Giá trị
Node 34.031
Cạnh 56.865
Cộng đồng phát hiện được 967
Nguồn gốc cạnh 76% EXTRACTED · 24% INFERRED
Đọc thô toàn bộ corpus 1.701.550 từ ≈ 2.268.733 token
Truy vấn graph trung bình ~24.702 token
Mức giảm ít hơn 91,8× token mỗi truy vấn

Theo từng câu hỏi, khoảng dao động rất rộng: 679,1× với "what is the main entry point", 34,0× với "what connects the data layer to the api".

Hai giới hạn. Phép so sánh là với việc đọc tất cả, mà một phiên làm việc dựa trên grep chưa bao giờ đắt đến thế, nên lợi ích thực tế nhỏ hơn. Và graph sẽ cũ đi — làm mới bằng graphify update <path>, --watch hoặc các git hook — trong khi lượt quét ngữ nghĩa trên tài liệu, PDF và ảnh thì có gọi mô hình và có tốn token.

Cài đặt: uv tool install graphifyy (tên gói có hai chữ y), rồi graphify install.

rtk: shell proxy ra phiên xử

rtk là một proxy CLI nằm giữa Claude Code và shell của bạn. Những lệnh thường ngày như ls, cat hay git status trả về rất nhiều nhiễu mà agent phải đọc dưới dạng token đầu vào: quyền file, thanh tiến trình, một trăm dòng test xanh. rtk chạy đúng lệnh đó và trả lại bản gọn: một binary Rust duy nhất, hơn 100 lệnh được hỗ trợ, độ trễ thêm dưới 10 ms. Một hook PreToolUse viết lại mọi lệnh Bash đủ điều kiện (git statusrtk git status) trước khi chạy, nên agent không bao giờ phải nhớ.

Bài đăng ra mắt của tác giả tuyên bố tiết kiệm 10,2 tr token trong hai tuần, 89,2%, với ví dụ như cargo test từ 155 dòng còn 3. Bảng điều khiển của chúng tôi sau 25.599 lệnh:

Lệnh Lượt gọi Token tiết kiệm Tỷ lệ
rtk find 354 2,2 tr 46,6%
rtk read 3.504 2,2 tr 10,4%
rtk grep 2.760 1,9 tr 47,7%
rtk ps aux 24 1,1 tr 98,0%
rtk diff 39 541,1 N 92,2%
Tổng 25.599 11,6 tr 41,6%

Rồi đến phiên xử. JetBrains cài rtk đúng như nó được phát hành và chạy 86 tác vụ hai lần trên claude-sonnet-5.

Phát hiện của JetBrains Giá trị
Lệnh shell rtk viết lại được 349 trên 1.056 (1 trong 3)
Trần của mức tiết kiệm tổng ~3% hóa đơn
Chi phí mỗi tác vụ, reasoning effort thấp +7,6% (p=0,004)
Số lượt mỗi tác vụ +13,8% (p=0,03)
Chi phí mỗi tác vụ, effort cao ±0%
Chất lượng tác vụ Không đổi

README của rtk nay nói thẳng: tới 90% đầu ra bash, "không giống với việc cắt 90% hóa đơn của bạn", và các con số của chính nó được ước tính bằng bytes / 4.

Phán quyết: miễn phí, khả năng nén là thật và, theo lời JetBrains, "thường rất khéo". Giữ nó cho các phiên nặng bash; đừng mong nó xoay chuyển hóa đơn.

Superpowers: định khung trước, rồi task nhỏ đến mức không thể fail

Superpowers là plugin Claude Code của Jesse Vincent — 280.792 sao, mười bốn skill, một lệnh cài đặt duy nhất (/plugin install superpowers@claude-plugins-official). Nó tiết kiệm token mà không nén bất cứ thứ gì.

Mọi thứ bắt đầu từ skill brainstorming, mở đầu bằng một cổng cứng: không code, không scaffolding, không skill triển khai nào cho tới khi một ý định rõ ràng được duyệt. Khi skill nạp vào, agent trở thành đối tác brainstorming, và trên thực tế nhiều phần của dự án được nghĩ lại trước khi xây bất cứ thứ gì. Đây là giai đoạn quan trọng nhất, vì những token đắt nhất là token bỏ ra để xây sai thứ.

Skill phân loại công việc thành spike, thay đổi giới hạn, hay thay đổi kiến trúc, và quy tắc được ghi thẳng trong file: "Khi phân vân giữa hai hướng, chọn hướng nặng hơn." Nó thậm chí gọi tên kiểu thất bại, với một mục anti-pattern tên "Too Simple To Need Approval". Hướng kiến trúc sinh ra một spec để bạn duyệt, rồi một kế hoạch triển khai.

Độ tin cậy đến từ kế hoạch. Skill writing-plans cắt công việc thành từng bước một hành động, 2 đến 5 phút: viết test thất bại, chạy để xác nhận nó fail, viết đoạn code tối thiểu để nó pass, chạy lại test, commit. Kế hoạch được viết với giả định người thực hiện không có chút ngữ cảnh nào. Một task nhỏ như vậy nằm gọn trong cửa sổ ngữ cảnh mới còn dư chỗ, nên agent không bao giờ tới cuối task với cửa sổ bão hòa — mà cửa sổ bão hòa chính là nơi sinh ra code bịa.

Giới hạn là phần nghi thức. File nói nó co giãn theo task, nhưng cổng vẫn kích hoạt với một bản vá một dòng, và đó cũng là token.

Superpowers: một task, một subagent, một model vừa vặn

Rồi kế hoạch chạy, và phép tính token thay đổi. Một task, một subagent. Mỗi subagent khởi động với ngữ cảnh mới chỉ chứa task của nó, không bao giờ có lịch sử phiên, nên cửa sổ của orchestrator vẫn nhỏ còn cửa sổ của subagent vẫn sạch. Sau mỗi task, orchestrator xem lại kết quả: OK, sang task tiếp; chưa OK, bản sửa quay lại một subagent. Tối đa năm vòng cho mỗi task — vòng 1 đến 3 tiếp tục với người triển khai ban đầu, vòng 4 giao việc cho một người triển khai mới trên model mạnh hơn, vòng 5 orchestrator tự quyết.

Quy tắc chi trả cho mọi thứ là việc chọn model: "Dùng model yếu nhất có thể đảm đương từng vai trò để tiết kiệm chi phí." Orchestrator chấm độ khó của từng task và chọn model tương xứng.

Loại task Bậc model
Máy móc, đặc tả rõ; kế hoạch đã có sẵn code Model rẻ nhất / nhỏ
Phối hợp nhiều file, gỡ lỗi Model tiêu chuẩn
Kiến trúc, review nhánh cuối cùng Model mạnh nhất
Không nêu model Kế thừa model của phiên

Một sắc thái từ cùng file đó: "Số lượt thắng giá token." Một model rẻ mà mất ba lượt thì không rẻ. Trên thực tế, đây là điều khiến Opus và Fable dùng được trên gói Pro 20 $ — model đắt chỉ chạm vào một nhúm task thay vì cả phiên.

Cái được cuối cùng là tài liệu. Mỗi spec và kế hoạch là một file markdown lưu trong docs/superpowers/specs/docs/superpowers/plans/YYYY-MM-DD-<feature-name>.md, commit khi xong việc. Trong chính pipeline của kênh này, việc chuyển sang engine video hiện tại là một spec cộng một kế hoạch mười bốn task mà bạn vẫn mở ra được, nhắc lại trong phiên mới và xây tiếp. Không có gì các agent làm mà không được ghi lại.

caveman và kiểu Concise: nói ít lại

Lát cuối cùng là thứ agent nói. Agent hay kể lể — "chắc chắn rồi", "rất vui được giúp", "vấn đề bạn gặp phải có lẽ do" — và đó là token đầu ra cho chẳng gì cả.

caveman là skill của Julius Brussee, 102.548 sao, khiến agent nói như người tiền sử: bỏ mạo từ, chữ đệm, khách sáo và rào đón, theo mẫu [thứ] [hành động] [lý do]. [bước tiếp theo]. Code, lệnh, đường dẫn file và thông báo lỗi chính xác thì không bao giờ bị đụng tới; chỉ phần văn xuôi quanh chúng bị rút gọn. Nó có ba mức (/caveman lite|full|ultra) và một hook SessionStart bật sẵn khi khởi động.

Bảng của chính nó, mười prompt qua API Claude, trung bình 1.214 token đầu ra khi không có skill và 294 khi có — 65%, tốt nhất 87% và tệ nhất 22%.

README tự đưa ra phần đối chiếu thực tế: skill chỉ rút ngắn đầu ra, token đầu vào và reasoning không đổi, còn bộ quy tắc của nó tốn khoảng 1–1,5 nghìn token đầu vào mỗi lượt. JetBrains đo nó trên 82 tác vụ agentic ghép cặp, tốn khoảng 106 $ tín dụng.

caveman Quảng cáo Đo được (JetBrains)
Tiết kiệm token đầu ra 65% 8,5% (592 N → 542 N)
Ảnh hưởng chất lượng Không phát hiện suy giảm (kiểm định dấu p=0,82)

Khoảng cách này mang tính cấu trúc: đầu ra của agent chủ yếu là code và lệnh gọi tool, thứ mà caveman để yên một cách đúng đắn. Khuyến nghị của JetBrains: "dùng nếu bạn thích. Nó vui, và không lấy đi thứ gì đo được về chất lượng."

Từ Claude Code v2.1.237 đã có bản tương đương tích hợp sẵn, kiểu đầu ra Concise: Claude "mở đầu bằng kết quả, bỏ phần rào đón và kể lể, và mặc định giữ câu trả lời ngắn". Chọn trong /config → Output style; nó lưu vào .claude/settings.local.json và có hiệu lực sau /clear hoặc ở phiên mới. Một giới hạn chung: kiểu đầu ra chỉ áp dụng cho hội thoại chính — subagent chạy prompt hệ thống riêng.

Phán quyết: cái gì xoay chuyển hóa đơn, cái gì chỉ nhích ở rìa

Xếp hạng theo thứ mỗi công cụ thực sự làm dịch chuyển, kèm cái giá nó mang theo.

Hạng Công cụ Dịch chuyển cái gì Hiệu quả đo được Cái giá
1 Superpowers Lịch sử mỗi task + model nào đọc nó Model đắt chỉ chạm vài task thay vì cả phiên Một cổng ở mọi task, kể cả bản vá một dòng
2 graphify Thứ agent đọc ít hơn 91,8× token mỗi truy vấn so với đọc thô toàn corpus (dự án của chúng tôi) Graph cũ đi; lượt quét ngữ nghĩa tốn token
3 rtk Byte đầu ra bash Trần ~3% hóa đơn; +7,6% mỗi task ở effort thấp trong bài kiểm của JetBrains Chỉ 1 trong 3 lệnh shell có quy tắc
4 caveman / Concise Văn xuôi agent viết 8,5% token đầu ra, không mất chất lượng ~1–1,5 nghìn token đầu vào mỗi lượt

Superpowers thắng, và không phải nhờ nén gì cả: ngữ cảnh mới cho mỗi task và model rẻ nhất đủ sức làm việc đã thay đổi thứ được đọc và ai đọc nó. graphify đứng thứ hai vì đọc ít hơn là nửa lớn hơn của hóa đơn. rtk là thật, miễn phí và vô hại, nhưng hai phần ba lệnh shell và mọi thao tác đọc file đều không đi qua nó. caveman, hay kiểu Concise nay có sẵn trong Claude Code, tỉa lát nhỏ nhất.

Cả bốn đều miễn phí — graphify và rtk theo Apache-2.0, Superpowers theo MIT, skill caveman theo MIT. Hơn 570.000 sao cho thấy người ta muốn một phép màu. Phiên bản trung thực là một bảng xếp hạng.

Nguồn

Câu hỏi thường gặp

Cách tốt nhất để tiết kiệm token trong Claude Code là gì?
Thay đổi thứ agent đọc và model nào đọc, thay vì nén văn bản. Plugin Superpowers cấp cho mỗi task một ngữ cảnh subagent mới chỉ chứa task đó, và giao model yếu nhất đủ sức xử lý. Điều đó dịch chuyển phần hóa đơn lớn hơn nhiều so với bất kỳ bộ nén đầu ra nào.
rtk có thực sự giảm chi phí Claude Code không?
Gần như không. Khả năng nén đầu ra shell là thật, nhưng JetBrains thấy chỉ 1 trên 3 lệnh shell có quy tắc và chỉ một phần năm thứ mô hình đọc là nén được, khiến mức tiết kiệm chạm trần khoảng 3% hóa đơn. Trong bài A/B 86 tác vụ của họ, rtk đắt hơn 7,6% mỗi tác vụ ở reasoning effort thấp và ngang bằng ở effort cao, chất lượng không đổi.
Vì sao rtk báo tiết kiệm hàng triệu token mà hóa đơn không giảm?
rtk đếm số byte đầu ra bash mà nó loại bỏ, ước tính bằng bytes/4, chứ không phải tiền. Bảng điều khiển của chúng tôi hiển thị 11,6 tr token tiết kiệm (41,6%) sau 25.599 lệnh. Tài liệu của chính nó nói thẳng: một lệnh hiển thị ít hơn 90% byte không làm phiên của bạn rẻ đi 90%.
graphify là gì và nó có tiết kiệm token không?
graphify là skill /graphify phân tích codebase ngay tại máy bằng tree-sitter thành một knowledge graph truy vấn được, không gọi LLM và không tốn tín dụng khi dựng. Sau đó agent đi theo các node logic thay vì grep file. Trên dự án của chúng tôi, benchmark tích hợp đo được ít hơn 91,8× token mỗi truy vấn so với đọc toàn bộ corpus, dù mốc so sánh đó là đọc thô toàn bộ chứ không phải một phiên dựa trên grep.
Skill caveman có đáng cài không?
Chỉ khi bạn thấy thích. Nó quảng cáo cắt 65% nhưng JetBrains đo được 8,5% token đầu ra trên 82 tác vụ ghép cặp, không phát hiện suy giảm chất lượng, vì code và lệnh gọi tool được để yên một cách đúng đắn. Ngoài ra, bộ quy tắc của nó thêm khoảng 1 đến 1,5 nghìn token đầu vào mỗi lượt.
Kiểu đầu ra Concise trong Claude Code là gì?
Một kiểu đầu ra tích hợp sẵn từ Claude Code v2.1.237, khiến Claude mở đầu bằng kết quả, bỏ phần rào đón và kể lể, và giữ câu trả lời ngắn. Bạn chọn trong /config, nó lưu vào .claude/settings.local.json, và chỉ áp dụng cho hội thoại chính — subagent vẫn giữ prompt hệ thống riêng.
Superpowers làm sao để dùng được Opus hay Fable trên gói 20 $?
Skill subagent-driven-development của nó bảo orchestrator dùng model yếu nhất đủ sức đảm đương từng vai trò: bậc rẻ nhất cho task máy móc đặc tả rõ, model tiêu chuẩn cho việc nhiều file và gỡ lỗi, model mạnh nhất chỉ cho kiến trúc và review cuối. Nhờ vậy model đắt chỉ chạm vào một nhúm task thay vì cả phiên.

Video liên quan