8 repo, một dự án, 87 lượt chạy
Tám repo trên GitHub xuất hiện trong mọi danh sách "phải có" cho Claude Code tháng này: Chisle, Ouroboros, Reticle, Caliper, Anti-Slop, UI Skills, img2threejs và FWC SwiftUI Skills. Cộng lại chúng có hơn 37.000 star. Những danh sách đó chỉ nói mỗi repo tuyên bố làm gì và cách cài đặt. Không ai cài chúng cùng lúc rồi đo lường cả.
Vì vậy cả tám repo được đưa vào một dự án thật, một app React với 111 test đang pass. Một trong số đó tự ghi mình vào cấu hình của chín công cụ AI khác trên máy. Một cái chưa từng được chạy, chỉ vì một dòng trong mã nguồn của nó. Và ba cái kết nối một server tới Claude Code nhưng chưa từng được gọi, dù chỉ một lần, trong 63 lượt chạy.
| Bài kiểm tra | Giá trị |
|---|---|
| Số repo được cài | 8 |
| Tổng số lượt chạy | 87 |
| Tổng chi phí | khoảng 6 đô la |
| Dự án | 1 app React, 111 test đang pass |
| Model | 1 |
| Thời gian | 1 ngày |
Ba câu hỏi dẫn dắt phần còn lại: mỗi repo tốn gì ngay khi khởi động, cái gì thực sự thay đổi trong kết quả đầu ra, và cái nào đáng giữ lại.
Mỗi repo tốn bao nhiêu trước khi gõ
Chi phí khởi động là những gì Claude Code nạp vào ngữ cảnh trước khi bạn gõ tin nhắn đầu tiên. Trên một dự án trống, con số đó khoảng 17.000 token, và bạn phải trả cho chúng ở mỗi lượt. Để đo một lượt cài, Claude được yêu cầu trả lời bằng đúng một từ, rồi hóa đơn được đọc lại. Đơn vị là token, không phải đô la: hai lượt chạy giống hệt nhau có thể chênh nhau gấp 10 lần về giá chỉ vì cơ chế cache.
| Cài đặt | Token khởi động tăng thêm |
|---|---|
| Chisle | khoảng 3.500 |
| Ouroboros | khoảng 1.600 |
| Reticle | khoảng 900 |
| img2threejs (file hướng dẫn 33 KB) | 107 |
| Anti-Slop (skill hỗ trợ) | 95 |
| UI Skills | 37 |
| Tất cả những cái còn lại | 100 đến 300 mỗi cái |
| Cả tám repo cộng lại | dưới 7.000 |
Hai trong tám repo hoàn toàn không dành cho dân web. img2threejs biến một bức ảnh thành cảnh 3D, còn FWC SwiftUI Skills dành cho app Apple. Chỉ có chi phí của chúng được đo. Skill 3D này đi kèm một file hướng dẫn 33 kilobyte và vẫn chỉ tốn 107 token, vì cho tới khi bạn gọi nó, chỉ phần mô tả của skill mới được nạp.
Server cũng đã rẻ đi. Claude Code giờ chỉ nạp tên các tool của một server và lấy chi tiết khi cần. Con số đó khoảng 45 token mỗi tool, bất kể tool đó làm gì. Với cả tám repo được cài, chi phí đơn giản là cộng dồn lại. Không có gì nhân lên cả.
Claude Code có một lệnh dự đoán chi phí này cho một plugin, và nó liệt kê hook là miễn phí. Với một plugin dùng hằng ngày trên máy này, lệnh đó dự đoán khoảng 540 token. Số đo thực tế là 744, vì hook khởi động của nó in thẳng vào phiên làm việc.
Khởi động không phải chỗ các repo này tốn kém. Các lượt trao đổi mới là chỗ đó.
Cùng một việc, có và không có
Bộ benchmark gồm ba tác vụ mà một lập trình viên thật sự sẽ giao: một lỗi trong cách dựng địa chỉ web, một tính năng hiển thị thời gian đọc, và một bộ đếm ký tự trên form. Mỗi tác vụ chạy với một repo được cài, với cả tám, và với không repo nào, ba lượt chạy mỗi lần. Giám khảo là một bài test mà agent không hề thấy, cộng với bộ test riêng của dự án, cộng với type checker. Mỗi lượt chạy dùng cùng một danh sách tool được phép cố định, không có bypass quyền.
| Kết quả | Giá trị |
|---|---|
| Số lượt chạy tác vụ | 63 |
| Số lượt pass | 63 |
| Lỗi type mới | 0 |
| Số lần gọi tới ba server đã kết nối | 0 |
| Sửa lỗi, baseline | 7 lượt, 27 giây |
| Tác vụ form, baseline | 22 lượt, khoảng 1 phút |
Không có gì khiến Claude làm hỏng một tác vụ, và cũng không có gì giúp nó vượt qua một tác vụ mà nếu không có công cụ đó nó sẽ trượt.
Ba trong số các repo này kết nối một server đầy tool. Trong 63 lượt chạy, Claude gọi các tool đó đúng 0 lần. Kể cả tác vụ form, vốn được viết ra để lời khuyên thiết kế và kiểm thử trực quan có việc để làm. Công bằng mà nói, hai trong số đó chưa từng được giao đúng việc của mình. Reticle cần một trình duyệt được ghép nối với app đang chạy của bạn, và việc ghép nối đó bị crash. Ouroboros cần một cấu hình trên toàn bộ máy, và nó không được cấp quyền đó.
Độ nhiễu rất lớn. Cùng một prompt, cùng một lượt cài: một lần chạy viết ra 4.300 token, lần khác viết ra 7.100. Chỉ hai kết quả vượt qua được độ nhiễu của chính chúng, cả hai đều ở tác vụ ngắn nhất. Một bản demo trước-sau duy nhất không chứng minh được điều gì.
52% của Chisle, trên công việc code thật
Chisle là một plugin nén output, và là repo duy nhất trong tám cái đưa ra một con số cụ thể: benchmark của nó nói hóa đơn của bạn giảm xuống còn 52%. Trên ba tác vụ thực tế, output đạt 94% so với baseline. Chính README giải thích lý do bằng lời của họ: những con số đó đến từ các prompt đơn lẻ không dùng tool, không phải chi phí toàn phiên làm việc.
| Số đo | Giá trị |
|---|---|
| Chisle tuyên bố trong benchmark | output ở mức 52% |
| Chisle trên ba tác vụ thực tế | output ở mức 94% so với baseline |
| Plugin rút gọn dùng hằng ngày, cùng tác vụ | 113%, nằm trong khoảng nhiễu |
| Một lượt sửa lỗi: token đọc vào | 95.000 |
| Một lượt sửa lỗi: token viết ra | 1.700 |
Trong một phiên code thật, output chỉ là phần nhỏ của hóa đơn. Chisle nạp các quy tắc của nó ngay từ đầu và ghim một lời nhắc vào mỗi prompt bạn gửi, nên các lượt chạy của nó tốn nhiều hơn baseline ở hai trên ba tác vụ. Các quy tắc đó nặng hơn số từ chúng tiết kiệm được. Bộ nén output của tool trong Chisle chạy ở mọi phiên và chưa từng ghi nhận một khoản tiết kiệm nào.
Không plugin nào tiết kiệm được gì đo đếm được. Một người dùng Chisle phát hiện điều tương tự qua 173 phiên, và tác giả nói lỗi đó đã được sửa. Công bằng mà nói, Chisle công khai cả những thất bại của chính mình, và cách xử lý file của nó được làm rất chắc chắn.
Bài học rút ra: một plugin nói chuyện ở mọi lượt là loại tốn kém nhất.
Những lượt cài vươn ra ngoài dự án
Phạm vi cài đặt là mức độ một repo vươn cấu hình của nó ra ngoài thư mục bạn đã chạy nó. Mọi thứ ở đây đều được cài trong một thư mục duy nhất, có chủ đích, để không có gì chạm vào phần còn lại của máy.
Lệnh cài đặt của Reticle lại có kế hoạch khác. Chính log của nó nói nó đã tự đăng ký với 8 agent khác: VS Code, Copilot, Warp, Kiro, Amazon Q, Cline, Amp, và một cái nữa. Trong Gemini, nó tự phê duyệt trước cho chính mình. Trong cấu hình Claude Code, nó thêm một quy tắc tự phê duyệt các tool của chính nó. Không có gì bị giấu ở đây, tất cả đều nằm ngay trong mã nguồn, trình cài đặt nói rõ ràng về những gì nó làm, và nó có kèm lệnh gỡ cài đặt. Nhưng nó chỉ được cấp một cờ đồng ý duy nhất, cho một dự án duy nhất.
Caliper lẽ ra là công cụ đo lường. Bộ khung của nó khởi chạy Claude với mọi kiểm tra quyền bị tắt hết, không có tùy chọn nào để thay đổi điều đó, và nó sao chép thông tin đăng nhập của bạn vào mỗi lượt test. Nó chưa từng được chạy; một bộ chạy tùy chỉnh đã thay thế nó.
| Repo | Cài sạch trong phạm vi dự án? | Ghi chú |
|---|---|---|
| Anti-Slop | Có | Chỉ sao chép file, không gì khác |
| UI Skills | Có | Thư viện skill từ xa |
| img2threejs | Có | Một skill |
| FWC SwiftUI Skills | Có | Văn bản thuần |
| Reticle | Một phần | Tự đăng ký với 8 agent khác, quy tắc tự phê duyệt |
| Chisle | Không | Chỉ cài toàn cục, kiểm tra cập nhật lúc khởi động, lưu output thô của tool ra đĩa |
| Ouroboros | Không | Chỉ cài toàn máy, mặc định báo cáo mức sử dụng, trình cài đặt có thể dẫn một script từ internet thẳng vào shell của bạn |
| Caliper | Chưa chạy | Tắt hết kiểm tra quyền, sao chép thông tin đăng nhập vào mỗi lượt |
Không cái nào trong số này là mã độc. Đó là kiểu tiện lợi mặc định rằng bạn muốn công cụ có mặt ở khắp mọi nơi. Hãy mở ba thứ trước bất kỳ lượt cài nào: hook, script cài đặt, và cấu hình server.
Điều gì xảy ra khi chúng chồng lên nhau
Chồng lên nhau nghĩa là cài cả tám repo cùng lúc: không crash, không lỗi, và chi phí cộng dồn gần như chính xác. Một cái bẫy đã tốn mất một giờ. Trong các lượt chạy kịch bản sẵn, một server dự án chờ một sự phê duyệt mà không ai có thể cấp, nên nó trông gần như miễn phí. Mọi con số về server ở đây đều được đo lại sau khi vấn đề đó được sửa.
Hook là nơi các repo này gặp nhau. Hook là một script mà Claude Code chạy tại một thời điểm cố định, và bất cứ thứ gì nó in ra đều có thể xuất hiện trước mặt model. Với ba trong các công cụ này được nối dây, ba script chạy lúc khởi động và ba script nữa chạy ở mỗi prompt. Một câu gõ bình thường tới được model kèm theo hai ghi chú đính vào: một ghi chú bảo nó viết ngắn gọn, một ghi chú đòi một bước cấu hình không thể hoàn thành bên trong một dự án. Ghi chú thứ hai đó quay lại ở mỗi prompt có chứa một trong các từ khóa của nó.
Tên tool không thể trùng nhau, vì mỗi server đều tự gắn tiền tố cho mình. Với hook thì tài liệu xác nhận điều đó: khi nhiều hook cùng thêm ngữ cảnh, Claude nhận được tất cả các giá trị đó.
Một nghiên cứu từ tháng 5 năm 2026 đo xem một đống lớn skill ảnh hưởng thế nào tới một agent. Với khoảng 200 skill, tỷ lệ pass giảm tới 21%, và phần lớn khoản mất đó là do agent chọn nhầm một skill trông giống thay vì skill đúng. Tám repo tương đương 10 skill, còn xa mới tới mức đó. Những người cài hàng chục skill thì khác.
Repo duy nhất thay đổi code
Anti-Slop là một bộ quy tắc lint bạn chép vào dự án của mình, không phải một plugin. Không có gói nào để cài; tác giả muốn bạn chép các quy tắc rồi tự chỉnh sửa chúng. Một linter đọc code của bạn ở ngoài model, nên nó không tốn ngữ cảnh: 95 token cho skill hỗ trợ của nó, và không tốn gì thêm mỗi lượt.
Trong tác vụ form, Claude phải nối một field mới xuyên qua một component. Nó sao chép lại dòng phía trên, kèm theo cả một phép ép kiểu không an toàn. Anti-Slop đã gắn cờ cảnh báo, ba lượt chạy trên ba. Đó chính là kiểu lỗi mà một người review thường cho qua, vì nó trông giống hệt những dòng bên cạnh.
| Phát hiện của Anti-Slop | Giá trị |
|---|---|
| Phép ép kiểu không an toàn bị gắn cờ | 3 trên 3 lượt chạy |
| Thiếu dòng trống bị gắn cờ trong một hàm sáu dòng đúng | 2 trên 3 lượt chạy |
| Số phát hiện trên dự án chưa chỉnh sửa | 109 |
| Tỷ lệ đến từ hai quy tắc phong cách | 83% |
| Các quy tắc khác | 16 |
Phát hiện về dòng trống là chuyện gu chứ không phải lỗi, và linter chỉ đọc một file mỗi lần. Chi phí lộ ra ngay ngày đầu: hãy quyết định về hai quy tắc phong cách đó trước khi bạn đánh giá 16 quy tắc còn lại. Một điểm cần lưu ý: các quy tắc này được đóng gói dưới dạng module, nên dự án của bạn cũng phải tự khai báo mình là module, nếu không linter sẽ crash.
UI Skills là cái rẻ nhất để giữ lại: 37 token cho một thư viện skill thiết kế từ xa, và 0 lượt gọi trong các lượt chạy này. Nó từng có 18 liên kết chết vào tháng 7. Cả 300 liên kết đã được kiểm tra vào sáng hôm quay video, và không cái nào bị hỏng.
Tôi giữ lại gì, và cách kiểm tra cấu hình của bạn
Tám repo đã được phân loại xong. Kỳ vọng ban đầu là ba cái đáng giữ. Dữ liệu cho ra một cái thực sự xứng đáng, và ba cái có thể giữ miễn phí.
| Repo | Phán quyết |
|---|---|
| Anti-Slop | Xứng đáng: bắt được một lỗi thật mỗi lần, gần như không tốn gì |
| UI Skills | Giữ miễn phí: 37 token, không va chạm với bất cứ thứ gì |
| img2threejs, FWC SwiftUI Skills | Giữ miễn phí nếu bạn có ngày sẽ gọi đến chúng: vài trăm token cộng lại |
| Chisle | Tốn nhiều hơn số nó tiết kiệm được trên công việc code thật |
| Caliper | Chưa từng chạy |
| Reticle, Ouroboros | Muốn chiếm cả máy, chưa từng thấy làm đúng việc của mình, nên chưa có phán quyết về việc chúng thực sự dùng để làm gì |
Chính người bảo trì Ouroboros đếm được khoảng 40% các lượt chạy của nó thất bại.
Giới hạn của bài kiểm tra rất đáng lưu ý: một dự án React, một model, ba tác vụ, ba lượt chạy mỗi tác vụ. Với độ nhiễu lớn như vậy, các hiệu ứng nhỏ trở nên vô hình. Điều dữ liệu thực sự xác nhận là cái sàn đã rất cao. Claude vượt qua mọi thứ dù có hay không có các công cụ này, và các công cụ nằm im trong ngữ cảnh chờ được gọi thì phần lớn không được gọi. Chúng cần một quy trình làm việc chủ động tìm đến chúng.
Bạn có thể kiểm tra cấu hình của chính mình trong hai phút. Một lệnh cho thấy những gì đang được nạp ngay lúc này. Một lệnh dự đoán chi phí của một plugin, và nhớ rằng nó tính hook là miễn phí. Một lệnh báo cáo mỗi skill tốn gì và được dùng thường xuyên ra sao. Và trước bất kỳ lượt cài nào, hãy mở hook, script cài đặt, và cấu hình server.
AIDive