八個repo,一個專案,87次執行
八個GitHub repo這個月幾乎在每份Claude Code必裝清單上都看得到:Chisle、Ouroboros、Reticle、Caliper、Anti-Slop、UI Skills、img2threejs和FWC SwiftUI Skills。它們加起來有超過37,000顆星。那些清單只會告訴你每個repo宣稱了什麼、怎麼安裝。沒有人把它們一起裝上,再實際測量。
於是這八個全部裝進了同一個真實專案,一個有111個測試全數通過的React應用。其中一個把自己寫進了機器上另外九個AI工具的設定裡。有一個因為原始碼裡的一行,完全沒有被執行過。還有三個把伺服器接上了Claude Code,卻在63次執行中一次也沒有被呼叫過。
| 測試項目 | 數值 |
|---|---|
| 安裝的repo數量 | 8 |
| 總執行次數 | 87 |
| 總花費 | 約6美元 |
| 專案 | 1個React應用,111個測試全數通過 |
| 模型 | 1個 |
| 耗時 | 1天 |
接下來的內容,由三個問題主導:每個repo在啟動時要花多少代價、實際輸出到底改變了什麼,以及哪些真正值得留下。
打字之前,每個要花多少
啟動成本,指的是在你送出第一則訊息之前,Claude Code就已經載入到context裡的東西。在空專案上這大約是17,000個token,而且每一輪對話都要為它付費。要測量一次安裝的代價,做法是請Claude回覆一個字,再讀取帳單。單位是token,不是美元:同樣的兩次執行,光是因為快取的關係,價格就可能差到10倍。
| 安裝項目 | 新增的啟動token |
|---|---|
| Chisle | 約3,500 |
| Ouroboros | 約1,600 |
| Reticle | 約900 |
| img2threejs(33 KB的指示檔) | 107 |
| Anti-Slop(輔助skill) | 95 |
| UI Skills | 37 |
| 其餘每個 | 100到300不等 |
| 八個加起來 | 不到7,000 |
八個裡有兩個根本不是給網頁開發者用的。img2threejs能把一張照片變成3D場景,FWC SwiftUI Skills則是給Apple應用用的。這兩個只測量了它們的成本。那個3D skill雖然附帶一份33KB的指示檔,卻只花107個token,因為在你真正呼叫它之前,只有skill的描述會被載入。
伺服器的成本也變低了。Claude Code現在只會載入伺服器工具的名稱,細節則是要用到才抓取,大約是每個工具45個token,不管那個工具實際做什麼。八個全部裝上之後,成本只是單純加總,不會相乘。
Claude Code有一個指令可以預估外掛的這項成本,而且它把hook算成免費。對這台機器上每天都在用的一個外掛,它預估約540個token,但實測是744個,因為它的啟動hook會直接把內容印進session裡。
啟動階段不是這些repo變貴的地方,真正花錢的是每一輪對話。
同樣任務,裝與不裝
這次的benchmark是三個開發者真的會交辦的任務:一個網址組合方式的bug、一個顯示閱讀時間的功能,以及表單上的字數計數器。每個任務分別在裝單一repo、裝全部八個、以及完全不裝的情況下執行,每種情況跑三次。評分依據是agent看不到的測試,加上專案自身的測試套件,再加上型別檢查器。每次執行都用同一份固定的允許工具清單,沒有繞過任何權限。
| 結果 | 數值 |
|---|---|
| 任務執行次數 | 63 |
| 通過次數 | 63 |
| 新增的型別錯誤 | 0 |
| 對三個已連接伺服器的呼叫次數 | 0 |
| 修bug,基準情況 | 7輪對話,27秒 |
| 表單任務,基準情況 | 22輪對話,約1分鐘 |
沒有任何東西讓Claude失敗,也沒有任何東西讓它通過一個原本會失敗的任務。
這裡面有三個repo接上了裝滿工具的伺服器。在63次執行中,Claude一次也沒有呼叫過那些工具,包括那個特地寫來讓設計建議和視覺測試有事可做的表單任務。平心而論,其中兩個從來沒有機會做它們真正的工作:Reticle需要瀏覽器跟你正在跑的應用配對,而那次配對失敗了;Ouroboros需要在整台機器上做設定,而這次測試沒有給它這個條件。
雜訊非常大。同樣的提示、同樣的安裝設定:一次執行寫了4,300個token,另一次寫了7,100個。只有兩個結果的差異大到能蓋過雜訊,而且都出現在最短的那個任務上。單一次的前後對比示範,什麼也證明不了。
Chisle的52%,遇上真實coding工作
Chisle是一個壓縮輸出的外掛,也是八個裡唯一敢承諾具體數字的:它的benchmark宣稱能把帳單降到52%。但在這三個任務裡,輸出量落在基準的94%。它的README自己也解釋了原因:那些數字來自沒有使用工具的單一提示,而不是整個session的成本。
| 項目 | 數值 |
|---|---|
| Chisle的benchmark宣稱 | 輸出量52% |
| Chisle在三個任務上的實測 | 輸出量為基準的94% |
| 日常使用的精簡外掛,同樣任務 | 113%,落在雜訊範圍內 |
| 一次修bug:讀取的token | 95,000 |
| 一次修bug:寫入的token | 1,700 |
在真實的coding session裡,輸出只是帳單裡比較小的那一塊。Chisle在一開始就載入自己的規則,還會在你送出的每個提示上附加一則提醒,所以三個任務裡有兩個的成本反而比基準更高。它的規則本身的重量,超過了它幫你省下的字數。它用來壓縮工具輸出的功能,在每個session裡都有運作,卻從來沒有記錄到任何節省。
兩個外掛都沒有省下任何可測量的東西。一位Chisle使用者在173個session裡也發現了同樣的結果,而作者表示這個bug已經修好了。公道地說,Chisle願意公開自己的損耗數字,而且它的檔案處理做得相當扎實。
從中能學到的規則是:一個在每一輪對話都要開口的外掛,是最貴的那種。
伸出專案之外的安裝
安裝範圍,指的是一個repo的設定會伸出你執行它的那個資料夾多遠。這次測試裡的每一樣東西都刻意裝在單一資料夾內,確保不會碰到機器上的其他部分。
但Reticle的安裝指令另有打算。它自己的紀錄顯示,它把自己註冊到了另外8個agent上:VS Code、Copilot、Warp、Kiro、Amazon Q、Cline、Amp,還有一個。在Gemini裡,它事先核准了自己。在Claude Code的設定裡,它加了一條會核准自己工具的規則。這些都不是藏起來的,原始碼裡寫得清清楚楚,安裝程式也大方交代自己做了什麼,還附上一個解除安裝的指令。但這次測試只給了它一個yes flag,而且只針對一個專案。
Caliper原本應該是拿來測量的工具。它的測試框架會在啟動Claude時關掉所有權限檢查,而且沒有辦法改變這一點,還會在每次測試執行時複製你的登入憑證。最後它從來沒有被實際執行過,改用了一個自製的runner來取代。
| Repo | 能不能乾淨地裝在專案內? | 備註 |
|---|---|---|
| Anti-Slop | 可以 | 只複製檔案,不做其他事 |
| UI Skills | 可以 | 遠端skill庫 |
| img2threejs | 可以 | 一個skill |
| FWC SwiftUI Skills | 可以 | 純文字 |
| Reticle | 部分可以 | 註冊到另外8個agent,自我核准規則 |
| Chisle | 不行 | 只能全域安裝,啟動時檢查更新,把原始工具輸出存到磁碟 |
| Ouroboros | 不行 | 只能裝在整台機器上,預設回報使用狀況,安裝程式可能把網路上的腳本直接餵進你的shell |
| Caliper | 沒有執行 | 權限檢查關閉,每次執行都會複製憑證 |
這些都不是惡意軟體,只是一種假設你到處都想用這個工具的方便設計。安裝前先打開三樣東西看一看:hook、安裝腳本,以及伺服器設定。
全部疊在一起會怎樣
疊裝,指的是把全部八個一起裝上:沒有出錯,也沒有崩潰,成本幾乎是精確地加總起來。有一個陷阱花掉了一個小時:在腳本化的執行裡,一個專案伺服器會等待一個根本沒有人能給出的核准,結果看起來幾乎是免費的。修好這個問題之後,文中所有伺服器的數字都重新測量過。
hook是這些repo交會的地方。hook是Claude Code在固定時機執行的腳本,它印出來的任何內容都可能出現在模型面前。裝上其中三個依賴hook的工具之後,啟動時會觸發三個腳本,每個提示還會再觸發三個。一句普通的輸入句子,送到模型手上時已經附帶了兩則備註:一則要求它寫得簡短,另一則要求完成一個在專案內根本無法完成的設定步驟。第二則備註,只要提示裡出現它的關鍵字,就會一再出現。
工具名稱不會互相衝突,因為每個伺服器都會替自己的工具加上前綴。至於hook,官方文件也證實了這一點:當多個hook都加入context時,Claude會收到所有的內容。
2026年5月的一份研究測量了一大堆skill會對agent造成什麼影響。當skill數量來到約200個時,通過率最多下降21%,而大部分的損失來自agent選錯了外觀相似的skill,而不是正確的那一個。八個repo等於10個skill,離那個數字還很遠。但裝了幾十個skill的人,可就在那個範圍裡了。
真正改變程式碼的那一個
Anti-Slop不是外掛,而是一組你複製進專案裡的lint規則。沒有套件可以安裝,作者就是希望你把規則複製過去,自己再去修改。linter是在模型之外讀你的程式碼,所以不會花費任何context:它的輔助skill只要95個token,之後每一輪對話都不用再花。
在表單任務裡,Claude必須把一個新欄位串接到一個元件裡。它照抄了上面那一行,連同裡面不安全的型別轉換一起複製過去。Anti-Slop標記出了這個問題,三次執行裡三次都抓到。這正是那種審查者通常會放行的東西,因為它看起來跟旁邊的程式碼沒兩樣。
| Anti-Slop的發現 | 數值 |
|---|---|
| 標記出不安全的型別轉換 | 3次執行裡3次 |
| 在一個正確的六行函式裡標記出缺少空行 | 3次執行裡2次 |
| 在未經修改的專案上發現的問題數 | 109 |
| 其中來自兩條風格規則的比例 | 83% |
| 其他規則 | 16 |
那個空行的發現屬於品味問題,不是bug,而且這個linter一次只讀一個檔案。成本在第一天就會出現:先決定好怎麼處理那兩條風格規則,再去評斷其他16條。有一個小陷阱:這些規則是以模組的形式提供的,所以你的專案也得宣告自己是模組,不然linter會崩潰。
UI Skills是最便宜的一個:一個遠端的設計skill庫只要37個token,而且在這次測試裡完全沒有被呼叫過。它在7月時有18個失效連結。影片拍攝當天早上,全部300個都測試過一遍,沒有一個是壞的。
我留下了哪些,以及怎麼檢查你的設定
八個repo都排定了去留。原本預期會留下三個,但數據給出的結果是:一個真正值得留下,另外三個則是留著也不會有損失。
| Repo | 結論 |
|---|---|
| Anti-Slop | 真正值得:幾乎不花代價,每次都抓到真正的錯誤 |
| UI Skills | 留著無妨:只要37個token,不跟任何東西衝突 |
| img2threejs、FWC SwiftUI Skills | 如果你會用到就留著無妨:加起來只要幾百個token |
| Chisle | 在真實coding工作裡花費比省下的還多 |
| Caliper | 從未實際執行過 |
| Reticle、Ouroboros | 想要整台機器的權限,卻從未看到它們做真正的工作,所以無法對它們的用途下結論 |
Ouroboros自己的維護者統計,它大約有40%的執行是失敗的。
這次測試的限制很重要:只有一個React專案、一個模型、三個任務,每個各跑三次。雜訊這麼大的情況下,微小的效果根本看不出來。但數據確實能確定一件事:底線很高。不論裝不裝這些工具,Claude都全部通過,而那些待在context裡等著被呼叫的工具,大多根本不會被呼叫。它們需要一套會主動去用它們的工作流程。
你可以花兩分鐘檢查自己的設定。一個指令能顯示目前載入了什麼,一個能預估外掛的成本(記得它把hook算成免費),還有一個能回報每個skill的成本和使用頻率。而在任何安裝之前,先打開hook、安裝腳本,和伺服器設定看一看。
AIDive