AIDive

我把8個爆紅Claude Code Repo全裝了,只有一個真正值得

AIDive · 發布

編碼 agentAI 資安

八個repo,一個專案,87次執行

八個GitHub repo這個月幾乎在每份Claude Code必裝清單上都看得到:Chisle、Ouroboros、Reticle、Caliper、Anti-Slop、UI Skills、img2threejs和FWC SwiftUI Skills。它們加起來有超過37,000顆星。那些清單只會告訴你每個repo宣稱了什麼、怎麼安裝。沒有人把它們一起裝上,再實際測量。

於是這八個全部裝進了同一個真實專案,一個有111個測試全數通過的React應用。其中一個把自己寫進了機器上另外九個AI工具的設定裡。有一個因為原始碼裡的一行,完全沒有被執行過。還有三個把伺服器接上了Claude Code,卻在63次執行中一次也沒有被呼叫過。

測試項目 數值
安裝的repo數量 8
總執行次數 87
總花費 約6美元
專案 1個React應用,111個測試全數通過
模型 1個
耗時 1天

接下來的內容,由三個問題主導:每個repo在啟動時要花多少代價、實際輸出到底改變了什麼,以及哪些真正值得留下。

打字之前,每個要花多少

啟動成本,指的是在你送出第一則訊息之前,Claude Code就已經載入到context裡的東西。在空專案上這大約是17,000個token,而且每一輪對話都要為它付費。要測量一次安裝的代價,做法是請Claude回覆一個字,再讀取帳單。單位是token,不是美元:同樣的兩次執行,光是因為快取的關係,價格就可能差到10倍。

安裝項目 新增的啟動token
Chisle 約3,500
Ouroboros 約1,600
Reticle 約900
img2threejs(33 KB的指示檔) 107
Anti-Slop(輔助skill) 95
UI Skills 37
其餘每個 100到300不等
八個加起來 不到7,000

八個裡有兩個根本不是給網頁開發者用的。img2threejs能把一張照片變成3D場景,FWC SwiftUI Skills則是給Apple應用用的。這兩個只測量了它們的成本。那個3D skill雖然附帶一份33KB的指示檔,卻只花107個token,因為在你真正呼叫它之前,只有skill的描述會被載入。

伺服器的成本也變低了。Claude Code現在只會載入伺服器工具的名稱,細節則是要用到才抓取,大約是每個工具45個token,不管那個工具實際做什麼。八個全部裝上之後,成本只是單純加總,不會相乘。

Claude Code有一個指令可以預估外掛的這項成本,而且它把hook算成免費。對這台機器上每天都在用的一個外掛,它預估約540個token,但實測是744個,因為它的啟動hook會直接把內容印進session裡。

啟動階段不是這些repo變貴的地方,真正花錢的是每一輪對話。

同樣任務,裝與不裝

這次的benchmark是三個開發者真的會交辦的任務:一個網址組合方式的bug、一個顯示閱讀時間的功能,以及表單上的字數計數器。每個任務分別在裝單一repo、裝全部八個、以及完全不裝的情況下執行,每種情況跑三次。評分依據是agent看不到的測試,加上專案自身的測試套件,再加上型別檢查器。每次執行都用同一份固定的允許工具清單,沒有繞過任何權限。

結果 數值
任務執行次數 63
通過次數 63
新增的型別錯誤 0
對三個已連接伺服器的呼叫次數 0
修bug,基準情況 7輪對話,27秒
表單任務,基準情況 22輪對話,約1分鐘

沒有任何東西讓Claude失敗,也沒有任何東西讓它通過一個原本會失敗的任務。

這裡面有三個repo接上了裝滿工具的伺服器。在63次執行中,Claude一次也沒有呼叫過那些工具,包括那個特地寫來讓設計建議和視覺測試有事可做的表單任務。平心而論,其中兩個從來沒有機會做它們真正的工作:Reticle需要瀏覽器跟你正在跑的應用配對,而那次配對失敗了;Ouroboros需要在整台機器上做設定,而這次測試沒有給它這個條件。

雜訊非常大。同樣的提示、同樣的安裝設定:一次執行寫了4,300個token,另一次寫了7,100個。只有兩個結果的差異大到能蓋過雜訊,而且都出現在最短的那個任務上。單一次的前後對比示範,什麼也證明不了。

Chisle的52%,遇上真實coding工作

Chisle是一個壓縮輸出的外掛,也是八個裡唯一敢承諾具體數字的:它的benchmark宣稱能把帳單降到52%。但在這三個任務裡,輸出量落在基準的94%。它的README自己也解釋了原因:那些數字來自沒有使用工具的單一提示,而不是整個session的成本。

項目 數值
Chisle的benchmark宣稱 輸出量52%
Chisle在三個任務上的實測 輸出量為基準的94%
日常使用的精簡外掛,同樣任務 113%,落在雜訊範圍內
一次修bug:讀取的token 95,000
一次修bug:寫入的token 1,700

在真實的coding session裡,輸出只是帳單裡比較小的那一塊。Chisle在一開始就載入自己的規則,還會在你送出的每個提示上附加一則提醒,所以三個任務裡有兩個的成本反而比基準更高。它的規則本身的重量,超過了它幫你省下的字數。它用來壓縮工具輸出的功能,在每個session裡都有運作,卻從來沒有記錄到任何節省。

兩個外掛都沒有省下任何可測量的東西。一位Chisle使用者在173個session裡也發現了同樣的結果,而作者表示這個bug已經修好了。公道地說,Chisle願意公開自己的損耗數字,而且它的檔案處理做得相當扎實。

從中能學到的規則是:一個在每一輪對話都要開口的外掛,是最貴的那種。

伸出專案之外的安裝

安裝範圍,指的是一個repo的設定會伸出你執行它的那個資料夾多遠。這次測試裡的每一樣東西都刻意裝在單一資料夾內,確保不會碰到機器上的其他部分。

但Reticle的安裝指令另有打算。它自己的紀錄顯示,它把自己註冊到了另外8個agent上:VS Code、Copilot、Warp、Kiro、Amazon Q、Cline、Amp,還有一個。在Gemini裡,它事先核准了自己。在Claude Code的設定裡,它加了一條會核准自己工具的規則。這些都不是藏起來的,原始碼裡寫得清清楚楚,安裝程式也大方交代自己做了什麼,還附上一個解除安裝的指令。但這次測試只給了它一個yes flag,而且只針對一個專案。

Caliper原本應該是拿來測量的工具。它的測試框架會在啟動Claude時關掉所有權限檢查,而且沒有辦法改變這一點,還會在每次測試執行時複製你的登入憑證。最後它從來沒有被實際執行過,改用了一個自製的runner來取代。

Repo 能不能乾淨地裝在專案內? 備註
Anti-Slop 可以 只複製檔案,不做其他事
UI Skills 可以 遠端skill庫
img2threejs 可以 一個skill
FWC SwiftUI Skills 可以 純文字
Reticle 部分可以 註冊到另外8個agent,自我核准規則
Chisle 不行 只能全域安裝,啟動時檢查更新,把原始工具輸出存到磁碟
Ouroboros 不行 只能裝在整台機器上,預設回報使用狀況,安裝程式可能把網路上的腳本直接餵進你的shell
Caliper 沒有執行 權限檢查關閉,每次執行都會複製憑證

這些都不是惡意軟體,只是一種假設你到處都想用這個工具的方便設計。安裝前先打開三樣東西看一看:hook、安裝腳本,以及伺服器設定。

全部疊在一起會怎樣

疊裝,指的是把全部八個一起裝上:沒有出錯,也沒有崩潰,成本幾乎是精確地加總起來。有一個陷阱花掉了一個小時:在腳本化的執行裡,一個專案伺服器會等待一個根本沒有人能給出的核准,結果看起來幾乎是免費的。修好這個問題之後,文中所有伺服器的數字都重新測量過。

hook是這些repo交會的地方。hook是Claude Code在固定時機執行的腳本,它印出來的任何內容都可能出現在模型面前。裝上其中三個依賴hook的工具之後,啟動時會觸發三個腳本,每個提示還會再觸發三個。一句普通的輸入句子,送到模型手上時已經附帶了兩則備註:一則要求它寫得簡短,另一則要求完成一個在專案內根本無法完成的設定步驟。第二則備註,只要提示裡出現它的關鍵字,就會一再出現。

工具名稱不會互相衝突,因為每個伺服器都會替自己的工具加上前綴。至於hook,官方文件也證實了這一點:當多個hook都加入context時,Claude會收到所有的內容。

2026年5月的一份研究測量了一大堆skill會對agent造成什麼影響。當skill數量來到約200個時,通過率最多下降21%,而大部分的損失來自agent選錯了外觀相似的skill,而不是正確的那一個。八個repo等於10個skill,離那個數字還很遠。但裝了幾十個skill的人,可就在那個範圍裡了。

真正改變程式碼的那一個

Anti-Slop不是外掛,而是一組你複製進專案裡的lint規則。沒有套件可以安裝,作者就是希望你把規則複製過去,自己再去修改。linter是在模型之外讀你的程式碼,所以不會花費任何context:它的輔助skill只要95個token,之後每一輪對話都不用再花。

在表單任務裡,Claude必須把一個新欄位串接到一個元件裡。它照抄了上面那一行,連同裡面不安全的型別轉換一起複製過去。Anti-Slop標記出了這個問題,三次執行裡三次都抓到。這正是那種審查者通常會放行的東西,因為它看起來跟旁邊的程式碼沒兩樣。

Anti-Slop的發現 數值
標記出不安全的型別轉換 3次執行裡3次
在一個正確的六行函式裡標記出缺少空行 3次執行裡2次
在未經修改的專案上發現的問題數 109
其中來自兩條風格規則的比例 83%
其他規則 16

那個空行的發現屬於品味問題,不是bug,而且這個linter一次只讀一個檔案。成本在第一天就會出現:先決定好怎麼處理那兩條風格規則,再去評斷其他16條。有一個小陷阱:這些規則是以模組的形式提供的,所以你的專案也得宣告自己是模組,不然linter會崩潰。

UI Skills是最便宜的一個:一個遠端的設計skill庫只要37個token,而且在這次測試裡完全沒有被呼叫過。它在7月時有18個失效連結。影片拍攝當天早上,全部300個都測試過一遍,沒有一個是壞的。

我留下了哪些,以及怎麼檢查你的設定

八個repo都排定了去留。原本預期會留下三個,但數據給出的結果是:一個真正值得留下,另外三個則是留著也不會有損失。

Repo 結論
Anti-Slop 真正值得:幾乎不花代價,每次都抓到真正的錯誤
UI Skills 留著無妨:只要37個token,不跟任何東西衝突
img2threejs、FWC SwiftUI Skills 如果你會用到就留著無妨:加起來只要幾百個token
Chisle 在真實coding工作裡花費比省下的還多
Caliper 從未實際執行過
Reticle、Ouroboros 想要整台機器的權限,卻從未看到它們做真正的工作,所以無法對它們的用途下結論

Ouroboros自己的維護者統計,它大約有40%的執行是失敗的。

這次測試的限制很重要:只有一個React專案、一個模型、三個任務,每個各跑三次。雜訊這麼大的情況下,微小的效果根本看不出來。但數據確實能確定一件事:底線很高。不論裝不裝這些工具,Claude都全部通過,而那些待在context裡等著被呼叫的工具,大多根本不會被呼叫。它們需要一套會主動去用它們的工作流程。

你可以花兩分鐘檢查自己的設定。一個指令能顯示目前載入了什麼,一個能預估外掛的成本(記得它把hook算成免費),還有一個能回報每個skill的成本和使用頻率。而在任何安裝之前,先打開hook、安裝腳本,和伺服器設定看一看。

來源

常見問題

哪些Claude Code repo真的值得安裝?
在同一個React專案上測試的八個repo裡,只有Anti-Slop真正值得留下:它的lint規則幾乎不花context成本,三次執行裡三次都抓到真正的不安全型別轉換。UI Skills、img2threejs和FWC SwiftUI Skills加起來只花幾百個token,也不會跟任何東西衝突,只要你會用到它們就可以放心留著。
Claude Code外掛在啟動時會多花多少token?
一個空專案本身就會載入約17,000個token。在這次測試中,Chisle多花了約3,500個,Ouroboros約1,600個,Reticle約900個,UI Skills只要37個,八個repo加起來不到7,000個。skill在被呼叫之前只會載入描述,而一個MCP伺服器則大約是每個工具45個token。
Chisle真的能把Claude Code的帳單降到52%嗎?
在真實coding工作裡並不會。在三個開發者任務中,輸出量落在基準的94%,而且三個任務裡有兩個的成本反而比基準更高,因為它在啟動時就載入規則,還會在每個提示上附加一則提醒。它的README也說明,那個52%的數字來自沒有使用工具的單一提示,而不是整個session的成本。
Claude Code外掛能讓Claude通過更多coding任務嗎?
在這次測試裡沒有。在三個任務、共63次執行中,不論裝單一repo、裝全部八個,還是完全不裝,每一次都通過了agent看不到的測試、專案自身的測試套件和型別檢查器。每次執行之間的雜訊很大,同樣的提示可以從4,300個輸出token跳到7,100個,所以單一次的前後對比示範什麼也證明不了。
安裝熱門的Claude Code repo安全嗎?
這八個repo都不是惡意軟體,但有幾個的影響範圍伸出了專案之外。Reticle的安裝程式把自己註冊到另外8個agent上,還加了一條自動核准自己工具的規則;Caliper啟動Claude時關掉了所有權限檢查,還會在每次執行時複製登入憑證;Chisle和Ouroboros則只能裝在整台機器上。安裝前務必先打開hook、安裝腳本和伺服器設定看一看。
同時安裝很多Claude Code外掛會發生什麼事?
八個一起裝上並沒有出錯,啟動成本也只是單純加總。hook是它們交會的地方:有三個依賴hook的工具裝在一起時,我打的一句普通句子送到模型手上時,已經附帶了兩則被注入的備註。2026年5月的一份研究發現,當skill數量來到約200個時,通過率最多會下降21%,大部分原因是agent選錯了外觀相似的skill。

相關影片