Acht Repos, ein Projekt, 87 Durchläufe
Acht GitHub-Repos stehen diesen Monat auf jeder Liste der Claude-Code-Essentials: Chisle, Ouroboros, Reticle, Caliper, Anti-Slop, UI Skills, img2threejs und FWC SwiftUI Skills. Zusammen haben sie über 37.000 Sterne. Diese Listen sagen dir, was jedes Repo verspricht und wie man es installiert. Niemand installiert sie zusammen und misst.
Also wanderten alle acht in ein echtes Projekt, eine React-App mit 111 bestandenen Tests. Eines davon schrieb sich selbst in die Einstellungen von neun weiteren KI-Tools auf der Maschine. Eines wurde nie ausgeführt, wegen einer einzigen Zeile in seinem Quellcode. Und drei von ihnen verbanden Claude Code mit einem Server, der in 63 Durchläufen kein einziges Mal aufgerufen wurde.
| Der Test | Wert |
|---|---|
| Installierte Repos | 8 |
| Durchläufe insgesamt | 87 |
| Gesamtkosten | etwa 6 $ |
| Projekt | 1 React-App, 111 bestandene Tests |
| Modell | 1 |
| Dauer | 1 Tag |
Drei Fragen bestimmen den Rest: was jedes Repo beim Start kostet, was sich im Ergebnis tatsächlich verändert hat, und welche es wert sind, behalten zu werden.
Was jedes kostet, bevor du tippst
Die Startkosten sind das, was Claude Code vor deiner ersten Nachricht in den Kontext lädt. Bei einem leeren Projekt sind das etwa 17.000 Token, und du zahlst dafür bei jeder Runde. Um eine Installation zu messen, wurde Claude gebeten, mit einem einzigen Wort zu antworten, und die Rechnung wurde abgelesen. Die Einheit ist Token, nicht Dollar: Zwei identische Durchläufe können allein durch Caching um das Zehnfache im Preis abweichen.
| Installation | Zusätzliche Start-Token |
|---|---|
| Chisle | etwa 3.500 |
| Ouroboros | etwa 1.600 |
| Reticle | etwa 900 |
| img2threejs (33-KB-Anweisungsdatei) | 107 |
| Anti-Slop (Helfer-Skill) | 95 |
| UI Skills | 37 |
| Alles andere | jeweils 100 bis 300 |
| Alle acht zusammen | unter 7.000 |
Zwei der acht sind gar nicht für Webentwickler gedacht. img2threejs verwandelt ein Foto in eine 3D-Szene, und FWC SwiftUI Skills ist für Apple-Apps. Nur ihre Kosten wurden gemessen. Der 3D-Skill liefert eine 33-Kilobyte-Anweisungsdatei mit und kostet trotzdem nur 107 Token, weil bis zum Aufruf nur die Beschreibung eines Skills geladen wird.
Auch Server wurden günstiger. Claude Code lädt inzwischen nur noch die Namen der Tools eines Servers und holt die Details bei Bedarf nach. Das sind etwa 45 Token pro Tool, egal was das Tool tut. Mit allen acht installiert summieren sich die Kosten einfach. Nichts multipliziert sich.
Claude Code hat einen Befehl, der diese Kosten für ein Plugin schätzt, und der listet Hooks als kostenlos. Für ein Plugin, das auf dieser Maschine täglich genutzt wird, schätzte er etwa 540 Token. Die Messung ergab 744, weil dessen Start-Hook direkt in die Session schreibt.
Teuer werden diese Repos nicht beim Start. Sondern in den Runden.
Gleiche Aufgaben, mit und ohne
Der Benchmark besteht aus drei Aufgaben, die ein Entwickler tatsächlich übergeben würde: ein Bug beim Aufbau einer Web-Adresse, ein Feature, das die Lesezeit anzeigt, und ein Zeichenzähler in einem Formular. Jede Aufgabe lief mit einem installierten Repo, mit allen acht und mit keinem, jeweils drei Durchläufe. Der Richter ist ein Test, den der Agent nie sieht, dazu die eigene Testsuite des Projekts und der Type-Checker. Jeder Durchlauf nutzte dieselbe feste Liste erlaubter Tools, ohne Permission-Bypass.
| Ergebnis | Wert |
|---|---|
| Aufgaben-Durchläufe | 63 |
| Bestanden | 63 |
| Neue Type-Errors | 0 |
| Aufrufe der drei verbundenen Server | 0 |
| Bugfix, Baseline | 7 Runden, 27 Sekunden |
| Formular-Aufgabe, Baseline | 22 Runden, etwa 1 Minute |
Nichts brachte Claude dazu, eine Aufgabe nicht zu bestehen, und nichts brachte es dazu, eine zu bestehen, die es ohne das jeweilige Repo nicht bestanden hätte.
Drei dieser Repos verbinden einen Server voller Tools. In 63 Durchläufen rief Claude diese Tools null Mal auf. Das schließt die Formular-Aufgabe ein, die extra so geschrieben wurde, dass Design-Ratschläge und visuelle Tests etwas zu tun gehabt hätten. Fairerweise kamen zwei davon nie zu ihrem eigentlichen Job. Reticle braucht einen Browser, der mit der laufenden App gekoppelt ist, und diese Kopplung stürzte ab. Ouroboros braucht ein Setup über die ganze Maschine hinweg, und das wurde ihm nicht gegeben.
Das Rauschen ist enorm. Gleicher Prompt, gleiche Installation: Ein Durchlauf schrieb 4.300 Token, ein anderer 7.100. Nur zwei Ergebnisse schlugen ihr eigenes Rauschen, beide bei der kürzesten Aufgabe. Eine einzelne Vorher-Nachher-Demo beweist gar nichts.
Chisles 52 Prozent, bei echter Coding-Arbeit
Chisle ist ein Plugin zur Output-Komprimierung und das einzige der acht, das eine Zahl verspricht: Sein Benchmark sagt, deine Rechnung sinkt auf 52 Prozent. Bei den drei Aufgaben lag der Output bei 94 Prozent der Baseline. Das README erklärt in eigenen Worten, warum: Diese Zahlen stammen aus einzelnen Prompts ohne Tools, nicht aus den Kosten einer ganzen Session.
| Messwert | Wert |
|---|---|
| Chisles Benchmark-Versprechen | Output bei 52 % |
| Chisle bei den drei Aufgaben | Output bei 94 % der Baseline |
| Das täglich genutzte Kürzungs-Plugin, gleiche Aufgaben | 113 %, innerhalb des Rauschens |
| Ein Bugfix: gelesene Token | 95.000 |
| Ein Bugfix: geschriebene Token | 1.700 |
In einer echten Coding-Session ist der Output die kleine Seite der Rechnung. Chisle lädt seine Regeln beim Start und heftet jedem Prompt, den du schickst, eine Erinnerung an, sodass seine Durchläufe bei zwei von drei Aufgaben mehr kosten als die Baseline. Die Regeln wiegen mehr als die Worte, die sie einsparen. Sein Kompressor für Tool-Output lief in jeder Session und hat nie eine Einsparung verzeichnet.
Keines der beiden Plugins sparte etwas Messbares. Ein Chisle-Nutzer fand dasselbe über 173 Sessions hinweg, und der Autor sagt, dieser Bug sei behoben. Anerkennung, wo sie hingehört: Chisle veröffentlicht seine eigenen Verluste, und seine Dateibehandlung ist sorgfältig abgesichert.
Die Regel, die man daraus mitnimmt: Ein Plugin, das bei jeder Runde mitredet, ist die teuerste Sorte.
Die Installs, die über dein Projekt hinausreichen
Der Install-Radius beschreibt, wie weit die Einrichtung eines Repos über den Ordner hinausreicht, in dem du es ausgeführt hast. Hier wurde alles bewusst in einem einzigen Ordner installiert, damit nichts sonst auf der Maschine berührt wird.
Reticles Setup-Befehl hatte andere Pläne. Sein eigenes Log meldet, dass es sich bei 8 weiteren Agenten registriert hat: VS Code, Copilot, Warp, Kiro, Amazon Q, Cline, Amp und noch einem. In Gemini genehmigte es sich selbst im Voraus. In den Claude-Code-Einstellungen fügte es eine Regel hinzu, die seine eigenen Tools genehmigt. Nichts davon ist versteckt, es steht genau so im Quellcode, der Installer kommuniziert offen, was er tut, und er liefert einen Deinstallationsbefehl mit. Aber er bekam ein einziges Yes-Flag, für ein einziges Projekt.
Caliper sollte das Messwerkzeug sein. Sein Harness startet Claude mit allen Rechteprüfungen ausgeschaltet, ohne Option, das zu ändern, und kopiert deine Login-Zugangsdaten in jeden Testlauf. Es wurde nie ausgeführt; ein eigener Runner ersetzte es.
| Repo | Installiert sauber innerhalb eines Projekts? | Notizen |
|---|---|---|
| Anti-Slop | Ja | Kopiert nur Dateien und sonst nichts |
| UI Skills | Ja | Externe Skill-Bibliothek |
| img2threejs | Ja | Ein Skill |
| FWC SwiftUI Skills | Ja | Reiner Text |
| Reticle | Teilweise | Bei 8 weiteren Agenten registriert, selbstgenehmigende Regel |
| Chisle | Nein | Nur global, prüft beim Start auf Updates, speichert rohen Tool-Output auf der Festplatte |
| Ouroboros | Nein | Nur maschinenweit, meldet standardmäßig die Nutzung, Installer kann ein Skript aus dem Internet in deine Shell leiten |
| Caliper | Nicht ausgeführt | Rechteprüfungen aus, Zugangsdaten in jeden Durchlauf kopiert |
Nichts davon ist Malware. Es ist Bequemlichkeit, die davon ausgeht, dass du das Tool überall haben willst. Öffne vor jeder Installation drei Dinge: die Hooks, das Installationsskript und die Server-Konfiguration.
Was passiert, wenn sie sich stapeln
Stapeln heißt: alle acht zusammen installiert. Kein Absturz, kein Fehler, und die Kosten summieren sich fast genau. Eine Falle kostete eine Stunde. In skriptgesteuerten Durchläufen wartet ein Projekt-Server auf eine Genehmigung, die niemand geben kann, sodass er fast kostenlos wirkt. Jede Serverzahl hier wurde erneut gemessen, nachdem das behoben war.
Bei den Hooks treffen sich die Repos. Ein Hook ist ein Skript, das Claude Code zu einem festen Zeitpunkt ausführt, und was es ausgibt, kann vor dem Modell landen. Mit drei dieser Tools eingebunden feuern drei Skripte beim Start und drei weitere bei jedem Prompt. Ein ganz gewöhnlicher, getippter Satz erreichte das Modell mit zwei angehängten Notizen: eine, die es zu knapper Ausdrucksweise anhielt, eine, die einen Setup-Schritt verlangte, der innerhalb eines Projekts nicht erledigt werden kann. Diese zweite Notiz kommt bei jedem Prompt zurück, der eines ihrer Schlüsselwörter enthält.
Tool-Namen können nicht kollidieren, weil jeder Server seine eigenen mit einem Präfix versieht. Für Hooks bestätigen es die Docs: Wenn mehrere Hooks Kontext hinzufügen, erhält Claude alle Werte.
Eine Studie von Mai 2026 hat gemessen, was ein großer Haufen Skills mit einem Agenten macht. Bei rund 200 Skills sank die Erfolgsquote um bis zu 21 Prozent, und der Großteil dieses Verlusts entsteht dadurch, dass der Agent einen ähnlich aussehenden Skill statt des richtigen wählt. Acht Repos sind 10 Skills, davon weit entfernt. Wer Dutzende installiert hat, ist es nicht.
Das eine, das den Code veränderte
Anti-Slop ist kein Plugin, sondern ein Satz Lint-Regeln, den du in dein Projekt kopierst. Es gibt kein Paket zu installieren; der Autor will, dass du die Regeln kopierst und selbst anpasst. Ein Linter liest deinen Code außerhalb des Modells, kostet also keinen Kontext: 95 Token für seinen Helfer-Skill, und nichts pro Runde.
Bei der Formular-Aufgabe musste Claude ein neues Feld durch eine Komponente verdrahten. Es kopierte die Zeile darüber, inklusive unsicherem Type-Cast. Anti-Slop markierte das, drei von drei Durchläufen. Genau die Art von Sache, die ein Reviewer durchwinkt, weil sie aussieht wie ihre Nachbarn.
| Anti-Slop-Fund | Wert |
|---|---|
| Unsicherer Type-Cast markiert | 3 von 3 Durchläufen |
| Fehlende Leerzeile in einer korrekten, sechs Zeilen langen Funktion markiert | 2 von 3 Durchläufen |
| Funde im unangetasteten Projekt | 109 |
| Anteil davon aus zwei Stilregeln | 83 % |
| Andere Regeln | 16 |
Der Fund zur Leerzeile ist Geschmackssache, kein Bug, und der Linter liest immer nur eine Datei auf einmal. Die Kosten zeigen sich am ersten Tag: Entscheide dich zu diesen zwei Stilregeln, bevor du über die anderen 16 urteilst. Eine Falle: Die Regeln kommen als Module, dein Projekt muss sich also ebenfalls als Modul deklarieren, sonst stürzt der Linter ab.
UI Skills ist am günstigsten zu behalten: 37 Token für eine externe Bibliothek von Design-Skills, und null Aufrufe in diesen Durchläufen. Im Juli hatte es 18 tote Links. Alle 300 wurden am Morgen des Videos getestet, und keiner ist mehr defekt.
Was ich behalte, und wie du dein Setup prüfst
Acht Repos sortiert. Erwartet waren drei Bleiber. Die Daten liefern eins, das es sich verdient hat, und drei, die man kostenlos behalten kann.
| Repo | Urteil |
|---|---|
| Anti-Slop | Verdient es: fing jedes Mal einen echten Fehler ab, fast umsonst |
| UI Skills | Kostenlos zu behalten: 37 Token, kollidiert mit nichts |
| img2threejs, FWC SwiftUI Skills | Kostenlos zu behalten, wenn du sie je aufrufst: zusammen ein paar Hundert Token |
| Chisle | Kostete mehr, als es bei echter Coding-Arbeit sparte |
| Caliper | Nie ausgeführt |
| Reticle, Ouroboros | Wollen die ganze Maschine, wurden nie bei ihrem eigentlichen Job beobachtet, also kein Urteil darüber, wofür sie gut sind |
Ouroboros' eigener Maintainer zählt etwa 40 Prozent fehlschlagende Durchläufe.
Die Grenzen zählen: ein React-Projekt, ein Modell, drei Aufgaben, drei Durchläufe je Aufgabe. Bei so breitem Rauschen sind kleine Effekte unsichtbar. Was die Daten sehr wohl klären: Das Grundniveau ist hoch. Claude bestand alles, mit oder ohne diese Tools, und Tools, die im Kontext liegen und auf ihren Aufruf warten, werden meistens nicht aufgerufen. Sie brauchen einen Workflow, der nach ihnen greift.
Du kannst dein eigenes Setup in zwei Minuten prüfen. Ein Befehl zeigt, was gerade geladen ist. Einer schätzt die Kosten eines Plugins, und denk daran, dass er Hooks als kostenlos zählt. Einer meldet, was jeder Skill kostet und wie oft er genutzt wird. Und öffne vor jeder Installation die Hooks, das Installationsskript und die Server-Konfiguration.
AIDive