Gelöscht, gemessen, eine Regel brach
Ein CLAUDE.md zu löschen heißt, die Anweisungsdatei zu entfernen, die Claude Code zu Beginn jedes Gesprächs liest. Boris Cherny, der Schöpfer von Claude Code, sagte auf einer Bühne, man solle sie alle sechs Monate löschen. Zweiundzwanzig Videos wiederholten ihn in sieben Wochen. Keins davon öffnete ein Repository.
Dieser Artikel tut, was die Videos nicht taten: Er nimmt eine echte App mit einer 177-zeiligen CLAUDE.md, drei Skills, vier Commands und einem Hook, führt fünf Alltagsaufgaben mit und ohne die Datei aus und zählt. Nach vierundvierzig Läufen brach genau eine Regel. Die Datei kostete bei jeder Aufgabe Tokens, nie den gleichen Betrag, und eine ihrer Zeilen konnte niemand befolgen.
Der Clip, wörtlich, und die zwei Zeilen, die nicht von ihm sind
Der Clip stammt aus Boris Chernys Vortrag bei der YC Startup School, aufgenommen einen Tag nach dem Erscheinen von Opus 5. Seine Worte: alle sechs Monate CLAUDE.md löschen, Skills löschen, Hooks löschen. Schauen, was das Modell macht, es könnte überraschen. Für Opus 5, sagt er, empfehle Anthropic wirklich, es zu versuchen: Das Modell brauche all diese Anweisungen vielleicht nicht mehr.
Dreißig Sekunden davor kommt der Vorbehalt, den niemand zitiert. Anthropic lösche nicht die gesamte Codebasis. Man lösche viel, und man nenne das eine Ablation. Das schriftliche Transkript trägt diese Zeile heute vollständig. Achtzig Prozent des Claude-Code-Systemprompts gingen diesen Weg: alles löschen, Zeile für Zeile zurückbringen, jede Zeile messen.
Zwei Sätze, die die Reaktionsvideos ihm in den Mund legen, stehen nicht im Talk. "Kontext, Ziele und eine Definition von fertig" erscheint nirgends; am nächsten kommt er mit Aufgabe, Leitplanken, Abschlusskriterien. "Vierundsechzig Agenten, die Bun umschreiben" ist ebenfalls nicht seine Zahl: Sie stammt von Jarred Sumner, im Bun-Beitrag. Cherny nennt elf Tage und, nach einer Zahl gefragt, schätzt Tausende.
Zweiundzwanzig Videos in sieben Wochen zitierten den Clip. Keins führte den Test durch. Dieser Artikel tut also, was er tatsächlich beschrieben hat: löschen, Stück für Stück zurückbringen, messen.
Das Instrument: Ablation, keine Löschung
Eine Ablation entfernt ein Stück einer Konfiguration nach dem anderen und misst die Wirkung, statt alles zu löschen und zu raten. Die CLAUDE.md wird zu Beginn jedes Gesprächs gelesen und dann bei jedem weiteren Turn erneut; Skills laden nur, wenn sie aufgerufen werden. Dieser Unterschied ist es, was gemessen wurde.
Anthropic liefert den Lösch-Schalter: eine bloße Flag, dieselbe Variable, die Cherny auf der Bühne nennt. Das Repository ist eine echte App von mir: 177 Zeilen Anweisungen, drei Skills, vier Commands und ein Hook, der bei jeder Suche feuert.
| Dimension | Wert |
|---|---|
| Alltagsaufgaben | 5 (neue Komponente, Edit, Refactor, Store-Änderung, Architekturfrage) |
| Konfigurationen | 5 (voll, ohne Datei, ohne Skills, ohne Hook, nichts) |
| Modell | eines, fixiert |
| Umgebung | leeres Config-Verzeichnis, frischer Clone vor jedem Lauf |
| Läufe | 44 |
| Kosten | $39 |
Jeder Lauf wurde auf dieselbe Weise bewertet, auf demselben Clone, durch ein Skript statt von Hand. Was als kaputt zählt: die eigenen Regeln des Repositorys (Imports, Typen, Design-Tokens, Übersetzungen) plus Typecheck und Lint.
Das eine Tool, das für diese Art von Ablation gebaut wurde, Caliper, ablatiert Skills und MCP-Server, rührt aber nie die Datei an; der CLAUDE.md-Tausch wurde von Hand gemacht. Die Grenzen, einmal genannt: ein Repository, ein Modell, zwei Läufe pro Zelle, kein Transkript. Das erste Ergebnis gab den Ton an: Die Refactor-Aufgabe kam identisch zurück, vierundsechzig Cent mit der Datei und dreiundsechzig ohne.
Was kaputtging: eine Regel, bei neuen Dateien
Die Regel, die brach, ist eine Internationalisierungsregel, in den eigenen Worten der Datei: immer sowohl Englisch als auch Französisch hinzufügen, nie einen für den Nutzer sichtbaren String hart codieren. Bei der Neue-Komponente-Aufgabe schrieben mit der Datei alle vier Läufe die Übersetzungsdatei. Ohne sie codierten drei von vier Läufen die Überschrift hart. Gleiche Aufgabe, gleiches Repository, gleiches Modell, gleicher Prompt.
| Neue Komponente | Übersetzungsdatei geschrieben |
|---|---|
| Mit CLAUDE.md | 4 von 4 |
| Ohne CLAUDE.md | 1 von 4 |
Die Edit-Aufgabe erzählt die andere Hälfte. Jede Konfiguration schaffte es, sogar ohne alles, weil die Nachbarn es lehren: Jede Komponente neben der bearbeiteten hat bereits eine Übersetzungsdatei. Alles andere hielt in allen vierundvierzig Läufen: der Import-Alias, Typ statt Interface, Design-Tokens, das Store-Muster. Der Code zeigt das, die Datei wiederholt es.
Ein Paper der ETH Zürich maß dasselbe an 138 echten Issues. Sein Befund: Kontextdateien verbessern den Erfolg nicht und kosten rund zwanzig Prozent mehr, und das Modell folgt den Anweisungen tatsächlich. Ein Vorbehalt: Ein Lauf ohne die Datei schrieb die Übersetzungsdatei trotzdem. Die Regel ist ohne die Datei nicht unmöglich, sie ist unzuverlässig. Eine Regel brach, jene, die der Code nicht lehren konnte. Und der Lauf, der diese Arbeit ausließ, war auch der günstigste.
Was die Datei kostete, Aufgabe für Aufgabe
Die Tokenkosten einer CLAUDE.md sind die Differenz der gelesenen Tokens zwischen einem Lauf mit der Datei und demselben Lauf ohne sie.
| Aufgabe | Weniger Tokens gelesen ohne die Datei |
|---|---|
| Neue Komponente | 61% |
| Edit | 15% |
| Refactor | 5% |
| Store-Änderung | 4% |
| Architekturfrage | 14% |
| Über die zehn Läufe | 32% Tokens, 22% Geld |
Zweiunddreißig Prozent ist die Zahl, die jedes Video zur Schlagzeile machen würde, und sie ist die falsche. Die größte Ersparnis ist der Lauf, der die Übersetzungsdatei nicht schrieb: günstiger, weil er weniger tat. Wo die Ausgabe identisch war, kostete die Datei vier bis vierzehn Prozent. Das ist ihr wahrer Preis, und die zwanzig Prozent des Papers liegen genau zwischen diesen beiden Zahlen.
Der Mechanismus sind etwa 1.800 Tokens, bei jedem Turn erneut gelesen. Skills, der Hook und der Knowledge Graph brachten nichts Messbares, anwesend oder nicht. Rauschen ist größer als das meiste davon: dieselbe Aufgabe mit derselben Datei kostete $2,11 in einem Lauf und $1,33 im anderen. Zwei Läufe erreichten die Turn-Obergrenze, einer mit der Datei und einer ohne. Die Datei kostet also überall ein wenig und verdient sich ihren Platz einmal, es sei denn, sie lügt auch.
Die Zeilen, die logen
Eine lügende Zeile ist eine Anweisung, der das Modell nicht folgen kann oder die nichts ändert. Die Zeile, die oben angeteasert wurde: das Theme aus dem Design-Tokens-Alias importieren. Der Alias existiert nicht: Die TypeScript-Konfiguration mappt ein Präfix, und der Tokens-Ordner hat keine Theme-Datei. Jeder Lauf, mit oder ohne Datei, tat, was die Nachbarn tun, dieselbe Import-Zeile vierundvierzig Mal.
Die Datei hat zweiundachtzig Zeilen Architekturüberblick. Gleiche Frage, sechs Antworten: alle sechs fanden dieselben neun Dateien, vom Backend bis zum Screen, in derselben Reihenfolge, mit und ohne den Überblick. Ein Block verweist auf einen Knowledge Graph, den der Clone nicht hat; mit vorhandenem Graph kostete die Frage dasselbe.
| Maß | Wert |
|---|---|
| Anthropics Größenregel | unter 200 Zeilen |
| Diese Datei | 177 Zeilen |
| Mediandatei im reporails-30k-Repo-Datensatz | 50 Elemente, 12 Direktiven |
| Direktivzeilen in dieser Datei | 24 von 177 |
Position entscheidet, welche von zwei widersprüchlichen Regeln gewinnt, und das Modell sagt es nie, etwa neunzig Punkte in einem Anbietertest. Der Überblick könnte einer hier nicht getesteten Aufgabe helfen: eine Stichprobe, eine Antwort. Drei Arten von Zeilen also: die, die sich ihren Platz verdient hat, die, die der Code lehrt, die, die lügen.
Behalten, verschieben, löschen: die kurze Liste
Drei Stapel, und die Messung hinter jedem.
| Stapel | Was dorthin gehört | Messung |
|---|---|---|
| Behalten | Die Regel, die der Code nicht zeigen kann | 6 Zeilen, die 4 Läufe retteten |
| Verschieben | Der Architekturüberblick und die Commands | 107 Zeilen ohne gemessenen Gewinn |
| Löschen | Die Zeilen, die lügen, und die Zeilen, die der Baum schon zeigt | 44 identische Läufe |
Behalte, was das Modell zweimal falsch machte: Das ist Anthropics eigenes Kriterium für die Datei. Verschiebe den Überblick und die Commands in einen Baum von Dateien, die bei Bedarf geladen werden; Anthropics Juli-Beitrag nennt das zentrale Repository einen Mythos. Hooks bleiben: Ein Gate verfällt nicht, wenn das Modell besser wird. Kürze die Prosa, die es überwachsen hat, behalte das Gate.
Die Datei danach: etwa siebzig Zeilen, dazu die sechs, die es sich verdient haben. Das ist Chernys Methode, ganz gelesen: löschen, Zeile für Zeile zurückbringen, messen. Ein Repository, ein Modell, zwei Läufe pro Zelle; deine Stapel werden anders aussehen, die Methode nicht. Löschen kostete eine Regel und sparte wenig. Die Zeilen zu finden, die lügen, war der Gewinn.
AIDive