AIDive

Ich löschte mein CLAUDE.md und maß, was kaputtging

Von AIDive · Veröffentlicht am

Coding-Agents

Gelöscht, gemessen, eine Regel brach

Ein CLAUDE.md zu löschen heißt, die Anweisungsdatei zu entfernen, die Claude Code zu Beginn jedes Gesprächs liest. Boris Cherny, der Schöpfer von Claude Code, sagte auf einer Bühne, man solle sie alle sechs Monate löschen. Zweiundzwanzig Videos wiederholten ihn in sieben Wochen. Keins davon öffnete ein Repository.

Dieser Artikel tut, was die Videos nicht taten: Er nimmt eine echte App mit einer 177-zeiligen CLAUDE.md, drei Skills, vier Commands und einem Hook, führt fünf Alltagsaufgaben mit und ohne die Datei aus und zählt. Nach vierundvierzig Läufen brach genau eine Regel. Die Datei kostete bei jeder Aufgabe Tokens, nie den gleichen Betrag, und eine ihrer Zeilen konnte niemand befolgen.

Der Clip, wörtlich, und die zwei Zeilen, die nicht von ihm sind

Der Clip stammt aus Boris Chernys Vortrag bei der YC Startup School, aufgenommen einen Tag nach dem Erscheinen von Opus 5. Seine Worte: alle sechs Monate CLAUDE.md löschen, Skills löschen, Hooks löschen. Schauen, was das Modell macht, es könnte überraschen. Für Opus 5, sagt er, empfehle Anthropic wirklich, es zu versuchen: Das Modell brauche all diese Anweisungen vielleicht nicht mehr.

Dreißig Sekunden davor kommt der Vorbehalt, den niemand zitiert. Anthropic lösche nicht die gesamte Codebasis. Man lösche viel, und man nenne das eine Ablation. Das schriftliche Transkript trägt diese Zeile heute vollständig. Achtzig Prozent des Claude-Code-Systemprompts gingen diesen Weg: alles löschen, Zeile für Zeile zurückbringen, jede Zeile messen.

Zwei Sätze, die die Reaktionsvideos ihm in den Mund legen, stehen nicht im Talk. "Kontext, Ziele und eine Definition von fertig" erscheint nirgends; am nächsten kommt er mit Aufgabe, Leitplanken, Abschlusskriterien. "Vierundsechzig Agenten, die Bun umschreiben" ist ebenfalls nicht seine Zahl: Sie stammt von Jarred Sumner, im Bun-Beitrag. Cherny nennt elf Tage und, nach einer Zahl gefragt, schätzt Tausende.

Zweiundzwanzig Videos in sieben Wochen zitierten den Clip. Keins führte den Test durch. Dieser Artikel tut also, was er tatsächlich beschrieben hat: löschen, Stück für Stück zurückbringen, messen.

Das Instrument: Ablation, keine Löschung

Eine Ablation entfernt ein Stück einer Konfiguration nach dem anderen und misst die Wirkung, statt alles zu löschen und zu raten. Die CLAUDE.md wird zu Beginn jedes Gesprächs gelesen und dann bei jedem weiteren Turn erneut; Skills laden nur, wenn sie aufgerufen werden. Dieser Unterschied ist es, was gemessen wurde.

Anthropic liefert den Lösch-Schalter: eine bloße Flag, dieselbe Variable, die Cherny auf der Bühne nennt. Das Repository ist eine echte App von mir: 177 Zeilen Anweisungen, drei Skills, vier Commands und ein Hook, der bei jeder Suche feuert.

Dimension Wert
Alltagsaufgaben 5 (neue Komponente, Edit, Refactor, Store-Änderung, Architekturfrage)
Konfigurationen 5 (voll, ohne Datei, ohne Skills, ohne Hook, nichts)
Modell eines, fixiert
Umgebung leeres Config-Verzeichnis, frischer Clone vor jedem Lauf
Läufe 44
Kosten $39

Jeder Lauf wurde auf dieselbe Weise bewertet, auf demselben Clone, durch ein Skript statt von Hand. Was als kaputt zählt: die eigenen Regeln des Repositorys (Imports, Typen, Design-Tokens, Übersetzungen) plus Typecheck und Lint.

Das eine Tool, das für diese Art von Ablation gebaut wurde, Caliper, ablatiert Skills und MCP-Server, rührt aber nie die Datei an; der CLAUDE.md-Tausch wurde von Hand gemacht. Die Grenzen, einmal genannt: ein Repository, ein Modell, zwei Läufe pro Zelle, kein Transkript. Das erste Ergebnis gab den Ton an: Die Refactor-Aufgabe kam identisch zurück, vierundsechzig Cent mit der Datei und dreiundsechzig ohne.

Was kaputtging: eine Regel, bei neuen Dateien

Die Regel, die brach, ist eine Internationalisierungsregel, in den eigenen Worten der Datei: immer sowohl Englisch als auch Französisch hinzufügen, nie einen für den Nutzer sichtbaren String hart codieren. Bei der Neue-Komponente-Aufgabe schrieben mit der Datei alle vier Läufe die Übersetzungsdatei. Ohne sie codierten drei von vier Läufen die Überschrift hart. Gleiche Aufgabe, gleiches Repository, gleiches Modell, gleicher Prompt.

Neue Komponente Übersetzungsdatei geschrieben
Mit CLAUDE.md 4 von 4
Ohne CLAUDE.md 1 von 4

Die Edit-Aufgabe erzählt die andere Hälfte. Jede Konfiguration schaffte es, sogar ohne alles, weil die Nachbarn es lehren: Jede Komponente neben der bearbeiteten hat bereits eine Übersetzungsdatei. Alles andere hielt in allen vierundvierzig Läufen: der Import-Alias, Typ statt Interface, Design-Tokens, das Store-Muster. Der Code zeigt das, die Datei wiederholt es.

Ein Paper der ETH Zürich maß dasselbe an 138 echten Issues. Sein Befund: Kontextdateien verbessern den Erfolg nicht und kosten rund zwanzig Prozent mehr, und das Modell folgt den Anweisungen tatsächlich. Ein Vorbehalt: Ein Lauf ohne die Datei schrieb die Übersetzungsdatei trotzdem. Die Regel ist ohne die Datei nicht unmöglich, sie ist unzuverlässig. Eine Regel brach, jene, die der Code nicht lehren konnte. Und der Lauf, der diese Arbeit ausließ, war auch der günstigste.

Was die Datei kostete, Aufgabe für Aufgabe

Die Tokenkosten einer CLAUDE.md sind die Differenz der gelesenen Tokens zwischen einem Lauf mit der Datei und demselben Lauf ohne sie.

Aufgabe Weniger Tokens gelesen ohne die Datei
Neue Komponente 61%
Edit 15%
Refactor 5%
Store-Änderung 4%
Architekturfrage 14%
Über die zehn Läufe 32% Tokens, 22% Geld

Zweiunddreißig Prozent ist die Zahl, die jedes Video zur Schlagzeile machen würde, und sie ist die falsche. Die größte Ersparnis ist der Lauf, der die Übersetzungsdatei nicht schrieb: günstiger, weil er weniger tat. Wo die Ausgabe identisch war, kostete die Datei vier bis vierzehn Prozent. Das ist ihr wahrer Preis, und die zwanzig Prozent des Papers liegen genau zwischen diesen beiden Zahlen.

Der Mechanismus sind etwa 1.800 Tokens, bei jedem Turn erneut gelesen. Skills, der Hook und der Knowledge Graph brachten nichts Messbares, anwesend oder nicht. Rauschen ist größer als das meiste davon: dieselbe Aufgabe mit derselben Datei kostete $2,11 in einem Lauf und $1,33 im anderen. Zwei Läufe erreichten die Turn-Obergrenze, einer mit der Datei und einer ohne. Die Datei kostet also überall ein wenig und verdient sich ihren Platz einmal, es sei denn, sie lügt auch.

Die Zeilen, die logen

Eine lügende Zeile ist eine Anweisung, der das Modell nicht folgen kann oder die nichts ändert. Die Zeile, die oben angeteasert wurde: das Theme aus dem Design-Tokens-Alias importieren. Der Alias existiert nicht: Die TypeScript-Konfiguration mappt ein Präfix, und der Tokens-Ordner hat keine Theme-Datei. Jeder Lauf, mit oder ohne Datei, tat, was die Nachbarn tun, dieselbe Import-Zeile vierundvierzig Mal.

Die Datei hat zweiundachtzig Zeilen Architekturüberblick. Gleiche Frage, sechs Antworten: alle sechs fanden dieselben neun Dateien, vom Backend bis zum Screen, in derselben Reihenfolge, mit und ohne den Überblick. Ein Block verweist auf einen Knowledge Graph, den der Clone nicht hat; mit vorhandenem Graph kostete die Frage dasselbe.

Maß Wert
Anthropics Größenregel unter 200 Zeilen
Diese Datei 177 Zeilen
Mediandatei im reporails-30k-Repo-Datensatz 50 Elemente, 12 Direktiven
Direktivzeilen in dieser Datei 24 von 177

Position entscheidet, welche von zwei widersprüchlichen Regeln gewinnt, und das Modell sagt es nie, etwa neunzig Punkte in einem Anbietertest. Der Überblick könnte einer hier nicht getesteten Aufgabe helfen: eine Stichprobe, eine Antwort. Drei Arten von Zeilen also: die, die sich ihren Platz verdient hat, die, die der Code lehrt, die, die lügen.

Behalten, verschieben, löschen: die kurze Liste

Drei Stapel, und die Messung hinter jedem.

Stapel Was dorthin gehört Messung
Behalten Die Regel, die der Code nicht zeigen kann 6 Zeilen, die 4 Läufe retteten
Verschieben Der Architekturüberblick und die Commands 107 Zeilen ohne gemessenen Gewinn
Löschen Die Zeilen, die lügen, und die Zeilen, die der Baum schon zeigt 44 identische Läufe

Behalte, was das Modell zweimal falsch machte: Das ist Anthropics eigenes Kriterium für die Datei. Verschiebe den Überblick und die Commands in einen Baum von Dateien, die bei Bedarf geladen werden; Anthropics Juli-Beitrag nennt das zentrale Repository einen Mythos. Hooks bleiben: Ein Gate verfällt nicht, wenn das Modell besser wird. Kürze die Prosa, die es überwachsen hat, behalte das Gate.

Die Datei danach: etwa siebzig Zeilen, dazu die sechs, die es sich verdient haben. Das ist Chernys Methode, ganz gelesen: löschen, Zeile für Zeile zurückbringen, messen. Ein Repository, ein Modell, zwei Läufe pro Zelle; deine Stapel werden anders aussehen, die Methode nicht. Löschen kostete eine Regel und sparte wenig. Die Zeilen zu finden, die lügen, war der Gewinn.

Quellen

Häufige Fragen

Sollte man sein CLAUDE.md löschen, wie Boris Cherny sagte?
Nicht blind. Chernys Talk beschreibt eine Ablation: die Datei löschen, Zeile für Zeile zurückbringen und jede Zeile messen. Bei einer echten 177-zeiligen Datei brach das Löschen eine Regel in 44 Läufen und sparte wenig; der Gewinn war, die Zeilen zu finden, die lügen.
Was geht kaputt, wenn man eine CLAUDE.md löscht?
In diesem Repository eine Regel: immer sowohl Englisch als auch Französisch hinzufügen. Ohne die Datei codierten drei von vier Läufen eine Überschrift bei der Neue-Komponente-Aufgabe hart. Jede andere Regel hielt, weil der benachbarte Code sie bereits zeigt.
Wie viele Tokens kostet ein CLAUDE.md?
Etwa 1.800 Tokens, bei jedem Turn erneut gelesen. Aufgabe für Aufgabe waren das 4% bis 61% weniger gelesene Tokens ohne die Datei; wo die Ausgabe identisch war, kostete die Datei 4% bis 14%, was dem Durchschnitt von 20% im ETH-Zürich-Paper entspricht.
Was sollte in einem CLAUDE.md bleiben?
Die Regeln, die der Code nicht zeigen kann, was auch Anthropics eigenes Kriterium ist: behalte, was das Modell zweimal falsch machte. Verschiebe Überblicke und Befehlslisten in bei Bedarf geladene Dateien, lösche Anweisungen, die auf nicht Existierendes verweisen, und behalte Hooks, weil ein Gate nicht verfällt, wenn das Modell besser wird.
Verbessern Kontextdateien wie CLAUDE.md oder AGENTS.md Coding-Agenten?
Das ETH-Zürich-Paper über 138 echte Issues fand, dass Kontextdateien den Aufgabenerfolg nicht verbessern und die Inferenzkosten im Schnitt um über 20% erhöhen, obwohl das Modell den Anweisungen folgt. Diese Messung an einem Repository landete im selben Bereich.
Was ist eine Ablation im Sinne von Claude Code?
Ein Stück der Konfiguration nach dem anderen entfernen, bei fixiertem Modell und frischem Clone pro Lauf, und die Wirkung messen. Anthropic nutzte das, um 80% des Claude-Code-Systemprompts zu kürzen; hier lief es über fünf Konfigurationen: voll, ohne Datei, ohne Skills, ohne Hook, nichts.

Ähnliche Videos