TL;DR
- Pada repo nyata dengan CLAUDE.md 177 baris, 3 skill, dan 1 hook, menghapus semuanya hanya merusak satu aturan, dalam satu situasi: aturan i18n pada file yang benar-benar baru. Semua konvensi lain tetap terjaga karena kode di sekitarnya sudah mengajarkannya.
- File itu memakan 4 sampai 14% token yang dibaca pada tugas yang hasilnya identik, sekitar satu dolar dari sepuluh. Angka utama penghematan 32% didominasi satu tugas di mana file itu membuat model bekerja lebih banyak.
- Skill dan hook tidak memakan biaya yang terukur: skill hanya dimuat saat dipanggil dan tidak ada yang dipanggil, hook hanya menyuntikkan satu kalimat.
- Ringkasan arsitektur sepanjang 82 baris tidak memberi apa-apa pada pertanyaan arsitektur: enam jawaban, semuanya benar, dengan atau tanpa file.
- "Hapus" menurut kata-kata Anthropic sendiri berarti ablasi dan pindah ke progressive disclosure, bukan menghapus habis. Simpan aturan yang tidak bisa diajarkan oleh kode, pindahkan sisanya ke file rules dan skill, dan ubah aturan yang tidak boleh ditawar menjadi hook.
- Dua kali jalan per konfigurasi adalah batas bawah, bukan putusan: selisih per tugas di bawah 15% masih dalam noise antar-run.
Apa kata pengukuran
Talk yang dibicarakan semua orang mengatakan dua hal, dan yang kedua sering terbuang. Boris Cherny membenarkan di panggung bahwa Claude Code menghapus 80% system prompt-nya, dan ia menjelaskan metodenya: hapus seluruh system prompt, lalu kembalikan baris demi baris untuk mengukur dampak tiap baris s2. Bagian "every 6 months" ada di 00:06:58 sampai 00:07:05, dan kata-katanya adalah "really do recommend", bukan "strongly recommend" s1. Dua kalimat yang banyak dikaitkan dengannya tidak ada di talk: "context, goals and a definition of done" (frasa asli terdekat di 15:22 adalah "describe the task, the guardrails, the exit criteria") dan "64 agents". Ia mengatakan "eleven days" dan, saat ditanya jumlah agen, "I'm not sure" s2. Angka 64 berasal dari tulisan tentang penulisan ulang Bun: "64 Claudes running for 11 days", sekitar $165,000 dengan harga API, 9 miliar token input tanpa cache, 690 juta token output, dan 72 miliar pembacaan token input dari cache s14.
Mekanisme yang membuat semua ini terukur adalah pemuatan. CLAUDE.md dan file rules disuntikkan di setiap turn; skill hanya dimuat saat dipanggil. Dokumen memory juga memuat panduan ukuran yang dikutip semua orang: "target under 200 lines per CLAUDE.md file. Longer files consume more context and reduce adherence." s4. Versi tertulis saran Anthropic menyebut CLAUDE.md sentral di repositori sebagai mitos dan mengarahkan ke progressive disclosure dan auto-memory s3.
Satu-satunya studi terkontrol sebelum studi kami adalah paper ETH tentang AGENTS.md: 138 issue di 12 repo, dan "providing context files does not generally improve task success rates, while increasing inference cost by over 20% on average". File yang di-commit developer mengungguli file buatan LLM sebesar 7% rata-rata, dan instruksi yang menyebut tool tertentu memang membantu s5.
Dua data tentang isi file dan cara file dibaca. Di 28,721 repositori dan 165,063 file, file instruksi median berisi 50 item konten, 12 di antaranya direktif sungguhan; menurut penulisnya hanya 27% isi file yang bekerja seperti yang Anda kira s8. Dalam eksperimen terkontrol dengan dua instruksi yang benar-benar bertentangan, memindahkan satu aturan dari atas file ke bawah mengubah seberapa sering model menurutinya sekitar 90 poin, dari hampir tidak pernah menjadi hampir selalu s9. Penerbit yang sama menarik garis yang diikuti eksperimen kami: ablasi bukan penghapusan, dan hook adalah penegakan, tidak kedaluwarsa saat model di-upgrade s7.
Dua prior informal cocok dengan hasil kami. CLAUDE.md 1,000 baris dibandingkan dengan versi ringkas ~20 baris pada issue GitHub yang sama dengan model yang sama: arsitektur bertahan, aturan rumah rusak s6. Seorang komentator yang memindahkan semuanya ke progressive disclosure melaporkan konteks yang dimuat otomatis turun dari ~35k menjadi ~4.5k token per sesi, tanpa pengetahuan yang dihapus s11. Untuk menilai ablasi skill ada tool-nya: --ablate di caliper mencakup skill dan server MCP dan compare melaporkan tingkat keberhasilan, token, dan waktu jalan; penggantian CLAUDE.md tetap manual s16.
Pengukuran
Protokol: satu repo Expo / React Native privat (1,021 file terlacak), CLAUDE.md 177 baris, 7,243 karakter, sekitar 1,800 token, 3 skill, 4 slash command, 1 hook PreToolUse. Model dipatok ke claude-opus-5 di setiap run, Claude Code 2.1.278, headless claude -p, --max-turns 40, direktori konfigurasi user kosong, tanpa MCP, clone baru direset sebelum tiap run. Lima tugas sehari-hari (komponen baru, edit komponen, refactor helper bersama, persist field store, jelaskan alur data), ablasi satu bagian per kali. 44 run, $38.97 dengan harga API, 92 menit waktu agen. Penilaian: aturan rumah repo pada baris yang ditambahkan, tsc --noEmit, eslint, jawaban dinilai manual.
Kualitas, apa yang rusak:
| konfigurasi | run edit | pelanggaran aturan rumah | error tsc baru | error eslint |
|---|---|---|---|---|
| A penuh | 8 | 0 | 0 | 0 |
| B tanpa CLAUDE.md | 8 | 1 (heading baru di-hardcode, tanpa .content.ts) |
0 | 0 |
| C tanpa skill | 4 | 0 | 0 | 0 |
| D tanpa hook | 4 | 0 | 0 | 0 |
| E tanpa semuanya | 8 | 2 (heading di-hardcode dua kali, tanpa .content.ts) |
0 | 0 |
Biaya per run, rata-rata dari run konfigurasi tersebut (token = pembacaan cache, konteks yang dibaca ulang di setiap turn):
| konfigurasi | run | $ / run | turn / run | token dibaca / run |
|---|---|---|---|---|
| A penuh | 10 | 0.95 | 25.6 | 829k |
| B tanpa CLAUDE.md | 10 | 0.74 | 21.9 | 568k |
| C tanpa skill | 5 | 0.96 | 28.2 | 819k |
| D tanpa hook | 5 | 0.96 | 27.8 | 851k |
| E tanpa semuanya | 10 | 0.85 | 25.7 | 655k |
Per tugas, A ke B (rata-rata 2 run masing-masing):
| tugas | A $ | B $ | biaya | token dibaca |
|---|---|---|---|---|
| T1 komponen baru | 1.72 | 0.96 | -44% | -61% |
| T2 edit komponen | 1.49 | 1.26 | -15% | -15% |
| T3 refactor | 0.64 | 0.63 | -1% | -5% |
| T4 store | 0.57 | 0.53 | -6% | -4% |
| T5 pertanyaan | 0.34 | 0.31 | -9% | -14% |
| semua 10 run | 9.51 | 7.40 | -22% | -32% |
Membaca tabelnya. Tanpa CLAUDE.md, 3 dari 4 run komponen baru menulis heading sebagai string biasa; dengan file itu, 4 dari 4 membuat .content.ts berisi EN dan FR. Pada tugas edit, setiap konfigurasi, bahkan E, menaruh string baru di .content.ts: file di sekitarnya membawa konvensinya. Semua yang lain bertahan di seluruh 44 run: 0 import relatif, type bukan interface di enam edit file types, design token di setiap diff, 0 warna hex, tanpa barrel file. Satu instruksi yang tidak bisa diikuti siapa pun: file itu menyuruh mengimpor theme dari @design-tokens, alias yang tidak ada di tsconfig.json; tidak ada run di konfigurasi mana pun yang memakainya, 1,800 token dibaca sia-sia di setiap sesi. Penghematan T1 adalah run yang lebih murah karena bekerja lebih sedikit. Variansi antar-run lebih besar daripada kebanyakan efek konfigurasi: T1 dengan konfigurasi penuh menelan $2.11 lalu $1.33. Kontrol dengan graf kode 333 MB mendarat di angka konfigurasi penuh ($1.59 vs $1.72 di T1, $0.38 vs $0.34 di T5): blok graf dan hook tidak mengubah apa pun yang terukur.
Lakukan Senin ini
- Hitung CLAUDE.md Anda: baris, karakter, dan jumlah baris yang benar-benar direktif (Always, Never, Use, Prefer). Sisanya adalah konteks yang dibaca ulang model di setiap turn.
- Pilih satu konvensi per bagian dan cek apakah file di sebelahnya sudah menunjukkannya. Kalau tiga file di folder mengikuti aturan itu, barisnya kandidat untuk dihapus.
- Temukan satu aturan yang tidak bisa diajarkan kode pada file yang benar-benar baru (i18n, telemetri, header lisensi, langkah registrasi wajib). Simpan, tulis dalam satu baris, dan taruh di dekat bagian atas.
- Coba setiap path import dan perintah yang disebut file Anda. Alias yang mati atau script yang berganti nama adalah instruksi yang tidak bisa diikuti siapa pun.
- Pindahkan ringkasan arsitektur panjang dan panduan setup ke file rules atau skill yang dimuat sesuai kebutuhan, lalu bandingkan konteks yang dimuat otomatis sebelum dan sesudah.
- Ubah dua atau tiga aturan yang tidak boleh ditawar menjadi hook atau aturan lint. Penegakan tidak bergantung pada model membaca satu paragraf.
- Jalankan dua tugas paling umum Anda dua kali dengan file dan dua kali tanpa, pada model yang dipatok, lalu baca token dan diff-nya. Dua kali jalan memberi tahu ke mana harus melihat, bukan apa yang harus disimpulkan.
Baca lebih lanjut
- Talk-nya sendiri, untuk metodenya dan bukan kutipan pendeknya: hapus, lalu kembalikan baris demi baris s2.
- Seluruh hasil paper, termasuk temuan bahwa file yang di-commit developer mengalahkan file buatan sebesar 7% dan bahwa menyebut tool membantu s5.
- Posisi aturan sebagai variabel: selisih ~90 poin dan cara model menyelesaikan instruksi yang bertentangan secara diam-diam s9.
- Anatomi file instruksi dari 30k repo: 50 item, 12 direktif, dan apa isi 38 sisanya s8.
- Panduan HumanLayer untuk menulis CLAUDE.md yang baik dan thread yang membantahnya s10.
- Thread "MUST use agent, ignored 80% of the time": argumen untuk hook ketika prosa gagal s12.
- Thread "Claude Code now ignores everything", berguna untuk memisahkan drift model dari konflik instruksi s13.
- caliper, untuk menilai ablasi skill dan MCP dengan tingkat keberhasilan, token, dan waktu jalan s16.
Sources
- Boris Cherny: We Cut 80% of Claude Code's Prompt, Y Combinator. Kenapa dibaca: kutipan primernya, dengan catatan yang dipotong klip.
- Transcript of the talk, Y Combinator. Kenapa dibaca: teks yang bisa dicari untuk mengecek apa yang dikatakan dan tidak.
- The new rules of context engineering for Claude 5 generation models, Anthropic. Kenapa dibaca: versi tertulis sarannya, progressive disclosure alih-alih satu file sentral.
- Memory docs: CLAUDE.md and rules files, Claude Code docs. Kenapa dibaca: apa yang dimuat tiap turn, apa yang dimuat sesuai kebutuhan, dan panduan 200 baris.
- Evaluating AGENTS.md, arXiv. Kenapa dibaca: satu-satunya pengukuran terkontrol atas file konteks sebelum yang ini.
- Should you delete your CLAUDE.md every 6 months?, Modern Creator. Kenapa dibaca: perbandingan informal 1,000 baris vs 20 baris dengan pola kerusakan yang cocok dengan kami.
- Opus 5: delete your CLAUDE.md?, reporails. Kenapa dibaca: ablasi versus penghapusan, dan kenapa hook bertahan saat model di-upgrade.
- The State of AI Instruction Quality: 30k-repo analysis, reporails. Kenapa dibaca: apa isi sebenarnya file instruksi median.
- Opus 5: the cost of instruction conflicts, reporails. Kenapa dibaca: eksperimen terkontrol tentang posisi aturan.
- Writing a good CLAUDE.md, HN thread, Hacker News. Kenapa dibaca: para praktisi berdebat tentang apa yang pantas masuk file.
- Anthropic says keep CLAUDE.md under 200 lines, r/ClaudeCode. Kenapa dibaca: komentar sebelum/sesudah ~35k ke ~4.5k.
- CLAUDE.md says MUST use agent, Claude ignores it, r/ClaudeCode. Kenapa dibaca: kasus konkret ketika instruksi berupa prosa gagal.
- Claude Code now ignores everything, r/ClaudeCode. Kenapa dibaca: laporan gejala di balik perasaan "ada yang berubah".
- Rewriting Bun in Rust, Simon Willison. Kenapa dibaca: asal angka 64 agen dan $165,000.
- caliper, GitHub. Kenapa dibaca: harness penilaian untuk ablasi skill dan MCP.
FAQ
Haruskah saya menghapus CLAUDE.md?
Jangan asal. Di repo kami satu-satunya kerugian adalah satu aturan pada file baru; semua yang sudah dicontohkan kode tetap bertahan tanpa file itu. Ablasi satu bagian per kali dan simpan yang mengubah hasil.
Kenapa file itu menghemat 32% token kalau biayanya hanya 4 sampai 14%?
Karena agregatnya didominasi tugas komponen baru, di mana file itu membuat model menulis file kedua dalam dua bahasa. Run yang lebih murah bekerja lebih sedikit. Pada tugas dengan hasil identik, penghematannya 4 sampai 14%.
Apakah skill dan hook memakan token di setiap turn?
Skill hanya dimuat saat dipanggil, jadi skill yang tidak dipanggil tidak memakan biaya; hook menyuntikkan satu kalimat. Menghapus keduanya tidak mengubah angka apa pun di run kami. File rules dan CLAUDE.md-lah yang dibaca ulang di setiap turn.
Apakah dua run per konfigurasi cukup?
Tidak. Dua kali jalan menemukan lokasi efeknya, tidak mengukur besarnya. Konfigurasi penuh kami menelan $2.11 lalu $1.33 pada tugas yang sama, jadi selisih per tugas di bawah 15% masih dalam noise.
AIDive