TL;DR
- Anthropic menilai 400,000 sesi Claude Code dari 235,000 orang dan menemukan bahwa manajer, bukan software engineer, mencatat tingkat keberhasilan terverifikasi terbaik.
- Bisa coding hampir tidak menambah apa-apa: profesi software memverifikasi 34% sesi yang menghasilkan kode, profesi lain 29%, dan kedua kelompok imbang pada keberhasilan parsial, 89% dan 88%.
- Yang membedakan hasil adalah level pengguna. Pemula mendapat sekitar 5 aksi agen dan 600 kata per prompt dengan tingkat keberhasilan terverifikasi 15%; ahli mendapat 12 aksi dan 3,200 kata dengan 28 sampai 33%.
- Tiga kebiasaan membawa hampir seluruh peningkatan: taruh konteksmu sendiri di prompt, akhiri dengan bukti yang bisa diverifikasi, dan tetap di sesi saat ada yang rusak alih-alih menutupnya.
- Batas atasnya rendah untuk semua orang: bahkan ahli hanya memverifikasi paling banyak sepertiga sesi, dan posisi teratas manajer mungkin sebagian merupakan artefak pengukuran.
Apa kata sumber
Studi ini adalah proses klasifikasi atas 400,000 sesi interaktif Claude Code dari 235,000 orang, direkam antara Oktober 2025 dan April 2026 s1. Tidak ada yang membaca percakapannya. Sebuah classifier berbasis Sonnet 4.6 menilai setiap sesi, lalu nilainya dicocokkan dengan telemetri, yaitu commit, perubahan kode, dan hasil tes; pada sesi yang mengubah kode, classifier dan telemetri sepakat lebih dari 90% s1. Claude Code sendiri adalah agen terminal yang membaca file-mu, menulis kode, dan menjalankan perintah dari permintaan dalam bahasa biasa s2.
Tiga definisi menentukan cara membaca setiap angka. Keberhasilan terverifikasi berarti classifier menemukan bukti kuat bahwa tujuan tercapai, termasuk tes lulus atau konfirmasi eksplisit dari pengguna. Keberhasilan parsial berarti tujuan tercapai setidaknya sebagian. Keahlian bukan jabatan: classifier menilai perilaku pengguna di dalam sesi, pada lima level dari pemula sampai ahli, memakai tiga sinyal: presisi instruksi, apa yang diminta pengguna untuk diverifikasi agen, dan apakah pengguna mengoreksi agen s1.
Hasil per profesi adalah sorotan utamanya. Pada sesi yang menghasilkan kode, profesi software mencapai 34% keberhasilan terverifikasi dan yang lain 29%, selisih lima poin yang stabil selama tujuh bulan sementara kedua kelompok sama-sama membaik s1. Pada keberhasilan parsial, kedua kelompok setara, 89% lawan 88% s1. Sepuluh kelompok profesi terbesar semuanya berada dalam selisih tujuh poin dari developer, dan kelompok manajemen ada di puncak s1. Nama dari Anthropic untuk prediktor yang benar-benar berpengaruh adalah keahlian domain: mengenal masalah yang kamu selesaikan secara mendalam.
Pembagian kerja menjelaskan alasannya. Dalam sesi tipikal, manusia membuat sekitar 70% keputusan perencanaan, yaitu apa yang dibangun, tetapi hanya 20% keputusan eksekusi, yaitu cara menulisnya s1. Manajer yang tahu persis apa yang harus dilakukan produk memegang separuh yang menentukan. Pergeseran yang sama terlihat pada cara orang memakai agen: selama tujuh bulan, porsi sesi debugging turun dari 33% ke 19%, menjalankan software naik dari 14% ke 21%, analisis data dan penulisan dokumen hampir dua kali lipat, sementara nilai estimasi tugas rata-rata yang diserahkan ke agen naik 27% s1.
Otonomi membuat setiap kalimat lebih berbobot. Sesi tipikal hanya berisi sekitar empat pertukaran antara pengguna dan agen, setiap prompt memicu rata-rata sekitar sepuluh aksi, dan satu prompt kadang memicu lebih dari seratus aksi s1. Kalau kamu hanya bicara empat kali, presisi tiap baris hampir seluruh kontribusimu.
Tangga level adalah tempat angka-angka praktisnya berada. Pemula menulis instruksi generik tanpa pengetahuan domain di dalamnya; setiap prompt memicu sekitar 5 aksi agen dan menghasilkan kira-kira 600 kata kerja, dan keberhasilan terverifikasi mentok di 15% s1. Ahli menulis prompt yang sarat konteks; agen yang sama merangkai 12 aksi dan menghasilkan 3,200 kata per instruksi, dan keberhasilan terverifikasi berada di antara 28% dan 33% s1. Itu sekitar lima kali lipat hasil kerja dan dua kali lipat tingkat keberhasilan dari alat yang sama dengan langganan yang sama, dengan orang di depan keyboard sebagai satu-satunya variabel. Hampir seluruh peningkatan itu ada di antara pemula dan menengah, yaitu langkah yang dicakup tiga kebiasaan di bawah.
Kebiasaan-kebiasaan itu terpetakan ke tiga sinyal classifier. Presisi instruksi: sebutkan di mana bertindak, dengan apa, dan seperti apa hasil yang selesai. Verifikasi: akhiri prompt dengan kondisi yang bisa dicek, jalankan tes, tunjukkan hasil render, pastikan halaman termuat; studi menemukan inilah yang memisahkan keberhasilan yang dinilai dari yang terverifikasi s1. Koreksi: pemula menerima output secara pasif dan berhenti empat kali lebih sering daripada pengguna lain begitu ada yang rusak, sedangkan menjelaskan ulang masalah dengan kata-katamu sendiri persis yang diukur sinyal ketiga s1. Tidak satu pun dari ketiganya menuntut satu baris kode.
Batasannya dinyatakan dalam studi itu sendiri. Bahkan ahli hanya memverifikasi 28% sampai 33% sesi, jadi dua dari tiga sesi berakhir tanpa bukti kuat bahwa tujuan tercapai, paling baik dengan keberhasilan parsial, yang memang melampaui 90% s1. Peringkat manajer berpotensi bias pengukuran: keberhasilan terverifikasi menghitung konfirmasi eksplisit dari pengguna, dan menyatakan dengan jelas bahwa pekerjaan diterima adalah kebiasaan manajer s1. Dan sampelnya adalah pengguna Claude Code, audiens command-line yang sudah lebih termotivasi dari rata-rata, jadi tidak ada jaminan angka yang sama di alat lain s1. Diskusi komunitas tentang tips pemula adalah pengecekan wajar dari arah sebaliknya: saran yang diberikan orang kepada pendatang baru sejalan dengan tiga sinyal itu, beri konteks, minta pengecekan, terus arahkan s3.
Putusan: apa yang didukung studi
| Klaim | Status | Dasar |
|---|---|---|
| Kamu harus bisa coding untuk mendapat kode yang jalan dari agen | Lewati | 34% vs 29% terverifikasi, 89% vs 88% parsial, manajer di puncak s1 |
| Menaruh konteksmu sendiri di prompt itu berguna | Pertahankan | 5 vs 12 aksi, 600 vs 3,200 kata per prompt antara pemula dan ahli s1 |
| Mengakhiri prompt dengan kondisi bukti itu berguna | Pertahankan | Verifikasi adalah satu dari tiga sinyal classifier; ini yang memisahkan keberhasilan yang dinilai dari yang terverifikasi s1 |
| Tetap di sesi setelah gagal itu berguna | Pertahankan | Pemula berhenti empat kali lebih sering; koreksi adalah sinyal ketiga s1 |
| Mencapai level ahli membuat agen andal | Lewati | Ahli tetap hanya memverifikasi 28 sampai 33% sesi s1 |
| Manajer lebih jago dalam hal ini daripada engineer | Coba, dengan hati-hati | Kemungkinan bias: keberhasilan terverifikasi menghitung konfirmasi eksplisit pengguna s1 |
| Angka-angka ini berlaku untuk alat AI lain | Lewati | Sampelnya hanya pengguna Claude Code s1 |
Lakukan ini hari Senin
- Ambil prompt terakhir yang kamu kirim ke agen dan tulis ulang dengan tiga blok: di mana bertindak, dengan apa (file, route, dataset, atau dokumen yang sudah ada), dan seperti apa hasil yang selesai.
- Tambahkan klausa bukti di akhir setiap prompt minggu ini: jalankan tes, buka halaman, cek semua link bisa dibuka, tunjukkan diff.
- Saat sesi bermasalah, tulis satu koreksi sebelum menutupnya: apa yang terjadi, apa yang kamu harapkan, ke mana harus melihat. Hitung seberapa sering giliran berikutnya memperbaikinya.
- Tuliskan tiga fakta tentang proyekmu yang hanya kamu yang tahu (audiens, batasan, hal yang tidak boleh berubah) dan tempel di bagian atas sesi berikutnya.
- Jalankan satu tugas non-kode lewat agen, draf newsletter atau penulisan ulang harga, dengan tiga blok yang sama, lalu bandingkan hasilnya dengan caramu yang biasa.
- Catat tally selama lima sesi: terverifikasi, parsial, atau tidak ada. Bandingkan dengan pita 15% pemula dan 28 sampai 33% ahli dari studi.
- Kalau satu blok di promptmu tetap kosong karena kamu tidak tahu jawabannya, selesaikan dengan rekan atau dokumen sebelum memulai sesi, bukan sesudahnya.
Baca lebih lanjut
- Baca bagian metodologi sebelum mengutip angka apa pun: classifier-nya Sonnet 4.6, dicocokkan dengan telemetri dengan kesepakatan lebih dari 90% pada sesi yang mengubah kode s1.
- Grafik aksi per prompt menurut level adalah gambaran paling jelas dari lompatan pemula ke ahli, 5 ke 12 aksi dan 600 ke 3,200 kata s1.
- Bagian komposisi tugas menunjukkan debugging turun dari 33% ke 19% dan menjalankan software naik dari 14% ke 21% selama tujuh bulan, argumen berguna saat ada yang bilang agen hanya untuk memperbaiki bug s1.
- Pembagian 70% perencanaan lawan 20% eksekusi adalah angka yang pas dibawa ke diskusi tim tentang siapa yang sebaiknya memegang kendali agen s1.
- Baca ulang catatan bias tentang keberhasilan terverifikasi dan konfirmasi eksplisit pengguna sebelum memakai hasil manajer di slide s1.
- Untuk cara kerja agen di terminal, apa yang dibaca, ditulis, dan dijalankannya, mulai dari halaman produk s2.
- Thread tips pemula adalah tempat pendatang baru bertukar kebiasaan prompt yang konkret; bacalah dengan tiga sinyal itu di kepala dan kelompokkan sarannya menurut sinyal yang dilayaninya s3.
Sumber
- How AI use changes with expertise: lessons from 400,000 Claude Code sessions, Anthropic. Mengapa dibaca: setiap angka di paket ini berasal dari sini, dan catatan metodologi serta biasnya mengubah cara membaca sorotan utamanya.
- Claude Code, Anthropic. Mengapa dibaca: agen yang diukur studi, dengan apa yang dilakukannya dalam sesi terminal.
- Beginner Claude Code tips (community discussion), Reddit r/ClaudeAI. Mengapa dibaca: saran praktisi untuk dibandingkan dengan tiga sinyal dalam studi.
FAQ
Apakah studi ini bilang non-programmer sama bagusnya dengan developer?
Tidak sepenuhnya. Developer mempertahankan keunggulan lima poin pada keberhasilan terverifikasi, 34% lawan 29%, dan itu stabil selama tujuh bulan. Studi menyebut keunggulan itu kecil dan level pengguna di dalam sesi memprediksi jauh lebih banyak daripada jabatan.
Apa yang dihitung sebagai keberhasilan terverifikasi?
Bukti kuat bahwa tujuan tercapai: tes lulus, hasil kerja yang bisa dikonfirmasi classifier dari telemetri, atau konfirmasi eksplisit dari pengguna. Butir terakhir itulah yang membuat hasil manajer berpotensi bias.
Bisakah aku naik level tanpa belajar coding?
Bisa. Classifier menilai presisi instruksi, apa yang kamu minta untuk diverifikasi agen, dan apakah kamu mengoreksinya. Ketiganya adalah deskripsi masalah dan standarmu, bukan kode.
Mengapa batas atasnya rendah bahkan untuk ahli?
Studi hanya menghitung sesi sebagai terverifikasi bila ada bukti. Ahli mencapai 28 sampai 33% terverifikasi, tetapi keberhasilan parsial melampaui 90%, jadi sebagian besar sesi menghasilkan sesuatu; yang kurang adalah bukti bahwa hasilnya sudah selesai.
AIDive