AIDive

Verbosity Opus 5 kami jinakkan, satu cacat bertahan

Oleh AIDive · Terbit

Coding agentModel AI

600 upvote kemarahan: kenapa semua bilang Opus 5 menyebalkan

Kamu minta perbaikan dua baris ke Opus 5 dan yang kembali adalah disertasi doktoral. Di subreddit Claude Code, thread berjudul "Opus 5 is insufferable" sudah lewat 600 upvote dan 178 komentar, dengan penulisnya menuduh model bicara dalam bahasa buatan yang ia sebut "Unintelligiblish". Dan Reddit masih tempat yang sopan: di X, seorang developer cuma memposting tangkapan layar komentar kode buatan Opus 5 dan mengumpulkan 9.700 like. Boris Cherny, pembuat Claude Code, membela model itu di depan umum dan justru kena balasan teratas, "this response is part of the problem", dengan 2.843 like.

Di mana Sinyal
r/ClaudeCode, "Opus 5 is insufferable" 600+ upvote, 178 komentar
X, tangkapan layar komentar kode Opus 5 9.700 like
X, balasan atas pembelaan Boris Cherny 2.843 like

Sementara keluhan menumpuk, Anthropic diam-diam menerbitkan panduan prompting khusus Opus 5 yang hampir tak ada yang buka. Jadi kami menjalankan tes yang tak dijalankan siapa pun: mereproduksi perilaku yang bikin semua orang gila, menerapkan panduan baris demi baris, lalu mengukur selisihnya pada tugas yang sama.

Apa yang benar-benar berubah: thinking, konteks, dan tuas effort

Tiga perubahan menjelaskan hampir semua yang dirasakan developer.

Thinking kini aktif secara default: model bernalar dalam blok privat sebelum setiap jawaban, dan hanya bisa dimatikan pada effort high atau di bawahnya. Context window naik ke satu juta token, sebagai default sekaligus maksimum. Dan perubahan ketiga inilah yang penting untuk keluhan verbosity: effort — parameter yang menentukan berapa banyak token yang dihabiskan model untuk berpikir, memanggil tool, dan menulis jawaban — menjadi tuas utama model, dengan lima level dan high sebagai default.

Effort Perilaku
Low Menggabungkan panggilan tool, tanpa pembukaan, konfirmasi satu kalimat
High (default) Melipatgandakan panggilan, menjelaskan rencananya sebelum menyentuh apa pun, mengomentari perubahan secara rinci
Extra high / Max Menjelajah lebih banyak file, memperkuat kasus tepi; thinking tak bisa lagi dimatikan

Kalau baris kedua terdengar persis seperti sesimu, itu karena kamu memang berjalan di default sejak hari pertama. Effort bukan tombol verbosity — salah paham inilah yang memenuhi thread Reddit.

Satu konteks lagi: Anthropic terang-terangan menyatakan Opus 5 menulis jawaban lebih panjang daripada model Opus sebelumnya dan menuntaskan tugas sepenuhnya alih-alih meninggalkan placeholder. Sebagian dari yang kamu rasakan sebagai bug adalah keputusan desain yang terdokumentasi — dan keputusan terdokumentasi bisa dikonfigurasi ulang.

Empat perilaku yang bikin marah, direproduksi sesuai permintaan

Tak satu pun perlu kami cari-cari.

Verbosity. Kami minta Opus 5 menjelaskan satu fungsi — pertanyaan yang jawabannya muat dalam dua kalimat — dan yang datang adalah bagian, subjudul, dan peringatan dengan nada laporan audit. Komentar teratas di thread Reddit menggambarkan hal yang sama: kalimat pengumuman megah bergaya "kami baru menemukan sesuatu yang mengubah segalanya", diikuti sepuluh menit perintah shell.

Over-engineering. Seorang pengguna bercerita soal file keputusan sepanjang 7.000 baris; ketika diminta merapikannya, Opus 5 memotong 1.200 baris lalu menambah 600 baris baru untuk mendokumentasikan penghapusan itu. Kami mereproduksi polanya pada fitur kecil: instance kami menambahkan langkah verifikasi yang tak diminta siapa pun, lalu menulis docstring dua puluh baris di atas fungsi lima baris.

Scope creep. Kamu minta X, model memutuskan topik sebenarnya adalah Y, lalu menjelaskan alasannya dalam delapan paragraf.

Kabar buruk yang dikubur. Seorang komentator menggambarkan dinding teks yang menjelaskan semuanya berjalan lancar, dengan tanda bintang di tiga perempat bagian yang mengakui ada yang rusak. Kami mengalaminya juga: instance kami mengumumkan migrasi sukses, dan baris yang mengakui tes integrasi masih perlu diperbaiki ada di paragraf ketujuh.

Kemarahannya nyata dan bisa direproduksi sesuai permintaan. Sisanya tinggal: bisa disetel atau tidak.

Panduan penjinakan resmi yang hampir tak ada yang buka

Panduannya bernama Prompting Claude Opus 5, ada di dokumentasi Anthropic, dan menjawab thread Reddit poin demi poin. Kalimat terpentingnya muat dalam satu baris: effort mengatur seberapa banyak model berpikir, bukan seberapa banyak ia bicara. Menurunkan effort mengecilkan volume berpikir tapi tidak andal memendekkan jawaban yang terlihat — jadi semua yang menurunkan effort demi membungkam model sedang menarik tuas yang salah.

Untuk panjang, panduannya tegas: minta dengan kata-kata biasa, lewat instruksi ringkas di system prompt. Dan ia menyampaikan sesuatu yang tak diduga dari Anthropic: kamu perlu menghapus instruksi dari prompt-mu. Kalau file instruksimu berbunyi "verifikasi pekerjaanmu sebelum menjawab", hapus baris itu: Opus 5 sudah memeriksa dirinya sendiri, dan baris semacam itu memicu putaran verifikasi tambahan — token terbakar percuma. Boris Cherny merangkumnya dalam satu baris: Opus 5 butuh prompting lebih sedikit, bukan lebih banyak.

Sisa panduannya menyisir keluhan lain secara metodis — satu bagian soal narasi agent, satu soal panjang file yang dihasilkan, satu soal pembingkaian scope, satu soal subagent, satu soal koreksi diri — dan tiap bagian memberi blok prompt persis untuk disalin, bukan saran samar.

Effort sweep: tugas sama, lima level, diukur

Effort sweep artinya menjalankan tugas yang sama di tiap level effort lalu membandingkan token, waktu, dan kualitas. Panduan menyarankan mengulanginya kalau kamu membawa pengaturan dari model lama. Praktiknya: empat run dan satu perbandingan.

Di Claude Code, effort disetel lewat tiga cara: perintah di dalam sesi, flag saat peluncuran, atau kunci di file settings — yang terakhir memberi default berbeda per proyek kalau repo-mu tidak punya kebutuhan yang sama.

Kami menjalankan perbaikan bug yang sama di low, medium, high, dan extra high, dalam empat sesi bersih.

Level Hasil pada perbaikan bug acuan kami
Low / Medium Perbaikan setara dengan sebagian kecil token high
High Default; tak ada kenaikan kualitas pada bug satu baris
Extra high Lebih banyak file dijelajahi, kasus tepi diperkuat — berguna pada refactor besar, berlebihan di sini

Itu cocok dengan yang diumumkan panduan saat menyarankan memakai level rendah dengan leluasa sebagai kendali biaya utama. Satu detail API sebelum kamu men-script ini: pada extra high dan max, thinking tak bisa lagi dimatikan, dan request mengembalikan error 400 kalau kamu coba.

Pemakaian sweep yang paling menguntungkan adalah code review. Anthropic mengklaim akurasi review Opus 5 tetap bertahan di level effort rendah, sehingga memungkinkan satu lintasan cepat dan murah saat commit dan lintasan mendalam belakangan. Kami mengujinya pada salah satu diff kami: lintasan low menemukan dua bug nyata yang sama dengan lintasan extra high, dengan sekitar seperlima token.

Jadi pengaturan pertama yang mengubah tagihanmu adalah memilih effort per jenis tugas alih-alih membiarkan semuanya di default — low atau medium untuk kerja harian dan review, extra high untuk pekerjaan besar. Sementara itu verbosity-nya tak bergeser satu kata pun.

Di mana sakelar verbosity sebenarnya berada

Karena effort tak memendekkan jawaban, panjang ditentukan oleh instruksi — dan di mana kamu menaruh instruksi itu sama pentingnya dengan isinya. Pengguna lain di subreddit Claude Code menghabiskan berhari-hari mengujinya, dan temuan pertamanya sama dengan kami: output style Concise bawaan hanya memangkas keluaran sekitar 6 persen. Yang berhasil adalah menaruh satu instruksi keringkasan sungguhan di slot output style dan tidak di tempat lain — kalimat yang sama sebagai hook, atau sebagai aturan di file instruksi, tak mengubah apa pun.

Output style adalah slot Claude Code yang menentukan bagaimana asisten menulis, bukan apa yang ia ketahui. Kami menyusun milik kami dari redaksi panduan resmi: jawaban pendek dan fokus, peringatan dikurangi, ringkasan tingkat tinggi kecuali detail diminta.

Di mana aturan keringkasan berada Efek pada panjang
Preset Concise bawaan ~6 persen lebih pendek
Hook, atau aturan di file instruksi Tak ada perubahan terukur
Slot output style Laporan lima bagian → satu paragraf dan daftar file

Panduan menambah dua instruksi sejenis yang kami salin apa adanya: satu untuk narasi agent, yang membingkai kapan model boleh mengomentari apa yang sedang dikerjakannya, dan satu untuk file yang ditulis ke disk, karena laporan dan file Markdown yang dihasilkan juga menggelembung.

Untuk aturan yang tak pernah aktif, post Reddit yang sama memberi kriterianya: aturan harus menyebut momen yang bisa dikenali dan tindakan konkret. "Jaga changelog tetap mutakhir" tak pernah aktif. "Saat kamu mengubah file di folder sumber, tambahkan satu baris ke changelog dalam commit yang sama" aktif.

Ada satu kebiasaan bicara yang tak tercakup blok-blok itu: koreksi diri yang dinarasikan. Opus 5 gemar mengumumkan bahwa ia sedang memperbaiki kalimat sebelumnya, bahkan ketika perbaikan itu tak mengubah apa pun bagimu, dan panduan punya instruksi khusus untuk itu: hanya tandai koreksi kalau kesalahannya akan mengubah kodemu atau keputusanmu, sisanya perbaiki diam-diam. Sejak baris itu masuk config kami, mea culpa palsu lenyap dari sesi kami.

Jadi verbosity memang bisa dijinakkan, hanya saja bukan dengan sakelar: dengan empat blok prompt yang ditaruh di slot yang benar.

Menghentikan over-engineering dengan menghapus prompt sendiri

Keluhan nomor dua diperbaiki dengan mengurangi teks, bukan menambah. Kami mulai dengan membersihkan setiap permintaan verifikasi dari prompt kami, persis seperti perintah panduan, dan putaran verifikasi ekstra ikut lenyap.

Lalu untuk scope, panduan menyediakan instruksi pembingkaian yang kami tempel apa adanya: berikan apa yang diminta pada cakupan yang dimaksud, sebutkan dalam satu kalimat kalau ada pendekatan yang lebih baik, dan lanjutkan pada tugas yang diminta alih-alih diam-diam mengubahnya. Pada fitur yang tadinya memicu docstring dua puluh baris kami, kami mengulang permintaan yang persis sama dengan pembingkaian itu: diff turun dari sembilan file tersentuh menjadi tiga, tanpa langkah verifikasi parasit.

Dua pengaturan sekeluarga layak satu baris masing-masing. Untuk code review, berhenti menulis "laporkan hanya masalah serius": Opus 5 menerimanya secara harfiah dan melaporkan terlalu sedikit, jadi minta semuanya lalu saring di lintasan kedua. Dan kalau model meluncurkan subagent untuk hal sepele, itu juga terdokumentasi: Opus 5 mendelegasikan lebih gampang daripada pendahulunya, dan tiap subagent melipatgandakan biaya. Panduan memberi instruksi yang mencadangkan delegasi untuk pekerjaan besar yang benar-benar paralel, dan sejak versi 2.1.217 Claude Code juga mengekspos dua variabel lingkungan yang membatasi keras kedalaman spawn dan jumlah agent yang berjalan bersamaan.

Batas Default
Kedalaman spawn subagent 3 level
Agent bersamaan 20

Default itulah yang menjelaskan bagaimana satu sesi bisa melebar sejauh itu tanpa pernah menanyakan pendapatmu. Over-engineering bukan takdir model: sebagian besar adalah prompt lamamu yang berbalik melawanmu.

Apa yang tak diperbaiki blok prompt mana pun

Batasnya tajam: panduan memperbaiki bentuk dari apa yang Opus 5 katakan, bukan apa yang ia putuskan untuk dilakukan. Sebagian omelan di thread menggambarkan hal lain selain verbosity: model yang mengakui sebuah batasan eksplisit, berjanji mematuhinya, lalu melakukan sebaliknya sejak giliran pertama. Keluhan itu tak punya bagian di panduan, dan tak satu pun blok prompt kami membuatnya hilang. Kami melihatnya sekali selama pengujian: batasan eksplisit untuk tidak menyentuh sebuah API, diakui dalam jawaban, lalu dilanggar dua giliran kemudian. Sekali dalam seminggu sesi jauh dari bencana yang digambarkan sebagian omelan, tapi ini jenis kesalahan yang tak dimaafkan pengaturan apa pun kalau menimpa kode produksi.

Ada juga biaya masuk. Sweep membakar token sungguhan: empat sesi uji kami memakan setara satu hari kerja besar di paket 20 dolar, dan seorang pengguna di thread melaporkan paket max terbesar nyaris tak bertahan satu akhir pekan di effort high. Dan tak satu pun pengaturan ini portabel — output style, pembingkaian scope, dan batas subagent semuanya tinggal di config-mu, jadi tiap mesin dan tiap proyek harus disetel ulang.

Kalau keluhanmu adalah kebisingannya, panduan ini menyelesaikannya. Kalau keluhanmu adalah model yang berbuat sesukanya, panduan takkan menyelamatkanmu — dan komentar dengan upvote terbanyak di thread setelah omelan itu sendiri tetap "kembali saja ke Opus sebelumnya".

Jinakkan atau kabur: putusan kami

Dua puluh menit pengaturan sudah cukup bagi kami: effort dipilih per jenis tugas alih-alih default, satu instruksi keringkasan di slot output style, pembingkaian scope dari panduan di system prompt, dan permintaan verifikasi dihapus dari file-file lama kami.

Metrik pada tugas acuan kami Sebelum Sesudah
Panjang jawaban Laporan lima bagian ~5× lebih pendek, satu paragraf + daftar file
Ukuran diff 9 file tersentuh 3 file tersentuh
Biaya code review Lintasan extra high ~1/5 token, dua bug nyata yang sama

Tanpa ganti model, tanpa ganti paket. Kalau keluhanmu verbosity dan over-engineering, jalankan penyetelan ini sebelum berpindah model — semuanya terdokumentasi, dan selisihnya terlihat sejak diff pertama. Kalau masalahmu adalah model yang mengabaikan batasanmu sejak giliran pertama, tak ada prompt di panduan yang memperbaikinya: simpan tugas sensitif di model yang menuruti kamu, dan kembalilah menguji Opus 5 di pembaruan berikutnya.

Sumber

Pertanyaan yang sering diajukan

Kenapa Opus 5 begitu bertele-tele?
Anthropic mendokumentasikan bahwa Opus 5 menulis jawaban lebih panjang daripada model Opus sebelumnya dan menuntaskan tugas sepenuhnya alih-alih meninggalkan placeholder. Thinking juga aktif secara default dan parameter effort dikirim pada high, sehingga model menjelaskan rencananya dan mengomentari perubahannya secara rinci.
Apakah menurunkan effort membuat Opus 5 lebih ringkas?
Tidak. Panduan resmi menyatakan effort mengatur seberapa banyak model berpikir, bukan seberapa banyak ia bicara. Dalam sweep kami, turun dari high ke low memangkas token secara tajam tapi tidak memendekkan jawaban yang terlihat satu kata pun.
Bagaimana cara benar-benar membuat Opus 5 ringkas?
Taruh satu instruksi keringkasan sungguhan di slot output style Claude Code — jawaban pendek dan fokus, peringatan dikurangi, ringkasan tingkat tinggi kecuali detail diminta. Kalimat yang sama di hook atau di file instruksi tak mengubah apa pun, dan preset Concise bawaan hanya memangkas keluaran sekitar 6 persen.
Apa itu effort sweep dan layakkah dijalankan?
Artinya menjalankan tugas yang sama di tiap level effort lalu membandingkan token, waktu, dan kualitas — empat run dan satu perbandingan. Layak demi kendali biaya: low dan medium menghasilkan perbaikan bug setara dengan sebagian kecil token high, dan code review di low menemukan dua bug nyata yang sama dengan extra high dengan sekitar seperlima biaya.
Bagaimana menghentikan over-engineering Opus 5?
Dengan menghapus instruksi, bukan menambahnya. Buang setiap permintaan verifikasi dari prompt-mu, tempel pembingkaian scope dari panduan agar model memberi apa yang diminta pada cakupan yang dimaksud, dan batasi delegasi dengan variabel lingkungan Claude Code untuk kedalaman dan jumlah subagent (default: 3 level, 20 agent).
Perlukah berpindah dari Opus 5?
Kalau keluhanmu verbosity dan over-engineering, setel dulu — pengaturan terdokumentasi memperbaiki keduanya bagi kami tanpa ganti model atau paket. Kalau masalahmu model yang mengabaikan batasan eksplisit sejak giliran pertama, tak ada prompt di panduan yang memperbaikinya, jadi simpan tugas sensitif di model yang menuruti kamu.

Video terkait