AIDive

Opus 5'in laf kalabalığını dizginledik, bir kusur kaldı

AIDive tarafından · Yayın

Kodlama agent'larıYapay zekâ modelleri

600 upvote'luk öfke: herkes neden Opus 5 çekilmez diyor

Opus 5'ten iki satırlık bir düzeltme istiyorsun, elinde doktora tezi buluyorsun. Claude Code subreddit'inde "Opus 5 is insufferable" başlıklı konu 600 upvote ve 178 yorumu geçti; yazar modeli, kendi deyimiyle "Unintelligiblish" adında uydurma bir dil konuşmakla suçluyor. Üstelik Reddit kibar mecra: X'te bir geliştirici yalnızca Opus 5'in ürettiği kod yorumlarının ekran görüntüsünü paylaştı ve 9.700 beğeni topladı. Claude Code'un yaratıcısı Boris Cherny modeli alenen savundu ve karşılığında en çok beğenilen yanıtı aldı: "this response is part of the problem", 2.843 beğeni.

Nerede Sinyal
r/ClaudeCode, "Opus 5 is insufferable" 600+ upvote, 178 yorum
X, Opus 5'in kod yorumlarının ekran görüntüsü 9.700 beğeni
X, Boris Cherny'nin savunmasına gelen yanıt 2.843 beğeni

Şikâyetler birikirken Anthropic, Opus 5'e özel bir prompting rehberini sessizce yayımladı — neredeyse kimsenin açmadığı bir rehber. Biz de kimsenin yapmadığı testi yaptık: herkesi çileden çıkaran davranışları yeniden üret, rehberi satır satır uygula ve aynı görevlerde farkı ölç.

Opus 5 gerçekte neyi değiştirdi: thinking, bağlam ve effort kadranı

Üç değişiklik, geliştiricilerin yaşadıklarının çoğunu açıklıyor.

Thinking artık varsayılan olarak açık: model her yanıttan önce özel bir blokta akıl yürütüyor ve bunu ancak effort high ve altındayken kapatabiliyorsun. Context window bir milyon token'a çıkıyor — hem varsayılan hem üst sınır olarak. Üçüncü değişiklik ise verbosity şikâyetleri açısından asıl olan: effort — modelin düşünmeye, araç çağırmaya ve yanıt yazmaya kaç token harcayacağını belirleyen parametre — modelin merkezî kadranı hâline geliyor; beş seviye ve varsayılanı high.

Effort Davranış
Low Araç çağrılarını toplu yapar, giriş yapmadan işe koyulur, tek cümleyle onaylar
High (varsayılan) Çağrıları çoğaltır, hiçbir şeye dokunmadan planını anlatır, değişiklikleri ayrıntılı yorumlar
Extra high / Max Daha çok dosya tarar, sınır durumları zırhlar; thinking artık kapatılamaz

İkinci satır tam olarak senin oturumlarına benziyorsa bu normal: ilk günden beri varsayılanda çalışıyorsun. Effort bir verbosity düğmesi değil — ve Reddit konularını dolduran tam olarak bu yanlış anlama.

Son bir bağlam: Anthropic, Opus 5'in önceki Opus modellerinden daha uzun yanıtlar yazdığını ve yer tutucu bırakmak yerine görevleri sonuna kadar tamamladığını açıkça söylüyor. Bug olarak yaşadığın şeyin bir kısmı, siyah beyaz belgelenmiş bir tasarım tercihi — ve belgelenmiş bir tercih yeniden yapılandırılabilir.

Dört öfke davranışı, talep üzerine yeniden üretildi

Hiçbirini aramak zorunda kalmadık.

Verbosity. Opus 5'ten tek bir fonksiyonu açıklamasını istedik — cevabı iki cümleye sığan bir soru — ve karşımıza bölümler, alt başlıklar ve uyarılar çıktı; tonu bir denetim raporu gibiydi. Reddit konusundaki en beğenilen yorum tam da bunu anlatıyor: "az önce her şeyi değiştiren bir şey keşfettik" tarzında görkemli duyuru cümleleri, ardından on dakikalık shell komutları.

Aşırı mühendislik. Bir kullanıcı 7.000 satırlık bir kararlar dosyasını anlatıyor; temizlemesini istediklerinde Opus 5 1.200 satır sildi, sonra silmeleri belgelemek için 600 yeni satır ekledi. Aynı örüntüyü küçük bir özellikte yeniden ürettik: bizim örneğimiz kimsenin istemediği bir doğrulama adımı ekledi, sonra beş satırlık fonksiyonların üstüne yirmi satırlık docstring yazdı.

Kapsam kayması. X istiyorsun, model asıl konunun Y olduğuna karar veriyor ve nedenini sekiz paragrafta anlatıyor.

Gömülü kötü haber. Bir yorumcu, her şeyin harika gittiğini anlatan bir metin duvarını tarif ediyor; dörtte üçlük yerde bir yıldız işareti bir şeyin bozulduğunu itiraf ediyor. Bunu biz de yaşadık: örneğimiz başarılı bir migration duyurdu, entegrasyon testlerinin hâlâ düzeltilmesi gerektiğini kabul eden satır yedinci paragraftaydı.

Öfke gerçek ve talep üzerine yeniden üretilebiliyor. Geriye kalan soru: ayarlanabilir mi?

Neredeyse kimsenin açmadığı resmî evcilleştirme rehberi

Rehberin adı Prompting Claude Opus 5; Anthropic'in dokümantasyonunda duruyor ve Reddit konusuna madde madde yanıt veriyor. En önemli cümlesi tek satıra sığıyor: effort, modelin ne kadar düşündüğünü kontrol eder, ne kadar konuştuğunu değil. Effort'u düşürmek düşünme hacmini küçültür ama görünen yanıtı güvenilir biçimde kısaltmaz — yani modeli susturmak için effort'u düşüren herkes yanlış kolu çekiyor.

Uzunluk konusunda rehber net: bunu düz sözlerle, sistem prompt'una konacak bir kısalık talimatıyla istiyorsun. Ve Anthropic'ten beklenmeyecek bir şey söylüyor: prompt'larından talimat çıkarman gerekiyor. Talimat dosyanda "yanıt vermeden önce işini doğrula" yazıyorsa o satırı sil: Opus 5 zaten kendini denetliyor ve bu tür satırlar fazladan doğrulama turlarını tetikliyor — yani boşa yanan token. Boris Cherny tek satırda özetledi: Opus 5'in daha az prompting'e ihtiyacı var, daha çoğuna değil.

Rehberin geri kalanı diğer şikâyetleri yöntemli biçimde ele alıyor — agent anlatımı üzerine bir bölüm, üretilen dosyaların uzunluğu üzerine bir bölüm, kapsam çerçevelemesi, subagent'lar, kendini düzeltme — ve her bölüm belirsiz bir öğüt yerine kopyalanacak tam prompt bloğunu veriyor.

Effort sweep: aynı görev, beş seviye, ölçüldü

Effort sweep, aynı görevi her effort seviyesinde çalıştırıp token, süre ve kaliteyi karşılaştırmak demek. Ayarlarını eski bir modelden taşıdıysan rehber bunu yeniden yapmanı öneriyor. Pratikte dört koşu ve bir karşılaştırma.

Claude Code'da effort üç şekilde ayarlanır: oturum içi bir komut, başlatmada bir bayrak veya settings dosyandaki bir anahtar — sonuncusu, repo'larının ihtiyaçları farklıysa proje başına ayrı bir varsayılan verir.

Aynı bug düzeltmesini low, medium, high ve extra high'da, dört temiz oturumda çalıştırdık.

Seviye Referans bug düzeltmemizdeki sonuç
Low / Medium High'ın token'larının bir kısmıyla eşdeğer düzeltme
High Varsayılan; tek satırlık bir bug'da kalite kazancı yok
Extra high Daha çok dosya tarandı, sınır durumlar zırhlandı — ağır refactor'da yararlı, burada fazlalık

Bu, rehberin düşük seviyeleri temel maliyet kontrolü olarak bolca kullan dediği yerle birebir örtüşüyor. Bunu betiğe dökmeden önce bilinmesi gereken bir API ayrıntısı: extra high ve max'ta thinking artık kapatılamıyor ve denersen istek 400 hatası döndürüyor.

Sweep'in en kârlı kullanımı code review. Anthropic, Opus 5'in review doğruluğunun düşük effort seviyelerinde de korunduğunu iddia ediyor; bu da commit anında hızlı ve ucuz bir geçiş, sonra derin bir geçiş yapmayı mümkün kılıyor. Bunu kendi diff'lerimizden birinde test ettik: low geçişi, extra high geçişinin bulduğu aynı iki gerçek bug'ı yaklaşık beşte bir token'la buldu.

Yani faturanı değiştiren ilk ayar, her şeyi varsayılanda bırakmak yerine effort'u görev tipine göre seçmek: günlük iş ve review'lar için low ya da medium, büyük işler için extra high. Verbosity ise tek kelime bile kısalmadı.

Ayrıntı bolluğunun kapatma düğmesi asıl nerede

Effort yanıtları kısaltmadığına göre uzunluk talimatla belirleniyor — ve bu talimatı nereye koyduğun, ne yazdığın kadar önemli. Claude Code subreddit'indeki başka bir kullanıcı bunu günlerce test etmiş ve ilk bulgusu bizimkiyle örtüşüyor: yerleşik Concise çıktı stili çıktıyı yalnızca yaklaşık yüzde 6 kısaltıyor. İşe yarayan şey, gerçek bir kısalık talimatını output style yuvasına koymak ve başka hiçbir yere koymamak oldu — aynı cümle hook olarak veya talimat dosyasında bir kural olarak hiçbir şey değiştirmedi.

Output style, asistanın ne bildiğini değil nasıl yazdığını tanımlayan Claude Code yuvasıdır. Bizimkini resmî rehberin ifadesinden kurduk: kısa ve odaklı yanıtlar, azaltılmış uyarılar, ayrıntı istenmedikçe üst düzey bir özet.

Kısalık kuralı nerede duruyor Uzunluğa etkisi
Yerleşik Concise ön ayarı ~yüzde 6 daha kısa
Hook veya talimat dosyasındaki kural Ölçülebilir değişiklik yok
Output style yuvası Beş bölümlük rapor → bir paragraf ve dosya listesi

Rehber, olduğu gibi kopyaladığımız iki kardeş talimat daha ekliyor: biri agent anlatımı için, modelin ne yaptığını ne zaman yorumlayabileceğini çerçeveliyor; diğeri diske yazılan dosyalar için, çünkü üretilen raporlar ve Markdown dosyaları da şişiyor.

Hiç tetiklenmeyen kurallar içinse aynı Reddit gönderisi ölçütü veriyor: bir kural tanınabilir bir an ve somut bir eylem adlandırmalı. "Changelog'u güncel tut" asla tetiklenmez. "Kaynak klasöründeki bir dosyayı değiştirdiğinde, aynı commit'te changelog'a bir satır ekle" tetiklenir.

Bu blokların kapsamadığı bir söz alışkanlığı kalıyor: anlatılan kendini düzeltme. Opus 5, düzeltme senin için hiçbir şeyi değiştirmese bile önceki bir cümleyi düzelttiğini duyurmayı seviyor; rehberin buna özel bir talimatı var: bir düzeltmeyi yalnızca hata kodunu ya da kararlarını değiştirecekse belirt, gerisini sessizce düzelt. Bu satır yapılandırmamıza girdiğinden beri sahte özürler oturumlarımızdan kayboldu.

Yani verbosity evcilleşiyor, sadece bir düğmeyle değil: doğru yuvalara konmuş dört prompt bloğuyla.

Kendi prompt'larını silerek aşırı mühendisliği durdurmak

İkinci şikâyet metin eklemekle değil, çıkarmakla düzeliyor. Önce, rehberin emrettiği gibi, prompt'larımızdaki bütün doğrulama isteklerini temizledik; fazladan doğrulama döngüsü de onlarla birlikte kayboldu.

Sonra kapsam için rehber, olduğu gibi yapıştırdığımız bir çerçeveleme talimatı sunuyor: isteneni amaçlanan kapsamda teslim et, daha iyi bir yaklaşım varsa bunu tek cümleyle belirt ve görevi sessizce dönüştürmek yerine istenen işe devam et. Yirmi satırlık docstring'leri tetikleyen özellikte tam olarak aynı isteği bu çerçevelemeyle tekrar çalıştırdık: diff dokuz dokunulan dosyadan üçe indi, asalak doğrulama adımı da yok.

Aynı aileden iki ayar birer satırı hak ediyor. Code review'da "yalnızca ciddi sorunları bildir" yazmayı bırak: Opus 5 bunu harfi harfine alıp eksik raporluyor; hepsini iste ve ikinci geçişte filtrele. Model en ufak bahaneyle subagent başlatıyorsa, o da belgeli: Opus 5 seleflerinden daha kolay devrediyor ve her subagent maliyeti katlıyor. Rehber, devretmeyi gerçekten paralel büyük işlere ayıran bir talimat veriyor; 2.1.217 sürümünden beri Claude Code, spawn derinliğini ve aynı anda çalışan agent sayısını sert biçimde sınırlayan iki ortam değişkeni de sunuyor.

Sınır Varsayılan
Subagent spawn derinliği 3 seviye
Eşzamanlı agent 20

Bu varsayılanlar, bir oturumun fikrini hiç sormadan nasıl o kadar dağılabildiğini açıklıyor. Aşırı mühendislik modelin kaderi değil: büyük ölçüde eski prompt'larının sana dönmesi.

Hiçbir prompt bloğunun onarmadığı şey

Sınır keskin: rehber, Opus 5'in söylediklerinin biçimini onarır, yapmaya karar verdiğini değil. Konudaki isyanların bir kısmı verbosity'den başka bir şeyi anlatıyor: açık bir kısıtlamayı kabul eden, ona uyacağına söz veren, sonra ilk turdan itibaren tersini yapan bir model. Bu şikâyetin rehberde bir bölümü yok ve prompt bloklarımızın hiçbiri onu ortadan kaldırmadı. Testlerimizde bir kez gördük: dokunulmaması gereken bir API'ye dair açık bir kısıtlama, yanıtta kabul edildi, iki tur sonra atlandı. Bir haftalık oturumlarda bir kez, bazı isyanların anlattığı gemi batışından çok uzak; ama üretim koduna düştüğünde hiçbir ayarın mazur göstermediği türden bir hata.

Bir de giriş maliyeti var. Sweep gerçek token yakıyor: dört test oturumumuz 20 dolarlık bir planda koca bir iş gününe denk geleni yedi; konudaki bir kullanıcı en büyük max planın effort high'da bir hafta sonunu zar zor çıkardığını aktarıyor. Ayrıca bu ayarların hiçbiri taşınabilir değil — output style, kapsam çerçevelemesi ve subagent sınırları hep senin yapılandırmanda yaşıyor, yani her makine ve her proje yeniden ayarlanmak zorunda.

Derdin gürültüyse rehber onu çözüyor. Derdin canı ne isterse onu yapan bir modelse rehber seni kurtarmaz — ve konudaki isyandan sonra en çok upvote alan yorum hâlâ şu: "önceki Opus'a geri dön".

Evcilleştir ya da kaç: kararımız

Bize yirmi dakikalık ayar yetti: varsayılan yerine görev tipine göre seçilen effort, output style yuvasında bir kısalık talimatı, sistem prompt'unda rehberin kapsam çerçevelemesi ve eski dosyalarımızdan silinen doğrulama istekleri.

Referans görevimizdeki ölçüt Önce Sonra
Yanıt uzunluğu Beş bölümlük rapor ~5× daha kısa, bir paragraf + dosya listesi
Diff boyutu 9 dosyaya dokunuldu 3 dosyaya dokunuldu
Code review maliyeti Extra high geçişi ~1/5 token, aynı iki gerçek bug

Model değişmeden, plan değişmeden. Şikâyetlerin verbosity ve aşırı mühendislikse, model değiştirmeden önce bu ayarı yap — her şey belgeli ve fark daha ilk diff'te görünüyor. Ama sorunun ilk turdan itibaren kısıtlamalarını yok sayan bir modelse, rehberdeki hiçbir prompt bunu onarmıyor: hassas görevleri sana itaat eden bir modelde tut ve bir sonraki güncellemede Opus 5'i yeniden test etmeye gel.

Kaynaklar

Sık sorulan sorular

Opus 5 neden bu kadar uzun konuşuyor?
Anthropic, Opus 5'in önceki Opus modellerinden daha uzun yanıtlar yazdığını ve yer tutucu bırakmak yerine görevleri sonuna kadar tamamladığını belgeliyor. Ayrıca thinking varsayılan olarak açık ve effort parametresi high ile geliyor; bu yüzden model planını anlatıyor ve değişikliklerini ayrıntılı yorumluyor.
Effort'u düşürmek Opus 5'i daha kısa yapar mı?
Hayır. Resmî rehber, effort'un modelin ne kadar düşündüğünü kontrol ettiğini, ne kadar konuştuğunu değil, açıkça belirtiyor. Bizim sweep'imizde high'dan low'a inmek token'ları belirgin biçimde azalttı ama görünen yanıtı tek kelime kısaltmadı.
Opus 5 gerçekte nasıl kısa tutulur?
Claude Code'un output style yuvasına gerçek bir kısalık talimatı koy — kısa ve odaklı yanıtlar, azaltılmış uyarılar, ayrıntı istenmedikçe üst düzey bir özet. Aynı cümle bir hook'ta veya talimat dosyasında hiçbir şey değiştirmez ve yerleşik Concise ön ayarı çıktıyı yalnızca yaklaşık yüzde 6 kısaltır.
Effort sweep nedir, yapmaya değer mi?
Aynı görevi her effort seviyesinde çalıştırıp token, süre ve kaliteyi karşılaştırmak demek — dört koşu ve bir karşılaştırma. Maliyet açısından değer: low ve medium, high'ın token'larının bir kısmıyla eşdeğer bir bug düzeltmesi üretti ve low'daki bir code review, extra high ile aynı iki gerçek bug'ı yaklaşık beşte bir maliyetle buldu.
Opus 5'in aşırı mühendisliği nasıl durdurulur?
Talimat eklemek yerine silerek. Prompt'larından bütün doğrulama isteklerini kaldır, modelin isteneni amaçlanan kapsamda teslim etmesi için rehberin kapsam çerçevelemesini yapıştır ve subagent derinliği ile eşzamanlılığını Claude Code ortam değişkenleriyle sınırla (varsayılan: 3 seviye, 20 agent).
Opus 5'ten uzaklaşmalı mısın?
Şikâyetlerin verbosity ve aşırı mühendislikse önce ayarla — belgelenmiş ayarlar bizde ikisini de model ya da plan değiştirmeden düzeltti. Sorunun ilk turdan itibaren açık bir kısıtlamayı yok sayan bir modelse, rehberdeki hiçbir prompt bunu onarmaz; hassas görevleri sana itaat eden bir modelde tut.

İlgili videolar