TL;DR
- Anthropic ha valutato 400,000 sessioni di Claude Code di 235,000 persone e ha scoperto che i manager, non gli ingegneri software, hanno il miglior tasso di successo verificato.
- Saper programmare vale molto poco: le professioni software verificano il 34% delle sessioni che producono codice, tutte le altre il 29%, e sul successo parziale i due gruppi sono pari, 89% e 88%.
- A fare la differenza è il livello dell'utente. I principianti ottengono circa 5 azioni dell'agente e 600 parole per prompt con il 15% di successo verificato; gli esperti 12 azioni e 3,200 parole con il 28% e il 33%.
- Tre abitudini portano quasi tutto il guadagno: mettere nel prompt il proprio contesto, chiudere con una prova verificabile e restare nella sessione quando qualcosa si rompe invece di chiuderla.
- Il tetto è basso per tutti: anche gli esperti verificano al massimo un terzo delle sessioni, e il primo posto dei manager potrebbe in parte essere un artefatto di misura.
Cosa dicono le fonti
Lo studio è un passaggio di classificazione su 400,000 sessioni interattive di Claude Code di 235,000 persone, registrate tra ottobre 2025 e aprile 2026 s1. Nessuno ha letto le conversazioni. Un classificatore basato su Sonnet 4.6 ha valutato ogni sessione e le sue valutazioni sono state confrontate con la telemetria, cioè commit, modifiche al codice e risultati dei test; sulle sessioni che modificano codice, classificatore e telemetria concordano in più del 90% dei casi s1. Claude Code è l'agente da terminale che legge i tuoi file, scrive codice ed esegue comandi a partire da una richiesta in linguaggio naturale s2.
Tre definizioni decidono come leggere ogni cifra. Successo verificato significa che il classificatore ha trovato prove concrete che l'obiettivo è stato raggiunto, per esempio test superati o una conferma esplicita dell'utente. Successo parziale significa che l'obiettivo è stato raggiunto almeno in parte. L'esperienza non è un titolo di lavoro: il classificatore valuta come si comporta l'utente dentro la sessione, su cinque livelli da principiante a esperto, con tre segnali: la precisione delle istruzioni, cosa l'utente chiede all'agente di verificare e se l'utente corregge l'agente s1.
Il risultato per professione è il titolo. Sulle sessioni che producono codice, le professioni software raggiungono il 34% di successo verificato e tutti gli altri il 29%, cinque punti di distacco rimasti stabili nei sette mesi mentre entrambi i gruppi miglioravano s1. Sul successo parziale i due gruppi sono pari, 89% contro 88% s1. I dieci gruppi professionali più grandi stanno tutti entro sette punti dagli sviluppatori e il gruppo del management è in testa s1. Il nome che Anthropic dà al predittore che conta davvero è competenza di dominio: conoscere a fondo il problema che si sta risolvendo.
La divisione del lavoro spiega il perché. In una sessione tipica l'umano prende circa il 70% delle decisioni di pianificazione, cosa costruire, ma solo il 20% delle decisioni di esecuzione, come scriverlo s1. Un manager che sa esattamente cosa deve fare il prodotto tiene in mano la metà che conta. Lo stesso spostamento si vede in come si usa l'agente: in sette mesi la quota di sessioni di debug è scesa dal 33% al 19%, l'esecuzione di software è salita dal 14% al 21%, analisi dei dati e scrittura di documenti sono quasi raddoppiate, e il valore stimato del compito medio affidato all'agente è salito del 27% s1.
L'autonomia dà più peso a ogni frase. Una sessione tipica contiene solo circa quattro scambi tra utente e agente, ogni prompt fa partire in media circa dieci azioni e un singolo prompt ne scatena a volte più di cento s1. Quando parli solo quattro volte, la precisione di ogni riga è quasi tutto il tuo contributo.
La scala dei livelli è dove stanno i numeri pratici. Un principiante scrive istruzioni generiche senza conoscenza del dominio; ogni prompt fa partire circa 5 azioni dell'agente e restituisce circa 600 parole di lavoro, e il successo verificato si ferma al 15% s1. Un esperto scrive prompt carichi di contesto; lo stesso agente concatena 12 azioni e produce 3,200 parole per istruzione, e il successo verificato sta tra il 28% e il 33% s1. Sono circa cinque volte il lavoro consegnato e il doppio del tasso di successo con lo stesso strumento e lo stesso abbonamento, con la persona alla tastiera come unica variabile. Quasi tutto il guadagno sta tra principiante e intermedio, ed è il passo che le tre abitudini qui sotto coprono.
Le abitudini corrispondono ai tre segnali del classificatore. Precisione delle istruzioni: di' dove agire, con cosa e come si riconosce un risultato finito. Verifica: chiudi il prompt con una condizione controllabile, esegui i test, mostrami il render, conferma che la pagina si carica; lo studio rileva che è ciò che separa un successo giudicato da uno verificato s1. Correzione: i principianti accettano passivamente l'output e abbandonano quattro volte più spesso degli altri utenti appena qualcosa si rompe, mentre rispiegare il problema con parole proprie è esattamente ciò che misura il terzo segnale s1. Nessuno dei tre richiede una riga di codice.
I limiti sono dichiarati nello studio stesso. Anche gli esperti verificano tra il 28% e il 33% delle sessioni, quindi due sessioni su tre finiscono senza prova concreta che l'obiettivo sia stato raggiunto, al meglio con un successo parziale, che supera il 90% s1. La classifica dei manager ha un possibile bias di misura: il successo verificato conta le conferme esplicite dell'utente, e confermare chiaramente che il lavoro è accettato è un'abitudine da manager s1. E il campione è fatto di utenti di Claude Code, un pubblico da riga di comando più motivato della media, quindi nulla garantisce gli stessi numeri in un altro strumento s1. Il thread della community sui consigli per principianti è un utile controllo dall'altra parte: i consigli che si danno ai nuovi arrivati coincidono con i tre segnali, dare contesto, chiedere verifiche, continuare a guidare s3.
Verdetto: cosa regge lo studio
| Affermazione | Stato | Base |
|---|---|---|
| Bisogna saper programmare per ottenere codice funzionante dall'agente | Salta | 34% vs 29% verificato, 89% vs 88% parziale, manager in testa s1 |
| Mettere il proprio contesto nel prompt ripaga | Tieni | 5 vs 12 azioni, 600 vs 3,200 parole per prompt tra principiante ed esperto s1 |
| Chiudere il prompt con una condizione di prova ripaga | Tieni | La verifica è uno dei tre segnali del classificatore; separa il successo giudicato da quello verificato s1 |
| Restare nella sessione dopo un fallimento ripaga | Tieni | I principianti abbandonano quattro volte più spesso; la correzione è il terzo segnale s1 |
| Arrivare al livello esperto rende l'agente affidabile | Salta | Gli esperti verificano comunque solo il 28% e il 33% delle sessioni s1 |
| I manager sono più bravi degli ingegneri in questo | Prova, con cautela | Possibile bias: il successo verificato conta le conferme esplicite dell'utente s1 |
| Questi numeri valgono per altri strumenti di IA | Salta | Il campione è fatto solo di utenti di Claude Code s1 |
Da fare lunedì
- Prendi l'ultimo prompt che hai inviato a un agente e riscrivilo con tre blocchi: dove agire, con cosa (il file, la route, il dataset o il documento esistente) e come si riconosce un risultato finito.
- Aggiungi una clausola di prova alla fine di ogni prompt questa settimana: esegui i test, apri la pagina, controlla che ogni link si risolva, mostrami il diff.
- Quando una sessione va storta, scrivi una correzione prima di chiuderla: cosa è successo, cosa ti aspettavi, dove guardare. Conta quante volte il turno successivo risolve.
- Scrivi i tre fatti sul tuo progetto che conosci solo tu (pubblico, vincoli, ciò che non deve cambiare) e incollali in cima alla prossima sessione.
- Passa un compito non di codice all'agente, la bozza di una newsletter o la riscrittura di un listino, con gli stessi tre blocchi, e confronta il risultato con il tuo modo abituale.
- Tieni un conteggio per cinque sessioni: verificata, parziale o niente. Confrontalo con le fasce dello studio, 15% per i principianti e 28 a 33% per gli esperti.
- Se un blocco del tuo prompt resta vuoto perché non sai la risposta, risolvilo con un collega o un documento prima di lanciare la sessione, non dopo.
Per approfondire
- Leggi la sezione sulla metodologia prima di citare qualsiasi cifra: il classificatore è Sonnet 4.6, confrontato con la telemetria con più del 90% di concordanza sulle sessioni che modificano codice s1.
- Il grafico delle azioni per prompt per livello è l'immagine più chiara del salto da principiante a esperto, da 5 a 12 azioni e da 600 a 3,200 parole s1.
- La sezione sul mix di compiti mostra il debug che scende dal 33% al 19% e l'esecuzione di software che sale dal 14% al 21% in sette mesi, un buon argomento quando qualcuno dice che gli agenti servono solo a correggere bug s1.
- La ripartizione 70% pianificazione contro 20% esecuzione è il numero da portare in una discussione di team su chi dovrebbe guidare un agente s1.
- Rileggi la nota sul bias del successo verificato e delle conferme esplicite dell'utente prima di usare il risultato dei manager in una slide s1.
- Per capire come lavora davvero l'agente in un terminale, cosa legge, scrive ed esegue, parti dalla pagina del prodotto s2.
- Il thread sui consigli per principianti è dove i nuovi arrivati si scambiano abitudini concrete di prompt; leggilo tenendo a mente i tre segnali e ordina i consigli in base al segnale che servono s3.
Fonti
- How AI use changes with expertise: lessons from 400,000 Claude Code sessions, Anthropic. Perché leggerla: ogni cifra di questo pacchetto viene da qui, e le note su metodologia e bias cambiano il modo di leggere il titolo.
- Claude Code, Anthropic. Perché leggerla: l'agente misurato dallo studio, con quello che fa in una sessione da terminale.
- Beginner Claude Code tips (community discussion), Reddit r/ClaudeAI. Perché leggerla: consigli di chi lavora sul campo da confrontare con i tre segnali dello studio.
FAQ
Lo studio dice che chi non programma è bravo quanto gli sviluppatori?
Non proprio. Gli sviluppatori mantengono un vantaggio di cinque punti sul successo verificato, 34% contro 29%, rimasto stabile in sette mesi. Lo studio dice che il vantaggio è piccolo e che il livello dell'utente dentro la sessione predice molto di più del titolo di lavoro.
Cosa conta come successo verificato?
Prove concrete che l'obiettivo è stato raggiunto: test superati, un risultato funzionante che il classificatore può confermare dalla telemetria, o una conferma esplicita dell'utente. Quest'ultimo punto è il motivo per cui il risultato dei manager porta un possibile bias.
Posso salire di livello senza imparare a programmare?
Sì. Il classificatore valuta la precisione delle istruzioni, cosa chiedi all'agente di verificare e se lo correggi. Tutti e tre descrivono il tuo problema e il tuo standard, non codice.
Perché il tetto è così basso anche per gli esperti?
Lo studio conta una sessione come verificata solo quando c'è una prova. Gli esperti arrivano al 28 a 33% di verificato, ma il successo parziale supera il 90%, quindi la maggior parte delle sessioni produce qualcosa; ciò che manca è la prova che sia finito.
AIDive