AIDive

Anthropic ha studiato 400.000 sessioni AI: i dev perdono

Di AIDive · Pubblicato il

Agent di coding

I manager battono gli sviluppatori nell'AI coding

Anthropic ha fatto valutare da un classificatore 400.000 sessioni di Claude Code, una per una, per scoprire chi ha davvero successo con un agente di coding. Il gruppo con il miglior tasso di successo verificato non è quello degli ingegneri software. È quello dei manager. Le dieci categorie professionali più numerose dello studio restano tutte entro sette punti dagli sviluppatori: persone che non scrivono codice consegnano codice funzionante quasi allo stesso ritmo di chi lo fa per mestiere.

Se ti sei mai detto che questi strumenti non fanno per te perché non sai programmare, lo studio dice l'esatto contrario. Saper programmare non separa più chi riesce da chi fallisce, e lo studio dice con precisione cosa lo fa.

Cosa ha misurato davvero Anthropic

Tre definizioni cambiano il modo in cui leggere ogni numero dello studio. Primo, il campione: 400.000 sessioni interattive di 235.000 persone, registrate tra ottobre 2025 e aprile 2026. Claude Code è l'agente di coding di Anthropic che vive in un terminale: scrivi quello che vuoi in linguaggio naturale e lui legge i tuoi file, scrive il codice ed esegue i comandi da solo.

Nessuno in Anthropic ha letto quelle conversazioni a mano. Un classificatore costruito su uno dei loro modelli ha valutato ogni sessione in automatico, e i suoi giudizi sono stati confrontati con la telemetria, cioè i commit, le modifiche al codice e i risultati dei test. Sulle sessioni che modificano codice, classificatore e telemetria concordano più del 90% delle volte.

Secondo, il successo. Lo studio ne traccia due tipi, e la differenza regge tutto quello che segue. Un successo giudicato significa che il classificatore ritiene raggiunto l'obiettivo dichiarato. Un successo verificato è più esigente: servono prove, come test che passano, un commit o l'utente che conferma esplicitamente il risultato. Il successo verificato è l'asticella alta dietro ogni numero qui sotto, ed è severa, perché molte sessioni utili finiscono senza prova formale.

Terzo, la competenza stessa. Il classificatore non guarda mai il tuo titolo di lavoro o il tuo curriculum. Legge il tuo comportamento dentro la sessione e lo valuta su una scala a cinque livelli da novizio a esperto, usando solo tre segnali: quanto sono precise le tue istruzioni, cosa chiedi all'agente di verificare e se uno dei due corregge l'altro. Il tuo livello misura la presa che hai sul problema in quella sessione, quindi la stessa persona può essere esperta del suo mestiere la mattina e novizia su un argomento nuovo la sera.

I cinque livelli, da novizio a esperto

Un novizio si riconosce in una frase: istruzioni generiche senza alcuna conoscenza di dominio dentro. Un esperto scrive prompt carichi di contesto, e lo stesso agente risponde con molto più lavoro autonomo. Un'azione qui è una mossa concreta dell'agente, come leggere un file, scrivere una funzione o eseguire un comando.

Metrica Novizio Esperto
Azioni dell'agente per prompt ~5 ~12
Parole di lavoro consegnato per prompt ~600 ~3.200
Tasso di successo verificato 15% 28-33% (da intermedio in su)
Tasso di abbandono quando una sessione va male 19% 5-7% (tutti i non novizi)
Sessioni in difficoltà convertite in successo verificato 4% 15%

Sono cinque volte il lavoro consegnato, con lo stesso strumento e lo stesso abbonamento. L'unica variabile cambiata è la persona alla tastiera.

Il dettaglio che conta di più: quasi tutto il guadagno avviene tra novizio e intermedio, mentre il divario tra intermedio ed esperto è modesto. Non devi diventare esperto per raddoppiare il tuo tasso di successo. Devi smettere di essere un novizio.

Il divario più brutale emerge quando una sessione va male. Quando l'agente sprofonda in errori e test rotti, i novizi abbandonano il 19% delle volte, contro il 5-7% di tutti gli altri. Tra chi resiste, i novizi convertono solo il 4% di quelle sessioni in difficoltà in successi verificati, mentre gli esperti ne convertono il 15%. Sono quasi quattro volte più sessioni salvate, solo perché la persona capisce il problema abbastanza bene da raddrizzare l'agente invece di guardarlo affondare. La differenza tra i livelli non si vede quando tutto funziona. Si vede al primo intoppo.

Perché saper programmare non conta più

La competenza di dominio, nei termini di Anthropic, è capire il problema che stai cercando di risolvere, fino in fondo. Sulle sessioni che producono codice, il divario tra professioni è piccolo e stabile:

Gruppo Successo verificato Successo parziale
Professioni software 34% 89%
Tutte le altre professioni 29% 88%

Cinque punti di differenza, un divario che non si è né allargato né ristretto nei sette mesi dello studio, mentre entrambi i gruppi continuavano a migliorare. Sul successo parziale, dove l'obiettivo è stato raggiunto almeno in parte, i due gruppi pareggiano.

Lo studio mostra anche dove agisce la competenza di dominio. In una sessione tipica, l'umano prende circa il 70% delle decisioni di pianificazione (cosa costruire) ma solo il 20% delle decisioni di esecuzione (come scriverlo). La divisione è già lì: tu decidi il cosa, l'agente gestisce il come. Un manager che sa esattamente cosa deve fare il suo prodotto tiene in mano la leva che conta, anche senza scrivere una sola riga di quello che l'agente produce. Ecco perché i manager finiscono in cima alla classifica.

L'uso nei sette mesi osservati conferma che il baricentro si sta spostando:

Tipo di task Inizio dello studio Fine dello studio
Debugging 33% delle sessioni 19%
Esecuzione di software 14% 21%
Analisi dati e scrittura di documenti riferimento quasi raddoppiate

Le persone non usano più l'agente solo per riparare codice; lo usano per mandare avanti il proprio lavoro. Nello stesso periodo, il valore stimato del task medio affidato all'agente è cresciuto del 27%.

L'autonomia ridefinisce il tuo ruolo allo stesso modo. Una sessione tipica contiene solo circa quattro scambi tra l'umano e l'agente, e ogni prompt innesca in media una decina di azioni. All'estremo, un singolo prompt scatena a volte più di cento azioni: un'istruzione, e l'agente lavora da solo per l'equivalente di un pomeriggio. Quello che porti tu sta in poche frasi per sessione, ed è esattamente per questo che la loro precisione pesa così tanto. Quando parli solo quattro volte, ogni frase conta.

Lo stesso task, con un prompt da novizio e uno da esperto

Abbiamo rigiocato la differenza su un task che chiunque capisce: aggiungere un modulo di contatto a un piccolo sito web.

La versione da novizio è il prompt che metà di noi scrive ancora: nove parole, nessun contesto, nessun criterio. L'agente non sa dove vive il sito, cosa raccoglie il modulo o dove finiscono i messaggi, quindi prende ognuna di quelle decisioni al posto tuo, e tu scopri le sue scelte alla fine. Nel nostro run ha piazzato il modulo sulla homepage, inventato un campo telefono che nessuno aveva chiesto e collegato gli invii a un indirizzo email che non esiste. Niente di tutto questo è un bug. L'agente ha riempito i buchi della richiesta con supposizioni, e ogni supposizione era un'occasione di sbagliare. È il pattern misurato del novizio: poche azioni, un risultato corto e circa una probabilità su sette di un successo verificato.

La versione da esperto affronta lo stesso task senza una sola riga di codice nel prompt. Dice dove agire (la pagina about), cosa costruire (tre campi precisi), con cosa costruirlo (la route di invio che esiste già) e soprattutto come dimostrare che è finito (esegui i test e mostra il modulo nel browser). Nessuna di queste informazioni richiede saper programmare. Richiede conoscere il tuo sito, il tuo bisogno e il tuo standard, cioè il tuo dominio. L'agente fa il resto: legge la pagina, aggiunge il modulo, collega la route, scrive la validazione ed esegue i test. È la catena di 12 azioni dello studio, innescata dalla precisione del prompt, non dal talento tecnico di chi l'ha scritto.

Scrivere il prompt da esperto ha richiesto circa trenta secondi in più di quello da novizio, e quei trenta secondi hanno eliminato ogni occasione che l'agente aveva di tirare a indovinare. L'intera dimostrazione sta in una frase: lo stesso strumento diventa cinque volte più produttivo quando la richiesta porta con sé il dominio.

Tre abitudini per salire di livello

La prima abitudine è dare il contesto che solo tu conosci, prima che l'agente lo indovini male. Il classificatore la chiama precisione delle istruzioni. Ogni richiesta dovrebbe dire dove agire, con cosa e che aspetto ha il lavoro finito. Bastano tre frasi, e funziona per qualsiasi mestiere, non solo per il codice: un prompt di marketing con il pubblico, i vincoli e il traguardo copre gli stessi tre blocchi. Se non riesci a riempire uno dei blocchi, è il segnale che la vaghezza sta dalla tua parte, non da quella dell'agente, e vale la pena chiarirla prima di lanciare la sessione.

La seconda abitudine è pretendere prove alla fine, il secondo segnale del classificatore. Chiudi i tuoi prompt con una condizione di fine verificabile: esegui i test, mostrami il risultato, controlla che la pagina si carichi. Un agente a cui non chiedi prove ti consegnerà lavoro non verificabile, e lo studio mostra che è esattamente ciò che separa un successo giudicato da uno verificato. Quella prova ti protegge anche, perché ti permette di approvare il lavoro senza saper leggere il codice che c'è dietro.

La terza abitudine è restare nel loop quando le cose iniziano a rompersi. Rileggi quello che l'agente restituisce, correggilo quando sbaglia e non chiudere la sessione al primo fallimento. I novizi accettano l'output passivamente e abbandonano circa quattro volte più spesso degli altri appena qualcosa si inceppa, eppure è proprio lì che il livello paga. Rispiegare il problema con parole tue e indicare cosa non corrisponde alle tue attese è correggere l'agente, il terzo segnale del classificatore. La forma di una buona correzione: cosa sta succedendo, cosa ti aspettavi, dove guardare. Ancora nessuna riga di codice, solo una descrizione onesta dello scarto.

Le tre abitudini stanno su un post-it: dai il tuo contesto, pretendi prove, resta nel loop. Nessuna richiede imparare a programmare, e insieme coprono la forbice tra il 15 e il 30% di successo.

Quello che lo studio non dice

Anche per gli esperti, il successo verificato si ferma tra il 28 e il 33%. Due sessioni su tre finiscono senza prova solida che l'obiettivo sia stato raggiunto, al massimo con un successo parziale, che invece sale sopra il 90%. Salire di livello raddoppia le tue probabilità; non rende l'agente infallibile.

La classifica dei manager merita una cautela a parte. Anthropic segnala un possibile bias di misurazione, perché il successo verificato conta anche le conferme esplicite dell'utente, e confermare chiaramente che il lavoro è validato è un riflesso da manager. In più, lo studio misura sessioni di Claude Code, uno strumento da terminale il cui pubblico è già più motivato della media, quindi niente garantisce che gli stessi numeri valgano in ChatGPT o in qualsiasi altro strumento. Tieni la pendenza generale, non i decimali: la precisione paga, la prova paga, e nessuno supera un terzo di certezza.

Il tuo livello non è un'etichetta

Dovresti buttarti se non sai programmare? Lo studio risponde per gruppi. Se conosci il tuo mestiere a fondo (il tuo dominio, i tuoi clienti, cosa significa un buon risultato), allora sì. Porti esattamente la metà delle decisioni che conta, quella della pianificazione. Ma se entri in un argomento che non capisci ancora, l'agente non riempirà quel vuoto; lo imbottirà di supposizioni, come il nostro modulo di contatto finito sulla pagina sbagliata.

La lezione sta in una decisione: smetti di trattare la tua mancanza di codice come un handicap e inizia a trattare la tua conoscenza del problema come il tuo vero capitale. Il classificatore non valuta chi sei; valuta come lavori dentro la sessione, e questo può cambiare già dalla prossima. Scrivi la richiesta con dentro il tuo contesto, chiudila con la prova che pretendi e, quando si inceppa, riformula invece di chiudere. Se non sai programmare, parti con le stesse probabilità di tutti gli altri. Lo studio l'ha appena dimostrato su 400.000 sessioni.

Fonti

Domande frequenti

Cosa ha scoperto lo studio Anthropic sulle 400.000 sessioni di Claude Code?
Un classificatore ha valutato 400.000 sessioni di Claude Code di 235.000 persone (da ottobre 2025 ad aprile 2026) e ha scoperto che a predire il successo è la competenza di dominio, non la capacità di programmare. I manager hanno avuto il miglior tasso di successo verificato, e le professioni non software verificano al 29% contro il 34% delle professioni software.
Si può usare Claude Code senza saper programmare?
Sì, se conosci il tuo dominio. In una sessione tipica gli umani prendono circa il 70% delle decisioni di pianificazione ma solo il 20% di quelle di esecuzione, quindi sapere cosa costruire conta più di sapere come scriverlo. Chi non programma consegna codice funzionante quasi allo stesso ritmo degli sviluppatori professionisti.
Cos'è un successo verificato nello studio di Anthropic?
Un successo verificato richiede la prova che l'obiettivo è stato raggiunto: test che passano, un commit o la conferma esplicita dell'utente. È più severo di un successo giudicato, dove il classificatore ritiene semplicemente raggiunto l'obiettivo. Anche gli esperti verificano solo il 28-33% delle sessioni.
Come misura Anthropic i livelli di competenza degli utenti AI?
Un classificatore valuta ogni sessione su una scala a cinque livelli da novizio a esperto usando tre segnali comportamentali: la precisione delle istruzioni, cosa l'utente chiede all'agente di verificare e se utente e agente si correggono a vicenda. Non guarda mai i titoli di lavoro, quindi la stessa persona può risultare esperta su un task e novizia su un altro.
Cosa distingue i prompt da novizio da quelli da esperto con gli agenti di coding?
I prompt da esperto portano contesto di dominio: dove agire, cosa costruire, con cosa costruirlo e una condizione di fine verificabile come eseguire i test. Ogni prompt da esperto innesca circa 12 azioni dell'agente e 3.200 parole di lavoro, contro 5 azioni e 600 parole dei prompt generici da novizio, con il doppio del tasso di successo verificato.
Gli sviluppatori hanno ancora un vantaggio con gli agenti di coding AI?
Un vantaggio piccolo: le professioni software verificano il 34% delle sessioni che producono codice contro il 29% di tutti gli altri, un divario di cinque punti rimasto stabile per sette mesi. Sul successo parziale i gruppi pareggiano con 89% e 88%.

Video correlati