TL;DR
- A Anthropic avaliou 400,000 sessões do Claude Code de 235,000 pessoas e descobriu que os gerentes, e não os engenheiros de software, têm a melhor taxa de sucesso verificado.
- Saber programar acrescenta muito pouco: as ocupações de software verificam 34% das sessões que produzem código, todas as outras 29%, e os dois grupos empatam no sucesso parcial, 89% contra 88%.
- O que separa os resultados é o nível do usuário. Novatos conseguem cerca de 5 ações do agente e 600 palavras por prompt com 15% de sucesso verificado; especialistas conseguem 12 ações e 3,200 palavras com 28 a 33%.
- Três hábitos carregam quase todo o ganho: colocar seu próprio contexto no prompt, terminar com uma prova verificável e ficar na sessão quando algo quebra em vez de fechá-la.
- O teto é baixo para todos: mesmo os especialistas verificam no máximo um terço das sessões, e o primeiro lugar dos gerentes pode ser em parte um artefato de medição.
O que dizem as fontes
O estudo é uma passada de classificador sobre 400,000 sessões interativas do Claude Code de 235,000 pessoas, registradas entre outubro de 2025 e abril de 2026 s1. Ninguém leu as conversas. Um classificador construído sobre o Sonnet 4.6 avaliou cada sessão, e as notas foram cruzadas com a telemetria, ou seja, commits, mudanças de código e resultados de testes; nas sessões que modificam código, classificador e telemetria concordam em mais de 90% dos casos s1. O próprio Claude Code é o agente de terminal que lê seus arquivos, escreve código e roda comandos a partir de um pedido em linguagem natural s2.
Três definições determinam como cada número é lido. Sucesso verificado significa que o classificador encontrou evidência concreta de que o objetivo foi atingido, incluindo testes passando ou uma confirmação explícita do usuário. Sucesso parcial significa que o objetivo foi atingido ao menos em parte. Expertise não é um cargo: o classificador avalia como o usuário se comporta dentro da sessão, em cinco níveis, de novato a especialista, usando três sinais: a precisão das instruções, o que o usuário pede ao agente para verificar e se o usuário corrige o agente s1.
O resultado por ocupação é a manchete. Nas sessões que produzem código, as ocupações de software chegam a 34% de sucesso verificado e todo o resto a 29%, uma diferença de cinco pontos que se manteve estável durante os sete meses enquanto os dois grupos melhoravam s1. No sucesso parcial os dois grupos estão no mesmo nível, 89% contra 88% s1. Os dez maiores grupos de ocupações ficam todos a menos de sete pontos dos desenvolvedores, e o grupo de gestão está no topo s1. O preditor que realmente importa, a Anthropic chama de expertise de domínio: conhecer a fundo o problema que você está resolvendo.
A divisão do trabalho explica o porquê. Em uma sessão típica o humano toma cerca de 70% das decisões de planejamento, o que construir, mas só 20% das decisões de execução, como escrever s1. Um gerente que sabe exatamente o que o produto precisa fazer tem a metade que conta. A mesma mudança aparece no uso do agente: ao longo dos sete meses, a fatia de sessões de depuração caiu de 33% para 19%, rodar software subiu de 14% para 21%, análise de dados e redação de documentos quase dobraram, e o valor estimado da tarefa média entregue ao agente subiu 27% s1.
A autonomia dá mais peso a cada frase. Uma sessão típica tem só uns quatro intercâmbios entre usuário e agente, cada prompt dispara em média cerca de dez ações, e um único prompt às vezes dispara mais de cem s1. Quando você fala só quatro vezes, a precisão de cada linha é quase toda a sua contribuição.
A escala de níveis é onde estão os números práticos. Um novato escreve instruções genéricas, sem conhecimento do domínio; cada prompt dispara cerca de 5 ações do agente e devolve umas 600 palavras de trabalho, e o sucesso verificado fica em 15% s1. Um especialista escreve prompts carregados de contexto; o mesmo agente encadeia 12 ações e produz 3,200 palavras por instrução, e o sucesso verificado fica entre 28% e 33% s1. Isso é cerca de cinco vezes mais trabalho entregue e o dobro de sucesso com a mesma ferramenta e a mesma assinatura, tendo a pessoa no teclado como única variável. Quase todo esse ganho está entre novato e intermediário, que é o passo coberto pelos três hábitos abaixo.
Os hábitos correspondem aos três sinais do classificador. Precisão das instruções: diga onde agir, com o quê e como é um resultado terminado. Verificação: termine o prompt com uma condição checável, rode os testes, mostre o render, confirme que a página carrega; o estudo conclui que isso é o que separa um sucesso julgado de um verificado s1. Correção: novatos aceitam a saída passivamente e desistem quatro vezes mais que os outros usuários assim que algo quebra, enquanto reexplicar o problema com suas próprias palavras é exatamente o que o terceiro sinal mede s1. Nenhum dos três pede uma linha de código.
Os limites são declarados no próprio estudo. Mesmo os especialistas verificam entre 28% e 33% das sessões, então duas em cada três terminam sem prova concreta de que o objetivo foi atingido, no melhor caso com um sucesso parcial, que de fato passa de 90% s1. O ranking dos gerentes tem um possível viés de medição: o sucesso verificado conta confirmações explícitas do usuário, e confirmar com clareza que um trabalho foi aceito é um hábito de gerente s1. E a amostra é de usuários do Claude Code, um público de linha de comando já mais motivado que a média, então nada garante os mesmos números em outra ferramenta s1. O tópico da comunidade sobre dicas para iniciantes é um bom teste de sanidade pelo outro lado: o conselho que se dá a quem chega coincide com os três sinais, dar contexto, pedir verificações, continuar conduzindo s3.
Veredito: o que o estudo sustenta
| Afirmação | Status | Base |
|---|---|---|
| É preciso saber programar para obter código que funcione do agente | Descartar | 34% contra 29% verificado, 89% contra 88% parcial, gerentes no topo s1 |
| Colocar seu próprio contexto no prompt compensa | Manter | 5 contra 12 ações, 600 contra 3,200 palavras por prompt entre novato e especialista s1 |
| Terminar o prompt com uma condição de prova compensa | Manter | Verificação é um dos três sinais do classificador; separa o sucesso julgado do verificado s1 |
| Ficar na sessão depois de uma falha compensa | Manter | Novatos desistem quatro vezes mais; correção é o terceiro sinal s1 |
| Chegar ao nível de especialista torna o agente confiável | Descartar | Especialistas ainda verificam só 28 a 33% das sessões s1 |
| Gerentes são melhores nisso do que engenheiros | Testar, com cautela | Possível viés: o sucesso verificado conta confirmações explícitas do usuário s1 |
| Esses números valem para outras ferramentas de IA | Descartar | A amostra é só de usuários do Claude Code s1 |
Faça isto na segunda
- Pegue o último prompt que você mandou a um agente e reescreva com três blocos: onde agir, com o quê (o arquivo, a rota, o dataset ou o documento existente) e como é o resultado terminado.
- Acrescente uma cláusula de prova no fim de cada prompt esta semana: rode os testes, abra a página, confira se todos os links respondem, mostre o diff.
- Quando uma sessão der errado, escreva uma correção antes de fechá-la: o que aconteceu, o que você esperava, onde olhar. Conte quantas vezes o turno seguinte resolve.
- Anote os três fatos do seu projeto que só você conhece (público, restrições, o que não pode mudar) e cole no topo da próxima sessão.
- Passe uma tarefa que não seja de código pelo agente, um rascunho de newsletter ou uma reescrita de preços, com os mesmos três blocos, e compare com o seu jeito de sempre.
- Faça uma contagem por cinco sessões: verificada, parcial ou nada. Compare com as faixas do estudo, 15% de novato e 28 a 33% de especialista.
- Se um bloco do seu prompt ficar vazio porque você não sabe a resposta, resolva com um colega ou um documento antes de iniciar a sessão, não depois.
Para ir além
- Leia a seção de metodologia antes de citar qualquer número: o classificador é o Sonnet 4.6, cruzado com a telemetria com mais de 90% de concordância nas sessões que modificam código s1.
- O gráfico de ações por prompt por nível é a imagem mais clara do salto de novato a especialista, de 5 a 12 ações e de 600 a 3,200 palavras s1.
- A seção de mix de tarefas mostra a depuração caindo de 33% para 19% e rodar software subindo de 14% para 21% em sete meses, um bom argumento quando alguém diz que agentes só servem para corrigir bugs s1.
- A divisão de 70% de planejamento contra 20% de execução é o número para levar a uma discussão de equipe sobre quem deve conduzir um agente s1.
- Releia a nota de viés sobre o sucesso verificado e as confirmações explícitas do usuário antes de usar o resultado dos gerentes em um slide s1.
- Para ver como o agente realmente funciona em um terminal, o que ele lê, escreve e roda, comece pela página do produto s2.
- O tópico de dicas para iniciantes é onde quem chega troca hábitos concretos de prompt; leia com os três sinais em mente e classifique os conselhos pelo sinal a que servem s3.
Fontes
- How AI use changes with expertise: lessons from 400,000 Claude Code sessions, Anthropic. Por que ler: todos os números deste pack vêm daqui, e as notas de metodologia e de viés mudam a leitura da manchete.
- Claude Code, Anthropic. Por que ler: o agente que o estudo mediu, com o que ele faz em uma sessão de terminal.
- Beginner Claude Code tips (community discussion), Reddit r/ClaudeAI. Por que ler: conselhos de quem usa no dia a dia para comparar com os três sinais do estudo.
FAQ
O estudo diz que quem não programa é tão bom quanto os desenvolvedores?
Não exatamente. Os desenvolvedores mantêm cinco pontos de vantagem no sucesso verificado, 34% contra 29%, e isso se manteve estável por sete meses. O estudo diz que a vantagem é pequena e que o nível do usuário dentro da sessão prevê muito mais que o cargo.
O que conta como sucesso verificado?
Evidência concreta de que o objetivo foi atingido: testes passando, um resultado que funciona e que o classificador consegue confirmar pela telemetria, ou uma confirmação explícita do usuário. Esse último item é o motivo do possível viés no resultado dos gerentes.
Posso subir de nível sem aprender a programar?
Sim. O classificador avalia a precisão das instruções, o que você pede ao agente para verificar e se você o corrige. Os três são descrições do seu problema e do seu critério, não código.
Por que o teto é tão baixo mesmo para especialistas?
O estudo só conta uma sessão como verificada quando há prova. Especialistas chegam a 28 a 33% verificado, mas o sucesso parcial passa de 90%, então a maioria das sessões entrega alguma coisa; o que falta é a prova de que está terminado.
AIDive