AIDive

Pack vidéo

Les 400,000 sessions Claude Code d'Anthropic : chiffres, verdict et checklist du lundi

9 min de lecture

TL;DR

  • Anthropic a évalué 400,000 sessions Claude Code issues de 235,000 personnes et constaté que les managers, et non les ingénieurs logiciel, affichent le meilleur taux de réussite vérifiée.
  • Savoir coder rapporte très peu : les métiers du logiciel vérifient 34% des sessions qui produisent du code, tous les autres métiers 29%, et les deux groupes sont à égalité sur la réussite partielle, 89% contre 88%.
  • Ce qui fait la différence, c'est le niveau de l'utilisateur. Les novices obtiennent environ 5 actions d'agent et 600 mots par prompt avec 15% de réussite vérifiée ; les experts obtiennent 12 actions et 3,200 mots avec 28 à 33%.
  • Trois habitudes portent presque tout le gain : mettre son propre contexte dans le prompt, finir par une preuve vérifiable, et rester dans la session quand ça casse au lieu de la fermer.
  • Le plafond est bas pour tout le monde : même les experts vérifient au mieux un tiers des sessions, et la première place des managers tient peut-être en partie à un artefact de mesure.

Ce que disent les sources

L'étude est un passage de classifieur sur 400,000 sessions interactives de Claude Code issues de 235,000 personnes, enregistrées entre octobre 2025 et avril 2026 s1. Personne n'a lu les conversations. Un classifieur construit sur Sonnet 4.6 a noté chaque session, et ses notes ont été recoupées avec la télémétrie, c'est-à-dire les commits, les changements de code et les résultats de tests ; sur les sessions qui modifient du code, classifieur et télémétrie concordent à plus de 90% s1. Claude Code lui-même est l'agent de terminal qui lit vos fichiers, écrit du code et lance des commandes à partir d'une demande en langage courant s2.

Trois définitions déterminent la lecture de chaque chiffre. La réussite vérifiée signifie que le classifieur a trouvé une preuve solide que l'objectif est atteint, par exemple des tests qui passent ou une confirmation explicite de l'utilisateur. La réussite partielle signifie que l'objectif a été au moins en partie atteint. L'expertise n'est pas un intitulé de poste : le classifieur note le comportement de l'utilisateur dans la session, sur cinq niveaux du novice à l'expert, à partir de trois signaux : la précision des instructions, ce que l'utilisateur demande à l'agent de vérifier, et si l'utilisateur corrige l'agent s1.

Le résultat par métier est le titre principal. Sur les sessions qui produisent du code, les métiers du logiciel atteignent 34% de réussite vérifiée et tous les autres 29%, un écart de cinq points resté stable pendant les sept mois alors que les deux groupes progressaient s1. Sur la réussite partielle, les deux groupes sont à égalité, 89% contre 88% s1. Les dix plus grands groupes de métiers sont tous à moins de sept points des développeurs, et le groupe du management est en tête s1. Le prédicteur qui compte vraiment, Anthropic l'appelle l'expertise du domaine : connaître en profondeur le problème qu'on résout.

La répartition du travail l'explique. Dans une session typique, l'humain prend environ 70% des décisions de planification, quoi construire, mais seulement 20% des décisions d'exécution, comment l'écrire s1. Un manager qui sait exactement ce que le produit doit faire tient la moitié qui compte. Le même glissement se voit dans l'usage de l'agent : sur les sept mois, la part des sessions de débogage est passée de 33% à 19%, l'exécution de logiciels est montée de 14% à 21%, et l'analyse de données comme la rédaction de documents ont presque doublé, tandis que la valeur estimée de la tâche moyenne confiée à l'agent a grimpé de 27% s1.

L'autonomie donne plus de poids à chaque phrase. Une session typique ne compte qu'environ quatre échanges entre l'utilisateur et l'agent, chaque prompt déclenche en moyenne une dizaine d'actions, et un seul prompt en déclenche parfois plus d'une centaine s1. Quand on ne parle que quatre fois, la précision de chaque ligne fait l'essentiel de votre contribution.

C'est dans l'échelle des niveaux que se trouvent les chiffres pratiques. Un novice écrit des instructions génériques sans connaissance du domaine ; chaque prompt déclenche environ 5 actions de l'agent et renvoie environ 600 mots de travail, et la réussite vérifiée plafonne à 15% s1. Un expert écrit des prompts chargés de contexte ; le même agent enchaîne 12 actions et produit 3,200 mots par instruction, et la réussite vérifiée se situe entre 28% et 33% s1. Cela fait environ cinq fois plus de travail livré et deux fois plus de réussite avec le même outil et le même abonnement, la personne au clavier étant la seule variable. Presque tout ce gain se situe entre novice et intermédiaire, ce que couvrent les trois habitudes ci-dessous.

Les habitudes correspondent aux trois signaux du classifieur. Précision des instructions : dire où agir, avec quoi, et à quoi ressemble un résultat terminé. Vérification : finir le prompt par une condition contrôlable, lance les tests, montre-moi le rendu, confirme que la page se charge ; l'étude constate que c'est ce qui sépare une réussite jugée d'une réussite vérifiée s1. Correction : les novices acceptent le résultat passivement et abandonnent quatre fois plus souvent que les autres utilisateurs dès que quelque chose casse, alors que reformuler le problème avec ses propres mots est exactement ce que mesure le troisième signal s1. Aucune des trois ne demande une ligne de code.

Les limites sont énoncées dans l'étude elle-même. Même les experts vérifient entre 28% et 33% des sessions, donc deux sessions sur trois se terminent sans preuve solide que l'objectif est atteint, au mieux avec une réussite partielle, qui dépasse bien 90% s1. Le classement des managers comporte un possible biais de mesure : la réussite vérifiée compte les confirmations explicites de l'utilisateur, et confirmer clairement qu'un travail est accepté est une habitude de manager s1. Enfin, l'échantillon est composé d'utilisateurs de Claude Code, un public de ligne de commande déjà plus motivé que la moyenne, donc rien ne garantit les mêmes chiffres dans un autre outil s1. Le fil de la communauté sur les conseils aux débutants est un bon test de cohérence dans l'autre sens : les conseils donnés aux nouveaux recoupent les trois signaux, donner du contexte, demander des vérifications, continuer à piloter s3.

Verdict : ce que l'étude soutient

Affirmation Statut Base
Il faut savoir coder pour obtenir du code qui marche de l'agent À écarter 34% contre 29% vérifiés, 89% contre 88% partiels, managers en tête s1
Mettre son propre contexte dans le prompt paie À garder 5 contre 12 actions, 600 contre 3,200 mots par prompt entre novice et expert s1
Finir le prompt par une condition de preuve paie À garder La vérification est l'un des trois signaux du classifieur ; elle sépare la réussite jugée de la réussite vérifiée s1
Rester dans la session après un échec paie À garder Les novices abandonnent quatre fois plus ; la correction est le troisième signal s1
Atteindre le niveau expert rend l'agent fiable À écarter Les experts ne vérifient encore que 28 à 33% des sessions s1
Les managers sont meilleurs que les ingénieurs à ça À tester, avec prudence Biais possible : la réussite vérifiée compte les confirmations explicites de l'utilisateur s1
Ces chiffres se transposent aux autres outils d'IA À écarter L'échantillon ne compte que des utilisateurs de Claude Code s1

À faire lundi

  • Prenez le dernier prompt envoyé à un agent et réécrivez-le en trois blocs : où agir, avec quoi (le fichier, la route, le jeu de données ou le document existant), et à quoi ressemble le résultat terminé.
  • Ajoutez une clause de preuve à la fin de chaque prompt cette semaine : lance les tests, ouvre la page, vérifie que chaque lien répond, montre le diff.
  • Quand une session déraille, écrivez une correction avant de la fermer : ce qui s'est passé, ce que vous attendiez, où regarder. Comptez combien de fois le tour suivant règle le problème.
  • Notez les trois faits sur votre projet que vous seul connaissez (public, contraintes, ce qui ne doit pas changer) et collez-les en haut de votre prochaine session.
  • Passez une tâche hors code par l'agent, un brouillon de newsletter ou une réécriture de tarifs, avec les trois mêmes blocs, et comparez avec votre façon habituelle.
  • Tenez un décompte sur cinq sessions : vérifiée, partielle ou rien. Comparez-le aux tranches de l'étude, 15% pour les novices et 28 à 33% pour les experts.
  • Si un bloc de votre prompt reste vide parce que vous ne connaissez pas la réponse, réglez la question avec un collègue ou un document avant de lancer la session, pas après.

Aller plus loin

  • Lisez la section méthodologie avant de citer un chiffre : le classifieur est Sonnet 4.6, recoupé avec la télémétrie avec plus de 90% de concordance sur les sessions qui modifient du code s1.
  • Le graphique des actions par prompt selon le niveau est l'image la plus claire du saut entre novice et expert, de 5 à 12 actions et de 600 à 3,200 mots s1.
  • La section sur la répartition des tâches montre le débogage qui passe de 33% à 19% et l'exécution de logiciels qui monte de 14% à 21% en sept mois, un bon argument quand quelqu'un dit que les agents ne servent qu'à corriger des bugs s1.
  • La répartition 70% planification contre 20% exécution est le chiffre à apporter dans une discussion d'équipe sur qui doit piloter un agent s1.
  • Relisez la note de biais sur la réussite vérifiée et les confirmations explicites de l'utilisateur avant de reprendre le résultat des managers dans une présentation s1.
  • Pour comprendre comment l'agent travaille réellement dans un terminal, ce qu'il lit, écrit et lance, commencez par la page produit s2.
  • Le fil des conseils aux débutants est l'endroit où les nouveaux échangent des habitudes de prompt concrètes ; lisez-le en gardant les trois signaux en tête et triez les conseils selon le signal qu'ils servent s3.

Sources

FAQ

L'étude dit-elle que les non-codeurs valent les développeurs ?

Pas tout à fait. Les développeurs gardent cinq points d'avance sur la réussite vérifiée, 34% contre 29%, et cet écart est resté stable pendant sept mois. L'étude indique que l'avance est faible et que le niveau de l'utilisateur dans la session prédit bien davantage que l'intitulé du poste.

Qu'est-ce qu'une réussite vérifiée ?

Une preuve solide que l'objectif est atteint : des tests qui passent, un résultat qui marche et que le classifieur peut confirmer par la télémétrie, ou une confirmation explicite de l'utilisateur. Ce dernier point explique le biais possible du résultat des managers.

Puis-je monter d'un niveau sans apprendre à coder ?

Oui. Le classifieur note la précision des instructions, ce que vous demandez à l'agent de vérifier, et si vous le corrigez. Les trois décrivent votre problème et votre exigence, pas du code.

Pourquoi le plafond est-il si bas, même pour les experts ?

L'étude ne compte une session comme vérifiée que s'il existe une preuve. Les experts atteignent 28 à 33% de réussite vérifiée, mais la réussite partielle dépasse 90%, donc la plupart des sessions livrent quelque chose ; ce qui manque, c'est la preuve que c'est terminé.