AIDive

Video-Paket

Anthropics 400,000 Claude-Code-Sessions: Zahlen, Urteil und eine Checkliste für Montag

9 Min. Lesezeit

TL;DR

  • Anthropic hat 400,000 Claude-Code-Sessions von 235,000 Personen bewertet und festgestellt: Die beste verifizierte Erfolgsquote haben Manager, nicht Software-Ingenieure.
  • Programmieren zu können bringt erstaunlich wenig: Softwareberufe verifizieren 34% der Sessions, die Code erzeugen, alle anderen Berufe 29%, und bei teilweisem Erfolg liegen beide Gruppen gleichauf, bei 89% und 88%.
  • Den Unterschied macht das Niveau des Nutzers. Einsteiger bekommen pro Prompt etwa 5 Agent-Aktionen und 600 Wörter bei 15% verifizierter Erfolgsquote; Experten bekommen 12 Aktionen und 3,200 Wörter bei 28 bis 33%.
  • Drei Gewohnheiten tragen fast den ganzen Gewinn: den eigenen Kontext in den Prompt packen, mit einem überprüfbaren Beleg enden und in der Session bleiben, wenn etwas schiefgeht, statt sie zu schließen.
  • Die Obergrenze ist für alle niedrig: Selbst Experten verifizieren höchstens ein Drittel der Sessions, und der Spitzenplatz der Manager könnte zum Teil ein Messartefakt sein.

Was die Quellen sagen

Die Studie ist ein Klassifikator-Durchlauf über 400,000 interaktive Claude-Code-Sessions von 235,000 Personen, aufgezeichnet zwischen Oktober 2025 und April 2026 s1. Niemand hat die Gespräche gelesen. Ein auf Sonnet 4.6 basierender Klassifikator hat jede Session bewertet, und seine Bewertungen wurden mit Telemetrie abgeglichen, also mit Commits, Codeänderungen und Testergebnissen; bei Sessions, die Code ändern, stimmen Klassifikator und Telemetrie in mehr als 90% der Fälle überein s1. Claude Code selbst ist der Terminal-Agent, der deine Dateien liest, Code schreibt und Befehle ausführt, ausgehend von einer Anfrage in normaler Sprache s2.

Drei Definitionen entscheiden, wie jede Zahl zu lesen ist. Verifizierter Erfolg heißt: Der Klassifikator hat harte Belege gefunden, dass das Ziel erreicht wurde, etwa bestandene Tests oder eine ausdrückliche Bestätigung des Nutzers. Teilweiser Erfolg heißt: Das Ziel wurde zumindest teilweise erreicht. Expertise ist keine Berufsbezeichnung: Der Klassifikator bewertet das Verhalten des Nutzers innerhalb der Session auf fünf Stufen von Einsteiger bis Experte, anhand von drei Signalen: Präzision der Anweisungen, was der Nutzer den Agent überprüfen lässt und ob der Nutzer den Agent korrigiert s1.

Das Ergebnis nach Berufen ist die Schlagzeile. Bei Sessions, die Code erzeugen, erreichen Softwareberufe 34% verifizierten Erfolg und alle anderen 29%, ein Abstand von fünf Punkten, der über die sieben Monate stabil blieb, während sich beide Gruppen verbesserten s1. Beim teilweisen Erfolg sind beide Gruppen gleichauf, 89% gegen 88% s1. Die zehn größten Berufsgruppen liegen alle innerhalb von sieben Punkten der Entwickler, und die Management-Gruppe steht an der Spitze s1. Anthropic nennt den Prädiktor, der tatsächlich zählt, Domänenexpertise: das Problem, das man löst, in der Tiefe zu kennen.

Die Arbeitsteilung erklärt, warum. In einer typischen Session trifft der Mensch etwa 70% der Planungsentscheidungen, also was gebaut wird, aber nur 20% der Ausführungsentscheidungen, also wie es geschrieben wird s1. Ein Manager, der genau weiß, was das Produkt leisten muss, hält die Hälfte, auf die es ankommt. Dieselbe Verschiebung zeigt sich in dem, wofür der Agent genutzt wird: Über die sieben Monate sank der Anteil der Debugging-Sessions von 33% auf 19%, das Ausführen von Software stieg von 14% auf 21%, Datenanalyse und Dokumentenerstellung verdoppelten sich fast, und der geschätzte Wert der durchschnittlichen, an den Agent übergebenen Aufgabe stieg um 27% s1.

Autonomie gibt jedem Satz mehr Gewicht. Eine typische Session enthält nur etwa vier Wortwechsel zwischen Nutzer und Agent, jeder Prompt löst im Schnitt rund zehn Aktionen aus, und ein einzelner Prompt löst manchmal mehr als hundert Aktionen aus s1. Wenn du nur viermal sprichst, ist die Präzision jeder Zeile der größte Teil deines Beitrags.

Auf der Stufenleiter stehen die praktischen Zahlen. Ein Einsteiger schreibt generische Anweisungen ohne Domänenwissen; jeder Prompt löst etwa 5 Agent-Aktionen aus und liefert rund 600 Wörter Arbeit, und der verifizierte Erfolg liegt höchstens bei 15% s1. Ein Experte schreibt Prompts voller Kontext; derselbe Agent verkettet 12 Aktionen und liefert 3,200 Wörter pro Anweisung, und der verifizierte Erfolg liegt zwischen 28% und 33% s1. Das ist etwa das Fünffache an gelieferter Arbeit und die doppelte Erfolgsquote mit demselben Werkzeug und demselben Abo, wobei die Person an der Tastatur die einzige Variable ist. Fast der gesamte Gewinn liegt zwischen Einsteiger und Fortgeschrittenem, und genau diesen Schritt decken die drei Gewohnheiten unten ab.

Die Gewohnheiten entsprechen den drei Signalen des Klassifikators. Präzision der Anweisungen: sag, wo gehandelt werden soll, womit und woran man ein fertiges Ergebnis erkennt. Verifikation: beende den Prompt mit einer prüfbaren Bedingung, führe die Tests aus, zeig mir das Rendering, bestätige, dass die Seite lädt; laut Studie unterscheidet das einen beurteilten von einem verifizierten Erfolg s1. Korrektur: Einsteiger nehmen die Ausgabe passiv hin und brechen viermal häufiger ab als andere Nutzer, sobald etwas schiefgeht, während das Problem in eigenen Worten neu zu erklären genau das ist, was das dritte Signal misst s1. Keine der drei verlangt eine Zeile Code.

Die Grenzen nennt die Studie selbst. Selbst Experten verifizieren zwischen 28% und 33% der Sessions, also enden zwei von drei Sessions ohne harten Beleg, dass das Ziel erreicht wurde, bestenfalls mit teilweisem Erfolg, der über 90% liegt s1. Das Ranking der Manager enthält eine mögliche Messverzerrung: Verifizierter Erfolg zählt ausdrückliche Nutzerbestätigungen, und klar zu bestätigen, dass Arbeit abgenommen ist, ist eine Gewohnheit von Managern s1. Und die Stichprobe besteht aus Claude-Code-Nutzern, einem Kommandozeilen-Publikum, das motivierter ist als der Durchschnitt, also ist nicht garantiert, dass in einem anderen Werkzeug dieselben Zahlen herauskommen s1. Der Community-Thread mit Einsteigertipps ist ein nützlicher Plausibilitätscheck aus der Gegenrichtung: Die Ratschläge, die Neulingen gegeben werden, decken sich mit den drei Signalen, Kontext geben, Prüfungen verlangen, weiter steuern s3.

Urteil: was die Studie stützt

Behauptung Status Grundlage
Man muss programmieren können, um funktionierenden Code vom Agent zu bekommen Überspringen 34% vs 29% verifiziert, 89% vs 88% teilweise, Manager an der Spitze s1
Den eigenen Kontext in den Prompt zu packen zahlt sich aus Behalten 5 vs 12 Aktionen, 600 vs 3,200 Wörter pro Prompt zwischen Einsteiger und Experte s1
Den Prompt mit einer Beleg-Bedingung zu beenden zahlt sich aus Behalten Verifikation ist eines der drei Signale des Klassifikators; sie trennt beurteilten von verifiziertem Erfolg s1
Nach einem Fehlschlag in der Session zu bleiben zahlt sich aus Behalten Einsteiger brechen viermal häufiger ab; Korrektur ist das dritte Signal s1
Expertenniveau macht den Agent verlässlich Überspringen Experten verifizieren weiterhin nur 28 bis 33% der Sessions s1
Manager sind darin besser als Ingenieure Mit Vorsicht testen Mögliche Verzerrung: Verifizierter Erfolg zählt ausdrückliche Nutzerbestätigungen s1
Diese Zahlen lassen sich auf andere KI-Werkzeuge übertragen Überspringen Die Stichprobe besteht nur aus Claude-Code-Nutzern s1

Das machst du am Montag

  • Nimm den letzten Prompt, den du an einen Agent geschickt hast, und schreib ihn mit drei Blöcken neu: wo gehandelt werden soll, womit (die bestehende Datei, Route, der Datensatz oder das Dokument) und woran man ein fertiges Ergebnis erkennt.
  • Hänge diese Woche an jeden Prompt eine Beleg-Klausel an: Tests ausführen, die Seite öffnen, prüfen, dass jeder Link auflöst, den Diff zeigen.
  • Wenn eine Session schiefläuft, schreib eine Korrektur, bevor du sie schließt: was passiert ist, was du erwartet hast, wo man nachsehen soll. Zähl, wie oft die nächste Runde es behebt.
  • Schreib die drei Fakten über dein Projekt auf, die nur du kennst (Zielgruppe, Randbedingungen, das, was sich nicht ändern darf), und füge sie oben in deine nächste Session ein.
  • Lass eine Aufgabe ohne Code vom Agent erledigen, einen Newsletter-Entwurf oder eine Preisüberarbeitung, mit denselben drei Blöcken, und vergleich das Ergebnis mit deiner üblichen Arbeitsweise.
  • Führ über fünf Sessions eine Strichliste: verifiziert, teilweise oder nichts. Vergleich sie mit den 15% der Einsteiger und den 28 bis 33% der Experten aus der Studie.
  • Wenn ein Block in deinem Prompt leer bleibt, weil du die Antwort nicht kennst, klär das mit einem Kollegen oder einem Dokument, bevor du die Session startest, nicht danach.

Weiterlesen

  • Lies den Methodikteil, bevor du irgendeine Zahl zitierst: Der Klassifikator ist Sonnet 4.6, abgeglichen mit Telemetrie bei mehr als 90% Übereinstimmung auf Sessions, die Code ändern s1.
  • Das Diagramm der Aktionen pro Prompt nach Niveau zeigt den Sprung vom Einsteiger zum Experten am klarsten, 5 auf 12 Aktionen und 600 auf 3,200 Wörter s1.
  • Der Abschnitt zur Aufgabenverteilung zeigt Debugging von 33% auf 19% fallend und das Ausführen von Software von 14% auf 21% steigend über sieben Monate, ein nützliches Argument, wenn jemand sagt, Agents seien nur zum Beheben von Bugs da s1.
  • Die Aufteilung 70% Planung gegen 20% Ausführung ist die Zahl für eine Teamdiskussion darüber, wer einen Agent steuern sollte s1.
  • Lies den Hinweis zur Verzerrung beim verifizierten Erfolg und den ausdrücklichen Nutzerbestätigungen noch einmal, bevor du das Manager-Ergebnis in einer Folie verwendest s1.
  • Wie der Agent im Terminal tatsächlich arbeitet, was er liest, schreibt und ausführt, erfährst du auf der Produktseite s2.
  • Im Thread mit Einsteigertipps tauschen Neulinge konkrete Prompt-Gewohnheiten aus; lies ihn mit den drei Signalen im Kopf und sortiere die Ratschläge danach, welchem Signal sie dienen s3.

Quellen

FAQ

Sagt die Studie, dass Nicht-Programmierer genauso gut sind wie Entwickler?

Nicht ganz. Entwickler behalten einen Vorsprung von fünf Punkten beim verifizierten Erfolg, 34% gegen 29%, und er blieb über sieben Monate stabil. Die Studie sagt, der Vorsprung sei klein und das Niveau des Nutzers innerhalb der Session sage weit mehr voraus als der Jobtitel.

Was zählt als verifizierter Erfolg?

Harte Belege, dass das Ziel erreicht wurde: bestandene Tests, ein funktionierendes Ergebnis, das der Klassifikator anhand der Telemetrie bestätigen kann, oder eine ausdrückliche Bestätigung des Nutzers. Dieser letzte Punkt ist der Grund, warum das Ergebnis der Manager möglicherweise verzerrt ist.

Kann ich ein Niveau aufsteigen, ohne programmieren zu lernen?

Ja. Der Klassifikator bewertet die Präzision der Anweisungen, was du den Agent überprüfen lässt und ob du ihn korrigierst. Alle drei beschreiben dein Problem und deinen Anspruch, nicht Code.

Warum ist die Obergrenze selbst für Experten so niedrig?

Die Studie zählt eine Session nur dann als verifiziert, wenn es einen Beleg gibt. Experten erreichen 28 bis 33% verifiziert, aber der teilweise Erfolg liegt über 90%, die meisten Sessions liefern also etwas; es fehlt der Beleg, dass es fertig ist.