AIDive

Anthropic analysierte 400.000 KI-Sessions. Coder verlieren

Von AIDive · Veröffentlicht am

Coding-Agents

Manager schlagen Entwickler beim KI-Coding

Anthropic ließ einen Klassifikator 400.000 Claude Code Sessions einzeln bewerten, um herauszufinden, wer mit einem Coding-Agent tatsächlich Erfolg hat. Die Gruppe mit der besten verifizierten Erfolgsquote sind nicht die Softwareentwickler. Es sind die Manager. Die zehn größten Berufsgruppen der Studie liegen alle innerhalb von sieben Punkten um die Entwickler, was bedeutet: Menschen, die keinen Code schreiben, liefern funktionierenden Code in fast derselben Quote wie Menschen, die das beruflich tun.

Wenn du dir je gesagt hast, diese Tools seien nichts für dich, weil du nicht programmieren kannst, sagt diese Studie das genaue Gegenteil. Programmieren zu können trennt nicht mehr die Erfolgreichen von den Erfolglosen, und die Studie benennt präzise, was es stattdessen tut.

Was Anthropic wirklich gemessen hat

Drei Definitionen verändern, wie du jede Zahl der Studie lesen solltest. Zuerst die Stichprobe: 400.000 interaktive Sessions von 235.000 Personen, aufgezeichnet zwischen Oktober 2025 und April 2026. Claude Code ist Anthropics Coding-Agent im Terminal: Du schreibst in normaler Sprache, was du willst, und er liest deine Dateien, schreibt den Code und führt die Befehle selbstständig aus.

Niemand bei Anthropic hat diese Konversationen von Hand gelesen. Ein Klassifikator auf Basis eines ihrer eigenen Modelle bewertete jede Session automatisch, und seine Bewertungen wurden gegen Telemetrie geprüft, also Commits, Codeänderungen und Testergebnisse. Bei Sessions, die Code verändern, stimmen Klassifikator und Telemetrie in mehr als 90 Prozent der Fälle überein.

Zweitens: Erfolg. Die Studie unterscheidet zwei Arten, und dieser Unterschied trägt alles Folgende. Ein bewerteter Erfolg bedeutet, dass der Klassifikator glaubt, das erklärte Ziel wurde erreicht. Ein verifizierter Erfolg ist härter: Er braucht Belege, etwa bestandene Tests, einen Commit oder die ausdrückliche Bestätigung des Nutzers. Der verifizierte Erfolg ist die hohe Messlatte hinter jeder Zahl unten, und sie ist anspruchsvoll, denn viele nützliche Sessions enden ohne formalen Beleg.

Drittens: die Expertise selbst. Der Klassifikator schaut nie auf deinen Jobtitel oder deinen Lebenslauf. Er liest dein Verhalten innerhalb der Session und bewertet es auf einer Fünf-Stufen-Skala von Anfänger bis Experte, anhand von nur drei Signalen: wie präzise deine Anweisungen sind, was du den Agent überprüfen lässt und ob einer von euch den anderen korrigiert. Dein Level misst deinen Griff auf das Problem in dieser Session, dieselbe Person kann also morgens Experte in ihrem Fach sein und abends Anfänger auf neuem Terrain.

Die fünf Stufen, von Anfänger bis Experte

Einen Anfänger erkennt man an einem Satz: generische Anweisungen ohne eingearbeitetes Fachwissen. Ein Experte schreibt Prompts voller Kontext, und derselbe Agent antwortet mit deutlich mehr autonomer Arbeit. Eine Aktion ist dabei ein konkreter Schritt des Agents, etwa eine Datei lesen, eine Funktion schreiben oder einen Befehl ausführen.

Metrik Anfänger Experte
Agent-Aktionen pro Prompt ~5 ~12
Wörter gelieferter Arbeit pro Prompt ~600 ~3.200
Verifizierte Erfolgsquote 15% 28 bis 33% (ab Fortgeschritten)
Abbruchquote, wenn eine Session schiefläuft 19% 5 bis 7% (alle Nicht-Anfänger)
In verifizierte Erfolge gerettete Problem-Sessions 4% 15%

Das ist fünfmal so viel gelieferte Arbeit aus demselben Tool im selben Abo. Die einzige Variable, die sich geändert hat, ist die Person an der Tastatur.

Das wichtigste Detail: Fast der gesamte Gewinn liegt zwischen Anfänger und Fortgeschritten, der Abstand zwischen Fortgeschritten und Experte ist moderat. Du musst kein Experte werden, um deine Erfolgsquote zu verdoppeln. Du musst aufhören, ein Anfänger zu sein.

Die brutalste Lücke zeigt sich, wenn eine Session schiefläuft. Wenn sich der Agent in Fehler und brechende Tests verrennt, brechen Anfänger in 19 Prozent der Fälle ab, gegenüber 5 bis 7 Prozent bei allen anderen. Und unter denen, die dranbleiben, verwandeln Anfänger nur 4 Prozent dieser Problem-Sessions in verifizierte Erfolge, Experten dagegen 15 Prozent. Das sind fast viermal so viele gerettete Sessions, allein weil die Person das Problem gut genug versteht, um den Agent umzulenken, statt ihm beim Untergehen zuzusehen. Der Unterschied zwischen den Stufen zeigt sich nicht, wenn alles funktioniert. Er zeigt sich beim ersten Stolperer.

Warum Programmieren-Können nicht mehr zählt

Fachwissen, in Anthropics Worten Domain-Expertise, heißt: das Problem, das du lösen willst, bis auf den Grund zu verstehen. Bei Sessions, die Code produzieren, ist die Lücke zwischen den Berufsgruppen klein und stabil:

Gruppe Verifizierter Erfolg Teilerfolg
Software-Berufe 34% 89%
Alle anderen Berufe 29% 88%

Fünf Punkte Unterschied, eine Lücke, die sich über die sieben Monate der Studie weder vergrößerte noch verkleinerte, während beide Gruppen besser wurden. Beim Teilerfolg, bei dem das Ziel zumindest teilweise erreicht wurde, liegen beide Gruppen gleichauf.

Die Studie zeigt auch, wo Fachwissen wirkt. In einer typischen Session trifft der Mensch etwa 70 Prozent der Planungsentscheidungen (was gebaut wird), aber nur 20 Prozent der Ausführungsentscheidungen (wie es geschrieben wird). Die Aufteilung existiert bereits: Du entscheidest das Was, der Agent übernimmt das Wie. Ein Manager, der genau weiß, was sein Produkt tun soll, hält den Hebel, der zählt, auch ohne eine einzige Zeile dessen zu schreiben, was der Agent produziert. Deshalb stehen Manager am Ende ganz oben im Ranking.

Die Nutzung über die sieben beobachteten Monate bestätigt, dass sich der Schwerpunkt verschiebt:

Aufgabentyp Beginn der Studie Ende der Studie
Debugging 33% der Sessions 19%
Software ausführen 14% 21%
Datenanalyse und Dokumente schreiben Ausgangswert fast verdoppelt

Die Leute nutzen den Agent nicht mehr nur, um Code zu reparieren, sie nutzen ihn, um ihre Arbeit zu erledigen. Im selben Zeitraum wuchs der geschätzte Wert der durchschnittlich übergebenen Aufgabe um 27 Prozent.

Autonomie verschiebt deine Rolle auf dieselbe Weise. Eine typische Session enthält nur etwa vier Wortwechsel zwischen Mensch und Agent, und jeder Prompt löst im Schnitt rund zehn Aktionen aus. Im Extremfall setzt ein einziger Prompt mehr als hundert Aktionen in Gang: eine Anweisung, und der Agent arbeitet allein das Äquivalent eines Nachmittags. Was du beiträgst, passt in wenige Sätze pro Session, und genau deshalb wiegt ihre Präzision so schwer. Wenn du nur viermal sprichst, zählt jeder Satz.

Dieselbe Aufgabe, geprompted wie ein Anfänger und wie ein Experte

Wir haben den Unterschied an einer Aufgabe nachgestellt, die jeder versteht: ein Kontaktformular zu einer kleinen Website hinzufügen.

Die Anfänger-Version ist der Prompt, den die Hälfte von uns immer noch tippt: neun Wörter, kein Kontext, keine Kriterien. Der Agent weiß nicht, wo die Site liegt, was das Formular erfasst oder wohin die Nachrichten gehen, also trifft er jede dieser Entscheidungen für dich, und du entdeckst seine Wahl erst am Ende. In unserem Durchlauf setzte er das Formular auf die Startseite, erfand ein Telefonfeld, nach dem niemand gefragt hatte, und verband die Einsendungen mit einer E-Mail-Adresse, die nicht existiert. Nichts davon ist ein Bug. Der Agent füllte die Lücken der Anfrage mit Vermutungen, und jede Vermutung war eine Chance, falsch zu liegen. Das ist das gemessene Anfängermuster: wenige Aktionen, ein kurzes Ergebnis und ungefähr eine Chance von eins zu sieben auf einen verifizierten Erfolg.

Die Experten-Version löst dieselbe Aufgabe ohne eine einzige Zeile Code im Prompt. Sie sagt, wo gehandelt werden soll (die About-Seite), was gebaut wird (drei präzise Felder), womit (die Send-Route, die bereits existiert) und vor allem, wie bewiesen wird, dass es fertig ist (Tests ausführen und das Formular im Browser zeigen). Kein einziges Stück dieser Information erfordert Programmierkenntnisse. Es erfordert, deine Site, deinen Bedarf und deinen Standard zu kennen, also dein Fachgebiet. Der Agent übernimmt von dort: Er liest die Seite, fügt das Formular hinzu, verdrahtet die Route, schreibt die Validierung und führt die Tests aus. Das ist die 12-Aktionen-Kette der Studie, ausgelöst durch die Präzision des Prompts, nicht durch das technische Talent seines Autors.

Den Experten-Prompt zu schreiben dauerte etwa dreißig Sekunden länger als den Anfänger-Prompt, und diese dreißig Sekunden nahmen dem Agent jede Gelegenheit zu raten. Die ganze Demonstration passt in einen Satz: Dasselbe Tool wird fünfmal produktiver, wenn die Anfrage das Fachwissen trägt.

Drei Gewohnheiten, die dich eine Stufe nach oben bringen

Die erste Gewohnheit: den Kontext geben, den nur du kennst, bevor der Agent ihn falsch errät. Der Klassifikator nennt das Anweisungspräzision. Jede Anfrage sollte sagen, wo gehandelt wird, womit und wie fertig aussieht. Drei Sätze genügen, und das funktioniert für jeden Beruf, nicht nur für Code: Ein Marketing-Prompt mit Zielgruppe, Constraints und Ziellinie erfüllt dieselben drei Blöcke. Wenn du einen der Blöcke nicht füllen kannst, ist das das Signal, dass die Unschärfe auf deiner Seite liegt, nicht auf der des Agents, und es lohnt sich, sie vor dem Start der Session zu klären.

Die zweite Gewohnheit: am Ende Belege verlangen, das zweite Signal des Klassifikators. Beende deine Prompts mit einer überprüfbaren Abschlussbedingung: führe die Tests aus, zeig mir das Ergebnis, prüfe, ob die Seite lädt. Ein Agent, von dem du keine Belege verlangst, liefert dir nicht überprüfbare Arbeit, und die Studie zeigt, dass genau das einen bewerteten von einem verifizierten Erfolg trennt. Dieser Beleg schützt auch dich, denn er erlaubt dir, die Arbeit abzunehmen, ohne den Code dahinter lesen zu können.

Die dritte Gewohnheit: im Loop bleiben, wenn es zu brechen beginnt. Lies nach, was der Agent zurückgibt, korrigiere ihn, wenn er falsch liegt, und schließe die Session nicht beim ersten Fehlschlag. Anfänger nehmen Output passiv an und brechen etwa viermal häufiger ab als alle anderen, sobald es klemmt, dabei zahlt sich genau hier das Level aus. Das Problem noch einmal in eigenen Worten zu erklären und auf das zu zeigen, was nicht deiner Erwartung entspricht, ist das Korrigieren des Agents, das dritte Signal des Klassifikators. Die Form einer guten Korrektur: was passiert, was erwartet wurde, wo man suchen soll. Immer noch keine Zeile Code, nur eine ehrliche Beschreibung der Lücke.

Die drei Gewohnheiten passen auf einen Notizzettel: Gib deinen Kontext, verlange Belege, bleib im Loop. Keine davon erfordert Programmieren zu lernen, und zusammen decken sie die Spanne zwischen 15 und 30 Prozent Erfolg ab.

Was die Studie nicht sagt

Selbst bei Experten liegt der verifizierte Erfolg maximal zwischen 28 und 33 Prozent. Zwei von drei Sessions enden ohne soliden Beleg, dass das Ziel erreicht wurde, bestenfalls mit einem Teilerfolg, der allerdings über 90 Prozent klettert. Eine Stufe aufzusteigen verdoppelt deine Chancen; unfehlbar macht es den Agent nicht.

Das Manager-Ranking verdient seine eigene Warnung. Anthropic merkt an, dass ein Messfehler möglich ist, denn verifizierter Erfolg zählt auch ausdrückliche Nutzerbestätigungen, und klar zu bestätigen, dass Arbeit abgenommen ist, ist ein Manager-Reflex. Hinzu kommt: Die Studie misst Claude Code Sessions, ein Terminal-Tool, dessen Publikum ohnehin motivierter ist als der Durchschnitt, nichts garantiert also, dass dieselben Zahlen in ChatGPT oder einem anderen Tool gelten. Behalte die grobe Richtung, nicht die Nachkommastellen: Präzision zahlt sich aus, Belege zahlen sich aus, und niemand kommt über ein Drittel Gewissheit hinaus.

Dein Level ist kein Etikett

Solltest du einsteigen, wenn du nicht programmieren kannst? Die Studie antwortet nach Gruppen. Wenn du dein Fach in- und auswendig kennst (dein Gebiet, deine Kunden, was ein gutes Ergebnis bedeutet), dann ja. Du bringst genau die Hälfte der Entscheidungen mit, die zählt, die Planungshälfte. Betrittst du aber ein Thema, das du noch nicht verstehst, wird der Agent diese Leere nicht füllen; er stopft sie mit Vermutungen, wie unser Kontaktformular auf der falschen Seite.

Die Erkenntnis passt in eine Entscheidung: Hör auf, deinen fehlenden Code als Handicap zu behandeln, und fang an, dein Wissen über das Problem als dein echtes Kapital zu sehen. Der Klassifikator bewertet nicht, wer du bist; er bewertet, wie du innerhalb der Session arbeitest, und das kann sich schon mit deiner nächsten ändern. Schreib die Anfrage mit deinem Kontext darin, beende sie mit dem Beleg, den du verlangst, und wenn es klemmt, formuliere neu, statt zu schließen. Wer nicht programmieren kann, startet mit denselben Chancen wie alle anderen. Die Studie hat es gerade an 400.000 Sessions bewiesen.

Quellen

Häufige Fragen

Was hat Anthropics Claude Code Studie zu 400.000 Sessions herausgefunden?
Ein Klassifikator bewertete 400.000 Claude Code Sessions von 235.000 Personen (Oktober 2025 bis April 2026) und fand heraus, dass Fachwissen, nicht Programmierkenntnis, Erfolg vorhersagt. Manager hatten die beste verifizierte Erfolgsquote, und Nicht-Software-Berufe verifizierten 29% gegenüber 34% bei Software-Berufen.
Kann man Claude Code nutzen, ohne programmieren zu können?
Ja, wenn du dein Fachgebiet kennst. Menschen treffen in einer typischen Session etwa 70% der Planungsentscheidungen, aber nur 20% der Ausführungsentscheidungen, zu wissen, was gebaut werden soll, zählt also mehr als zu wissen, wie man es schreibt. Nicht-Programmierer liefern funktionierenden Code in fast derselben Quote wie professionelle Entwickler.
Was ist ein verifizierter Erfolg in der Anthropic-Studie?
Ein verifizierter Erfolg erfordert Belege, dass das Ziel erreicht wurde: bestandene Tests, ein Commit oder eine ausdrückliche Nutzerbestätigung. Er ist strenger als ein bewerteter Erfolg, bei dem der Klassifikator das Ziel lediglich für erreicht hält. Selbst Experten verifizieren nur 28-33% ihrer Sessions.
Wie misst Anthropic die Expertise-Level von KI-Nutzern?
Ein Klassifikator bewertet jede Session auf einer Fünf-Stufen-Skala von Anfänger bis Experte anhand von drei Verhaltenssignalen: Anweisungspräzision, was der Nutzer den Agent überprüfen lässt und ob Nutzer und Agent einander korrigieren. Jobtitel spielen keine Rolle, dieselbe Person kann bei einer Aufgabe als Experte und bei einer anderen als Anfänger eingestuft werden.
Was unterscheidet Anfänger- und Experten-Prompts bei KI-Coding-Agents?
Experten-Prompts tragen Fachkontext: wo gehandelt wird, was gebaut wird, womit, und eine überprüfbare Abschlussbedingung wie das Ausführen der Tests. Jeder Experten-Prompt löst rund 12 Agent-Aktionen und 3.200 Wörter Arbeit aus, gegenüber 5 Aktionen und 600 Wörtern bei generischen Anfänger-Prompts, bei doppelter verifizierter Erfolgsquote.
Haben Entwickler mit KI-Coding-Agents noch einen Vorteil?
Einen kleinen: Software-Berufe verifizieren 34% der Code produzierenden Sessions gegenüber 29% bei allen anderen, eine Fünf-Punkte-Lücke, die über sieben Monate stabil blieb. Beim Teilerfolg liegen die Gruppen mit 89% und 88% gleichauf.

Ähnliche Videos