AIDive

Pakiet do filmu

400,000 sesji Claude Code od Anthropic: liczby, werdykt i lista kontrolna na poniedziałek

9 min czytania

TL;DR

  • Anthropic ocenił 400,000 sesji Claude Code od 235,000 osób i ustalił, że najlepszy zweryfikowany odsetek sukcesów mają menedżerowie, a nie inżynierowie oprogramowania.
  • Umiejętność programowania daje bardzo niewiele: zawody programistyczne weryfikują 34% sesji tworzących kod, wszystkie pozostałe 29%, a przy sukcesie częściowym obie grupy remisują, 89% i 88%.
  • O wyniku decyduje poziom użytkownika. Początkujący dostają około 5 akcji agenta i 600 słów na prompt przy 15% zweryfikowanych sukcesów; eksperci 12 akcji i 3,200 słów przy 28 do 33%.
  • Trzy nawyki dają prawie cały zysk: wpisz do promptu własny kontekst, zakończ weryfikowalnym dowodem i zostań w sesji, gdy coś się psuje, zamiast ją zamykać.
  • Sufit jest niski dla wszystkich: nawet eksperci weryfikują najwyżej jedną trzecią sesji, a pierwsze miejsce menedżerów może częściowo wynikać z artefaktu pomiaru.

Co mówią źródła

Badanie to przebieg klasyfikatora po 400,000 interaktywnych sesji Claude Code od 235,000 osób, zarejestrowanych między październikiem 2025 a kwietniem 2026 s1. Nikt nie czytał rozmów. Klasyfikator oparty na Sonnet 4.6 ocenił każdą sesję, a jego oceny porównano z telemetrią, czyli z commitami, zmianami w kodzie i wynikami testów; w sesjach modyfikujących kod klasyfikator i telemetria zgadzają się w ponad 90% przypadków s1. Sam Claude Code to agent terminalowy, który czyta twoje pliki, pisze kod i uruchamia polecenia na podstawie prośby w zwykłym języku s2.

Trzy definicje decydują o tym, jak czytać każdą liczbę. Zweryfikowany sukces oznacza, że klasyfikator znalazł twardy dowód osiągnięcia celu, na przykład przechodzące testy lub wyraźne potwierdzenie od użytkownika. Sukces częściowy oznacza, że cel osiągnięto przynajmniej w części. Ekspertyza nie jest tytułem zawodowym: klasyfikator ocenia zachowanie użytkownika w sesji na pięciu poziomach od nowicjusza do eksperta, według trzech sygnałów: precyzji instrukcji, tego, co użytkownik każe agentowi zweryfikować, i tego, czy poprawia agenta s1.

Wynik według zawodów to nagłówek. W sesjach tworzących kod zawody programistyczne osiągają 34% zweryfikowanego sukcesu, a wszyscy pozostali 29%, pięć punktów różnicy, stabilnych przez siedem miesięcy, gdy obie grupy się poprawiały s1. Przy sukcesie częściowym obie grupy są równe, 89% wobec 88% s1. Dziesięć największych grup zawodowych mieści się w granicach siedmiu punktów od programistów, a grupa menedżerska jest na szczycie s1. Predyktor, który faktycznie się liczy, Anthropic nazywa ekspertyzą dziedzinową: dogłębną znajomością problemu, który się rozwiązuje.

Podział pracy wyjaśnia dlaczego. W typowej sesji człowiek podejmuje około 70% decyzji planistycznych, czyli co zbudować, ale tylko 20% decyzji wykonawczych, czyli jak to napisać s1. Menedżer, który dokładnie wie, co produkt ma robić, trzyma tę połowę, która się liczy. To samo przesunięcie widać w tym, do czego używa się agenta: w ciągu siedmiu miesięcy udział sesji debugowania spadł z 33% do 19%, uruchamianie oprogramowania wzrosło z 14% do 21%, analiza danych i pisanie dokumentów prawie się podwoiły, a szacowana wartość przeciętnego zadania oddawanego agentowi wzrosła o 27% s1.

Autonomia nadaje każdemu zdaniu większą wagę. Typowa sesja zawiera tylko około czterech wymian między użytkownikiem a agentem, każdy prompt uruchamia średnio około dziesięciu akcji, a pojedynczy prompt czasem wywołuje ponad sto akcji s1. Gdy odzywasz się tylko cztery razy, precyzja każdej linijki to większość twojego wkładu.

Drabina poziomów to miejsce, gdzie leżą praktyczne liczby. Nowicjusz pisze ogólne instrukcje bez wiedzy dziedzinowej; każdy prompt uruchamia około 5 akcji agenta i zwraca około 600 słów pracy, a zweryfikowany sukces sięga najwyżej 15% s1. Ekspert pisze prompty naładowane kontekstem; ten sam agent łączy 12 akcji i produkuje 3,200 słów na instrukcję, a zweryfikowany sukces wynosi od 28% do 33% s1. To około pięciokrotnie więcej dostarczonej pracy i dwukrotnie wyższy odsetek sukcesów przy tym samym narzędziu i tej samej subskrypcji, a jedyną zmienną jest osoba przy klawiaturze. Prawie cały zysk leży między nowicjuszem a średniozaawansowanym, i ten krok obejmują trzy nawyki poniżej.

Nawyki odpowiadają trzem sygnałom klasyfikatora. Precyzja instrukcji: powiedz, gdzie działać, z czym i po czym poznać gotowy wynik. Weryfikacja: zakończ prompt sprawdzalnym warunkiem, uruchom testy, pokaż mi render, potwierdź, że strona się ładuje; badanie ustala, że to oddziela sukces oceniony od zweryfikowanego s1. Korekta: nowicjusze biernie przyjmują wynik i porzucają sesję cztery razy częściej niż inni użytkownicy, gdy tylko coś się psuje, a ponowne wyjaśnienie problemu własnymi słowami to dokładnie to, co mierzy trzeci sygnał s1. Żaden z trzech nie wymaga ani linijki kodu.

Ograniczenia podaje samo badanie. Nawet eksperci weryfikują od 28% do 33% sesji, więc dwie sesje na trzy kończą się bez twardego dowodu osiągnięcia celu, w najlepszym razie z sukcesem częściowym, który przekracza 90% s1. Ranking menedżerów niesie możliwe obciążenie pomiaru: zweryfikowany sukces liczy wyraźne potwierdzenia użytkownika, a jasne potwierdzanie, że praca jest przyjęta, to nawyk menedżerów s1. Próba to użytkownicy Claude Code, publiczność z wiersza poleceń bardziej zmotywowana niż przeciętna, więc nic nie gwarantuje takich samych liczb w innym narzędziu s1. Wątek społeczności o poradach dla początkujących to przydatny test z drugiej strony: rady dawane nowym osobom pokrywają się z trzema sygnałami, daj kontekst, proś o sprawdzenia, dalej kieruj s3.

Werdykt: co potwierdza badanie

Twierdzenie Status Podstawa
Trzeba umieć programować, żeby dostać od agenta działający kod Pomiń 34% vs 29% zweryfikowanych, 89% vs 88% częściowych, menedżerowie na szczycie s1
Wpisanie własnego kontekstu do promptu się opłaca Zachowaj 5 vs 12 akcji, 600 vs 3,200 słów na prompt między nowicjuszem a ekspertem s1
Zakończenie promptu warunkiem dowodu się opłaca Zachowaj Weryfikacja to jeden z trzech sygnałów klasyfikatora; oddziela sukces oceniony od zweryfikowanego s1
Pozostanie w sesji po porażce się opłaca Zachowaj Nowicjusze porzucają cztery razy częściej; korekta to trzeci sygnał s1
Osiągnięcie poziomu eksperta czyni agenta niezawodnym Pomiń Eksperci nadal weryfikują tylko 28 do 33% sesji s1
Menedżerowie robią to lepiej niż inżynierowie Wypróbuj ostrożnie Możliwe obciążenie: zweryfikowany sukces liczy wyraźne potwierdzenia użytkownika s1
Te liczby przenoszą się na inne narzędzia AI Pomiń Próba obejmuje tylko użytkowników Claude Code s1

Zrób to w poniedziałek

  • Weź ostatni prompt wysłany agentowi i przepisz go w trzech blokach: gdzie działać, z czym (istniejący plik, route, zbiór danych lub dokument) i po czym poznać gotowy wynik.
  • W tym tygodniu dodawaj klauzulę dowodu na końcu każdego promptu: uruchom testy, otwórz stronę, sprawdź, czy każdy link działa, pokaż diff.
  • Gdy sesja idzie źle, napisz jedną korektę, zanim ją zamkniesz: co się stało, czego oczekiwałeś, gdzie patrzeć. Policz, jak często następna tura to naprawia.
  • Zapisz trzy fakty o swoim projekcie, które znasz tylko ty (odbiorcy, ograniczenia, to, co nie może się zmienić) i wklej je na początku następnej sesji.
  • Przepuść przez agenta jedno zadanie niezwiązane z kodem, szkic newslettera albo przepisanie cennika, z tymi samymi trzema blokami, i porównaj wynik ze swoim zwykłym sposobem.
  • Prowadź zestawienie przez pięć sesji: zweryfikowana, częściowa albo nic. Porównaj je z przedziałami z badania, 15% dla nowicjuszy i 28 do 33% dla ekspertów.
  • Jeśli blok w twoim prompcie zostaje pusty, bo nie znasz odpowiedzi, ustal ją z kolegą albo w dokumencie przed uruchomieniem sesji, nie po.

Czytaj dalej

  • Przeczytaj sekcję o metodologii, zanim zacytujesz jakąkolwiek liczbę: klasyfikator to Sonnet 4.6, porównany z telemetrią przy ponad 90% zgodności w sesjach modyfikujących kod s1.
  • Wykres akcji na prompt według poziomu najlepiej pokazuje skok od nowicjusza do eksperta, od 5 do 12 akcji i od 600 do 3,200 słów s1.
  • Sekcja o strukturze zadań pokazuje debugowanie spadające z 33% do 19% i uruchamianie oprogramowania rosnące z 14% do 21% w siedem miesięcy, przydatny argument, gdy ktoś mówi, że agenci służą tylko do naprawiania bugów s1.
  • Podział 70% planowania wobec 20% wykonania to liczba do rozmowy w zespole o tym, kto powinien prowadzić agenta s1.
  • Przeczytaj jeszcze raz notkę o obciążeniu zweryfikowanego sukcesu wyraźnymi potwierdzeniami użytkownika, zanim użyjesz wyniku menedżerów na slajdzie s1.
  • Żeby zobaczyć, jak agent faktycznie działa w terminalu, co czyta, pisze i uruchamia, zacznij od strony produktu s2.
  • Wątek z poradami dla początkujących to miejsce, gdzie nowi wymieniają konkretne nawyki promptowania; czytaj go z trzema sygnałami w głowie i sortuj rady według tego, któremu sygnałowi służą s3.

Źródła

FAQ

Czy badanie mówi, że osoby niepiszące kodu są tak dobre jak programiści?

Nie do końca. Programiści zachowują pięciopunktową przewagę w zweryfikowanym sukcesie, 34% wobec 29%, stabilną przez siedem miesięcy. Badanie mówi, że przewaga jest niewielka, a poziom użytkownika w sesji przewiduje wynik znacznie lepiej niż nazwa stanowiska.

Co liczy się jako zweryfikowany sukces?

Twardy dowód osiągnięcia celu: przechodzące testy, działający wynik, który klasyfikator może potwierdzić z telemetrii, albo wyraźne potwierdzenie od użytkownika. Ten ostatni punkt jest powodem, dla którego wynik menedżerów niesie możliwe obciążenie.

Czy mogę wejść poziom wyżej bez nauki programowania?

Tak. Klasyfikator ocenia precyzję instrukcji, to, co każesz agentowi zweryfikować, i to, czy go poprawiasz. Wszystkie trzy to opisy twojego problemu i twojego standardu, nie kod.

Dlaczego sufit jest tak niski nawet dla ekspertów?

Badanie liczy sesję jako zweryfikowaną tylko wtedy, gdy istnieje dowód. Eksperci osiągają 28 do 33% zweryfikowanych, ale sukces częściowy przekracza 90%, więc większość sesji coś dostarcza; brakuje dowodu, że to skończone.