AIDive

Anthropic zbadał 400 000 sesji AI. Programiści przegrali

AIDive · Opublikowano

Agenty do kodowania

Menedżerowie biją programistów w kodowaniu z AI

Anthropic kazał klasyfikatorowi ocenić 400 000 sesji Claude Code, jedną po drugiej, żeby ustalić, kto naprawdę odnosi sukcesy z agentem kodującym. Grupą z najlepszym wskaźnikiem potwierdzonego sukcesu nie są inżynierowie oprogramowania. Są nią menedżerowie. Dziesięć największych grup zawodowych w badaniu mieści się w granicach siedmiu punktów od programistów, co oznacza, że ludzie, którzy nie piszą kodu, dostarczają działający kod niemal tak samo często jak ci, którzy robią to zawodowo.

Jeśli kiedykolwiek mówiłeś sobie, że te narzędzia nie są dla ciebie, bo nie umiesz programować, to badanie twierdzi dokładnie coś przeciwnego. Umiejętność kodowania nie oddziela już tych, którym się udaje, od tych, którym się nie udaje, a badanie precyzyjnie wskazuje, co oddziela.

Co Anthropic naprawdę zmierzył

Trzy definicje zmieniają sposób, w jaki należy czytać każdą liczbę w tym badaniu. Najpierw próba: 400 000 interaktywnych sesji od 235 000 osób, zarejestrowanych między październikiem 2025 a kwietniem 2026. Claude Code to agent kodujący Anthropic działający w terminalu: piszesz, czego chcesz, zwykłym językiem, a on czyta twoje pliki, pisze kod i sam uruchamia polecenia.

Nikt w Anthropic nie czytał tych rozmów ręcznie. Klasyfikator zbudowany na jednym z ich własnych modeli oceniał każdą sesję automatycznie, a jego oceny były sprawdzane z telemetrią, czyli commitami, zmianami w kodzie i wynikami testów. W sesjach modyfikujących kod klasyfikator i telemetria zgadzają się w ponad 90% przypadków.

Po drugie, sukces. Badanie śledzi dwa jego rodzaje i ta różnica niesie wszystko, co następuje dalej. Sukces oceniony oznacza, że klasyfikator uważa, iż zadeklarowany cel został osiągnięty. Sukces potwierdzony jest trudniejszy: wymaga dowodu, takiego jak przechodzące testy, commit albo jawne potwierdzenie wyniku przez użytkownika. Sukces potwierdzony to wysoko zawieszona poprzeczka stojąca za każdą liczbą poniżej, i to poprzeczka wymagająca, bo wiele użytecznych sesji kończy się bez formalnego dowodu.

Po trzecie, sama ekspertyza. Klasyfikator nigdy nie patrzy na twoje stanowisko ani CV. Czyta twoje zachowanie wewnątrz sesji i ocenia je w pięciostopniowej skali od nowicjusza do eksperta, używając tylko trzech sygnałów: jak precyzyjne są twoje instrukcje, o weryfikację czego prosisz agenta i czy któraś ze stron poprawia drugą. Twój poziom mierzy, jak dobrze trzymasz w garści problem z tej konkretnej sesji, więc ta sama osoba może być ekspertem w swoim fachu rano i nowicjuszem w nowym temacie wieczorem.

Pięć poziomów, od nowicjusza do eksperta

Nowicjusza rozpoznasz po jednym zdaniu: ogólnikowe instrukcje bez wplecionej wiedzy domenowej. Ekspert pisze prompty naładowane kontekstem, a ten sam agent odpowiada znacznie większą ilością samodzielnej pracy. Akcja to tutaj jeden konkretny ruch agenta, jak odczytanie pliku, napisanie funkcji albo uruchomienie polecenia.

Metryka Nowicjusz Ekspert
Akcje agenta na prompt ~5 ~12
Słowa dostarczonej pracy na prompt ~600 ~3200
Wskaźnik potwierdzonego sukcesu 15% 28-33% (od średniozaawansowanego w górę)
Odsetek porzuceń, gdy sesja idzie źle 19% 5-7% (wszyscy poza nowicjuszami)
Sesje w kłopotach zamienione w potwierdzony sukces 4% 15%

To pięć razy więcej dostarczonej pracy z tego samego narzędzia na tej samej subskrypcji. Jedyną zmienną, która się zmieniła, jest osoba przy klawiaturze.

Szczegół, który liczy się najbardziej: prawie cały zysk dzieje się między nowicjuszem a średniozaawansowanym, a różnica między średniozaawansowanym a ekspertem jest umiarkowana. Nie musisz zostać ekspertem, żeby podwoić swój wskaźnik sukcesu. Musisz przestać być nowicjuszem.

Najbrutalniejsza różnica ujawnia się, gdy sesja idzie źle. Kiedy agent wpada w spiralę błędów i psujących się testów, nowicjusze porzucają sesję w 19% przypadków, wobec 5-7% u wszystkich pozostałych. Wśród tych, którzy nie odpuszczają, nowicjusze zamieniają w potwierdzone sukcesy tylko 4% takich problematycznych sesji, podczas gdy eksperci 15%. To prawie cztery razy więcej uratowanych sesji, wyłącznie dlatego, że ta osoba rozumie problem na tyle dobrze, by przekierować agenta, zamiast patrzeć, jak tonie. Różnica między poziomami nie widać, gdy wszystko działa. Widać ją przy pierwszej czkawce.

Dlaczego umiejętność kodowania już się nie liczy

Wiedza domenowa, w rozumieniu Anthropic, to rozumienie problemu, który próbujesz rozwiązać, do samego dna. W sesjach, które produkują kod, różnica między zawodami jest mała i stabilna:

Grupa Sukces potwierdzony Sukces częściowy
Zawody programistyczne 34% 89%
Wszystkie pozostałe zawody 29% 88%

Pięć punktów różnicy, przepaść, która ani się nie poszerzyła, ani nie zwęziła przez siedem miesięcy badania, podczas gdy obie grupy stale się poprawiały. W sukcesie częściowym, gdzie cel został osiągnięty przynajmniej w części, obie grupy idą łeb w łeb.

Badanie pokazuje też, gdzie działa wiedza domenowa. W typowej sesji człowiek podejmuje około 70% decyzji planistycznych (co zbudować), ale tylko 20% decyzji wykonawczych (jak to napisać). Podział już istnieje: ty decydujesz „co", a agent zajmuje się „jak". Menedżer, który dokładnie wie, co jego produkt ma robić, trzyma dźwignię, która się liczy, nawet jeśli nie napisałby ani jednej linii tego, co produkuje agent. Właśnie dlatego menedżerowie lądują na szczycie rankingu.

Sposób użycia w ciągu siedmiu obserwowanych miesięcy potwierdza, że środek ciężkości się przesuwa:

Typ zadania Początek badania Koniec badania
Debugowanie 33% sesji 19%
Uruchamianie oprogramowania 14% 21%
Analiza danych i pisanie dokumentów punkt wyjścia niemal podwojone

Ludzie nie używają już agenta tylko do naprawiania kodu; używają go do prowadzenia swojej pracy. W tym samym okresie szacowana wartość przeciętnego zadania powierzanego agentowi wzrosła o 27%.

Autonomia przekształca twoją rolę w ten sam sposób. Typowa sesja mieści tylko około czterech wymian między człowiekiem a agentem, a każdy prompt uruchamia średnio około dziesięciu akcji. W skrajnych przypadkach pojedynczy prompt potrafi uruchomić ponad sto akcji: jedna instrukcja i agent pracuje sam przez odpowiednik całego popołudnia. To, co wnosisz, mieści się w kilku zdaniach na sesję, i właśnie dlatego ich precyzja waży tak dużo. Kiedy odzywasz się tylko cztery razy, liczy się każde zdanie.

To samo zadanie promptowane jak nowicjusz i jak ekspert

Odtworzyliśmy tę różnicę na zadaniu, które każdy rozumie: dodaniu formularza kontaktowego do małej strony internetowej.

Wersja nowicjusza to prompt, który połowa z nas wciąż wpisuje: dziewięć słów, zero kontekstu, zero kryteriów. Agent nie wie, gdzie żyje strona, co zbiera formularz ani dokąd trafiają wiadomości, więc podejmuje każdą z tych decyzji za ciebie, a ty odkrywasz jego wybory na końcu. W naszym przebiegu wrzucił formularz na stronę główną, wymyślił pole na telefon, o które nikt nie prosił, i podpiął wysyłkę pod adres e-mail, który nie istnieje. Nic z tego nie jest bugiem. Agent wypełnił dziury w zapytaniu domysłami, a każdy domysł był szansą na pomyłkę. To jest zmierzony wzorzec nowicjusza: mało akcji, krótki wynik i mniej więcej jedna szansa na siedem na potwierdzony sukces.

Wersja ekspercka załatwia to samo zadanie bez ani jednej linii kodu w prompcie. Mówi, gdzie działać (strona „o nas"), co zbudować (trzy precyzyjne pola), z czego budować (trasa wysyłki, która już istnieje), a przede wszystkim jak udowodnić, że jest zrobione (uruchom testy i pokaż formularz w przeglądarce). Żadna z tych informacji nie wymaga umiejętności programowania. Wymaga znajomości własnej strony, własnej potrzeby i własnego standardu, czyli twojej domeny. Agent przejmuje resztę: czyta stronę, dodaje formularz, podpina trasę, pisze walidację i uruchamia testy. To jest ten łańcuch 12 akcji z badania, uruchomiony precyzją promptu, a nie technicznym talentem jego autora.

Napisanie eksperckiego promptu zajęło około trzydziestu sekund więcej niż nowicjuszowskiego, a te trzydzieści sekund odebrało agentowi każdą okazję do zgadywania. Cała demonstracja mieści się w jednym zdaniu: to samo narzędzie staje się pięć razy produktywniejsze, gdy zapytanie niesie w sobie domenę.

Trzy nawyki, które przenoszą cię poziom wyżej

Pierwszy nawyk to podawanie kontekstu, który znasz tylko ty, zanim agent źle go zgadnie. Klasyfikator nazywa to precyzją instrukcji. Każde zapytanie powinno mówić, gdzie działać, z czego korzystać i jak wygląda skończona praca. Wystarczą trzy zdania i działa to w każdym zawodzie, nie tylko w kodzie: prompt marketingowy z grupą docelową, ograniczeniami i linią mety zalicza te same trzy bloki. Jeśli nie umiesz wypełnić któregoś z bloków, to sygnał, że mgła siedzi po twojej stronie, nie po stronie agenta, i warto ją rozwiać przed uruchomieniem sesji.

Drugi nawyk to żądanie dowodu na końcu, drugi sygnał klasyfikatora. Kończ prompty sprawdzalnym warunkiem ukończenia: uruchom testy, pokaż mi wynik, sprawdź, czy strona się ładuje. Agent, od którego nie żądasz dowodu, wręczy ci pracę nie do zweryfikowania, a badanie pokazuje, że dokładnie to oddziela sukces oceniony od potwierdzonego. Ten dowód też cię chroni, bo pozwala odebrać pracę bez umiejętności czytania kodu, który za nią stoi.

Trzeci nawyk to pozostawanie w pętli, gdy coś zaczyna się sypać. Czytaj, co agent zwraca, poprawiaj go, gdy się myli, i nie zamykaj sesji przy pierwszej porażce. Nowicjusze przyjmują wynik biernie i porzucają około cztery razy częściej niż wszyscy inni w momencie zacięcia, a przecież to właśnie tutaj poziom się opłaca. Ponowne wyjaśnienie problemu własnymi słowami i wskazanie, co nie zgadza się z twoim oczekiwaniem, to jest poprawianie agenta, trzeci sygnał klasyfikatora. Kształt dobrej korekty: co się dzieje, czego oczekiwano, gdzie patrzeć. Wciąż ani linii kodu, tylko uczciwy opis rozbieżności.

Trzy nawyki mieszczą się na karteczce samoprzylepnej: podaj kontekst, żądaj dowodu, zostań w pętli. Żaden nie wymaga nauki programowania, a razem pokrywają rozpiętość między 15 a 30% sukcesu.

Czego badanie nie mówi

Nawet u ekspertów potwierdzony sukces kończy się między 28 a 33%. Dwie sesje na trzy kończą się bez solidnego dowodu osiągnięcia celu, w najlepszym razie sukcesem częściowym, który faktycznie wspina się powyżej 90%. Awans o poziom podwaja twoje szanse; nie czyni agenta nieomylnym.

Ranking menedżerów zasługuje na własne zastrzeżenie. Anthropic zaznacza, że możliwy jest błąd pomiaru, bo sukces potwierdzony liczy też jawne potwierdzenia użytkownika, a wyraźne potwierdzanie, że praca została odebrana, to odruch menedżera. Do tego badanie mierzy sesje Claude Code, narzędzia terminalowego, którego publiczność jest już bardziej zmotywowana niż przeciętna, więc nic nie gwarantuje, że te same liczby utrzymają się w ChatGPT czy jakimkolwiek innym narzędziu. Zapamiętaj ogólne nachylenie, nie miejsca po przecinku: precyzja popłaca, dowód popłaca i nikt nie przekracza jednej trzeciej pewności.

Twój poziom to nie etykieta

Czy warto wskakiwać, jeśli nie umiesz programować? Badanie odpowiada grupami. Jeśli znasz swój fach na wylot (swoją domenę, swoich klientów, to, co oznacza dobry wynik), to tak. Wnosisz dokładnie tę połowę decyzji, która się liczy, połowę planistyczną. Ale jeśli wchodzisz w temat, którego jeszcze nie rozumiesz, agent nie wypełni tej pustki; zapcha ją domysłami, jak nasz formularz kontaktowy lądujący na złej stronie.

Wniosek mieści się w jednej decyzji: przestań traktować brak kodu jako upośledzenie i zacznij traktować znajomość problemu jako swój prawdziwy kapitał. Klasyfikator nie ocenia tego, kim jesteś; ocenia to, jak pracujesz wewnątrz sesji, a to może się zmienić już przy następnej. Napisz zapytanie ze swoim kontekstem w środku, zakończ je dowodem, którego żądasz, a gdy się zatnie, przeformułuj zamiast zamykać. Jeśli nie umiesz programować, startujesz z takimi samymi szansami jak wszyscy inni. Badanie właśnie to udowodniło na 400 000 sesji.

Źródła

Najczęstsze pytania

Co wykazało badanie Anthropic obejmujące 400 000 sesji Claude Code?
Klasyfikator ocenił 400 000 sesji Claude Code od 235 000 osób (październik 2025 do kwietnia 2026) i wykazał, że sukces przewiduje wiedza domenowa, a nie umiejętność programowania. Menedżerowie mieli najlepszy wskaźnik potwierdzonego sukcesu, a zawody nieprogramistyczne potwierdzały 29% wobec 34% dla zawodów programistycznych.
Czy można używać Claude Code bez umiejętności programowania?
Tak, jeśli znasz swoją domenę. W typowej sesji człowiek podejmuje około 70% decyzji planistycznych, ale tylko 20% decyzji wykonawczych, więc wiedza o tym, co zbudować, liczy się bardziej niż umiejętność zapisania tego. Osoby niekodujące dostarczają działający kod niemal tak samo często jak zawodowi programiści.
Czym jest sukces potwierdzony w badaniu Anthropic?
Sukces potwierdzony wymaga dowodu osiągnięcia celu: przechodzących testów, commita albo jawnego potwierdzenia przez użytkownika. Jest surowszy niż sukces oceniony, w którym klasyfikator jedynie uznaje cel za osiągnięty. Nawet eksperci potwierdzają tylko 28-33% sesji.
Jak Anthropic mierzy poziom ekspertyzy użytkowników AI?
Klasyfikator ocenia każdą sesję w pięciostopniowej skali od nowicjusza do eksperta na podstawie trzech sygnałów behawioralnych: precyzji instrukcji, tego, o weryfikację czego użytkownik prosi agenta, oraz tego, czy użytkownik i agent poprawiają się nawzajem. Nigdy nie patrzy na stanowiska, więc ta sama osoba może wypaść jako ekspert w jednym zadaniu i nowicjusz w innym.
Co odróżnia prompty nowicjusza od promptów eksperta w agentach kodujących?
Prompty eksperckie niosą kontekst domenowy: gdzie działać, co zbudować, z czego korzystać i sprawdzalny warunek ukończenia, jak uruchomienie testów. Każdy ekspercki prompt uruchamia około 12 akcji agenta i 3200 słów pracy, wobec 5 akcji i 600 słów przy ogólnikowych promptach nowicjusza, przy dwukrotnie wyższym wskaźniku potwierdzonego sukcesu.
Czy programiści wciąż mają przewagę przy agentach kodujących?
Niewielką: zawody programistyczne potwierdzają 34% sesji produkujących kod wobec 29% u pozostałych, pięć punktów różnicy stabilnych przez siedem miesięcy. W sukcesie częściowym grupy remisują: 89% i 88%.

Powiązane filmy