AIDive

Anthropic изучила 400 000 сессий ИИ. Кодеры проиграли

AIDive · Опубликовано

Кодинг-агенты

Менеджеры обходят разработчиков в ИИ-кодинге

Anthropic поручила классификатору оценить 400 000 сессий Claude Code, одну за другой, чтобы выяснить, кто на самом деле добивается успеха с кодинг-агентом. Группа с лучшим показателем подтверждённого успеха оказалась не инженерами-программистами. Это менеджеры. Десять крупнейших профессиональных групп исследования укладываются в пределах семи пунктов от разработчиков, а значит, люди, которые не пишут код, выпускают работающий код почти с той же частотой, что и те, кто занимается этим профессионально.

Если вы когда-нибудь говорили себе, что эти инструменты не для вас, потому что вы не умеете программировать, исследование утверждает ровно обратное. Умение писать код больше не отделяет тех, кто добивается успеха, от тех, кто терпит неудачу, и исследование точно называет, что отделяет.

Что на самом деле измерила Anthropic

Три определения меняют то, как следует читать каждое число в исследовании. Сначала выборка: 400 000 интерактивных сессий от 235 000 человек, записанных с октября 2025 по апрель 2026 года. Claude Code, это кодинг-агент Anthropic, живущий в терминале: вы описываете задачу обычным языком, а он читает ваши файлы, пишет код и сам запускает команды.

Никто в Anthropic не читал эти разговоры вручную. Классификатор, построенный на одной из их собственных моделей, автоматически оценил каждую сессию, а его оценки сверялись с телеметрией, то есть с коммитами, изменениями кода и результатами тестов. На сессиях, изменяющих код, классификатор и телеметрия совпадают более чем в 90% случаев.

Второе, успех. Исследование отслеживает два его вида, и на этой разнице держится всё дальнейшее. Оценочный успех означает, что классификатор считает заявленную цель достигнутой. Подтверждённый успех строже: ему нужны доказательства, такие как пройденные тесты, коммит или явное подтверждение пользователя. Подтверждённый успех и есть высокая планка за каждым числом ниже, и планка требовательная, ведь немало полезных сессий заканчивается без формальных доказательств.

Третье, сама экспертиза. Классификатор никогда не смотрит на должность или резюме. Он читает ваше поведение внутри сессии и оценивает его по пятиуровневой шкале от новичка до эксперта, опираясь всего на три сигнала: насколько точны ваши указания, что вы просите агента проверить и исправляет ли кто-то из вас другого. Ваш уровень измеряет, насколько крепко вы держите задачу в этой конкретной сессии, поэтому один и тот же человек может утром быть экспертом в своём ремесле, а вечером новичком в новой теме.

Пять уровней: от новичка до эксперта

Новичка можно узнать по одному предложению: общие указания без вплетённого знания предметной области. Эксперт пишет промпты, насыщенные контекстом, и тот же агент отвечает куда большим объёмом самостоятельной работы. Действие здесь, это один конкретный шаг агента, например чтение файла, написание функции или запуск команды.

Метрика Новичок Эксперт
Действий агента на промпт ~5 ~12
Слов готовой работы на промпт ~600 ~3 200
Подтверждённый успех 15% 28-33% (со среднего уровня и выше)
Доля брошенных сессий при сбое 19% 5-7% (все, кроме новичков)
Проблемные сессии, доведённые до подтверждённого успеха 4% 15%

Это в пять раз больше готовой работы от того же инструмента на той же подписке. Единственная изменившаяся переменная, это человек за клавиатурой.

Самая важная деталь: почти весь прирост происходит между новичком и средним уровнем, а разрыв между средним уровнем и экспертом скромен. Не нужно становиться экспертом, чтобы удвоить свой показатель успеха. Нужно перестать быть новичком.

Самый жестокий разрыв проявляется, когда сессия идёт наперекосяк. Когда агент скатывается в ошибки и падающие тесты, новички бросают сессию в 19% случаев против 5-7% у всех остальных. Среди тех, кто держится, новички доводят до подтверждённого успеха лишь 4% таких проблемных сессий, а эксперты 15%. Это почти в четыре раза больше спасённых сессий, и только потому, что человек понимает задачу достаточно хорошо, чтобы перенаправить агента, а не смотреть, как он тонет. Разница между уровнями не видна, когда всё работает. Она видна при первом сбое.

Почему умение кодить больше не решает

Знание предметной области, в терминах Anthropic, это понимание задачи, которую вы решаете, до самого дна. На сессиях, производящих код, профессиональный разрыв мал и стабилен:

Группа Подтверждённый успех Частичный успех
Профессии в разработке ПО 34% 89%
Все остальные профессии 29% 88%

Пять пунктов разницы, разрыв, который за семь месяцев исследования не расширился и не сузился, пока обе группы продолжали расти. По частичному успеху, когда цель достигнута хотя бы отчасти, группы идут вровень.

Исследование также показывает, где работает знание предметной области. В типичной сессии человек принимает около 70% решений по планированию (что строить), но лишь 20% решений по исполнению (как это написать). Разделение уже сложилось: вы решаете «что», агент берёт на себя «как». Менеджер, точно знающий, что должен делать его продукт, держит в руках именно тот рычаг, который важен, даже не написав ни строчки из того, что производит агент. Вот почему менеджеры оказываются на вершине рейтинга.

Использование за семь наблюдаемых месяцев подтверждает, что центр тяжести смещается:

Тип задач Начало исследования Конец исследования
Отладка 33% сессий 19%
Запуск программ 14% 21%
Анализ данных и работа с документами базовый уровень почти удвоились

Люди больше не используют агента только для починки кода; они используют его для ведения своей работы. За тот же период оценочная ценность средней задачи, переданной агенту, выросла на 27%.

Автономность переосмысляет вашу роль так же. Типичная сессия содержит лишь около четырёх обменов репликами между человеком и агентом, а каждый промпт запускает в среднем около десяти действий. В крайних случаях один промпт запускает более ста действий: одна инструкция, и агент работает в одиночку эквивалент целого рабочего дня после обеда. То, что вы вносите, умещается в несколько предложений на сессию, и именно поэтому их точность весит так много. Когда вы говорите всего четыре раза, каждое предложение на счету.

Одна задача: промпт новичка и промпт эксперта

Мы воспроизвели разницу на задаче, понятной каждому: добавить форму обратной связи на небольшой сайт.

Версия новичка, это промпт, который половина из нас всё ещё набирает: девять слов, без контекста, без критериев. Агент не знает, где живёт сайт, что собирает форма и куда уходят сообщения, поэтому он примет каждое из этих решений за вас, а вы обнаружите его выбор в самом конце. В нашем запуске он поместил форму на главную страницу, придумал поле для телефона, о котором никто не просил, и направил отправленные сообщения на несуществующий адрес почты. Ничто из этого не баг. Агент заполнил дыры в запросе догадками, и каждая догадка была шансом ошибиться. Это и есть измеренный паттерн новичка: мало действий, короткий результат и примерно один шанс из семи на подтверждённый успех.

Экспертная версия решает ту же задачу без единой строки кода в промпте. Она говорит, где действовать (страница «О нас»), что строить (три точных поля), из чего строить (уже существующий маршрут отправки) и, главное, как доказать, что готово (запустить тесты и показать форму в браузере). Ни один из этих фрагментов информации не требует умения программировать. Он требует знания своего сайта, своей потребности и своей планки качества, то есть вашей предметной области. Дальше агент берёт всё на себя: читает страницу, добавляет форму, подключает маршрут, пишет валидацию и запускает тесты. Это и есть цепочка из 12 действий из исследования, запущенная точностью промпта, а не техническим талантом его автора.

Написание экспертного промпта заняло примерно на тридцать секунд больше, чем новичкового, и эти тридцать секунд убрали у агента каждую возможность гадать. Вся демонстрация умещается в одно предложение: тот же инструмент становится в пять раз продуктивнее, когда запрос несёт в себе предметную область.

Три привычки, поднимающие на уровень выше

Первая привычка, это давать контекст, который знаете только вы, прежде чем агент угадает его неправильно. Классификатор называет это точностью указаний. Каждый запрос должен говорить, где действовать, с чем и как выглядит «готово». Трёх предложений достаточно, и это работает для любой профессии, не только для кода: маркетинговый промпт с аудиторией, ограничениями и финишной чертой закрывает те же три блока. Если вы не можете заполнить один из блоков, это сигнал, что размытость на вашей стороне, а не на стороне агента, и её стоит прояснить до запуска сессии.

Вторая привычка, требовать доказательств в конце, второй сигнал классификатора. Завершайте промпты проверяемым условием готовности: запусти тесты, покажи результат, проверь, что страница загружается. Агент, у которого не просят доказательств, вручит вам непроверяемую работу, а исследование показывает, что именно это отделяет оценочный успех от подтверждённого. Такое доказательство ещё и защищает вас, потому что позволяет принять работу, не умея читать код за ней.

Третья привычка, оставаться в игре, когда всё начинает ломаться. Перечитывайте то, что возвращает агент, исправляйте его, когда он неправ, и не закрывайте сессию при первой неудаче. Новички пассивно принимают вывод и бросают примерно в четыре раза чаще остальных в момент затыка, а ведь именно здесь уровень окупается. Заново объяснить проблему своими словами и указать на то, что не совпадает с ожиданием, это и есть исправление агента, третий сигнал классификатора. Форма хорошего исправления: что происходит, что ожидалось, куда смотреть. По-прежнему ни строки кода, лишь честное описание расхождения.

Три привычки умещаются на стикере: дай свой контекст, требуй доказательств, оставайся в игре. Ни одна не требует учиться программировать, а вместе они покрывают разбег между 15 и 30% успеха.

О чём исследование молчит

Даже у экспертов подтверждённый успех не превышает 28-33%. Две сессии из трёх заканчиваются без твёрдых доказательств достижения цели, в лучшем случае частичным успехом, который действительно поднимается выше 90%. Подъём на уровень удваивает ваши шансы; он не делает агента непогрешимым.

Рейтинг менеджеров заслуживает отдельной оговорки. Anthropic отмечает возможное смещение измерения: подтверждённый успех засчитывает и явные подтверждения пользователя, а чётко подтвердить, что работа принята, это рефлекс менеджера. Вдобавок исследование измеряет сессии Claude Code, терминального инструмента, чья аудитория уже мотивированнее среднего, поэтому ничто не гарантирует, что те же числа сохранятся в ChatGPT или любом другом инструменте. Держите в голове общий наклон, а не десятые доли: точность окупается, доказательства окупаются, и никто не переваливает за треть уверенности.

Ваш уровень не ярлык

Стоит ли начинать, если вы не умеете программировать? Исследование отвечает по группам. Если вы знаете своё ремесло вдоль и поперёк (свою предметную область, своих клиентов, что означает хороший результат), тогда да. Вы приносите ровно ту половину решений, которая важна, половину планирования. Но если вы входите в тему, которую пока не понимаете, агент не заполнит эту пустоту; он набьёт её догадками, как наша форма обратной связи, оказавшаяся не на той странице.

Вывод умещается в одно решение: перестаньте считать отсутствие кода своим недостатком и начните считать знание задачи своим настоящим капиталом. Классификатор оценивает не то, кто вы; он оценивает то, как вы работаете внутри сессии, а это может измениться уже в следующей. Напишите запрос со своим контекстом, завершите его доказательством, которое требуете, а когда всё заклинит, переформулируйте вместо того, чтобы закрывать. Если вы не умеете программировать, вы стартуете с теми же шансами, что и все остальные. Исследование только что доказало это на 400 000 сессий.

Источники

Частые вопросы

Что показало исследование Anthropic по 400 000 сессий Claude Code?
Классификатор оценил 400 000 сессий Claude Code от 235 000 человек (октябрь 2025 - апрель 2026) и выяснил, что успех предсказывает знание предметной области, а не навык программирования. Лучший подтверждённый успех у менеджеров, а профессии вне разработки ПО подтверждали 29% против 34% у разработчиков.
Можно ли использовать Claude Code без умения программировать?
Да, если вы знаете свою предметную область. В типичной сессии человек принимает около 70% решений по планированию и лишь 20% решений по исполнению, поэтому знать, что строить, важнее, чем уметь это написать. Люди без навыков кода выпускают работающий код почти с той же частотой, что и профессиональные разработчики.
Что такое подтверждённый успех в исследовании Anthropic?
Подтверждённый успех требует доказательств достижения цели: пройденных тестов, коммита или явного подтверждения пользователя. Он строже оценочного успеха, при котором классификатор лишь считает цель достигнутой. Даже эксперты подтверждают только 28-33% сессий.
Как Anthropic измеряет уровни экспертизы пользователей ИИ?
Классификатор оценивает каждую сессию по пятиуровневой шкале от новичка до эксперта по трём поведенческим сигналам: точность указаний, что пользователь просит агента проверить и исправляют ли пользователь и агент друг друга. Он не смотрит на должности, поэтому один человек может быть экспертом в одной задаче и новичком в другой.
Чем отличаются промпты новичка и эксперта для кодинг-агентов?
Экспертные промпты несут контекст предметной области: где действовать, что строить, из чего строить и проверяемое условие готовности, например запуск тестов. Каждый экспертный промпт запускает около 12 действий агента и 3 200 слов работы против 5 действий и 600 слов у общих новичковых промптов, при вдвое большем подтверждённом успехе.
Есть ли у разработчиков ещё преимущество при работе с ИИ-агентами?
Небольшое: профессии в разработке ПО подтверждают 34% сессий, производящих код, против 29% у остальных, и этот разрыв в пять пунктов оставался стабильным семь месяцев. По частичному успеху группы идут вровень: 89% и 88%.

Похожие видео