AIDive

Пакет к видео

400,000 сессий Claude Code от Anthropic: цифры, вердикт и чек-лист на понедельник

9 мин чтения

TL;DR

  • Anthropic оценила 400,000 сессий Claude Code от 235,000 человек и выяснила, что лучший подтвержденный процент успеха у менеджеров, а не у инженеров-программистов.
  • Умение писать код дает очень мало: программистские профессии подтверждают 34% сессий, в которых создается код, все остальные профессии 29%, а по частичному успеху обе группы почти равны: 89% и 88%.
  • Результат определяет уровень пользователя. Новичок получает около 5 действий агента и 600 слов на один промпт при 15% подтвержденного успеха; эксперт получает 12 действий и 3,200 слов при 28-33%.
  • Почти весь прирост дают три привычки: добавлять в промпт собственный контекст, заканчивать проверяемым доказательством и оставаться в сессии, когда что-то ломается, а не закрывать ее.
  • Потолок низкий для всех: даже эксперты подтверждают не больше трети сессий, а первое место менеджеров отчасти может быть артефактом измерения.

Что говорят источники

Исследование представляет собой прогон классификатора по 400,000 интерактивных сессий Claude Code от 235,000 человек, записанных с октября 2025 по апрель 2026 s1. Никто не читал сами диалоги. Классификатор на базе Sonnet 4.6 оценил каждую сессию, а оценки сверили с телеметрией: коммитами, изменениями кода и результатами тестов. В сессиях, где код меняется, классификатор и телеметрия совпадают более чем в 90% случаев s1. Сам Claude Code это терминальный агент, который читает ваши файлы, пишет код и запускает команды по запросу на обычном языке s2.

Три определения задают смысл всех цифр. Подтвержденный успех означает, что классификатор нашел жесткое свидетельство достижения цели, включая прошедшие тесты или явное подтверждение от пользователя. Частичный успех означает, что цель достигнута хотя бы отчасти. Экспертность это не должность: классификатор оценивает, как пользователь ведет себя внутри сессии, по пяти уровням от новичка до эксперта, по трем сигналам: точность инструкций, что пользователь просит агента проверить и исправляет ли пользователь агента s1.

Главный результат касается профессий. В сессиях, где создается код, программистские профессии достигают 34% подтвержденного успеха, остальные 29%. Разрыв в пять пунктов оставался стабильным все семь месяцев, пока обе группы улучшались s1. По частичному успеху группы на одном уровне, 89% против 88% s1. Десять крупнейших профессиональных групп лежат в пределах семи пунктов от разработчиков, а группа менеджмента находится на вершине s1. Предиктор, который действительно важен, Anthropic называет доменной экспертизой: глубоким знанием задачи, которую вы решаете.

Объясняет это разделение труда. В типичной сессии человек принимает около 70% решений по планированию, то есть что строить, но только 20% решений по исполнению, то есть как это писать s1. Менеджер, который точно знает, что должен делать продукт, держит в руках ту половину, которая решает. Тот же сдвиг виден в том, для чего люди используют агента: за семь месяцев доля сессий с отладкой упала с 33% до 19%, запуск ПО вырос с 14% до 21%, анализ данных и написание документов выросли почти вдвое, а оценочная стоимость средней задачи, передаваемой агенту, выросла на 27% s1.

Автономия делает каждую фразу весомее. В типичной сессии всего около четырех обменов между пользователем и агентом, каждый промпт запускает в среднем около десяти действий, а один промпт иногда запускает более ста действий s1. Когда вы говорите всего четыре раза, точность каждой строки составляет почти весь ваш вклад.

Практические цифры лежат в лестнице уровней. Новичок пишет общие инструкции без доменных знаний; каждый промпт запускает около 5 действий агента и возвращает примерно 600 слов работы, а подтвержденный успех не поднимается выше 15% s1. Эксперт пишет промпты, насыщенные контекстом; тот же агент выстраивает цепочку из 12 действий и выдает 3,200 слов на инструкцию, а подтвержденный успех составляет от 28% до 33% s1. Это примерно в пять раз больше выполненной работы и вдвое выше доля успеха при том же инструменте и той же подписке, где единственная переменная это человек за клавиатурой. Почти весь этот прирост приходится на переход от новичка к среднему уровню, и именно его покрывают три привычки ниже.

Привычки соответствуют трем сигналам классификатора. Точность инструкций: скажите, где действовать, с чем и как выглядит готовый результат. Проверка: закончите промпт проверяемым условием, запусти тесты, покажи рендер, убедись, что страница загружается; исследование показывает, что именно это отделяет оцененный успех от подтвержденного s1. Коррекция: новички пассивно принимают результат и бросают сессию в четыре раза чаще остальных, как только что-то ломается, а повторное объяснение проблемы своими словами как раз и измеряет третий сигнал s1. Ни один из трех не требует ни строки кода.

Ограничения указаны в самом исследовании. Даже эксперты подтверждают от 28% до 33% сессий, то есть две сессии из трех заканчиваются без жесткого доказательства достижения цели, в лучшем случае с частичным успехом, который действительно превышает 90% s1. Рейтинг менеджеров несет возможное смещение измерения: подтвержденный успех учитывает явные подтверждения пользователя, а ясно подтверждать, что работа принята, это привычка менеджера s1. И выборка состоит из пользователей Claude Code, аудитории командной строки, которая мотивирована выше среднего, так что нет гарантии тех же цифр в другом инструменте s1. Обсуждение советов для новичков в сообществе служит полезной проверкой с другой стороны: советы, которые люди дают новичкам, совпадают с тремя сигналами: дай контекст, проси проверки, продолжай рулить s3.

Вердикт: что подтверждает исследование

Утверждение Статус Основание
Нужно уметь программировать, чтобы получить рабочий код от агента Skip 34% против 29% подтвержденных, 89% против 88% частичных, менеджеры на вершине s1
Собственный контекст в промпте окупается Keep 5 против 12 действий, 600 против 3,200 слов на промпт между новичком и экспертом s1
Окончание промпта условием доказательства окупается Keep Проверка это один из трех сигналов классификатора; она отделяет оцененный успех от подтвержденного s1
Оставаться в сессии после сбоя окупается Keep Новички бросают в четыре раза чаще; коррекция это третий сигнал s1
Уровень эксперта делает агента надежным Skip Эксперты по-прежнему подтверждают только 28-33% сессий s1
Менеджеры справляются с этим лучше инженеров Try, с осторожностью Возможное смещение: подтвержденный успех учитывает явные подтверждения пользователя s1
Эти цифры переносятся на другие ИИ-инструменты Skip Выборка состоит только из пользователей Claude Code s1

Сделайте в понедельник

  • Возьмите последний промпт, отправленный агенту, и перепишите его с тремя блоками: где действовать, с чем (существующий файл, маршрут, датасет или документ) и как выглядит готовый результат.
  • Добавьте в конец каждого промпта на этой неделе условие проверки: запусти тесты, открой страницу, проверь, что все ссылки открываются, покажи diff.
  • Когда сессия идет не так, напишите одну коррекцию, прежде чем закрывать ее: что произошло, чего вы ожидали, куда смотреть. Посчитайте, как часто следующий ход это исправляет.
  • Запишите три факта о вашем проекте, которые знаете только вы (аудитория, ограничения, то, что менять нельзя), и вставьте их в начало следующей сессии.
  • Прогоните через агента одну задачу без кода, черновик рассылки или переписывание прайса, с теми же тремя блоками и сравните результат с привычным способом.
  • Ведите счет пять сессий: подтверждено, частично или ничего. Сравните с полосами исследования: 15% у новичков и 28-33% у экспертов.
  • Если какой-то блок в вашем промпте остается пустым, потому что вы не знаете ответа, выясните его с коллегой или по документу до запуска сессии, а не после.

Читать дальше

  • Прочитайте раздел о методологии, прежде чем цитировать любую цифру: классификатор это Sonnet 4.6, сверенный с телеметрией с совпадением более 90% на сессиях, меняющих код s1.
  • График действий на промпт по уровням лучше всего показывает скачок от новичка к эксперту: от 5 до 12 действий и от 600 до 3,200 слов s1.
  • Раздел о структуре задач показывает падение отладки с 33% до 19% и рост запуска ПО с 14% до 21% за семь месяцев, хороший аргумент, когда кто-то говорит, что агенты нужны только для исправления багов s1.
  • Соотношение 70% планирования и 20% исполнения это цифра, которую стоит принести на командное обсуждение, кто должен управлять агентом s1.
  • Перечитайте примечание о смещении в подтвержденном успехе и явных подтверждениях пользователя, прежде чем использовать результат менеджеров на слайде s1.
  • Чтобы понять, как агент реально работает в терминале, что он читает, пишет и запускает, начните со страницы продукта s2.
  • В ветке с советами для новичков люди обмениваются конкретными привычками промптов; читайте ее с учетом трех сигналов и сортируйте советы по тому, какому сигналу они служат s3.

Источники

  • How AI use changes with expertise: lessons from 400,000 Claude Code sessions, Anthropic. Почему стоит прочитать: каждая цифра в этом наборе взята отсюда, а методология и примечания о смещении меняют прочтение главного вывода.
  • Claude Code, Anthropic. Почему стоит прочитать: агент, которого измеряло исследование, и что он делает в терминальной сессии.
  • Beginner Claude Code tips (community discussion), Reddit r/ClaudeAI. Почему стоит прочитать: практические советы, которые можно сравнить с тремя сигналами исследования.

FAQ

Значит ли исследование, что люди без навыков кода не хуже разработчиков?

Не совсем. У разработчиков сохраняется преимущество в пять пунктов по подтвержденному успеху, 34% против 29%, и оно оставалось стабильным семь месяцев. Исследование говорит, что разрыв небольшой, а уровень пользователя внутри сессии предсказывает результат гораздо лучше, чем должность.

Что считается подтвержденным успехом?

Жесткое свидетельство того, что цель достигнута: прошедшие тесты, рабочий результат, который классификатор может подтвердить по телеметрии, или явное подтверждение от пользователя. Именно последний пункт объясняет возможное смещение в результате менеджеров.

Можно ли подняться на уровень выше, не учась программировать?

Да. Классификатор оценивает точность инструкций, что вы просите агента проверить и исправляете ли вы его. Все три это описание вашей задачи и вашего стандарта, а не код.

Почему потолок так низок даже у экспертов?

Исследование засчитывает сессию как подтвержденную только при наличии доказательства. Эксперты достигают 28-33% подтвержденных, но частичный успех превышает 90%, так что большинство сессий что-то дает; не хватает доказательства, что работа завершена.