AIDive

動画パック

Anthropic の Claude Code 40万セッション調査:数字、判定、月曜のチェックリスト

9 分で読めます

TL;DR

  • Anthropic は 235,000 人による 400,000 件の Claude Code セッションを採点し、検証済み成功率が最も高かったのはソフトウェアエンジニアではなくマネージャーだったと発表しました。
  • コードが書けることの効果はごくわずかです。コードを生成したセッションのうち、検証済み成功はソフトウェア職で 34%、それ以外の職種で 29%、部分的成功は 89% と 88% でほぼ並びます。
  • 差を生むのはユーザーのレベルです。初心者はプロンプト 1 回あたりエージェントの動作が約 5 回、600 語で、検証済み成功率は 15%。熟練者は 12 回、3,200 語で、28 から 33% です。
  • 成果のほとんどは 3 つの習慣で説明できます。自分のコンテキストをプロンプトに入れること、検証できる証拠で締めること、壊れたときにセッションを閉じず中に留まることです。
  • 上限は誰にとっても低いままです。熟練者でも検証済みはせいぜい 3 件に 1 件で、マネージャーの首位は一部が測定上のアーティファクトかもしれません。

ソースが語ること

この調査は、2025 年 10 月から 2026 年 4 月に記録された 235,000 人による 400,000 件の対話型 Claude Code セッションを分類器で採点したものです s1。会話を人が読んだわけではありません。Sonnet 4.6 を基にした分類器が各セッションを採点し、その結果をコミット、コード変更、テスト結果といったテレメトリと突き合わせています。コードを変更するセッションでは、分類器とテレメトリの一致率は 90% を超えます s1。Claude Code 自体は、平易な言葉での依頼からファイルを読み、コードを書き、コマンドを実行するターミナルエージェントです s2。

数字の読み方を決める定義が 3 つあります。検証済み成功とは、テストの通過やユーザーの明示的な確認など、目標が達成された確かな証拠を分類器が見つけたことを指します。部分的成功とは、目標が少なくとも部分的に達成されたことです。専門性は職名ではありません。分類器はセッション内でのユーザーの振る舞いを、初心者から熟練者までの 5 段階で採点します。使う信号は 3 つで、指示の精度、ユーザーがエージェントに何を検証させるか、ユーザーがエージェントを修正するかどうかです s1。

職種別の結果が最大の見どころです。コードを生成するセッションでは、検証済み成功がソフトウェア職で 34%、それ以外で 29% でした。5 ポイントの差は、両グループが改善した 7 か月間ずっと安定していました s1。部分的成功では両者は並び、89% 対 88% です s1。最大規模の 10 職種グループはすべて開発者から 7 ポイント以内に収まり、管理職グループが首位です s1。本当に効く予測因子を、Anthropic はドメインの専門性と呼んでいます。解こうとしている問題を深く知っていることです。

役割分担がその理由を説明します。典型的なセッションでは、人間は計画の判断(何を作るか)の約 70% を担いますが、実行の判断(どう書くか)は 20% にとどまります s1。プロダクトが何をすべきかを正確に知っているマネージャーは、重要な半分を握っています。同じ変化はエージェントの使い方にも表れています。7 か月の間に、デバッグのセッションは 33% から 19% に減り、ソフトウェアの実行は 14% から 21% に増え、データ分析と文書作成はほぼ倍増し、エージェントに任せるタスクの平均的な推定価値は 27% 上がりました s1。

自律性が高いほど、一文の重みは増します。典型的なセッションでのユーザーとエージェントのやり取りは約 4 往復で、プロンプト 1 回で平均約 10 回の動作が走り、1 回のプロンプトで 100 回を超える動作が起きることもあります s1。話す機会が 4 回しかないなら、1 行ごとの精度があなたの貢献のほとんどです。

実用的な数字はレベルの階段にあります。初心者は、ドメイン知識の入っていない一般的な指示を書きます。プロンプト 1 回でエージェントの動作は約 5 回、返ってくる成果物は約 600 語で、検証済み成功は 15% が上限です s1。熟練者はコンテキストを詰め込んだプロンプトを書きます。同じエージェントが 12 回の動作を連鎖させ、指示 1 回あたり 3,200 語を出力し、検証済み成功は 28% から 33% に収まります s1。同じツール、同じサブスクリプションで、成果物は約 5 倍、成功率は 2 倍です。変数はキーボードの前に座っている人だけです。この向上のほとんどは初心者から中級者の間にあり、下の 3 つの習慣はまさにその段階をカバーします。

習慣は分類器の 3 つの信号に対応します。指示の精度は、どこで、何を使って作業し、完成形がどうなっているかを伝えることです。検証は、プロンプトを確認できる条件で締めることです。テストを実行する、レンダリング結果を見せる、ページが読み込まれることを確認する、といった形です。調査によれば、これが評価された成功と検証された成功を分けます s1。修正については、初心者は出力を受け身で受け入れ、何かが壊れるとほかのユーザーの 4 倍の頻度で諦めます。一方、問題を自分の言葉で説明し直すことこそ、3 つ目の信号が測っているものです s1。3 つのどれも、コードを 1 行も要求しません。

限界は調査自身が述べています。熟練者でも検証済みは 28% から 33% のセッションにとどまり、3 件のうち 2 件は、目標が達成されたという確かな証拠なしに終わります。部分的成功まで含めれば、90% を超えます s1。マネージャーの順位には測定上のバイアスの可能性があります。検証済み成功にはユーザーの明示的な確認が含まれ、成果を受け入れたとはっきり伝えるのはマネージャーの習慣だからです s1。さらに、対象は Claude Code のユーザー、つまり平均よりもともと意欲の高いコマンドライン利用者なので、別のツールで同じ数字になる保証はありません s1。初心者向けヒントのコミュニティスレッドは、逆方向からの妥当性チェックになります。初心者に贈られる助言は 3 つの信号と一致しています。コンテキストを渡す、確認を求める、舵を取り続ける、です s3。

判定:調査が裏づけること

主張 判定 根拠
エージェントから動くコードを得るにはコードが書ける必要がある 不要 検証済み 34% 対 29%、部分的 89% 対 88%、マネージャーが首位 s1
自分のコンテキストをプロンプトに入れると効果がある 採用 初心者と熟練者で 5 対 12 回の動作、プロンプトあたり 600 対 3,200 語 s1
証明条件でプロンプトを締めると効果がある 採用 検証は分類器の 3 つの信号の 1 つで、評価された成功と検証された成功を分ける s1
失敗後もセッションに留まると効果がある 採用 初心者は 4 倍の頻度で諦める。修正は 3 つ目の信号 s1
熟練者のレベルに達すればエージェントは信頼できる 不要 熟練者でも検証済みは 28 から 33% のセッションだけ s1
マネージャーはエンジニアよりこれが得意 注意して試す バイアスの可能性:検証済み成功はユーザーの明示的な確認を数える s1
この数字はほかの AI ツールにも当てはまる 不要 対象は Claude Code ユーザーのみ s1

月曜にやること

  • 直近にエージェントへ送ったプロンプトを、3 つのブロックで書き直す。どこで作業するか、何を使うか(既存のファイル、ルート、データセット、ドキュメント)、完成形はどうなっているか。
  • 今週のすべてのプロンプトの末尾に証明の一文を足す。テストを実行する、ページを開く、すべてのリンクが解決することを確認する、diff を見せる。
  • セッションがうまくいかなくなったら、閉じる前に修正を 1 回書く。何が起きたか、何を期待していたか、どこを見るか。次のターンで直る頻度を数える。
  • プロジェクトについて自分しか知らない 3 つの事実(対象読者、制約、変えてはいけないもの)を書き出し、次のセッションの冒頭に貼る。
  • コード以外のタスクを 1 つ、ニュースレターの下書きや料金表の書き直しなどを、同じ 3 つのブロックでエージェントに任せ、いつものやり方の結果と比べる。
  • 5 セッションの間、検証済み、部分的、成果なしの集計をつける。調査の初心者 15% と熟練者 28 から 33% の帯と比べる。
  • 答えがわからずプロンプトのブロックが空のままなら、セッションを始める前に、同僚やドキュメントで解決する。始めた後ではなく。

さらに読む

  • 数字を引用する前に方法論のセクションを読むこと。分類器は Sonnet 4.6 で、コードを変更するセッションではテレメトリとの一致が 90% を超えます s1。
  • レベル別のプロンプトあたりの動作数のグラフは、初心者から熟練者への飛躍が最もよくわかる図です。動作は 5 から 12 回、語数は 600 から 3,200 です s1。
  • タスク構成のセクションでは、7 か月でデバッグが 33% から 19% に下がり、ソフトウェアの実行が 14% から 21% に上がっています。エージェントはバグ修正専用だと言う人への反論に使えます s1。
  • 計画 70% 対 実行 20% の比率は、誰がエージェントを操縦すべきかというチーム内の議論に持ち込むべき数字です s1。
  • マネージャーの結果をスライドで使う前に、検証済み成功とユーザーの明示的な確認に関するバイアスの注記を読み直してください s1。
  • エージェントがターミナルで実際にどう動くか、何を読み、書き、実行するかを知るには、製品ページから始めてください s2。
  • 初心者ヒントのスレッドは、初心者が具体的なプロンプトの習慣を交換する場所です。3 つの信号を頭に置いて読み、助言がどの信号に役立つかで仕分けしてください s3。

ソース

FAQ

調査は、非エンジニアが開発者と同じくらい優秀だと言っているのですか?

そこまでは言っていません。開発者は検証済み成功で 5 ポイントのリードを保っており、34% 対 29% で、7 か月間安定していました。調査は、その差は小さく、職名よりもセッション内でのユーザーのレベルのほうがはるかによく結果を予測すると述べています。

検証済み成功とは何ですか?

目標が達成された確かな証拠です。テストの通過、分類器がテレメトリから確認できる動く結果、またはユーザーの明示的な確認です。最後の項目があるため、マネージャーの結果にはバイアスの可能性があります。

コードを学ばずにレベルを上げられますか?

はい。分類器が採点するのは、指示の精度、エージェントに何を検証させるか、エージェントを修正するかどうかです。3 つとも、あなたの問題とあなたの基準の記述であり、コードではありません。

熟練者でも上限が低いのはなぜですか?

調査は、証拠があるときだけセッションを検証済みとして数えます。熟練者の検証済みは 28 から 33% ですが、部分的成功は 90% を超えるので、ほとんどのセッションは何かを届けています。足りないのは、完了したという証拠です。