本文へ移動
NEWS
AIコードエディタ

Claude Codeの許可を押す人の86%は危険操作を見逃した

読了 約5分
Anthropic Claude Codeのロゴが写った写真。Claude Codeの許可を押す人の86%は危険操作を見逃した
この記事の要点

Anthropicが1053人の有償テスターで対照実験した結果、Claude Codeの確認画面に混ぜた危険なコマンドを止められたのは人間が13.6%でAIの自動判定は89%でした。この結果を受けてClaude Codeの初期設定が自動モードに切り替わっています。

みんなの意見

コードの確認をAI任せにしてよいと思いますか?

まだ回答がありません。最初の1票をどうぞ

SHARE
89%AIの危険コマンド検知率
13.6%人間の検知率
1053テスター数

1053人の実験で判明 危険操作を止めたのはAI89%で人間は14%だった

テスターが危険なコマンドを止められたのは1053件中143件で13.6%でした。AIの自動判定は1053件中937件の89%をブロックしています。

判定者 検知率 件数
AI自動判定 89% 937件
人間のレビュー 13.6% 143件

Anthropicは調査会社を通じて1053人の有償テスターを集め、盲検法で対照実験を行いました。テスターは専用環境で実際にコーディングをしながら確認画面への反応を測られています。セッションの途中で確認画面の1つが危険なコマンドに差し替えられますが、承認しても実際に実行されることはない仕組みです。

直接比較すると人間が承認した800件を自動モードが止めています。逆に自動モードが通して人間が止めたのは6件だけでした。

Claude Code公式ブログの自動モード解説ページ
Claude Code公式ブログの自動モード解説ページ / 出典:claude.com / 制作:AInformation
これまでの流れ
  1. 5〜6月Anthropicが安全性監視でフラグの立ったセッションを再評価
  2. 8/7自動モードをPro・Max・Teamの標準にすると発表
  3. 8/14新規セッションが自動モードで起動するように変更

50回確認すると検知率は5%まで落ちる ボタンの形骸化が数字で出た

Claude Codeでは確認画面の97%が承認されています。大半は安全な定型コマンドですが、この承認率の高さは中身を見ずに押す利用者が多いことの証拠です。

Claudeが計画を提示して承認を求める場面では却下率が39%に達する一方、個別の権限確認になると却下率は3%まで落ちます。作業の判断は慎重でも操作の1つ1つは素通りさせている格好です。

人間の検知率はセッションが長くなるほど下がりました。序盤は約17%でしたが50回以上の確認を経ると約5%まで落ちています。自動モードのブロック率は一定のままでした。

Anthropicが2026年5〜6月に再評価した本番データでも傾向は同じです。深刻な被害を含むセッションは手動承認が6.3%に対して自動モードは2.4%でした。

1053人テストの危険コマンド検知率

AI自動判定 89%
人間(序盤) 約17%
人間(50回以降) 約5%
データ:Anthropic公式ブログ / 制作:AInformation

「python:*」のような広い許可は自動モードで無効になる

「python:*」のように任意のコードを実行できる広い許可ルールは自動モードの間だけ無効になります。分類器を素通りさせないための措置です。別のモードに切り替えれば再び有効になりますが、日常的に広い許可ルールで運用してきたチームは作業の流れが変わる可能性があります。

2026年8月14日からClaude CodeのPro・Max・Teamプランでは新規セッションが自動モードで起動しています。AIの分類器がツール呼び出しの危険度を判定し、取り消しが効かない操作や破壊的な操作をブロックする仕組みです。

3回連続でブロックされるか1セッションで20回ブロックされると手動承認に切り替わります。AIの判定に納得できない場面では人間が引き継げる設計です。分類器が消費する追加トークンぶんの課金はPro・Max・Teamプランではなくなっています。

Claude Codeの初期設定の変化。これまで:操作ごとに確認画面を表示、承認率は97%。ほとんど素通し。8月14日から:自動モードが標準、AIが危険な操作だけ止める。Pro・Max・Teamプラン。データ:Anthropic公式ブログ。制作:AInformation。
Claude Codeの初期設定の変化 / データ:Anthropic公式ブログ / 制作:AInformation

見逃し率7%は残る ログの監視を切るのはまだ早い

自動モードの見逃し率は7%でゼロにはなっていません。AnthropicはAI安全性を評価する英国のApollo Researchと2週間のパイロットを実施してこの数字を出しています。

改善後の自動モードはそれまで見逃していた攻撃の約半分を新たに捕捉しました。一方で以前捕捉できていた攻撃の約2%を取りこぼしています。コーディングの作業履歴に合成した攻撃を差し込み、データの持ち出しを含む3種類のデータセットでテストした結果です。

この7%は分類器の穴を探すための合成攻撃での数字で、日常のトラフィックでの見逃し率ではないとAnthropicは説明しています。それでも自動モードへの切り替えでログの監視をやめてよい理由にはなりません。重大な操作のログは別に残しておく運用が現実的です。

この記事に出てくることば
分類器
Claude Codeがツール呼び出しの危険度を自動で判定する仕組み。取り消しが効かない操作や破壊的な操作をブロックする
盲検法
テスターに何を測っているか知らせずに実験する方法。確認画面への反応を普段どおりの状態で測るために使われた
藤井俊太(AI導入コンサルタント)の見方

企業でClaude Codeを使うとき「人が目を通すから安全」という前提は数字の上で崩れました。97%を素通りする確認画面に安全管理を任せていた組織は少なくないはずです。自動モードへの切り替え自体はAnthropicが済ませましたが問題はその先です。どの操作をAI任せにしてどの操作にはログと人の判断を残すか。この線引きを組織として決めておかないと自動モードの恩恵も限定的になるとみています。

よくある質問
Claude Codeの自動モードは自分で元に戻せるのか
元に戻せます。設定ファイルでデフォルトモードを固定していればそのまま変わりません。固定していない場合でも自動モードへの切り替えを確認する画面が1回だけ出るので断ればそれまでのモードが続きます。Pro・Max・Teamプランの新規セッションだけが対象で強制的に上書きする仕組みではありません。
自動モードの見逃し率はどのくらいあるのか
第三者機関Apollo Researchとのテストでは見逃し率が7%でした。ただしこれは分類器の穴を探すために作った合成攻撃での数字であり、日常の操作で7%が見逃されるという意味ではないとAnthropicは説明しています。本番の利用データでは手動承認より自動モードのほうが深刻な被害を含むセッションが少ない結果でした。

この記事の出典

補助資料

  • [1]ITmedia AI+ITmedia AI+・補助的な二次資料・確認 2026-09-11この記事の元にした報道

出典の最終確認日:2026年9月11日

SHARE
この記事に出てくるAIも、まとめて比べられます 494本のAIツールを、やりたいこと・料金・日本語対応で絞り込めるデータベースです。5日ごとに料金を取り直しています。 AIツールを探す

あわせて読みたいRELATED