[ニュース解説]Claude Codeの「オートモード」がデフォルト化——手動承認より安全という検証結果の中身

目次

はじめに

 Anthropicは 2026年8月7日 、開発者向けAIコーディングツール「Claude Code」において、Pro・Max・Teamプランを対象に「オートモード」を8月14日からデフォルト設定にすると発表しました。本稿では、オートモードの仕組みと、手動承認より安全とする検証データについて解説します。

参考記事

関連記事

あわせて読みたい
[ニュース解説]Claude Codeはこうして生まれた——Anthropic開発陣が語る誕生秘話 はじめに  Anthropicは2026年、公式サイトにて「The Making of Claude Code」と題したオーラルヒストリーを公開しました。本稿では、開発陣や社外ユーザーの証言をもと...
あわせて読みたい
[開発者向け]Cursor・Claude Code・Codexが「AIコーディングスタック」を形成——誰も設計しなかった3層... はじめに  2026年4月第1週、AIコーディングツールの市場に大きな変化が起きました。Cursorがエージェント管理に特化した新インターフェースを発表し、OpenAIがAnthropi...
あわせて読みたい
[ニュース解説]Claude Sonnet 5が登場——Opus 4.8に迫る性能をSonnet価格で、エージェント性能が前世代... はじめに  AnthropicがClaude Sonnet 5を2026年6月30日に発表しました。Sonnetクラスの価格帯を維持しながら、Opus 4.8に近い性能を実現したとされるモデルで、エージ...

要点

  • Claude Codeは 2026年8月14日 から、Pro・Max・Teamプランの新規セッションで「オートモード」をデフォルトとする
  • オートモードは各ツール呼び出しを分類器が審査し、不可逆・破壊的・環境外への操作を中心にブロックする仕組みである
  • 1,053名の有償テスターによる実験では、危険なコマンドの検知率が人間の手動承認で13.6%だったのに対し、オートモードは89%だった
  • 第三者機関Trajectory Labsによる評価では、Claude Fable 5・Opus 5・Sonnet 5をオートモードで動かした720件の攻撃試行のうち成功例はゼロだった
  • Enterprise・Claude API・AWS Bedrock等では当面オプトインのままとし、今後1か月程度でデフォルト化を予定している

詳細解説

オートモードの仕組みと変更点

 Anthropicによれば、オートモードは許可プロンプトによる中断を減らしつつ危険な操作を防ぐ設計で、各ツール呼び出しを分類器が審査し、不可逆的・破壊的、または利用者の環境外に向かう操作を中心にブロックします。ブロックされた場合、Claudeは自力で安全な代替手段を探すか、利用者に直接確認を求めるとのことです。連続3回、またはセッション内で合計20回ブロックが発生すると、Claude Codeは手動承認モードに切り替わります。

 あわせて、オートモードの分類器処理にかかる追加トークン分の課金を、Pro・Max・Teamプランのユーザーについて本発表と同日から取りやめるとしています。 一方、Claude Enterprise、Claude API、AWS Bedrock、Google CloudのAgent Platform、Microsoft Foundryでは当面オプトインの位置づけを維持し、Anthropicは今後1か月程度で各パートナーと協力しながらこれらにもデフォルト適用を広げる方針だと説明しています。なお、既存の許可ルールのうち、任意のコード実行を許すような広範なルール(例: Bash(python:*))はオートモード中は無効化され、分類器の審査を経ずに実行されることを防ぐ仕組みになっています。

 なお、既存の許可ルールを設定ファイルで細かく管理してきた開発者にとっては、運用の一部見直しが必要になる場面もあるかもしれません。

検証データが示す安全性の比較

 Anthropicの発表では、Claude Codeで許可プロンプトが表示された際、利用者は97%を承認しているといいます。個別の許可要求に対する却下率がわずか3%である一方、Claudeが提示した作業計画に対する却下率は39%に上るとされ、Anthropicはこの差から、利用者が許可プロンプトを都度精査するというより反射的に承認している可能性を指摘しています。 また2026年6月時点で、CLIを利用するアクティブユーザーの49.5%が手動でBashの許可ルールを設定しており、うち5%は任意のシェルコマンドを一括許可、43%はBash(python:*)のような事実上同等のインタプリタ単位ルールを使っているとのことです。

 1,053名の有償テスターによる実験結果からは、両者の差が明確に読み取れます。セッション途中で許可プロンプトの一部を意図的に危険なコマンドへ差し替えたところ、テスターが検知できたのは13.6%(1,053件中143件)にとどまり、オートモードは89%(937件)を検知したと報告されています。オートモードが人間の承認した800件をブロックした一方、人間がオートモードの許可した内容をブロックしたのはわずか6件だったとされ、セッションが長くなるほど人間の検知率が低下する(初期の約17%から50回超のプロンプト経験後には約5%に低下)のに対し、オートモードの検知率はセッション長によらず一定だったといいます。

 UKを拠点とするAI安全性の専門機関Apollo Researchとの2週間の共同検証でも、オートモードの分類器を強化したとしています。強化後、これまで見逃していた攻撃の約半分を新たに検知できるようになった一方、従来検知できていた攻撃の約2%を新たに見逃す結果になり、分類器全体の見逃し率は12%から7%に低下したとのことです。

プロンプトインジェクション対策と実運用への展開

 第三者機関Trajectory Labsによる評価では、Claude Code(オートモード)とOpenAIのCodex(Auto-reviewモード)を対象に、間接的なプロンプトインジェクション攻撃72シナリオをそれぞれ10回ずつ試行しています。 その結果、Claude Fable 5・Opus 5・Sonnet 5をオートモードで動かした場合、720件の攻撃はすべて失敗した一方、GPT-5.6 SolをCodexのAuto-reviewモードで動かした場合の攻撃成功率は5.83%、Full Accessモードでは19.03%だったとされています。この評価はブラウザ操作を含むMCPツールを用いた検証であり、各社が個別に提供するブラウザ拡張機能自体の安全策は対象外である点に留意が必要だと考えられます。

 オートモードには、データの持ち出しなど絶対に承認しない「ハード拒否」ルールや、git pushの送信先が公開・非公開・信頼済みのいずれかを判定する仕組み、破壊的なgit操作の前に現在のリポジトリ状態を分類器に提示する仕組みなどが組み込まれているといいます。Anthropic社内でも、外部の共有サービスへのアップロード試行や、約2,000ポッドへの一括プロセス終了、過剰な権限を持つクラウドロールの付与といった操作を分類器が事前に防いだ例が紹介されています。

 実運用面では、AdobeがEC関連ページの検証ループにオートモードを組み込み、Nuroが夜間の研究エージェントに活用しているほか、Gusto社では許可疲れの解消を目的に導入し、5月中旬以降のセッションの約10%で分類器による拒否が発生しているとのことです。Garner Healthは550名の全従業員に管理設定経由でオートモードを標準適用したと報告されています。

まとめ

 Claude Codeのオートモードは、複数の検証データをもとに手動承認より安全とされ、8月14日からPro・Max・Teamプランでデフォルト化されます。開発ツールにおける自律実行の広がりについては、こちらの記事でも整理していますので、あわせてご覧いただければと思います。

この記事が気に入ったら
フォローしてね!

  • URLをコピーしました!
  • URLをコピーしました!
目次