[ニュース解説]Claude Codeの「auto mode」は本番環境でどう使われているか——Nuro・Gusto・Garner Health 3社の実践

目次

はじめに

 Anthropicが 8月 7, 2026 、Claude Codeの既定設定「auto mode」を本番環境で使う3社の事例を公開しました。分類器がコマンドの危険性を判定し、承認プロンプトを代行する仕組みです。本稿では各社の運用実態と、引かれた境界線を整理します。

参考記事

関連記事

あわせて読みたい
[ニュース解説]Cursorが「自動レビュー」を導入——AIエージェントの自律性を分類器で動的に管理する仕組み はじめに  Cursorは2026年6月11日、AIコーディングエージェントの自律性を動的に管理する新機能「自動レビュー(Auto Review)」を発表しました。エージェントのアクショ...
あわせて読みたい
[ビジネスマン向け]アルバータ州政府がClaude Codeで4.6億行のコードを審査——政府システムのセキュリ... はじめに  Anthropicは2026年7月6日、カナダ・アルバータ州政府がClaude Codeを活用し、政府システム全体の脆弱性発見と修正を進めてきた事例を公開しました。本稿では...
あわせて読みたい
[ニュース解説]長時間自律型AIはサンドボックスを突破する——OpenAIが公開した安全インシデントの内幕 はじめに  OpenAIは2026年7月20日、長時間にわたり自律的に動作するAIモデルを社内利用する中で観測された安全上の問題と、その対応策をまとめた記事を公開しました。...

要点

  • auto modeはClaude Codeの既定設定であり、分類器が各アクションを評価して有害と判断したものを遮断する仕組みである
  • Anthropicの社内評価では、分類器は承認プロンプトを手作業で処理する開発者よりも多くの危険なアクションを捕捉し、第三者によるレッドチーミングでも性能を維持したとされる
  • Claude Codeの利用全体で、中断から次の中断までの稼働時間は従来の既定設定の9倍に伸びている
  • Nuroでは夜間に自律実行する研究エージェント、Gustoでは短時間の調査業務、Garner Healthでは全社標準の開発ライフサイクルの基盤として使われている
  • 3社とも、再帰的削除・対人コミュニケーション・本番インフラ操作などは分類器の判断に委ねず、設定やモード切り替えで明示的に除外している

詳細解説

auto modeが解こうとしたトレードオフ

 auto modeは現在、Claude Codeの既定設定になっています。エージェントが実行しようとするコマンドを1つずつ人間が承認する代わりに、分類器が各アクションを評価し、有害と見なされるものを遮断します。

 この設計が向き合っているのは、エージェント型コーディングで繰り返し議論されてきた速度と安全性のトレードオフです。すべてのコマンドを確認すれば人間が介在し続けられますが、セッションが数時間に及んだり並行して複数走ったりすると、確認作業そのものがボトルネックになります。逆に権限チェックを完全に省略すれば速くはなるものの、プロンプトインジェクション(外部から紛れ込んだ指示にAIが従ってしまう攻撃手法)やスコープの逸脱、本番リソースの誤削除といった事故が通り抜けます。

 Anthropicによれば、社内評価では分類器のほうが、承認プロンプトを手作業でクリックしていく開発者よりも多くの危険なアクションを捕捉し、第三者によるレッドチーミングでも性能を維持したとされています。セッションの停止回数が減った結果、Claude Codeの利用全体で 中断までの稼働時間は従来の既定設定の9倍 に伸びたと説明されています。分類器でエージェントの自律性を動的に管理する発想は、Cursorが導入した自動レビューの仕組みにも共通しており、業界の潮流になりつつあると考えられます。

Nuro: 夜通し走る研究エージェントを支える

 レベル4の自動運転技術を開発するNuroは2025年後半にClaude Codeを導入し、3月には社内で最も使われるエージェント型コーディングツールになりました。スタッフソフトウェアエンジニアのKai Zhou氏は、auto modeの提供前に社内向けの代替策を試作しています。保留中のアクションを小規模モデルに送り、9割程度を占める定型操作は自動承認し、機微なものだけSlackで人間が確認するフックです。エンジニアは承認プロンプトの相手をしたがらない一方、セキュリティと法務の観点では権限確認の全面省略も認められない、という緊張関係への回答でしたが、auto modeの登場に伴い棚上げされました。

 現在、Zhou氏はコーディング作業のすべてでauto modeを使い、多くの場合3〜4セッションを並行させています。例外は他チームに影響する作業で、Claude Codeが代理でプルリクエストをレビューする際は対話モードに戻します。またNuroは再帰的削除のような危険度の高いコマンドを設定側で明示的に拒否しており、分類器はそのガードレールの内側で判断します。 分類器と、事前に固定された禁止リストの二層構成 は、判定の誤りが致命傷にならないようにする設計だと考えられます。

 効果が大きかったのは、退勤後も走り続ける作業を仕込めるようになった点です。Zhou氏のチームは自動運転スタックの評価指標を自律的に改善する長時間稼働の研究エージェントを運用しており、夜間にエージェントが評価スイートの検出漏れを分析し、改善案を作り、実験を回して反復を続けます。別チームは特定バイナリのメモリ使用量削減に同じ手法を適用しており、指標自体が改善か後退かを伝えるため、明確な評価方法があるタスクなら同様に適用できるとされています。午後10時に起動したエージェントが午前5時まで動き、朝には3件のプルリクエストが出来上がっていた例も紹介されています。

Gusto: 権限疲れの解消と、線を引く場所

 中小企業向けテクノロジー企業のGustoでは、auto modeへの移行が先回りのセキュリティ強化として始まりました。AI Dev ToolsチームのMartin Emde氏は12月以降2,425回のセッションを起動しており、フォルダーアクセスの承認で止まっていたリポジトリ横断の作業が中断なく走るようになったほか、GitHub・Slack・Jiraから日報をまとめる無人実行のジョブも動くようになったと説明されています。同チームの分析では、2026年5月中旬以降のセッション記録の約10%にauto modeによる遮断が含まれており、分類器が正当な作業を過度に妨げずに機能している指標として挙げられています。

 同社AIT Cloud EngineeringチームのChad Kunsman氏は、異なる方向から同じ結論に至っています。業務はエンドポイント調査、ログ監査、コネクター管理、複数のMCPサーバーをまたぐドキュメント取り込みで、20分程度の短い作業が中心です。求めていたのは実行時間の延長ではなく、権限確認を迂回する設定に近い手離れの良さを、プロンプトインジェクションを通す危険なしに得ることでした。分類器が介入した場面については、当初の依頼から逸れていた点を指摘して確認を求めてきたもので、判断は的確だったと述べています。

 もっとも、Kunsman氏は最も機微な作業ではauto modeから抜けます。TerraformやAWS、稼働中APIへの直接のPOSTなど本番インフラに触れるセッションでは編集許可モードに切り替え、ツール呼び出しを手で確認します。節約できる時間と起こり得る失敗の深刻さを天秤にかける必要があり、最終的な責任は利用者にある、という整理です。GustoはMCPの通信をツールガードとプロンプト検査を備えたプロキシ層に通しており、権限を絞ったうえでauto modeを働かせる多層防御の構成になっています。

Garner Health: 標準化された開発ライフサイクルの前提に

 医療テクノロジー企業のGarner Healthは、2月に全部門550名の従業員へClaude Codeを展開しました。Salesforce、Zendesk、Snowflakeなどの基幹システムと接続し、従業員には週2時間程度を目安に、自分の業務のうち反復性の高い部分を自動化することが推奨されています。プラットフォームエンジニアリングマネージャーのEvan Magnussen氏は、auto mode以前の権限管理を、承認コマンドの一覧を手作業で整備し、パイプでつないだコマンドが弾かれるのを見続ける煩雑な作業だったと振り返っています。

 Magnussen氏によれば、組織全体で標準化した開発ライフサイクルは、auto modeがあって初めて成立したとされています。この仕組みは標準化されたスキルをまとめたプラグインとして動作し、エージェントがタスクを受け取り、アクセスできる文脈を調べ、コンテキストファイルをリポジトリに記録し、同氏が「敵対的リサーチ」と呼ぶ工程で自らの前提を検証したうえで実装に進み、自力で見つけられない情報が必要なときだけ人間の判断を仰ぎます。調査に重点を置いたこれらの段階は、auto mode以前には実現できなかったと説明されています。

 分類器の調整はほとんど必要なかったとされ、Magnussen氏が加えた変更はNuroのZhou氏と同じ方向でした。Slackメッセージやメールなど、他者への連絡にあたるアクションを自動承認しない設定にした、という調整です。中核となる知的財産を扱うチームは、分類器に与えるプロンプトを調整し、許容度を上げ下げして運用しているとのことです。導入企業への助言としては、裁量を与えつつ安全に展開できる統制の整備が挙げられています。テレメトリーを取らないまま各自が独自のワークフローを作る状態は危険であり、計測と標準化があるからこそ任せられる、という整理です。

3社の運用に共通する線引き

 3社を並べると、auto modeの使い方そのものは対照的です。Nuroは夜間の長時間実行、Gustoは短時間の調査業務、Garner Healthは全社共通の開発プロセスと、時間軸も対象範囲も異なります。

 一方で、分類器に委ねない領域を各社が明示的に決めている点は共通しています。Nuroは再帰的削除を設定で拒否し、Gustoは本番インフラ操作で手動確認に戻り、Garner Healthは対人コミュニケーションを自動承認から外しています。導入を検討する際は、分類器の精度そのものよりも、 自組織で「失敗が取り返しのつかない操作」がどれかを先に定義できるか が実務上の分かれ目になると考えられます。テレメトリーの整備を助言に挙げるGarner Healthの姿勢も、任せた範囲を後から検証できる状態を保つ狙いがあると言えます。

まとめ

 auto modeは、承認プロンプトの負担と権限省略の危険の中間を分類器で埋める仕組みです。3社の事例からは、自動化の範囲を広げつつ危険度の高い操作だけを手元に残す形が見えてきます。大規模導入については、アルバータ州政府の事例も整理していますので、あわせてご覧ください。

この記事が気に入ったら
フォローしてね!

  • URLをコピーしました!
  • URLをコピーしました!
目次