[ニュース解説]Gemini 3.5 FlashにComputer Useが統合——単独モデルからメインモデルへの進化と安全対策の全容

目次

はじめに

 GoogleのAI部門Google DeepMindが2026年6月24日、Gemini 3.5 FlashにComputer Use(コンピュータ操作)機能をビルトインツールとして統合したことを発表しました。本稿では、この発表の内容と、エンタープライズ向けの安全対策、開発者が今すぐ活用できる手段について解説します。

参考記事

関連記事

あわせて読みたい
[開発者向け] Google「Gemini 2.5 Computer Use」:ブラウザを自律操作するAIモデルの実力と実装方法 はじめに  Google DeepMindが2025年10月7日、ウェブブラウザやモバイルアプリのUIを直接操作できるAIモデル「Gemini 2.5 Computer Use」をAPI経由で公開しました。本稿...
あわせて読みたい
[ビジネスマン向け]GoogleのエンタープライズRAGが進化——「十分な文脈」を自律判断するマルチエージェ... はじめに  Google ResearchとGoogle Cloudが共同で開発したエンタープライズ向けマルチエージェントRAGフレームワークが、2026年6月5日に発表されました。本稿では、複...
あわせて読みたい
[AIツール利用者向け]NotebookLMが大幅アップグレード——Gemini 3.5搭載とエージェント機能で「自律型... はじめに  GoogleがNotebookLMの大規模アップグレードを2026年6月8日に発表しました。Gemini 3.5を搭載した新たな推論エンジンの導入、エージェント的なチャット機能の...

要点

  • Gemini 3.5 FlashにComputer Useがビルトインツールとして統合され、単独モデルとしてではなくメインのFlashモデルの組み込み機能として提供されるようになった
  • ブラウザ・モバイル・デスクトップ環境を横断したエージェント構築が可能になり、継続的なソフトウェアテストや業務アプリを使ったナレッジワークなどの長期タスクに対応する
  • 間接プロンプトインジェクション対策として敵対的訓練(adversarial training)を適用し、企業向けに2つのオプション安全ガード機能を追加公開した
  • Gemini APIおよびGemini Enterprise Agent Platformを通じて、開発者・企業がすぐに利用を開始できる

詳細解説

メインモデルへの統合という変化

 Google DeepMindの発表によれば、Computer Useはこれまで独立したモデル「Gemini 2.5 Computer Use」として提供されていました。2025年10月にモデルを取り上げた記事では専用モデルとして開発者向けに提供される形でしたが、今回の発表でGemini 3.5 Flashのビルトイン機能として統合されました。

 この変化が意味するのは、Computer Useが「特殊用途のオプション」から「標準的な道具」へと位置づけを変えたことだと思います。Gemini 3.5 FlashはすでにFunction CallingやSearch、Mapsグラウンディングといったビルトインツールが充実していますが、そこにコンピュータ操作能力が加わったことで、単一モデルでより幅広いエージェントタスクを完結できる構成になります。

対応環境と想定ユースケース

 Googleの発表では、Gemini 3.5 FlashのComputer Useはブラウザ・モバイル・デスクトップの3つの環境を横断したエージェント構築を可能にするとしています。特に「長期タスク(long-horizon tasks)」と「エンタープライズ自動化」を中心に据えており、具体的な例として継続的なソフトウェアテストや業務アプリケーションを用いたナレッジワークが挙げられています。

 ソフトウェアテストの自動化は、テスト対象のUIが変更されるたびにスクリプトを書き直す手間がかかる従来手法の課題を、視覚的に画面を認識して操作するComputer Useで解消できる可能性があります。企業での実務アプリ操作でも、RPA(Robotic Process Automation:定型業務を自動化するソフトウェアロボット)が苦手としていた動的なUIへの対応が改善されると考えられます。

安全対策:敵対的訓練と2つの企業向けガード機能

 ライブ環境で動作するエージェントにとって大きなリスクの一つが、悪意あるコンテンツが外部から操作指示に紛れ込む「間接プロンプトインジェクション」です。Googleによれば、Gemini 3.5 FlashのComputer Useでは、このリスクに対して adversarial training(敵対的訓練) を的を絞った形で適用しているとのことです。敵対的訓練とは、攻撃パターンを意図的に学習データに含めることで、モデル自身がそれらを識別・回避できるよう強化する手法です。

 加えて、企業向けに2つのオプション安全ガード機能を公開しています。

  1. センシティブ・不可逆な操作に対する明示的なユーザー確認の要求 — エージェントが重要な操作を実行する前に人間の承認を得るフローを組み込める機能です。
  2. 間接プロンプトインジェクション検知時のタスク自動停止 — 不審な外部入力を検知した場合に処理を自動で止める機能です。

 Googleはこれらに加え、「defense-in-depth(多層防御)」のアプローチとして、セキュアなサンドボックス環境の使用、ヒューマン・イン・ザ・ループ(処理の途中で人間が確認を行う仕組み)の採用、厳格なアクセス制御との組み合わせを推奨しています。エージェントが企業の実環境で動作する以上、単一の安全策ではなく複数の防御層を重ねる姿勢は理にかなっていると思います。

利用開始の方法

 Googleによれば、現時点でGemini APIおよびGemini Enterprise Agent Platformの両方を通じてComputer Useを利用できます。また、Browserbaseがホストするデモ環境でも機能を試すことができます。参考実装(reference implementation)はGitHubのgoogle-geminiリポジトリでも公開されており、ドキュメントとあわせて活用できます。

 Gemini Enterprise Agent PlatformのエンタープライズRAG機能については過去記事でも解説していますので、プラットフォーム全体の理解とあわせてご確認いただくと、どの範囲にComputer Useを組み込むかのイメージが掴みやすいと思います。

まとめ

 Gemini 3.5 FlashへのComputer Use統合は、専用モデルから汎用モデルへの組み込みというステップを経て、エージェント開発の敷居が下がる変化だと思います。安全対策も着実に充実しており、企業での実用展開に向けた布石と言えます。今後、どのような業務領域での活用事例が出てくるか注目したいところです。

この記事が気に入ったら
フォローしてね!

  • URLをコピーしました!
  • URLをコピーしました!
目次