[開発者向け]Gemini 4 Argon発表―100万トークンと最前線の防御能力

目次

はじめに

 Google DeepMindは 2026年9月30日 、長時間の研究や大規模開発、サイバー防御に重点を置く「Gemini 4 Argon」を発表しました。本稿では、社内実務の成果、100万トークンの出力、価格と提供対象、安全策を数値とともに整理します。

参考記事

関連記事

あわせて読みたい
[Google I/O 2025][技術解説]AIは見えない指示に操られる?「間接プロンプトインジェクション」の脅威... はじめに  本稿では、Google DeepMindが2025年5月20日に公開した記事「Advancing Gemini's security safeguards」をもとに、AI、特に大規模言語モデル(LLM)における...
あわせて読みたい
[Google I/O 2025]Vertex AIで進化するGemini 2.5:思考の可視化と高度セキュリティでAI開発を革新 はじめに  本稿では、Google Cloud Blogに2025年5月21日付で掲載された記事「Gemini 2.5 Flash and Pro expand on Vertex AI to drive more sophisticated and secure ...

要点

  • Gemini 4 Argonは、研究、ソフトウェア開発、業務自動化、動画理解、サイバー防御を重視したモデルである。
  • 出力上限を64Kから100万トークンへ拡大し、大規模なコード変更や長時間の作業を支援する。
  • Google社内で量子最適化40%改善、300TiB超のメモリ解放、80万行超のコード移行に使われた。
  • サイバー防御ではCWE-bench v1で最高タイの68%を記録し、実際の重大脆弱性も発見した。
  • 強力な能力に合わせ、段階提供、プロンプトインジェクション耐性、内部監視、サンドボックス強化を採用する。

詳細解説

長時間の知的作業を想定した設計

 Gemini 4 Argonは、単発の質問応答よりも、調査、計画、実行、検証を繰り返す長時間タスクを想定しています。対象は研究、ソフトウェア開発、業務自動化、動画理解、サイバー防御です。Google社内ではすでに数千人が試用しました。

 企業で重要なのは、ベンチマークの一点性能だけでなく、長い文脈を保ちながら複数のツールを使い、結果を検査して作業を完了できるかです。Argonはこのエージェント型の実務を主要な評価軸に置いています。

社内の実務で得た成果

 量子最適化では公開済みのベースラインを40%上回りました。メモリ最適化では300TiB超を解放し、最終的に500TiBから1PiBの削減が見込まれています。試験用の小規模課題だけでなく、Googleの計算基盤へ直接影響する成果です。

 ただし、これらはGoogle固有の環境、データ、検証体制で得られた結果です。他社が同じ削減率を得られる保証ではなく、導入時は自社環境での再評価が必要です。

大規模コード変更

 C/C++からRustへの移行では、80万行超のコードベースを扱いました。動画デコーダーlibgav1では32,000行のSIMDコードを置き換え、既存のRust移植版より2.7倍高速で、動画出力は同一だったとしています。

 大規模移行では、生成できるコード量より、互換性、性能、テスト結果を保ったまま変更を完了する能力が重要です。Argonの事例は、AIによるコード変換をレビュー可能な単位へ分解し、実行結果で検証する用途を示します。

100万トークンの出力

 出力トークン上限は64Kから100万へ増えました。長い入力を読めるだけでなく、大量のコード、レポート、作業記録を一度のタスクで生成できます。一方、長い出力ほど誤りの発見が難しくなるため、区間ごとのテストや承認を組み込む運用が欠かせません。

 ベンチマークではDeepSWE v1.1が77.9%、AutomationBenchが51.3%で首位、長時間動画理解のLVBenchが91.7%でした。Vals Index、Finance Agent v2、Harveyの法律ベンチマークでも首位と報告されています。

防御側に重点を置くサイバー能力

 Argonは脆弱性の発見、検証、修正を一連の流れで支援します。CWE-bench v1では最高タイの68%を記録し、Google社内の20言語の評価やWizのブラックボックス評価でも高い性能を示しました。

 WizのScan for Goodでは、従来のフロンティアモデルが見逃した医療ソフトウェアの重大な脆弱性を発見しました。信頼できる防御者と社内チームには、サイバー関連のガードレールを外した版を提供し、防御研究に必要な能力を引き出します。

強い能力に合わせた安全策

 Google DeepMindはFairwind Programを通じて信頼できるサイバー防御者から提供を始め、段階的に対象を広げます。米国政府の任意の事前審査プロセスにも参加します。一般利用と高リスク能力へのアクセスを同時に開放しない設計です。

 悪用やCBRN領域に関する拒否と内部活性の監視、Gray Swan IPIで評価されたプロンプトインジェクション耐性、思考・行動の監視、サンドボックス強化も採用します。エージェントがツールを使うほど、モデル単体ではなく実行環境を含めた制御が重要になります。

段階的な提供と価格

 最初は有料API利用者とGoogle AI Ultra契約者へ提供されます。導入初期の価格は入力100万トークン当たり2ドル、出力10ドルで、キャッシュ入力は95%引きです。初期期間後は入力4ドル、出力20ドルになります。

 100万トークンの出力を最大まで使うとコストも確認量も増えます。企業はキャッシュを活用しつつ、長文生成を目的にせず、検証可能な成果物へ分割する設計が現実的です。

まとめ

 Gemini 4 Argonは、長い出力とエージェント能力を、実際の最適化、コード移行、サイバー防御へ結び付けたモデルです。強い能力ゆえに、段階提供、監視、実行環境の防御とセットで評価する必要があります。

この記事が気に入ったら
フォローしてね!

  • URLをコピーしました!
  • URLをコピーしました!
目次