[開発者向け]Google Interactions APIが正式版(GA)に——GeminiモデルとAIエージェントを統一する新APIの全機能

目次

はじめに

 Google DeepMindが2026年6月、GeminiモデルとAIエージェントを統一的に呼び出すための「Interactions API」の正式版(GA)を公開しました。2025年12月のパブリックベータ公開以来、開発者から支持を集めてきた同APIが安定版に到達しました。本稿では、GA版で追加された主要機能を中心に解説します。

参考記事

関連記事

あわせて読みたい
[開発者向け]Gemini Deep Research AgentとInteractions API – Googleが自律研究機能を開発者に... はじめに  Google DeepMindが2025年12月11日、強化されたGemini Deep Research AgentとInteractions APIをパブリックベータとして公開しました。これにより、開発者は...
あわせて読みたい
[ニュース解説]Google I/O 2026の開発者向け発表を整理する——Antigravity・Gemini 3.5 Flash・Managed... はじめに  Googleは2026年5月19日、年次開発者イベント「Google I/O 2026」に合わせ、エージェント開発基盤の刷新や新モデルの投入など、開発者向けの大規模なアップデ...
あわせて読みたい
[ニュース解説]Google Antigravity 2.0発表——IDEを手放したエージェントファースト・デスクトップアプ... はじめに  Googleが2026年5月20日、エージェント操作に特化したスタンドアロン・デスクトップアプリ「Google Antigravity 2.0」を発表しました。IDEを持たずエージェン...

要点

  • Interactions APIが正式版(GA)に到達し、スキーマが安定した。GeminiのモデルIDまたはエージェントIDを指定するだけで、推論とエージェント実行を同一インターフェースで呼び出せる
  • Managed Agentsにより、単一のAPIコールでリモートLinuxサンドボックスが起動し、コード実行・ウェブ閲覧・ファイル管理を自律的にこなすエージェントを構築できる
  • background=True を設定するだけで、長時間タスクをサーバー側で非同期実行できる
  • Google SearchやGoogle Mapsなどのビルトインツールとカスタム関数を、同一リクエスト内で組み合わせて呼び出せるようになった
  • Flexティアで最大50%のコスト削減が可能になり、用途に応じてコスト優先か低レイテンシ優先かを選択できる

詳細解説

Interactions API とは

 Interactions API(インタラクションズ API)は、GeminiモデルへのLLM推論(大規模言語モデルによるテキスト生成)と、エージェントによる自律タスク実行を、ひとつのエンドポイントで扱えるよう設計された統合APIです。Google DeepMindによれば、今回のGA化によりAPIスキーマが安定し、今後はすべての公式ドキュメントがInteractions APIを標準として扱うとのことです。

 従来の generateContent APIは引き続きサポートされますが、長時間タスクやエージェントに関わるフロンティア機能は、今後Interactions APIにのみ追加される予定と説明されています。既存プロジェクトからの移行は、Google DeepMindが公開している移行ガイドを使いながら自分のペースで進められます。

基本的な使い方(コードサンプル)

 Interactions APIの特長は、モデルへの推論とエージェント実行を同一のメソッド interactions.create() で呼び出せる点です。以下は、Pythonを使った最小構成のサンプルです(参考記事のサンプルコードをもとにしています)。

 SDKのインストールは以下のコマンドで行えます。

# Python用のGoogle GenAI SDKをインストールするコマンドです

pip install google-genai

 インストール後、以下のコードでモデル推論とエージェント実行の両方を試せます。

from google import genai  # Google GenAI SDKをインポート

client = genai.Client()  # クライアントを初期化(APIキーは環境変数から自動取得)

# ---- モデルに推論を実行するシンプルな呼び出し ----
interaction = client.interactions.create(
    model="gemini-3.5-flash",                         # モデルIDを指定して推論実行
    input="Explain quantum entanglement simply.",      # 入力テキスト
)

# ---- エージェントを呼び出してタスクを実行させる例 ----
interaction = client.interactions.create(
    agent="antigravity-preview-05-2026",               # エージェントIDを指定
    input="Plot the growth of solar energy generation globally and make some slides in HTML.",
    environment="remote",                              # リモートサンドボックス上で実行
)

 model= に切り替えればモデル推論、agent= に切り替えればエージェント実行と、引数ひとつで動作が変わる設計になっています。コードの構造をほぼ変えずに両方の機能を使い分けられる点は、開発・テスト時に役立つと思います。

注意: APIキーは Google AI Studio(https://aistudio.google.com/)で発行し、環境変数 GOOGLE_API_KEY に設定してください。

Managed Agents——リモートサンドボックスでエージェントを稼働させる

 GA版の主要追加機能のひとつが Managed Agents です。単一のAPIコールで、サーバー側にリモートLinuxサンドボックスが起動し、エージェントがコードの実行・ウェブブラウジング・ファイル管理を自律的に行います。

 デフォルトで利用できる Antigravity エージェント をそのまま使える点に加え、独自の指示・スキル・データソースを設定したカスタムエージェントを定義することも可能です。Managed Agentsは、ローカル環境に依存しない長時間の自律タスクを実行させたい場合の有効な手段と考えられます。

バックグラウンド実行

 background=True を設定すると、APIコールがサーバー側で非同期実行されます。これにより、クライアントの接続を維持したまま長時間待機する必要がなくなります。実行結果は有料ティアで最大55日間保持されるため、後から取得することも可能です。

# background=True を指定すると、サーバー側で非同期処理が走ります
# クライアント側の接続を維持し続ける必要がありません

interaction = client.interactions.create(
    agent="antigravity-preview-05-2026",
    input="Conduct a comprehensive market research report on EV adoption in Southeast Asia.",
    environment="remote",
    background=True,  # サーバー側で非同期実行
)

# interaction.id を保存しておき、後から結果を取得できます

注意: バックグラウンド実行のサンプルは参考記事の説明をもとにした補足コードです。実際のパラメータ仕様は公式ドキュメントで確認してください。

ツールの統合強化

 Google DeepMindによれば、GA版ではビルトインツール(Google Search・Google Mapsなど)と、開発者が定義したカスタム関数を、同一リクエスト内で組み合わせて呼び出せるようになりました。さらに、関数呼び出しの結果としてテキストと画像を同時に返すことも可能になっており、マルチモーダルなエージェント設計がより柔軟になっています。

Deep Research のアップグレード

 Deep Researchエージェントにも複数の更新が加わっています。処理速度を重視するバリアントと調査の深さを重視するバリアントの2種類が追加され、調査計画を利用者と対話的に策定するコラボレーティブプランニング機能も導入されました。調査結果にネイティブで図表・インフォグラフィックが生成されるほか、画像・PDF・音声を含むマルチモーダルなグラウンディングにも対応しています。

メディア生成の追加

 画像生成モデル「Nano Banana 2」(Google画像検索によるグラウンディング対応)、音楽生成モデル「Lyria 3」、マルチスピーカー対応の音声合成(TTS)が新たにInteractions APIに追加されました。テキスト・画像・音声・音楽の生成を同じAPIインターフェースから呼び出せる点は、マルチモーダルなアプリケーション開発の管理を簡潔にしてくれると思います。

スキーマ変更: Roles から Steps へ

 GAに際してAPIのスキーマ設計が変更されています。従来の「役割(Roles)」ベースの構造から「ステップ(Steps)」ベースへと移行しました。user_input・thought・function_call・model_output などのアクションが、それぞれ独立した型付きステップとして表現されるようになっています。

 generateContent APIからの移行には、各フィールドの対応表をまとめた移行ガイドが公開されており、段階的な対応が可能です。既存プロジェクトをお持ちの場合は、移行前に変更点を確認することをおすすめします。

コスト最適化と開発者向け改善

 GA版では Flex と Priority の2つの処理ティアが追加されました。 Flex はコスト優先で、 Priority と比べて最大50%のコスト削減が可能とのことです。また、エラーメッセージが原因となっている正確なフィールドを指し示すようになっており、デバッグ時の確認が効率化されています。

コーディングエージェント向けスキルと対応SDK

 Interactions APIはPython SDK(google-genai)とJavaScript SDK(@google/genai)から利用できます。サードパーティとして LiteLLM・Eigent・Agno との統合も提供されています。

 コーディングエージェント向けには gemini-interactions-api スキルが提供されており、以下のコマンドで追加できます(参考記事のサンプルコードをもとにしています)。

# npx(Node.jsのパッケージランナー)を使ってスキルを追加するコマンドです
# このスキルにより、エージェントがInteractions APIのベストプラクティスを参照できます

npx skills add google-gemini/gemini-skills --skill gemini-interactions-api

注意: npx を使うには Node.js がインストールされている必要があります。事前に node –version でバージョンを確認してください。

 このスキルにより、ストリーミング・Function Calling(関数呼び出し)・構造化出力・Deep Researchなどのパターンをエージェントが自動的に参照できるようになります。

まとめ

 Google Interactions APIのGA化により、GeminiモデルとAIエージェントを同一インターフェースで扱える開発環境が整いました。Managed AgentsやDeep Research強化など、エージェント開発を加速する機能が追加されており、新規プロジェクトでは同APIの採用を検討する価値があると思います。デフォルトのAntigravityエージェントについては、過去記事でも整理していますので、あわせてご覧いただければと思います。

この記事が気に入ったら
フォローしてね!

  • URLをコピーしました!
  • URLをコピーしました!
目次