[開発者向け]Google「Gemini 3.1 Flash Live」リリース——低遅延・多言語対応でリアルタイム音声AIが実用段階へ

目次

はじめに

 Googleは2026年3月26日、リアルタイム対話に特化した音声モデル「Gemini 3.1 Flash Live」を公開しました。開発者向けにはGemini Live APIとGoogle AI Studioを通じてプレビュー提供され、Search LiveおよびGemini Liveにも組み込まれています。本稿では、その性能と開発者向けの活用方法を解説します。

参考記事

要点

  • Gemini 3.1 Flash LiveはGoogleの最新音声モデルで、低遅延・高品質なリアルタイム対話を開発者・企業・一般ユーザーに提供する
  • ComplexFuncBench Audioで90.8%、Scale AIのAudio MultiChallengeで36.1%を記録し、いずれも競合モデルを上回った
  • ピッチや話速といった音響的ニュアンスの認識精度が向上し、騒音環境下でのノイズフィルタリング性能も強化された
  • 90以上の言語でのリアルタイム音声対話に対応し、Search Liveが200か国以上に展開された
  • 出力音声にはSynthIDによる透かし処理が施されており、AI生成コンテンツの信頼性のある検出が可能である

詳細解説

Gemini 3.1 Flash Liveとは

 Gemini 3.1 Flash Liveは、Googleが2026年3月26日に発表したリアルタイム音声対話特化のモデルです。Googleによれば、同社のこれまでで最も高品質な音声モデルと位置付けられており、開発者・企業・一般ユーザーのそれぞれに向けた機能強化が施されています。

 提供経路は複数用意されています。開発者向けにはGemini Live APIを通じてGoogle AI Studioでプレビュー提供されており、企業向けにはGemini Enterprise for Customer Experienceで利用可能です。一般ユーザー向けにはGemini LiveとSearch Liveに組み込まれています。

 音声AIのリアルタイム対話では、数ミリ秒単位の遅延でも会話の自然な流れが損なわれます。この問題への対応として、レイテンシの低減と音響的ニュアンスの認識精度向上が本モデルの核心的な改善点となっています。

ベンチマーク性能

 Googleの発表によれば、Gemini 3.1 Flash LiveはComplexFuncBench Audioで90.8%のスコアを記録し、競合モデルを上回りました。ComplexFuncBench Audioは、多段階の関数呼び出しとさまざまな制約条件を組み合わせたタスクを評価するベンチマークで、音声エージェントが複雑な指示を確実に実行できるかを測る指標です。

 Scale AIが提供するAudio MultiChallengeでは、「thinking」モードを有効にした状態で36.1%のスコアを記録し、同様にリードしています。このベンチマークは、実際の音声会話に見られる割り込みやためらいを含む状況での複雑な指示追従と長期的な推論を評価するもので、現実のシナリオへの適応力を重視した設計となっています。

開発者向けの機能強化

 開発者向けの観点では、ノイズ環境への対応とシステム指示の遵守が大幅に改善されています。Googleの説明では、交通音やテレビ音声のような環境音から関連する発話を識別する能力が向上し、騒音下でも外部ツールの呼び出しや情報提供をより確実に実行できるとのことです。

 システム指示への追従精度も向上しており、会話が想定外の方向に進んでも、エージェントが設定された動作範囲内にとどまりやすくなっています。Verizon、LiveKit、The Home Depotといった企業も3.1 Flash Liveのワークフローへの導入を評価しており、自然な会話の実現を高く評価しているとGoogleは報告しています。

 本番環境での展開に向けては、LiveKit、Firebase AI Logic、Pipecat、VisionAgents、Voximplantなどのパートナー統合が整備されています。WebRTCスケーリングやグローバルエッジルーティングが必要なシステムでは、これらの統合の活用が推奨されています。

Google GenAI SDKでの利用方法

 Google GenAI SDKを使ったAPI接続は、以下のようなシンプルなコードで開始できます。モデル名にはgemini-3.1-flash-live-previewを指定します。

import asyncio
from google import genai

client = genai.Client(api_key="YOUR_API_KEY")
model = "gemini-3.1-flash-live-preview"
config = {"response_modalities": ["AUDIO"]}

async def main():
    async with client.aio.live.connect(model=model, config=config) as session:
        print("Session started")
        # Send content...

if __name__ == "__main__":
    asyncio.run(main())

 Gemini Live APIのドキュメントでは、多言語サポート、ツール使用と関数呼び出し、長時間会話のセッション管理、エフェメラルトークンといった機能が解説されています。また、GitHubにはLive APIのサンプルコードと、コーディングエージェント向けのスキルリポジトリも公開されています。

一般ユーザー向けの改善

 Gemini LiveおよびSearch Liveにも本モデルが組み込まれています。Googleによれば、Gemini Liveでは従来モデルと比べて応答速度が向上し、会話の文脈を2倍の長さまで保持できるようになりました。長い思考整理や複数のトピックにわたる会話でも、話の流れが途切れにくくなると考えられます。

 また、今週発表されたSearch Liveのグローバル展開の基盤としても3.1 Flash Liveが機能しており、200か国以上の地域で90言語以上を使ったリアルタイムのマルチモーダル対話が可能になりました。多言語対応はモデルの設計段階から組み込まれた機能であり、翻訳処理を経由しない直接的な音声理解を実現しています。

安全性への取り組み

 Googleによれば、3.1 Flash Liveが生成するすべての音声にはSynthIDによる透かし処理が施されています。SynthIDはGoogleが開発した技術で、音声波形に知覚できない形でマーカーを埋め込むことにより、AI生成コンテンツの信頼性のある検出を可能にします。音声AIの普及に伴いフェイク音声の悪用が懸念される中、こうした技術的な対策は重要な要素と考えられます。

まとめ

 Gemini 3.1 Flash Liveは、低遅延・多言語・ノイズ耐性という三つの軸でリアルタイム音声AIの実用性を高めた新モデルです。複数のベンチマークで競合を上回る性能を示しており、開発者向けAPIとして即日利用可能な点は評価できます。音声エージェントの構築を検討している場合は、まずGoogle AI StudioでのLive API検証から始めてみるとよいと思います。

この記事が気に入ったら
フォローしてね!

  • URLをコピーしました!
  • URLをコピーしました!
目次