はじめに
Google DeepMindが2026年4月14日、ロボット向け身体的推論モデル「Gemini Robotics-ER 1.6」を発表しました。前世代モデルであるER 1.5から大幅に強化され、空間推論・マルチビュー理解・計器読み取りといった実環境対応能力が向上しています。本稿では、発表内容をもとに主要機能と性能指標を詳しく解説します。
参考記事
メイン記事:
- タイトル: Gemini Robotics-ER 1.6: Powering real-world robotics tasks through enhanced embodied reasoning
- 著者: Laura Graesser、Peng Xu
- 発行元: Google DeepMind
- 発行日: 2026年4月14日
- URL: https://deepmind.google/blog/gemini-robotics-er-1-6/
関連情報:
- タイトル: Gemini Robotics ER-1.6 enhances reasoning to help robots navigate real-world tasks.
- 発行元: Google Blog
- 発行日: 2026年4月14日
- URL: https://blog.google/innovation-and-ai/models-and-research/google-deepmind/gemini-robotics-er-1-6/
関連記事


要点
- Gemini Robotics-ER 1.6は、空間推論・マルチビュー理解・タスク成功判定・計器読み取りに特化したロボット向け身体的推論モデルである
- 計器読み取り精度は、ER 1.5の23%からER 1.6で86%に向上し、agentic vision有効時には93%を達成した
- Boston Dynamicsとの協業から生まれた「計器読み取り」機能を新たに搭載し、産業施設での自律巡回点検への応用が見込まれる
- 安全性評価ベンチマーク(ASIMOV)においてGemini 3.0 Flashを上回り(テキスト+6%、ビデオ+10%)、シリーズ最高の安全水準を達成した
- Gemini APIおよびGoogle AI Studio経由で開発者向けプレビューとして提供が開始された
詳細解説
Gemini Robotics-ERとは
Gemini Robotics-ERは、ロボットが物理世界を理解するための「高レベル推論モデル」として位置づけられるシリーズです。視覚・空間理解、タスク計画、成功判定を専門とし、Google SearchやVLA(視覚言語行動モデル)、サードパーティ関数などをネイティブに呼び出せるツール統合アーキテクチャを採用しています。本ブログでは2025年9月にER 1.5を取り上げています(→ https://jobirun.com/google-gemini-robotics-er-1-5-technical-overview/)。今回のER 1.6はその後継モデルにあたり、特に空間推論・物理推論の両面で進化しています。
Google DeepMindによれば、ER 1.6はER 1.5およびGemini 3.0 Flashの両モデルとベンチマーク比較が実施されており、ポインティング・カウント・成功判定・計器読み取りのすべてのタスクで上回る結果が示されています。
ポインティング:空間推論の基盤
Gemini Robotics-ER 1.6において、「ポインティング」はあらゆる空間推論の基盤となる能力です。Google DeepMindによれば、本モデルは精度の高い物体検出・カウント、比較論理(「最も小さいものを指定する」など)、軌跡マッピング、把持点の特定、制約条件に基づく指定(「青いカップに入るすべての物体を指せ」など複合的な条件付き指示)といった多様なタスクに対応しています。
ポインティングは単独の出力にとどまらず、より複雑なタスクの中間ステップとしても機能します。たとえば、画像内の物体数をカウントする際に点を活用したり、数学的演算と組み合わせてメトリクス推定の精度を向上させるといった用途が想定されています。評価では、ER 1.5が見逃していたはさみの検出や、ペンチの正確な位置特定においても正確な結果が示されており、前世代からの改善が確認されています。
成功判定:自律性を支えるエンジン
ロボティクスにおいて、タスクが「完了したかどうか」を正確に判断する能力は、自律性の中核をなします。Google DeepMindは成功判定を「次のステップに進むか、やり直すかを判断するための意思決定エンジン」と説明しています。
実環境でこの能力を発揮するには、遮蔽(オクルージョン)・照明不良・曖昧な指示といった複合的な障害を乗り越える知覚・推論能力が求められます。また、多くのロボットは頭上カメラと手首カメラなど複数のカメラを搭載しており、複数の視点を統合して状況を把握する「マルチビュー推論」が不可欠です。ER 1.6はこのマルチビュー推論を強化しており、動的な環境や視野が遮られた状況でも複数カメラの映像を統合して判断できると説明されています。タスクが真に完了しているかを複数の視点から確認できることは、産業用途での信頼性向上に直結すると考えられます。
計器読み取り:実世界の視覚推論
ER 1.6の目玉機能の一つが、新たに追加された「計器読み取り」です。この機能はBoston Dynamicsとの協業を通じて発見されたユースケースであり、産業施設の巡回点検を担うロボット犬「Spot」への実装を念頭に開発されました。
対応する計器は、円形の圧力計・垂直レベル計・サイトグラス・デジタル表示器など多岐にわたります。計器の読み取りには、針・液面・目盛・単位テキストなど複数要素を同時に認識し、それらの相互関係を理解する複合的な視覚推論が求められます。サイトグラスの場合はカメラ視点による歪みを考慮した液面推定、複数の針を持つ計器では小数点の桁数を考慮した組み合わせ計算も必要になります。
Google DeepMindによれば、この能力はagentic vision(視覚推論とコード実行を組み合わせた技術)を活用して実現されています。モデルはまず画像内の細部をズームインして精度を高め、ポインティングとコード実行を用いて目盛の間隔と比率を算出し、最終的に世界知識を活用して計測値の意味を解釈する段階的な処理を行います。
計器読み取りの成功率は、ER 1.5の23%から、ER 1.6では86%、agentic vision有効時には93%まで向上しており、前世代からの大幅な改善が確認されています。
安全性:シリーズ最高水準
Google DeepMindは、ER 1.6がシリーズ中で最も安全なモデルだとしています。物理的な安全制約への対応力が向上しており、「液体を扱わない」「20kgを超える物体は持ち上げない」といった制約条件をポインティングなどの空間出力で遵守できる能力が強化されています。
また、実際の負傷報告を基に構築された安全評価ベンチマーク「ASIMOV」においても評価が実施されており、テキストシナリオでGemini 3.0 Flashを6ポイント、ビデオシナリオで10ポイント上回る結果が示されています。ロボットが物理世界に直接介入するうえで安全性の確保は特に重要であり、この指標の改善は産業導入における信頼性向上につながると考えられます。
提供方法
ER 1.6は2026年4月14日より、Gemini APIおよびGoogle AI Studio経由でプレビュー版として開発者向けに提供が開始されています。GitHubには設定方法やプロンプト例を含むColabノートブックも公開されており、すぐに試せる環境が整備されています。また特定のユースケースで現行の能力に限界を感じた場合は、10〜50枚のラベル付き画像を提出することで開発チームが次バージョンの改善に活用する取り組みも進められています。
まとめ
Gemini Robotics-ER 1.6は、空間推論の精度向上と計器読み取りという新機能の追加により、産業ロボットの自律化に近づいたモデルです。Boston Dynamicsとの実運用を通じた機能開発という点も、実用志向の開発姿勢が感じられます。Gemini API経由で開発者向け提供が開始されており、今後の性能進化が注目されます。
