はじめに
Googleが2026年2月25日、インタラクティブな仮想世界を生成・探索できる実験的プロトタイプ「Project Genie」の仕組みについて、開発担当者へのインタビュー記事を公開しました。本稿では、Project Genieを支える「ワールドモデル(world model)」という概念を中心に、その仕組みと活用可能性を解説します。
参考記事
- タイトル: Ask a Techspert: What’s a world model?
- 著者: Molly McHugh-Johnson
- 発行元: Google The Keyword
- 発行日: 2026年2月25日
- URL: https://blog.google/company-news/inside-google/googlers/ask-a-techspert/what-is-a-world-model-project-genie/
要点
- ワールドモデルとは、エージェント(AIや操作主体)の行動の連続に基づいて、次の瞬間に世界がどうなるかを予測するAIモデルである
- Project Genieは、ゲームエンジンを使わず、ワールドモデルだけで物理的な環境の動きをリアルタイムに再現できる実験的プロトタイプである
- ワールドモデルの概念は2018年のGoogle Brain(現Google DeepMind)の論文に起源があり、David HaとJürgen Schmidhuberが視覚領域で初めてモデルを訓練した
- 現在のProject Genieにおける「観察(observation)」は視覚情報に限定されており、テキストと画像の両方をプロンプトとして使用できる
- AIエージェントの訓練環境、教育、ゲーム開発、映像制作など幅広い活用が想定されている
詳細解説
ワールドモデルとは何か
「ワールドモデル」という言葉は、大規模言語モデル(LLM)や画像生成モデルと比べるとまだ耳慣れない方も多いと思います。Googleの開発担当者であるShlomi Fruchter氏はその違いを次のように説明しています。言語モデルが「次の単語を予測すること」でその本質を学ぶように、ワールドモデルは「エージェントが行動を連続して行う中で、次の瞬間に世界がどうなるかを予測すること」で、世界の表現を学びます。つまり、環境を瞬間ごとにシミュレーションし、エージェントの行動に反応するモデルです。
この概念は今に始まったものではなく、Googleによれば2018年のGoogle Brain(現Google DeepMind)の論文にさかのぼります。David HaとJürgen Schmidhuberによるその論文は、視覚領域でワールドモデルを初めて訓練した研究として、開発者コミュニティに「ワールドモデル」という言葉を広めたとされています。
Project Genieの仕組み
Project Genieは、こうしたワールドモデルを活用して、キャラクターや環境を含む独自の仮想世界をリアルタイムに生成・探索できる実験的プロトタイプです。研究科学者のJack Parker-Holder氏によれば、エイリアンの惑星を旅したり、海の生き物と水中を泳いだりといった体験を、ユーザーの想像に応じて作り出せるとのことです。
注目すべき点は、こうした環境の動きがゲームエンジンを一切使わず、モデルだけで再現されることです。Fruchter氏が説明するように、たとえば床に転がるボールを蹴れば実際に転がり始め、水がこぼれたり雨が降ったりといった物理現象もエンドツーエンドでシミュレートされます。自分の部屋の写真を元に仮想空間を作れば、鏡の映り込みや木床への光の反射といった細部まで予測されるとのことです。
プロンプトの方法は、画像とテキストの組み合わせが最も効果的とされています。たとえば「波が荒れた海辺の犬の写真」に「波が荒い」というテキストを添えることで、そのシーンの動きを記述できます。テキストのみでも動作しますが、視覚的なインプットがあるほうが豊かな体験になると説明されています。
現時点での「観察(observation)」は視覚情報に限定されています。触感や嗅覚といった情報を統合することは将来的な課題であり、現状はあくまで視覚ベースのシミュレーションという位置づけです。
想定される活用領域
Project Genieはまだプロトタイプ段階ですが、Googleの開発チームはいくつかの活用領域を示しています。
第一に、AIエージェントの訓練環境としての活用です。現実世界でAIエージェントを直接動かすことはコストと安全上のリスクを伴いますが、仮想環境であれば安全にテストを繰り返すことができます。ロボット工学や自動運転の開発現場では、こうしたシミュレーション環境の重要性が以前から指摘されており、ワールドモデルの活用はその方向性と合致します。
第二に、教育への応用です。Parker-Holder氏は「古代ローマを歩き回りながら歴史を学ぶ」「緊急救助員や消防士の現場を体験する」といった例を挙げています。危険を伴わずに職業体験ができるという点は、職業訓練の分野でも可能性があると思います。
第三に、ゲーム開発や映像制作への応用です。早期テスターからは、ゲームのアイデア探索に使っているという声や、映画の新しいロケ環境を試すために使いたいという声が届いているとのことです。開発チームは将来的に、映画を「見る」とゲームを「プレイする」の境界を曖昧にする新しいメディアになりうると展望しています。
現時点でProject Genieは米国在住・18歳以上のGoogle AI Ultraサブスクライバーを対象としており、今後さらなる展開が予定されています。
まとめ
Googleが公開した解説記事を通じて、ワールドモデルとは何か、そしてProject Genieがその技術をどのように体験可能な形にしているかを整理しました。エージェント訓練、教育、創作表現と、応用領域は多岐にわたります。まだプロトタイプ段階ではありますが、今後の発展が注目されます。
