[AIツール利用者向け]Gemini Omniで何が作れるのか——5組のビルダーが示した動画制作の実例

目次

はじめに

 Googleが 2026年8月7日、公式ブログで動画生成モデル「Gemini Omni」を使ったビルダー5組の作例を紹介しました。本稿では、視点の切り替えや落書きによるアニメーション、スタイル変換など、実際に公開されたデモをもとに、Omniで何ができるのかを整理します。

参考記事

関連記事

あわせて読みたい
[ニュース解説]テキストで動画を自在に編集——Googleが「Gemini Omni Flash」を発表 はじめに  GoogleのCTO・Koray Kavukcuoglu氏が2026年5月、あらゆる入力からコンテンツを生成できる新モデルファミリー「Gemini Omni」を発表しました。本稿では第1弾...
あわせて読みたい
[AIツール利用者向け]Google FlowにGemini OmniとAIエージェントが登場——動画・音楽制作の新機能まとめ はじめに  GoogleのElias Roman氏(VP, Product, Google Labs)が2026年5月19日、AI動画・音楽制作プラットフォーム「Google Flow」および「Google Flow Music」の大型...
あわせて読みたい
[開発者向け]Google「Nano Banana 2 Lite」と「Gemini Omni Flash」発表——高速・低コストな画像/動画... はじめに  Google DeepMindは2026年6月30日、高速かつ低コストな画像生成モデル「Nano Banana 2 Lite」と、動画生成・編集モデル「Gemini Omni Flash」の開発者向け提...

要点

  • Gemini Omniは、テキスト・画像・動画・音声を参照素材として動画を生成し、既存の動画を編集することもできるモデルファミリーである
  • Googleは今年のI/Oで最初のモデル「Gemini Omni Flash」を発表し、その後開発者向けに提供を開始した
  • 公式ブログでは、視点変更・環境の変換・落書きによるアニメーション・スタイル変換・企画の可視化という5種類の作例が紹介された
  • Omniは物理法則の理解とGeminiの実世界知識を組み合わせることで、より現実に即した出力を生成するとGoogleは説明している
  • 利用先はGeminiアプリ、Google Flow、Google AI Studio、Gemini API、Gemini Enterprise Agent Platformの5つである

詳細解説

Gemini Omniとは何か

  Gemini Omni は、Googleが今年のI/Oで発表した動画向けモデルファミリーです。Googleによれば、テキスト・画像・動画・音声のいずれかを参照素材として高品質な動画を生成でき、手元にある自分の動画を編集することもできます。同ファミリー最初のモデルが「Gemini Omni Flash」で、テキスト指示で動画を編集できるモデルとして発表されました。今回のブログ記事は、その後開発者にアクセスが開放されたことを受け、実際に作られたデモを紹介する内容になっています。

 Googleは、Omniが物理法則の直感的な理解とGeminiが持つ実世界の知識を組み合わせている点を、出力の現実らしさの理由として挙げています。動画生成モデルの評価では、物体の落下や光の反射といった物理的な整合性が崩れないかどうかが従来から課題とされてきました。知識と物理理解の統合という設計は、この課題に対する一つのアプローチだと考えられます。

視点の切り替えと環境の変換

 最初の作例は、カメラワークの編集です。Googleの説明では、Omniは元のシーンの一貫性を保ったまま、カメラアングルの変更、環境の切り替え、シネマティックなズームを適用できます。ビルダーのLeon Lin氏(X: @LexnLin)は、街中に立つ女性を約20種類の視点から捉えた作例を公開しました。近景と遠景、正面と横顔、俯瞰と煽りといったアングルが並び、ズームするショットと固定のショットが混在します。背景も歩道・横断歩道・車道へと移り変わり、歩行者や車、路面電車、さまざまな建物が現れます。

 2つ目は、動画の中で起きている出来事そのものを変える使い方です。Carlos Santana氏(X: @DotCSV)は、屋外のシーンを音声だけで操作し、照明を昼から夜へ切り替え、曇り空と雨音を加え、木の葉をオレンジに染め、地面を雪で覆いました。従来の映像編集では、天候や時間帯の変更にはロケハンや撮り直し、あるいは合成の工程が必要でした。音声による指示だけで同等の変更が試せるとすれば、企画段階での検討コストは下がると考えられます。

落書きによるアニメーションとスタイル変換

 3つ目は、Google Flow上でのOmniの使い方です。Googleによれば、スケッチを現実的な動画に変換でき、落書き(doodle)で個々の要素の動き方を指示できます。手描きの要素を最終的な出力に残すかどうかも選べます。ビルダーのPan氏(X: @sebatheepan)は、この機能で日用品を変身させました。レモンが海に浮かぶ潜水艦になり、エスプレッソのカップが人を空へ運ぶ熱気球になります。2本の唐辛子は眠る竜になって驚くと火を吹き、マッチはロケットに、はさみは獲物を探すサメになります。

 4つ目はスタイルの変換です。参照素材を入力するか、自然言語で望む見た目を説明することで、Omniがそれらを統合して一貫したクリップを作ります。Jerrod Lew氏(X: @jerrod_lew)は、街を歩く女性の動画を4種類のアニメーションスタイルでレンダリングしました。実写からアニメ、クレイアニメーションへと滑らかに移り変わりながら、女性が前へ歩き続ける動きは途切れません。スタイル変換では、フレームごとに絵柄が揺れる「ちらつき」が課題になりやすい領域です。動きの連続性が保たれている点は、時間方向の一貫性を扱えていることの現れだと言えます。

企画やデータの可視化に使う

 5つ目は、企業チームによる活用例です。Hyperagent(X: @hyperagentapp)は、Omniで3つのコンセプトを動画として可視化しました。何もない公園の動画に植栽を重ね、施工前後を比較する設計提案を作成。ビジネスダッシュボードを解説するアニメーションの教授を登場させ、データを擬人化しました。さらに、キャラクターがタスクを消化していく動画でToDoリストをゲーム化しています。

 ここで挙げられているのは、いずれも「まだ存在しないもの」や「目に見えないもの」を見せる用途です。提案資料や社内向けの説明に動画を使う場面は、制作コストの高さから限られてきました。会話に近い操作で試作できるようになると、動画の使いどころ自体が広がる可能性があります。なお、OmniはGoogle Flowでは音楽生成やAIエージェント機能とあわせて提供されており、制作フロー全体の中で使う設計になっています。

利用できる場所

 Googleによれば、Omniを試せるのはGeminiアプリ、Google Flow、Google AI Studio、Gemini API、Gemini Enterprise Agent Platformの5つです。手軽に触れたいならGeminiアプリやGoogle Flow、自分のアプリに組み込みたいならAI StudioやGemini API、という使い分けになると考えられます。

まとめ

 Gemini Omniの作例からは、視点変更、環境の変換、落書きからのアニメーション化、スタイル変換、企画の可視化という5つの方向性が見えてきます。編集の対象が「映像そのもの」から「言葉で伝える意図」へと移りつつある流れが見て取れます。モデルの仕様面については、発表時の解説記事もあわせてご覧いただければと思います。

この記事が気に入ったら
フォローしてね!

  • URLをコピーしました!
  • URLをコピーしました!
目次