[開発者向け]Google DeepMind「Dear Upstairs Neighbors」制作秘話——アニメーターとAI研究者の協働で生まれた表現主義的短編映画

目次

はじめに

 Google DeepMindが2026年1月26日、アニメーション短編映画「Dear Upstairs Neighbors」の制作プロセスを公式ブログで詳しく紹介しました。この作品は、Sundance Film Festivalでプレビュー上映され、Pixar出身の監督Connie HeとGoogle DeepMindの研究者たちが協力し、VeoとImagenのファインチューニング技術とビデオtoビデオワークフローを活用して制作されました。本稿では、アニメーターとAI研究者がどのように協働し、表現主義的なビジュアルスタイルを実現したかを解説します。

参考記事

要点

  • 「Dear Upstairs Neighbors」は、Pixar出身の監督Connie HeとGoogle DeepMind研究者が協力して制作したアニメーション短編映画であり、2026年1月26日にSundance Film Festivalでプレビュー上映された
  • 制作チームは、VeoとImagenをファインチューニングすることで、独自のキャラクターデザインと表現主義的なペイント風スタイルを実現した
  • テキストプロンプトだけでは表現できない細かい動きやタイミングを制御するため、ビデオtoビデオワークフローを開発し、アニメーターが従来のツールで作成したラフアニメーションをAIモデルが最終的なスタイルに変換した
  • 完成したショットは複数回の反復改善を経て完成し、局所的な修正ツールを使用して特定の領域を編集することで効率的に品質を向上させた
  • 最終的にVeoの4Kアップスケーリング機能を使用して、映画館での上映に適した高解像度の映像を生成した

詳細解説

映画の概要とストーリー

 「Dear Upstairs Neighbors」は、騒音に悩まされる若い女性Adaを主人公とした短編映画です。監督のConnie Heによれば、この物語は彼女自身の騒音トラブル体験に基づいており、夜が更けるにつれて主人公の幻覚がエスカレートしていく様子をストーリーボードで構想しました。

 プロダクションデザイナーのYingzong Xinは、Adaのキャラクターデザインとして、特徴的な比率と角ばった形状言語を持つ独特なスタイルを開発しました。Googleの発表によれば、Adaの寝室は冷色で描かれて落ち着きと安らぎを表現し、一方で幻覚シーンはネオンカラーのパレットと粗いスタイルで「現実世界」と区別されています。最も激しい場面では、抽象表現主義的なスタイルがシーン全体を支配するように設計されました。

 アニメーション映画において、表現主義的なビジュアルスタイルは伝統的な手法では実現が極めて困難です。制作チームは、AIがこのギャップを埋める可能性を見出しましたが、デザインの独自性と特殊性が高いため、新しい技術開発が必要となりました。

ファインチューニング技術による独自スタイルの実現

 制作チームが直面した最初の課題は、Adaのキャラクターデザインと各シーンのペイント風スタイルに一貫性のあるショットを生成することでした。Googleによれば、研究者たちはアーティストが少数のサンプル画像からカスタムVeoとImagenモデルをファインチューニングできるツールを構築し、モデルに新しいビジュアルコンセプトを学習させました。

 興味深い点として、ファインチューニングされたVeoモデルは、表面的な色やテクスチャだけでなく、2点透視法のような深い芸術的概念も学習したと報告されています。特にAdaのヘアデザインは、2次元的なルールに従っており、髪の盛り上がりとお団子が常にシルエットの一部として描かれ、顔を隠さないようになっています。3次元の彫刻ではあらゆる角度から正しく見えることは不可能ですが、ファインチューニングされたVeoは頭部が回転する際にシルエットを正しく保つよう形状をシームレスに適応させたとのことです。

 ファインチューニング技術は、機械学習において既存のモデルを特定のデータセットやタスクに適応させる手法です。一般的には、大規模なデータで事前学習されたモデルを、少量の特定データで追加学習させることで、新しい概念やスタイルを獲得させます。この手法により、ゼロから学習する場合と比較して、はるかに少ないデータと計算資源で高品質な結果を得ることができます。

ビデオtoビデオワークフロー:視覚的コミュニケーション

 テキストプロンプトだけでは、Adaの眠そうな指のタイピングのリズム、表情のコメディックなタイミング、カメラの正確なフレーミングなどを制御できないことが明らかになりました。Googleの発表では、研究者たちがアニメーターの視覚的なコミュニケーション方法(描画、ペイント、演技)にヒントを得て、新しいビデオtoビデオワークフローを開発したと説明されています。

 このワークフローでは、アニメーターが好みのツールでラフアニメーションを作成し、AIモデルがそれを完全にスタイライズされた映像に変換します。入力された動きに従いながら、厳密な制御と創造的な即興性のバランスを調整できる仕組みです。

 具体的な制作例として、アニメーターのBen KnightがMayaで3Dラフアニメーションを作成し、研究者のAndy CoenenfがファインチューニングされたVeoモデルを使用して最終的な見た目に変換しました。また、アニメーターのMattias BreitholtzがTV Paintで2Dラフアニメーションを作成し、研究者のForrester ColeがファインチューニングされたバージョンのImagenをComfyUIワークフローで使用してフレームごとに最終的な見た目に変換する方法も採用されました。

 この手法の利点は、各アーティストが自分の得意なツールを使用できる点にあります。従来のアニメーション制作パイプラインを大きく変更することなく、AIの能力を活用できると考えられます。

反復改善プロセスとローカライズされた修正

 ファインチューニングとビデオtoビデオワークフローを使用しても、最終的なショットは「ワンクリック」で生成されることはありませんでした。Googleによれば、制作チームは通常の映画制作と同様に、「デイリー」レビューで各ショットを批評し、細部を正しく仕上げるために複数回のフィードバックサイクルを経たとのことです。

 毎回ゼロから再生成することなくショットを改善するため、研究者たちは局所的な修正ツールを構築しました。このツールにより、ビデオの特定の領域を調整可能な制御レベルで編集できるようになりました。

 例として、Adaが幻覚で見る遠吠えする犬のシーンでは、Yingzong Xinのコンセプトペイントから始まり、Veoの画像to映像機能で動きを付けました。最初のパス(ファインチューニングなし)は意図したビジュアルスタイルに対してフォトリアリスティック過ぎたため、ファインチューニング版のVeoを使用してスタイルを近づけたと報告されています。ビデオtoビデオワークフローにより、VeoとPremiereのような従来のツールを自由に切り替えることができました。

 また、スーパーバイジングアニメーターのCassidy CurtisがMayaでラフな3Dアニメーションを作成し、研究者のErika LuがファインチューニングされたVeoモデルを使用して最終的な見た目に変換した例では、Adaの髪のシルエットを改善するため、Luがより多くの髪が必要な領域を示すラフマスクを追加し、Veoを使用してそこに追加の房をシームレスに即興で生成しました。

 このような局所的な修正機能は、映像生成AIの実用性を大きく高める要素と言えます。完全な再生成では時間とコストがかかるだけでなく、他の部分の良い結果まで失われる可能性があるためです。

4Kアップスケーリングと映画館上映への対応

 最終的に、映画館での上映に備えて、制作チームはVeoの4Kアップスケーリング機能を使用して最終ショットを4K解像度にしました。Googleによれば、研究者たちはアーティストの批評に基づいてモデルの動作を慎重に調整し、芸術的スタイルのあらゆるニュアンスを保持しながら豊かなディテールを追加したとのことです。

 このVeo 4K アップスケーリングモデルは、映画制作者の実際のニーズに応えるため、Flowで利用可能となっており、1月末にはGoogle AI StudioとVertex AIでも利用可能になる予定です。

 アップスケーリング技術は、低解像度の画像や映像を高解像度に変換する処理ですが、従来の手法では単純な補間によりディテールがぼやける問題がありました。AIベースのアップスケーリングでは、学習したパターンに基づいて新しいディテールを生成することで、より自然で高品質な結果を得られます。ただし、元のアーティスティックな意図を損なわないよう、生成されるディテールを慎重に制御する必要があると考えられます。

学びと今後の展望

 制作チームによれば、各ショットには独自の課題があり、制作期間を通じて、手作りアニメーションの正確な制御と、生成AIのスタイル的柔軟性とスケーラビリティを組み合わせた複数のワークフローが開発されました。AIモデルは面白いブルーパー(失敗作)を生み出すこともありましたが、予想外に美しく創造的な解決策で驚かせることもあったとのことです。

 Googleは、アーティストが実験的な研究に直接アクセスすることで新しい創造的な力を見出し、その技術と視点が開発の形成に貢献したと述べています。一方、研究者はテクニカルアーティストとしての実践的経験を得て、芸術的および技術的障壁を突破するソリューションを迅速にプロトタイピングしたとのことです。

 この協働プロジェクトは、プロフェッショナルなアーティストと映画制作者と共に、そして彼らのために生成AIを構築するというミッションを継続する上で、重要な知見を提供したと考えられます。

まとめ

 「Dear Upstairs Neighbors」の制作プロセスは、生成AIがアニメーション制作にどのように統合され得るかを具体的に示した事例です。ファインチューニング、ビデオtoビデオワークフロー、局所的修正ツール、4Kアップスケーリングという複数の技術を組み合わせることで、アーティストの創造的ビジョンを維持しながら、従来は困難だった表現主義的スタイルを実現しました。今後、同様のアプローチが映像制作の現場でどのように活用されるか注目されます。

この記事が気に入ったら
フォローしてね!

  • URLをコピーしました!
  • URLをコピーしました!
目次