はじめに
Google Cloudは2026年3月17日、NVIDIAとの拡大パートナーシップをGTC 2026にて発表しました。業界初となる分割型GPU仮想マシンのプレビュー開始や次世代プラットフォームへの対応計画など、エンタープライズ向けAIインフラに関する複数の新発表が行われています。本稿ではその概要を解説します。
参考記事
- タイトル: Google Cloud and NVIDIA expand AI innovation across industries at GTC 2026
- 著者: Mark Lohmeyer(VP & GM, AI & Computing Infrastructure)
- 発行元: Google Cloud Blog
- 発行日: 2026年3月17日
- URL: https://cloud.google.com/blog/products/compute/google-cloud-ai-infrastructure-at-nvidia-gtc-2026?hl=en
要点
- Google CloudはGTC 2026にてNVIDIAとの協業を拡大し、AIインフラに関する複数の新発表を行った
- NVIDIA RTX Pro 6000 Blackwell Server Edition搭載のG4 VMで、同GPU初となる分割型仮想マシン(フラクショナルG4 VM)のプレビューが開始された
- NVIDIA Vera Rubin NVL72プラットフォームへの対応を2026年後半に予定しており、主要クラウドプロバイダーの一社として早期提供を目指している
- NVIDIA DynamoとGKE Inference Gatewayの統合により、推論インフラのオープンソースベースの柔軟な制御が可能になった
- Vertex AIのトレーニングクラスターにA4X VMドメイン対応と障害予兆検知機能が追加され、長期学習ジョブの安定性が向上した
詳細解説
G4 VMの活用実績
G4 VMはNVIDIA RTX Pro 6000 Blackwell Server Edition GPUを搭載しており、空間コンピューティングから大規模AIモデルの推論・ファインチューニングまで幅広い用途に対応しています。4ビット浮動小数点(FP4)精度とP2P(ピアツーピア)通信を組み合わせることで、高スループットと低レイテンシを両立しており、リアルタイムのマルチモーダルAIエージェント構築に活用されているとされています。
Google Cloudの発表によれば、General MotorsはG4 VMによってAI/ML処理のスループットが4倍に向上したと報告しています。また、ElevenLabsは多言語音声エージェントの推論速度と信頼性の改善を、Imgixはレイテンシを50%削減しスループットを6倍に高めたとそれぞれコメントしています。物流領域では、Otto Group One.OがG4 VMを活用してロボットフリートのミリ秒精度の同期と、デジタルツインによるサプライチェーン最適化を実現していると述べています。
業界初:フラクショナルG4 VMのプレビュー開始
Google Cloudは、NVIDIA vGPU技術を用いたフラクショナル(分割型)G4 VMのプレビューを発表しました。NVIDIA RTX Pro 6000 Blackwell Server EditionにおけるvGPU分割提供は業界初とされており、利用目的に応じてGPU容量を細かく選択できる点が特徴です。
選択可能なGPUスライスは以下の3種類です。
- 1/2 GPU: LLM推論、ロボット向けセンサーシミュレーション、高精細3Dレンダリングなど比較的負荷の高い用途向け
- 1/4 GPU: 中規模のクリエイティブデザイン、動画トランスコーディング、リアルタイムデータ可視化など標準的なワークロード向け
- 1/8 GPU: リモートデスクトップ、生産性ツール、エントリーレベルのストリーミングなど軽量用途向け
フラクショナルG4 VMはGoogle Kubernetes Engine(GKE)で管理でき、コンテナのビンパッキング(詰め込み最適化)による効率的な資源配置が可能です。また、Dynamic Workload Schedulerと組み合わせることで、フォールバック優先順位を設定し、空きGPU構成を自動的に割り当てられる仕組みも備わっています。GPUを固定サイズで確保する従来の方式と比較すると、需要規模に応じた柔軟なリソース調整がしやすくなると考えられます。
NVIDIA Vera Rubin NVL72への対応計画
Google CloudはNVIDIAが発表した次世代アーキテクチャ「Vera Rubin」プラットフォームへの対応を表明しました。NVIDIA Vera Rubin NVL72ラックスケールシステムを2026年後半に提供予定であり、主要クラウドプロバイダーの一社として早期提供を目指すとしています。同プラットフォームはAI Hypercomputerアーキテクチャに統合され、次世代の推論・エージェント型AIワークロードの基盤として位置づけられています。
DynamoとGKE Inference Gatewayの統合
ソフトウェア面では、NVIDIA DynamoとGKE Inference Gatewayの統合が発表されました。Dynamoはオープンソースの推論最適化フレームワーク、GKE Inference Gatewayはクラスター内の推論トラフィックを制御するコントロールプレーンです。両者を組み合わせることで、アプリケーション層からハードウェア層までをカバーするモジュラー型の制御基盤が実現するとされています。
また、MoE(Mixture of Experts:複数の専門モデルを組み合わせるアーキテクチャ)を大規模に動かすための高度なスケーリングレシピが、A4X VM(NVIDIA GB200 NVL72搭載)向けに提供されています。メモリとインターコネクトのボトルネックへの対処指針が示されており、大規模推論ワークロードの運用効率化に活用できると思います。
Vertex AIトレーニングとModel Gardenの強化
Vertex AIのトレーニングクラスターには、主要な強化が2点加わりました。一つ目は、A4X VMドメインのサポートです。NVIDIA GB200 NVL72ラックスケールシステムを用いた大規模トレーニングが、Vertex AIのマネージドインフラ上で実行できるようになります。二つ目は、ハードウェア障害予兆検知機能の追加です。設定可能な事前スキャンにより、重要なトレーニングジョブが中断されるリスクを事前に低減できます。数週間にわたる長期学習ジョブの安定運用に貢献すると考えられます。
Salesforceは、Vertex AIトレーニングクラスターとNVIDIA GB200 NVL72を活用してAgentforce 360プラットフォームを構築し、GPUの稼働率を高めた状態を維持できるようになったと述べています。
Vertex AI Model GardenにはNVIDIA Nemotron 3シリーズが追加されました。Nemotron 3 NanoはプライベートVPCへのワンクリックデプロイに対応しており、Nemotron 3 Super 120Bは大規模な推論用途向けに即時アクセスが可能です。NVIDIAのTensorRT-LLMパフォーマンスライブラリとの統合も行われており、オープンソースモデルの最適化に活用できます。
Kaggleコンテストと公共部門向けスタートアップ支援
Kaggle上では、G4 VMを活用してNemotron 3 Nanoの推論精度改善を競うコンテストが開催されています。プロンプト設計、合成データ生成、データキュレーション、ファインチューニングなどの手法が対象となっており、コミュニティが知見を共有できる場として機能することが期待されています。
また、Google Public SectorとNVIDIAは、公共部門向けAIスタートアップ支援プログラムを共同で立ち上げました。NVIDIA InceptionとGoogle CloudのISVアクセラレーターリソースの両方を利用できる1年間のプログラムで、GTC 2026を皮切りにGoogle Cloud Nextまで続く予定です。選考された独立系ソフトウェアベンダー(ISV)が、公共部門向けアプリケーションのスケールアップに必要な技術支援や市場開拓サポートを受けられる内容となっています。
まとめ
Google CloudはGTC 2026において、フラクショナルG4 VMの提供開始、Vera Rubin NVL72への対応計画、DynamoとGKE連携、Vertex AI強化など、AIインフラの複数の強化を一斉に発表しました。エージェント型AIの普及に伴いインフラへの要求が多様化する中、柔軟なリソース活用と大規模処理の安定運用に向けた取り組みがどのように進展していくか、引き続き注目したいところです。
