[開発者向け]NVIDIA機密コンピューティングは推論性能をどこまで守れるか——TensorRT LLMの最適化と検証結果

目次

はじめに

 NVIDIAは2026年9月22日、開発者向けブログで、機密性の高いAI推論を保護する「NVIDIA Confidential Computing」と、推論フレームワーク「TensorRT LLM」による性能維持策を報告しました。本稿では、この発表をもとに、暗号化環境下での推論性能を検証したベンチマーク結果と技術的な工夫を解説します。

参考記事

関連記事

あわせて読みたい
[ニュース解説]NVIDIAの新技術「NVLink Fusion」でAIチップ間通信が加速! はじめに  本稿では、AI技術の進化を牽引するNVIDIA社が発表した最新技術について、ロイター通信の記事「Nvidia plans to sell tech to speed AI chip communication」...
あわせて読みたい
[開発者向け]NVIDIA GB300、新ベンチマークでH200比20倍のエージェント処理性能を記録 はじめに  NVIDIAは2026年6月12日、AI分析企業Artificial Analysisが開発した新しいハードウェアベンチマーク「AA-AgentPerf」の結果を公式ブログで公開しました。本稿...
あわせて読みたい
[開発者向け]NVIDIA SkillEvaluatorでAIスキルを評価——3段階と実測結果 はじめに  NVIDIAが 2026年8月19日 、AIエージェント用スキルの効果を測るオープンソースツール「SkillEvaluator」の評価方法と初期結果を公開しました。本稿では、3段...

要点

  • NVIDIAは、機密コンピューティング(CC)を有効にした状態でのTensorRT LLM推論性能を検証し、無効時と比べて出力トークンのスループットを96.1〜98.2%維持できたとしている。
  • 同条件でのTPOT(トークン1つあたりの出力時間)の増加は1.2〜4.3%にとどまったとしている。
  • 検証にはDeepSeek-R1-0528-NVFP4モデルを使用し、NVIDIA DGX B200(B200 GPU8基)上でTensorRT LLMのPyTorchバックエンドを動かしている。
  • TensorRT LLMは、ホスト・デバイス間のデータ転送、カーネルオートチューナーのタイミング計測、マルチGPU通信という3つの領域でCC対応の最適化を実装しているとしている。
  • 検証環境はIntel TDXをプラットフォームとし、Ubuntu上に構築した機密仮想マシン(CVM)でTensorRT LLMを動作させている。

詳細解説

NVIDIA Confidential Computingとは何か

 NVIDIA Confidential Computing(CC)は、メモリを暗号化した機密仮想マシン(CVM)、機密GPU、暗号化されたNVIDIA NVLinkを組み合わせ、信頼できる環境の中でAI推論を実行する仕組みです。個人利用・企業利用・規制業界のいずれにおいても、モデルの重みや入力プロンプトといった機密情報を処理する場面が増えており、NVIDIAはこうした需要に対応するためCCを提供しているとしています。

 CVMとは、ハードウェアレベルでメモリを暗号化し、ホストOSやハイパーバイザーからも内部のデータを見えなくする仮想マシンのことです。GPU間の高速接続についても、NVLink Fusionによる通信高速化の技術は以前にも紹介しましたが、CC環境ではこの接続経路自体も暗号化の対象になる点が特徴だと考えられます。

検証に使われたワークロードと環境構成

 NVIDIAの性能エンジニアリングチームは、CCによる性能への影響を可視化しやすいワークロードとして、長い入力コンテキスト・長い出力生成・低い同時実行数という条件を選んでいます。リクエスト数が多いと暗号化に伴う固定コストが他の処理と重なって見えにくくなるため、あえてこの条件を採用したとしています。

 長いコンテキストはプレフィル(入力処理)時のデータ移動負荷を高め、長い出力生成はデコード(トークン生成)時の小さなオーバーヘッドを積み重ねて顕在化させ、低い同時実行数は複数リクエスト間でコストを分散させる余地を減らす、という狙いです。具体的な検証条件は次の通りです。

  • モデル: nvidia/DeepSeek-R1-0528-NVFP4
  • 推論フレームワーク: TensorRT LLM(PyTorchバックエンド)
  • 入出力シーケンス長: 入力32K/出力1K
  • 同時実行リクエスト数: 1、2、4、8、16
  • 並列化構成: テンソル並列8、エキスパート並列1、パイプライン並列1
  • KVキャッシュ: FP8

 ハードウェア・ソフトウェア構成は次の通りです。

  • ハードウェア: NVIDIA DGX B200(NVIDIA B200 GPU8基)
  • プラットフォーム: Intel TDX
  • ホストOS/カーネル: Ubuntu 25.10 / 6.17.0-20-generic
  • ゲストOS/カーネル: Ubuntu 24.04.4 LTS / 6.8.0-124-generic
  • ゲストvCPU数: 256(NUMA2ノード)
  • NVIDIAドライバー: 595.71.05
  • GPU電力上限: 1,000W
  • CUDA: 13.2
  • TensorRT LLM: nvcr.io/nvidia/tensorrt-llm/release:1.3.0rc22
  • NCCL: v2.30
  • OpenSSL: 3.6.0
  • オーケストレーション: Docker Container + NVIDIA Container Toolkit

 注意: これらの構成は検証を再現する場合の参考情報であり、NVIDIAが動作を保証するものではありません。自社環境で試す場合は、まず手元のTensorRT LLMやドライバーのバージョンで動作確認することをおすすめします。

CC有効・無効の比較手法

 NVIDIAは、CCによる性能影響を切り分けるため、モデル・ハードウェア・フレームワークバージョン・シーケンス長・並列化構成・同時実行数をすべて固定し、CCの有効/無効だけを変えて同一ワークロードを実行する方法を採用しています。変化する条件を1つに絞ることで、測定された性能差がCCに起因すると言えるようにする狙いです。

 各同時実行数で、次の2つの指標を算出しています。

  • 出力スループット維持率: 100 ×(CC有効時の出力トークン/秒 ÷ CC無効時の出力トークン/秒)
  • TPOTのレイテンシオーバーヘッド: 100 ×(CC有効時のTPOT ÷ CC無効時のTPOT − 1)

 TPOT(Time Per Output Token)とは、1トークンを出力するのにかかる平均時間を指す指標です。この2つの指標を組み合わせることで、スループットだけでなく、ユーザーが体感する応答間隔への影響もあわせて把握できます。

パフォーマンス検証結果

 NVIDIAによれば、同時実行数1〜16の範囲で、CC有効時の出力トークンスループットはCC無効時の96.1〜98.2%を維持しました。また、平均TPOTのオーバーヘッドは1.2〜4.3%にとどまったとしています。

 この結果は、機密コンピューティングを有効にしても、スループット・レイテンシともに1〜4%程度の差に収まる場合があることを示すものであり、本稿としては、本番運用を検討する際の目安になる数値だと受け止めています。ただし、モデルサイズやワークロードの特性によってこの割合は変わり得るため、自社のワークロードで同様の比較を行うことが望ましいと考えられます。

ホスト・デバイス間データ転送の最適化

 B200のCC環境では、GPUが保護されたCVMメモリに直接アクセスできないため、ホスト・デバイス間の転送はソフトウェアで暗号化されたバウンスバッファを経由します。この結果、通常であれば非同期転送の利点を持つピン留めメモリがその利点を発揮できなくなり、一部のコピー処理が呼び出し元のスレッドをブロックしてしまうという課題が生じます。

 TensorRT LLMは、この課題に対して次の2つの対策を実装しています。

  • ホスト→デバイスの対策: 影響を受ける経路では、ピン留めメモリを無条件に使うのではなく、CC対応のメモリ選択によってページャブルメモリを選択する。
  • デバイス→ホストの対策: トークンやサンプリングデータの読み出しを非同期ワーカーに移すことで、保護されたコピー処理がデコード中のメインスケジューラーをブロックしないようにする(TensorRT LLM PR #11573を参照)。

カーネルオートチューナーのタイミング安定化

 カーネルオートチューナーは通常、候補となる実行方式(タクティクス)を比較する際にCUDAイベントを使用します。検証されたCC構成では、CUDAイベントのタイムスタンプが不安定な信号となり、オートチューナーがより遅いタクティクスを選んでしまう可能性があったとしています。

 この課題への対策として、TensorRT LLMはCC環境下ではGPUの%globaltimerをタクティクス測定に使用し、CC環境外では引き続きCUDAイベントを使う切り替え方式を採用しています(TensorRT LLM PR #11657を参照)。タイミング計測という基盤部分にまで手を入れている点から、CC対応が単なる暗号化の追加にとどまらない作業であることがうかがえます。

マルチGPU通信の最適化

 B200のCC構成では、NVLS(NVLink SHARP)によるマルチキャストが利用できません。NVLSがない状態でNCCL_SYMMETRICを使うと、本来のマルチキャストの利点が得られないまま、メモリ登録やランク間の同期コストだけがかかり、非マルチキャストの集団通信経路に切り替わってしまう場合があるとしています。

 この課題に対してNVIDIAは、CCを対象とするフレームワークはNVLSの利用可否を検出し、メッセージサイズやトポロジー、ワークロードの特性に応じてレイテンシを最小化できる通信アルゴリズムを選ぶべきだと述べています。具体的な実装コードは示されていませんが、通信経路の前提が変わることを踏まえた設計判断が必要になる領域だと考えられます。

まとめ

 NVIDIAは、Confidential Computing環境でもTensorRT LLMの最適化で出力スループット96%以上を維持したと報告しています。機密計算の導入時は、実運用ワークロードでの比較検証も重要だと考えています。NVIDIAのベンチマーク手法はGB300の性能検証でも紹介しており、あわせてご覧ください。

この記事が気に入ったら
フォローしてね!

  • URLをコピーしました!
  • URLをコピーしました!
目次