はじめに
NVIDIAは2026年4月23日、AI推論インフラの経済性を正確に評価するための視点として、「トークンあたりのコスト」こそが唯一の真の総所有コスト(TCO)指標であることを解説する記事を公開しました。本稿では、その内容をもとに、従来の評価指標の限界と、企業が採用すべき指標の考え方を紹介します。
参考記事
- タイトル: AI の TCO を再考する: トークンあたりのコストが唯一重要な指標である理由
- 著者: Shruti Koparkar
- 発行元: NVIDIA Blog(日本語版)
- 発行日: 2026年4月23日
- URL: https://blogs.nvidia.co.jp/blog/lowest-token-cost-ai-factories/
関連記事



要点
- データセンターは単なる計算・保存施設から「AIトークンファクトリー」へと進化しており、主な出力はトークンという形で生成されるインテリジェンスである
- AI インフラの評価指標には「コンピューティングコスト」「1ドルあたりのFLOPS」「トークンあたりのコスト」の3種類があり、企業が注目すべきは出力を直接反映する3番目の指標だけである
- トークンあたりのコストは、GPUのハードウェア性能だけでなく、ソフトウェア最適化・ネットワーク・メモリ・エコシステムといった「水面下の要因」によって大きく変わる
- NVIDIAによれば、BlackwellアーキテクチャはHopperに比べてGPUあたりのコストが約2倍であるにもかかわらず、100万トークンあたりのコストは約35分の1に低減される
- vLLM、SGLang、TensorRT-LLM、Dynamoなどのオープンソース推論ソフトウェアの継続的な最適化により、既存インフラでもトークンあたりのコストは下がり続けると述べられている
詳細解説
データセンターは「AIトークンファクトリー」へ
従来のデータセンターは、データの保存・取得・処理を主な役割としていました。しかし、生成AIやエージェント型AIが主流になるにつれ、その位置づけが変化しています。NVIDIAによれば、AI推論が主要なワークロードとなった現在、データセンターが生産するのはストレージではなく、トークンという形で出力される「インテリジェンス」だとされています。
以前NVIDIAが政府向けAIファクトリー設計を発表した際(https://jobirun.com/nvidia-ai-factory-government-announcement/)にも、AIインフラをファクトリーとして捉える視点が示されていましたが、今回の記事はその経済評価の軸を明確に言語化したものと考えられます。
「3つの指標」と本当に重要なもの
NVIDIAは、AIインフラ評価に使われる指標を3種類に整理しています。
- コンピューティングコスト: クラウドであれオンプレミスであれ、AIインフラに支払う費用そのもの
- 1ドルあたりのFLOPS: 1ドルで得られる純粋な計算性能を示す指標
- トークンあたりのコスト: 1トークン(通常は100万トークン単位)を生成するための企業の総コスト
最初の2つは「入力」の指標です。企業がビジネスとして運営している以上、成果物(出力)に基づいて評価するべきであり、入力だけを最適化しようとするのは根本的なミスマッチだとNVIDIAは指摘しています。
トークンあたりのコストは次の計算式で表されます。
100万トークンあたりのコスト = [GPU1基あたりの1時間コスト ÷ (GPU1基あたりのトークン/秒 × 3600)] × 100万
この式の分子(GPU時間単価)に目を向けがちですが、NVIDIAはコスト削減の鍵は 分母であるトークン出力量の最大化 にあると強調しています。分母が大きくなれば同じGPUコストでより多くのトークンを生成でき、1トークンあたりの費用は下がります。逆に言えば、GPUが安くても出力効率が低ければ、結果としてトークンあたりのコストは高くなるという構造です。
「推論の氷山」——見えていない要因の重要性
NVIDIAが「推論の氷山モデル」と呼ぶ概念は、AIインフラ評価の盲点をわかりやすく示しています。
水面上に見えているのはGPUの時間単価やピーク性能(FLOPS)といった比較しやすい数値です。一方、水面下にはトークン出力を実際に決定づける多くの要因が潜んでいます。NVIDIAが挙げる「詳細なコスト分析」に必要な問いは以下のようなものです。
- 大規模MoE(Mixture-of-Experts)モデルにおける100万トークンあたりのコストはいくらか
- 1メガワットあたりのトークン出力はどれくらいか(特にオンプレミス環境では重要)
- スケールアップインターコネクトはMoEモデルの「全対全通信」トラフィックに対応しているか
- FP4精度はサポートされているか(精度を維持しながら低精度演算で高速化できるか)
- 投機的デコードやマルチトークン予測はサポートされているか
- 分離型サービング、KV対応ルーティング、KVキャッシュオフロードなどのサービング最適化に対応しているか
これらのアルゴリズム・ハードウェア・ソフトウェアの最適化はすべてが有効かつ統合されている必要があり、どこかが欠けると分母が機能しなくなります。AIの推論(インファレンス)の仕組みそのものについては、 基礎解説記事もあわせて参考になります。
BlackwellとHopperの比較データが示すもの
NVIDIAはDeepSeek-R1モデルを対象としたデータを示し、指標の違いが実際のビジネス判断にどう影響するかを具体的に示しています。
| 指標 | Hopper(HGX H200) | Blackwell(GB300 NVL72) | 倍率 |
| GPUあたりコスト/時間 | $1.41 | $2.65 | 約2倍 |
| FLOPS/ドル | 2.8 PFLOPS | 5.6 PFLOPS | 約2倍 |
| GPUあたりトークン/秒 | 90 | 6,000 | 約65倍 |
| メガワットあたりトークン/秒 | 5万4千 | 280万 | 約50倍 |
| 100万トークンあたりコスト | $4.20 | $0.12 | 約35分の1 |
※NVIDIAの分析およびSemiAnalysis InferenceX v2ベンチマークに基づく
GPU単価やFLOPS/ドルだけを見ると、Blackwellの方が約2倍高コストに映ります。しかし、実際のトークン出力量を考慮すると、100万トークンあたりのコストはBlackwellの方が35倍安い計算になります。GPUの単価が約2倍高くても、トークン生成効率が約65倍高ければ、1トークンを生み出すための総コストは大幅に下がるという構造です。
この差はハードウェア性能だけで生まれているわけではありません。NVIDIAによれば、vLLM、SGLang、TensorRT-LLM、Dynamoといったオープンソース推論ソフトウェアの継続的な最適化が、既存のNVIDIAインフラでもトークンあたりコストを下げ続けることを可能にしているとのことです。
主要クラウドパートナーでの活用状況
NVIDIAによれば、CoreWeave、Nebius、Nscale、Together AIといったクラウドパートナーがすでにBlackwellインフラを導入しており、スタック全体を最適化することで企業向けトークンコストを現時点で可能な限り最低水準に抑えているとされています。フルスタックにわたって適切なAIインフラを構築することで、ハードウェア・ソフトウェア・エコシステムの協調設計によるメリットが最大限に発揮されると説明されています。
まとめ
NVIDIAのこの論考は、AIインフラ導入を検討する企業にとって示唆に富むものだと思います。GPU単価やFLOPSという「見えやすい指標」に引きずられることなく、実際の出力であるトークン生成コストで比較・評価する視点は、投資判断の精度を高める上で重要だと考えられます。AI推論インフラの基礎的な仕組みについてより詳しく知りたい方は、こちらの解説記事もあわせてご覧いただければと思います(https://jobirun.com/what-is-ai-inference-explained/)。
