はじめに
Metaが2026年3月11日、自社開発AIチップ「MTIA(Meta Training and Inference Accelerator)」の最新動向を公式ブログで発表しました。本稿では、MTIA 300から500までの4世代にわたる開発戦略と各チップの技術的特徴、ソフトウェアスタックの設計思想について解説します。
参考記事
- タイトル: Four MTIA Chips in Two Years: Scaling AI Experiences for Billions
- 著者: Yee Jiun Song, Andrew Tulloch, Harikrishna Reddy, CQ Tang, Vijay Thakkar
- 発行元: Meta AI Blog
- 発行日: 2026年3月11日
- URL: https://ai.meta.com/blog/meta-mtia-scale-ai-chips-for-billions/
要点
- MetaはBroadcomと共同開発するAIチップ「MTIA」を、2年以内にMTIA 300・400・450・500の4世代展開した
- MTIA 300からMTIA 500にかけて、HBM帯域幅は4.5倍、演算性能(FLOPS)は25倍に向上した
- 戦略の柱は「高速イテレーション」「推論優先」「PyTorchネイティブ」の3点である
- MTIA 450は2027年初頭、MTIA 500は2027年中に大規模展開が予定されている
- チップレット(小型モジュール)方式の採用により、数年単位ではなく数か月単位での改良が可能になった
詳細解説
MTIAとは——Metaが自社チップを持つ理由
MTIAはMetaがBroadcomと共同で開発するAI専用アクセラレータ(推論・学習向けの専用プロセッサ)です。MetaはNVIDIAなど外部ベンダーのGPUも引き続き活用しますが、MTIAはランキング・レコメンデーション(R&R)などMeta独自の大規模ワークロードに最適化されたチップとして、インフラコスト削減の柱に位置づけられています。
一般的なAIチップの開発サイクルは設計から量産まで2年前後かかります。しかしAIモデルの進化はそれよりはるかに速く、ハードウェアが完成する頃には対象ワークロードが大きく変わっているという課題があります。Metaはこの問題に対し、単一世代に賭けて長期間待つのではなく、短いサイクルで継続的に改良を重ねる「高速イテレーション戦略」を採用しました。
4世代の概要と各チップの位置づけ
Metaの発表によれば、MTIA 300・400・450・500の4世代が、それぞれ異なる役割を担います。
MTIA 300はR&Rモデル向けに最適化された基盤世代で、すでにR&Rトレーニング用として本番環境に投入されています。内蔵ネットワークチップレットや通信専用エンジン、メモリ近傍演算機能を備えており、後続世代の設計基盤となりました。
MTIA 400はGenAI(生成AI)需要の高まりを受け、MTIA 300を発展させた世代です。FP8演算性能が400%向上、HBM帯域幅も51%増加しており、コスト削減だけでなく商用製品と競合する生の演算性能を初めて備えたチップと位置づけられています。72台のデバイスをスイッチドバックプレーンで接続したラックスケールのスケールアップドメインを構成します。ラボでのテストを完了し、データセンターへの展開準備が整っています。
MTIA 450はGenAI推論の急成長を見据えてMTIA 400から発展した世代です。HBM帯域幅をMTIA 400の2倍に増やしてデコード処理を高速化し、MX4演算性能を75%向上させてMoE(Mixture of Experts:複数の専門モデルを組み合わせるアーキテクチャ)のFFN計算を加速します。また、SoftmaxやFlashAttentionのボトルネックを緩和するハードウェアアクセラレーションを導入し、低精度データ型の独自改良も加えています。2027年初頭の大規模展開が予定されています。HBM帯域幅はGenAI推論性能に最も影響する要素であり、この2倍化は実用上の意味が大きいと考えられます。
MTIA 500はMTIA 450をさらに発展させ、HBM帯域幅を50%追加増加、HBM容量を最大80%拡大、MX4演算性能を43%向上させた世代です。2×2構成の小型コンピュートチップレットを採用するなど、モジュール設計の思想をより推し進めた構造になっています。2027年中の大規模展開予定です。
Metaの発表では、MTIA 300からMTIA 500の間に、HBM帯域幅は4.5倍、演算性能(MX8からMX4換算)は25倍に達すると示されています。
戦略の3本柱
MetaのMTIA戦略は「高速イテレーション」「推論優先」「PyTorchネイティブ」の3点を柱としています。
高速イテレーションの面では、約6か月ごとに新世代チップを出荷できる体制を構築しています。これはチップレット方式の採用によるもので、コンピュート・I/O・ネットワーク用の各チップレットを個別にアップグレードできるため、チップ全体を設計し直すことなく数か月単位での改良が可能です。また、MTIA 400・450・500はいずれも同一のシャーシ・ラック・ネットワークインフラを共有しており、新世代チップを同じ物理フットプリントに換装できる点もデプロイ速度を高める要因になっています。
推論優先の設計については、主流のGPUが大規模な事前学習(プレトレーニング)向けに設計されてから他のワークロードに転用される形をとるのとは異なり、MTIA 450・500はGenAI推論を第一の最適化対象とした上で、R&Rトレーニングや生成AIトレーニングにも対応できる設計を採っています。
PyTorchネイティブの観点では、PyTorch・vLLM・Triton・OCP(Open Compute Project)といった業界標準のソフトウェア・ハードウェアエコシステムと最初から統合されています。PyTorchはMetaが開発し現在最も広く使われるMLフレームワークであり、MTIAは自然にPyTorchネイティブの設計を採用できる立場にあります。
ソフトウェアスタックの設計
MTIAのソフトウェアスタックは、開発者がGPU向けの既存知識をそのまま活かせるよう設計されています。torch.compileやtorch.exportといった標準ツールを使ってモデルグラフを取得・最適化でき、MTIA固有の書き換えは不要です。これにより本番モデルをGPUとMTIAに同時デプロイすることが可能になります。
コンパイラはTorch FX IRとTorchInductorをベースとし、カーネルコンパイラはTriton・MLIR・LLVMを拡張した構成です。また、カーネル自動生成のためのエージェントAIシステム(TritorXおよびKernelEvolve)も開発されています。通信ライブラリ「HCCL(Hoot Collective Communications Library)」は内蔵ネットワークチップレットを活用した低レイテンシ設計が特徴で、ファームウェアにはメモリ安全性に優れたRustが採用されています。
vLLMとの統合も提供されており、プリフィル・デコードの分離(prefill-decode disaggregation)や継続バッチ処理(continuous batching)といったvLLMの機能をMTIA上でも利用できます。
まとめ
Metaは約2年間でMTIAを4世代展開し、HBM帯域幅4.5倍・演算性能25倍という性能向上を実現しました。チップレットによるモジュール設計と共通インフラの活用が高速開発を支えており、2027年にかけてGenAI推論向けチップのさらなる大規模展開が続く見通しです。自社製シリコンがAIインフラ戦略においてどのような役割を担うか、引き続き注目する価値があると思います。
