[開発者向け]Google DeepMindが発表した「ATLAS」とは?多言語AIモデルのスケーリング法則を公開

目次

はじめに

 Google DeepMindとGoogle Cloudが2026年1月27日、多言語言語モデルのための新しいスケーリング法則「ATLAS(Adaptive Transfer Scaling Laws)」を発表しました。本稿では、この研究内容と、開発者が多言語モデルを構築する際の実践的なガイダンスについて解説します。

参考記事

  • タイトル: ATLAS: Practical scaling laws for multilingual models
  • 著者: Shayne Longpre(Google Cloud Student Researcher)、Sayna Ebrahimi(Research Scientist, Google DeepMind)
  • 発行元: Google Research Blog
  • 発行日: 2026年1月27日
  • URL: https://research.google/blog/atlas-practical-scaling-laws-for-multilingual-models/

要点

  • ATLASは、多言語言語モデルの最適なモデルサイズ、データ量、言語ミックスを決定するための実践的なスケーリング法則である
  • 774の学習実行(10M-8Bパラメータ)と400以上の言語を対象とした、これまでで最大規模の公開多言語事前学習研究である
  • クロスリンガル転移マトリックスにより、1,400の言語ペア間の相乗効果と干渉を定量化した
  • 言語数を2倍にする場合、モデルサイズを1.18倍、総データ量を1.66倍に増やすことで、多言語性の呪いによる性能低下を相殺できる
  • ファインチューニングとゼロからの事前学習のクロスオーバーポイントを明示し、計算予算に応じた最適な学習戦略を提示している

詳細解説

なぜATLASが必要なのか

 Google DeepMindによれば、AIモデル利用者の50%以上が英語以外の言語を使用しているにもかかわらず、公開されているスケーリング法則は圧倒的に英語に焦点を当てたものです。この不均衡により、数十億の国際的・多言語ユーザーにサービスを提供するモデル構築者は、非英語言語や特定の言語ミックスで構築する際の効率性、品質、コストに関する重要な開発決定について、データに基づいたガイダンスを得られない状況にありました。

 スケーリング法則とは、モデルのサイズや学習データ量と性能の関係を数式で表したもので、効率的なモデル開発の指針となります。従来のスケーリング法則は単一言語(主に英語)を前提としていたため、複数の言語を同時に扱う多言語モデルの開発には適用が難しいという課題がありました。

ATLASの3つの構成要素

 ATLASは、従来のスケーリング法則の原則を以下の3つの構成要素を通じて拡張しています。

 第一に、クロスリンガル転移マトリックスです。これは、どの言語を一緒に学習すべきかを特定するために使用されます。例えば、カタルーニャ語をターゲット言語とする場合、スペイン語、ポルトガル語、イタリアなどのラテン系言語が含まれると考えられます。

 第二に、スケーリング法則本体です。これは、サポートする言語数が増加するにつれて、モデルサイズとデータを効率的に拡張する方法についてのガイダンスを提供します。

 第三に、学習戦略の決定ルールです。これは、モデルをゼロから事前学習するか、多言語チェックポイントからファインチューニングするかを判断するためのものです。

 ATLASは、MADLAD-400コーパスを使用した数百の多言語実験(400以上の言語で750回以上の実行)を通じて、3つの異なるデータソースを考慮します。具体的には、(1)ターゲット言語、(2)実証分析に基づく類似転移言語、(3)その他すべての言語です。この新しいアプローチにより、各ソースが実際にターゲット言語をどれだけ助けるか、または妨げるかを学習できます。これは、従来の法則ではサポートされていなかった機能と言えます。

評価結果:多言語学習の計算効率コスト

 Google DeepMindは、MADLAD-400データセットを使用して、ATLASが新しいモデルサイズ、学習データ量の変化、または新しい言語ミックスに対してモデルの性能をどれだけ正確に予測できるかを評価しました。評価には、単一言語、二言語、大規模多言語設定における750以上の独立した実行が含まれ、語彙に依存しない損失を使用して性能を測定しています。

 英語、フランス語、ロシア語、中国語、ヒンディー語、スワヒリ語の6言語について、ATLASが予測する最適なモデルサイズ(N)とデータサイズ(D)のスケーリング軌跡を分析した結果、2つの観察が得られました。

 まず、曲線は驚くほど似ていますが、多言語語彙または完全な多言語データで学習すると、計算効率に余計な負担(税金)がかかります。特に英語でその傾向が顕著です。また、リソースの少ない言語は、データが不足すると上向きに曲がり、モデルがデータの繰り返しから学習するのに苦労する様子が見られます。ATLASはこれらの効果を明示的にモデル化していると説明されています。

 この「計算効率の税金」は、多言語モデル開発において考慮すべき重要な要素と考えられます。同じ品質を達成するために、多言語設定ではより多くの計算リソースが必要になるという実態を定量的に示したものと言えます。

クロスリンガル転移マトリックス:言語間の相乗効果を可視化

 研究チームは、言語から言語への相乗効果と干渉を大規模に測定し、言語Aで学習することが言語Bをどれだけ助ける(または妨げる)かを定量化するマトリックスを作成しました。

 結果は非常に直感的なものでした。ノルウェー語は主にスウェーデン語とドイツ語によって助けられ、マレー語はインドネシア語によって、アラビア語はヘブライ語によって助けられます。英語、フランス語、スペイン語は、最も広く役立つ言語であり、これはウェブ上で見つかるこれらの言語のテキストに固有の品質、異質性、量によるものと思われます。

 分析によれば、正の転移の最大の予測因子は、スクリプト(文字体系)や言語ファミリーを共有することであり、統計的に有意(p < .001)です。興味深いことに、英語は多くの言語を助けますが、すべてではありません。また、転移は必ずしも対称的ではなく、AがBを助ける程度と、BがAを助ける程度は異なる可能性があります。

 これらの測定値は、「勘」をデータ駆動型の言語ミックスの選択に変換するものと言えます。開発者は、このマトリックスを参照することで、ターゲット言語に対してどの言語を学習データに含めるべきかを、経験的なエビデンスに基づいて判断できます。

「多言語性の呪い」の解消:明確なスケーリングルール

 「多言語性の呪い」とは、モデル容量の制限により、複数の言語で学習されたモデルが新しい言語を追加するたびに性能が低下する現象を指します。従来は定性的に認識されていたこの問題を、研究チームはスケーリング法則として定式化しました。

 この法則は、モデルサイズ(N)と学習データ量(D)だけでなく、データ内の言語数(K)も考慮します。多くの実験にこの法則を当てはめた結果、言語を追加すると軽度の容量税がかかりますが、高度の正の転移があることが判明しました。

 具体的には、サポートする言語数を2倍(2·K)にしたい場合、モデルサイズを1.18倍、総データ量を1.66倍に増やすべきとされています。これは、2K言語それぞれのデータの83%に相当します。言語あたりのデータは少なくなりますが、すべての言語で学習することによる正の相乗効果により、性能低下を引き起こす容量制約が相殺されると説明されています。

 この発見は、多言語モデルの開発において重要な示唆を持つと考えられます。従来、「多言語性の呪い」は避けがたい制約と見なされていましたが、適切なスケーリング戦略によって、その影響を大幅に軽減できる可能性を示しています。

ファインチューニング vs ゼロからの事前学習:クロスオーバーポイント

 10言語について、最高性能のモデルを得るための2つの経路を比較しています。(a)ターゲット言語でゼロから事前学習する、(b)強力な多言語「Unimax」チェックポイントからファインチューニングする、の2つです。

 オプション(b)は、モデルがすでに言語全体でかなり強力であるため、最小限の追加計算で最高の性能を得られる可能性が高いと考えられます。しかし、モデルをはるかに長く学習できる場合、オプション(a)はしばしばより良い長期的な結果をもたらすことができます。研究の目標は、モデル構築者が費やせる計算量に基づいて、2つの学習曲線間のクロスオーバーポイントを見つけることでした。

 結果によれば、ファインチューニングは初期段階で勝ちますが、十分なトークンを確保できれば、事前学習が追い越します。研究チームの実行では、クロスオーバーは通常、2Bパラメータのモデルで約144Bから283Bトークンの間で発生しました(言語依存)。

 次に、クロスオーバーポイントをモデルサイズの関数としてプロットしています。これにより、具体的で予算を意識した経験則が得られます。トークンと計算予算がモデルサイズに対するクロスオーバーポイントを下回る場合は、多言語チェックポイントから始めることが推奨されます。それ以外の場合は、ゼロからの事前学習が通常、最終的に優位に立つとされています。ただし、正確なしきい値は、ベースモデルとミックスに依存すると注記されています。

 この分析は、限られた計算予算内で最適な学習戦略を選択するための実践的なガイダンスを提供していると言えます。

実践への応用

 Google DeepMindは、開発者がATLASを直接適用できる4つの具体的なシナリオを提示しています。

 第一に、新しい多言語または非英語モデルの学習を計画している場合、論文の図1または表C.1を使用して、語彙や学習の選択に基づいた潜在的なスケーリング法則の感覚をつかむことができます。

 第二に、新しい学習ミックスを選択する場合、転移マトリックス(図2)を参照して、ターゲットを経験的に助けるソース言語、特に同じスクリプト/ファミリーを共有するものを選択できます。

 第三に、より多くの言語で新しいモデルを学習する場合、セクション5を参照して、多言語性の呪いの影響を緩和するために、モデルサイズとデータサイズを最も効率的に拡張する方法を決定できます。

 第四に、計算制約がある場合、セクション6を参照して、多言語モデルをファインチューニングすべきか、ゼロから事前学習すべきかを決定できます。

 これらのガイダンスは、ICLR 2026で発表される論文と合わせて、数十億の非英語話者にサービスを提供する新世代の多言語モデルを可能にすることを目指していると、研究チームは述べています。

まとめ

 Google DeepMindとGoogle Cloudが発表したATLASは、多言語言語モデルのスケーリング法則として、クロスリンガル転移マトリックス、効率的なスケーリング戦略、学習方法の選択ルールを提供しています。774の学習実行と400以上の言語を対象とした大規模研究により、開発者は英語中心のアプローチを超えて、グローバルなモデル開発のロードマップを得られると考えられます。今後、この研究成果が多言語AIモデルの開発にどのような影響を与えるか注目されます。

この記事が気に入ったら
フォローしてね!

  • URLをコピーしました!
  • URLをコピーしました!
目次