はじめに
Google DeepMindが2026年2月11日、AI研究の新たな段階を示す発表を行いました。Gemini Deep Thinkモードが数学、物理学、コンピュータサイエンスの研究レベル問題を解決し、複数の査読付き論文を生成したというものです。本稿では、この発表内容をもとに、AI研究エージェント「Aletheia」の仕組みと実際の研究成果、そして人間とAIの協働研究がどのような形で実現されているかを解説します。
参考記事
- タイトル: Accelerating Mathematical and Scientific Discovery with Gemini Deep Think
- 著者: Thang Luong, Vahab Mirrokni
- 発行元: Google DeepMind Blog
- 発行日: 2026年2月11日
- URL: https://deepmind.google/blog/accelerating-mathematical-and-scientific-discovery-with-gemini-deep-think/
要点
- Gemini Deep Thinkは、2025年夏に国際数学オリンピック(IMO)で金メダル水準を達成した後、研究レベルの数学、物理学、コンピュータサイエンスの問題解決に応用されている
- 数学研究エージェント「Aletheia」は、候補解の生成、検証、修正を反復的に行い、IMO-ProofBench Advancedで最大90%のスコアを記録した
- AI単独で生成された研究論文、人間とAIの協働論文など、複数の査読投稿レベルの成果が生まれ、Erdős予想データベースの4つの未解決問題を自律的に解決した
- 物理学とコンピュータサイエンスでは、10年来の予想の反例発見、宇宙ひもの重力放射計算など、18の研究問題で専門家との協働が成果を上げた
- 人間が方向性を示し、AIが知識検索と厳密な検証を担う「force multiplier(力の倍増装置)」としての協働モデルが提示されている
詳細解説
研究レベル数学への挑戦と「Aletheia」の仕組み
Google DeepMindによれば、Gemini Deep Thinkは2025年7月に国際数学オリンピック(IMO)で金メダル水準を達成し、その後国際大学対抗プログラミングコンテストでも同等の結果を得ました。これらは学生向けの最難関問題を解く能力を示すものでしたが、研究レベルの数学はさらに高度な文献知識と専門技術を要求します。
この課題に対応するため、GoogleはGemini Deep Thinkモードを基盤とする数学研究エージェント「Aletheia」を開発しました。Aletheiaは、問題に対する候補解を生成し、自然言語による検証器が解の欠陥を特定、必要に応じて修正を繰り返すという反復的なプロセスを実行します。重要な特徴として、Aletheiaは問題を解けない場合にそれを認める能力を持ち、これが研究者にとっての効率改善につながったとされています。

加えて、AletheiaはGoogle検索とウェブブラウジング機能を活用し、既存の研究文献を統合する際の誤った引用や計算ミスを防ぐ仕組みが組み込まれています。このアプローチは、基盤モデルが大量の知識を持ちながらも、高度な専門分野ではデータ不足により表面的な理解やハルシネーション(誤った情報生成)が生じやすいという課題への対応と考えられます。
ベンチマーク性能とスケーリング則の継続
Googleの発表では、2026年1月版のGemini Deep Thinkが、オリンピックレベルの問題を評価するIMO-ProofBench Advancedで最大90%のスコアを記録しました。これは2025年7月の金メダル版を大きく上回る性能です。推論時間の計算リソースを増やすことで性能が向上するというスケーリング則は、オリンピックレベルを超えて博士課程レベルの演習問題(内部ベンチマークFutureMath Basic)でも継続することが示されました。


注目すべきは、AletheiaがGemini Deep Think単独よりも少ない推論時間計算で高い推論品質を達成した点です。すべての結果は人間の専門家による採点を経ており、ベンチマークスコアの信頼性が担保されています。
これらのベンチマークは、AIモデルの数学的推論能力を測る標準的な評価手法として学術界で用いられており、性能の客観的な比較を可能にします。
実際の研究成果:自律研究から人間との協働まで
Aletheiaは既に複数の研究成果を生み出しており、Google DeepMindは成果を自律性の度合いに応じて分類しています。
完全自律研究としては、算術幾何学における固有重み(eigenweights)と呼ばれる構造定数を計算した論文(Feng26)が、人間の介入なしにAIのみで生成されました。この論文は査読投稿レベルの品質とされています。
人間とAIの協働では、独立集合と呼ばれる相互作用する粒子系の境界を証明した論文(LeeSeo26)が、人間の専門家とAIの共同作業として作成されました。
さらに、Bloom氏のErdős予想データベースに登録された700の未解決問題を半自律的に評価し、そのうち4つの問題を自律的に解決しました。特にErdős-1051については、AIが自律的に解決し、その後人間の研究者による一般化につながり、別の研究論文(BKKKZ26)として報告されています。
GoogleはAI支援数学研究の分類法を提案しており、成果の重要性とAIの貢献度によってLevel 0からLevel 4まで定義されています。Level 2(「出版可能な品質」)の成果が査読付きジャーナルに投稿されていますが、現時点ではLevel 3(「重要な進歩」)やLevel 4(「画期的な突破」)に該当する成果は主張していません。この慎重な姿勢は、AI生成結果の責任ある文書化と評価という学術コミュニティでの議論に配慮したものと考えられます。
物理学とコンピュータサイエンスへの拡大
Gemini Deep Thinkモードは数学だけでなく、物理学とコンピュータサイエンスでも有望な結果を示しています。Googleが発表した第2の論文では、効果的な協働手法として「Advisor」モデルが提示されています。これは人間が反復的な「Vibe-Proving」サイクルを通じてAIをガイドし、直感を検証して証明を洗練させる方法です。
また、確証バイアスを防ぐための「バランスプロンプティング」(証明と反証を同時に要求する)や、コード支援による検証といった戦術的手法も詳述されています。これらの手法とAIが異なる科学分野間の深い構造的つながりを橋渡しする能力により、理論研究の進め方が変化しつつあります。

実際の成果として、18の研究問題で専門家との協働が行われ、アルゴリズム、機械学習と組合せ最適化、情報理論、経済学における長年のボトルネックが解決されました。
具体的な研究成果の例
Googleが公開した論文から、いくつかの代表的な成果を紹介します。
ネットワーク問題への数学的越境では、「Max-Cut」(ネットワークを効率的に分割する問題)や「Steiner Tree」(高次元空間で点を接続する問題)といった古典的なコンピュータサイエンス問題の進展が停滞していました。Gemini Deep Thinkは、Kirszbraun定理、測度論、Stone-Weierstrass定理といった、連続数学の全く異なる分野から高度なツールを引用することで、これらの離散的なアルゴリズム問題を解決しました。
10年来の予想の決着では、2015年の理論論文がデータストリームに関する一見明白な規則を提案していました。「到着したアイテムのコピーを作ることは、常にオリジナルを単純に移動するよりも価値が低い」というものです。専門家は10年間この証明に取り組みましたが、Gemini Deep Thinkは非常に特殊な3項目の組合せ的反例を構築し、この長年の人間の直感が誤りであることを厳密に証明しました。この例は、AIが従来の人間の直感に挑戦し、分野の理解を修正する役割を果たすことを示しています。
機械学習最適化の理論的説明では、AIにノイズを除去するよう訓練する際、通常はエンジニアが数学的な「ペナルティ」を手動で調整する必要があります。研究者が自動的にこれを行う新しい手法を開発しましたが、なぜ機能するのかを数学的に説明できませんでした。Gemini Deep Thinkは方程式を分析し、この手法が内部で独自の「適応的ペナルティ」を動的に生成することで成功していることを証明しました。
AIのための経済理論の拡張では、AI生成トークンをオークションにかける最近の「顕示原理」が、入札が有理数に制限される場合にのみ数学的に機能していました。連続的な実数への拡張は元の証明を無効にしました。Gemini Deep Thinkは高度な位相幾何学と順序理論を用いて定理を拡張し、現実世界の連続的なオークション動態に対応しました。
宇宙ひもの物理学では、宇宙ひもからの重力放射を計算するには、「特異点」を含む厄介な積分の解析解を見つける必要があります。Gemini Deep ThinkはGegenbauer多項式を用いた新しい解法を発見しました。これは特異点を自然に吸収し、無限級数を閉じた形の有限和に変換しました。
これらの成果は情報理論、複雑性理論から暗号学、メカニズムデザインまで多様な分野にまたがり、AIが研究を根本的に変化させていることを示しています。
コンピュータサイエンスの流動的な会議主導の出版パイプラインを考慮し、Googleはこれらの結果を厳格な分類法ではなく学術的な軌跡で説明しています。約半数が有力な会議(ICLR ’26での採択を含む)を目標としており、残りの多くは将来のジャーナル投稿を形成する見込みです。分野の誤りを特定したり予想を反証したりする場合でも、これらの成果はAIが高レベルの科学的協力者としての価値を持つことを示しています。
人間とAIの協働の未来
この研究は、Googleのこれまでの突破(純粋数学の探求、数学科学での新発見、IMO銀メダルレベルのAI、高度なアルゴリズム設計のためのコーディングエージェント、STOC’26会議でのCS理論論文の自動フィードバック提供など)を基盤としています。
汎用基盤モデルをエージェント的推論ワークフローと組み合わせることで、強力な科学的パートナーとして機能できることを実証しました。専門の数学者、物理学者、コンピュータサイエンティストの指導の下で、Gemini Deep Thinkモードは複雑な数学、論理、推論が中核となる分野で有用性を証明しています。
Googleは科学ワークフローの根本的な変化を目撃していると述べています。Gemini Deep Thinkが進化するにつれて、人間の知性の「force multiplier(力の倍増装置)」として機能し、知識検索と厳密な検証を処理することで、科学者は概念的な深さと創造的な方向性に集中できます。証明の洗練、反例の探索、あるいは異なる分野の橋渡しなど、AIは科学的進歩の次の章における価値ある協力者になりつつあります。
この協働モデルでは、人間が問題設定と方向性を提供し、AIが膨大な文献の検索、候補解の生成、厳密な検証を担当します。それぞれの強みを活かすことで、従来は数年かかっていた研究が短期間で進展する可能性が示されています。
まとめ
Google DeepMindのGemini Deep Thinkは、オリンピックレベルの数学問題解決から研究レベルの問題解決へと進化し、実際に査読投稿可能な研究成果を生み出しています。数学研究エージェント「Aletheia」の反復的な生成・検証・修正プロセス、そして物理学やコンピュータサイエンスでの専門家との協働は、AIが科学研究の進め方を変えつつあることを示しています。人間が概念的な深さと方向性を担い、AIが知識検索と厳密な検証を担当する協働モデルは、今後の科学研究の新しい形として注目されます。
