[ニュース解説]OpenAIのAIが研究レベルの数学証明に挑戦——「First Proof」で10問中5問以上を正解か

目次

はじめに

 OpenAIは2026年2月20日、研究レベルの数学証明課題「First Proof」に社内モデルで挑戦した結果を公開しました。本稿では、この取り組みの概要と結果、AIの数学的推論能力の現状について解説します。

参考記事

要点

  • OpenAIの社内モデルが、専門家レベルの数学証明課題「First Proof」全10問に挑戦し、少なくとも5問(問題4・5・6・9・10)が正解である可能性が高いとされている
  • 問題2については当初正解と見込んでいたが、公式解説とコミュニティの分析をもとに不正解と判断された
  • 今回使用したモデルは長時間にわたる推論の厳密さを高めることを主目的として訓練中のものであり、訓練を通じて継続的に性能が向上した
  • 人間による限定的な監督のもとで実行され、ChatGPTを検証・整形に活用するなど実験的な手法が用いられた
  • OpenAIはベンチマークより「フロンティア研究課題」こそ次世代AIの能力評価に重要だという立場を示している

詳細解説

First Proofとはどのような課題か

 「First Proof」(https://1stproof.org/) は、AIシステムが正しく検証可能な証明を作成できるかを試すために設計された、研究レベルの数学課題です。選択肢から答えを選ぶ形式や、短答式の競技数学とは異なり、専門領域において最初から最後まで一貫した論証を構築する必要があります。OpenAIによれば、問題を作成したのは各分野の第一線の専門家であり、なかには著者自身が解を見つけるまでに数年を要した問題も含まれています。

 数学の証明を評価する際の難しさは、正しさの確認に専門家の査読が不可欠な点にあります。競技数学のように採点基準が明確でなく、論証の各ステップが論理的に成立しているかを丁寧に確認する必要があります。このような課題が、AIの推論能力の評価として適しているとOpenAIは考えているようです。

モデルの結果と評価プロセス

 OpenAIによれば、証明の試みは2026年2月14日(太平洋時間)に公開され、専門家からのフィードバックをもとに、問題4・5・6・9・10の少なくとも5問が正解である可能性が高いと判断されました。問題2については当初正解の見込みとしていましたが、公式解説およびコミュニティの分析の結果、不正解と結論づけています。残りの問題については現在も査読が続いています。

 実験の過程では、限定的な人間の監督のもとでモデルを動作させました。具体的には、以前の試みで有効と思われた戦略を再試行するよう促したり、専門家のフィードバックを受けて証明の一部を展開・明確化するよう依頼したりしたとのことです。また、このモデルとChatGPTの間でやり取りを仲介し、検証・整形・スタイルの調整に活用しました。複数の試みの中から人間の判断で最良のものを選んだ問題もあり、OpenAIは「今回の手順は厳密に制御された評価として理想的ではない」と率直に認めています。

訓練中のモデルが日々進化

 OpenAIの研究者James R. Lee氏は、このモデルが「推論の厳密さを高めること」を主目的に訓練中のものだと述べています。目標は、モデルが何時間にもわたって連続的に思考を続けながら、結論に高い確信を持てるようにすることです。

 First Proofの問題が発表されたとき、同氏はそれを格好のテストベッドと判断し、週末のうちに試したところ、まず問題9と10を解くことができました。その後、訓練が進むにつれてさらに少なくとも3問を解けるようになり、問題6、続いて2日後に問題4を解いた際には特に手ごたえを感じたと述べています。「モデルが日を追うごとに確実に賢くなっていく様子を見るのは、かなり印象的だ」という言葉からは、訓練中のモデルの急速な成長がうかがえます。

背景にあるOpenAIの研究方針

 OpenAIはこの取り組みを、フロンティア推論モデルによる数学・科学分野での研究成果の流れに位置づけています。2025年7月には、汎用推論モデルが国際数学オリンピック(IMO)で金メダル相当の成績(42点中35点)を達成しました。同年11月には、GPT-5が数学・物理・生物学などの分野で研究者の具体的な進展を支援した事例集を公開。さらに最近では、GPT-5.2がグルーオン振幅の候補式を提案し、社内モデルがそれを証明、著者が検証するという物理学での共同研究も報告されています。

 OpenAIは「ベンチマークは有用だが、長い推論の連鎖を維持すること、適切な抽象化を選択すること、問題文の曖昧さへの対処、専門家の精査に耐える論証の作成など、研究の最も難しい部分を見落とすことがある」と述べており、フロンティア課題こそが次世代AIの能力評価に本質的だという立場を示しています。この姿勢は、標準的なベンチマークを超えた評価のあり方を問い直すものとして、AI研究コミュニティでも関心を集めると思います。

まとめ

 OpenAIの社内モデルは、専門家レベルの数学証明課題「First Proof」において、10問中少なくとも5問で正解の可能性が高い結果を示しました。実験手法の厳密さには課題が残るものの、訓練中のモデルが日々性能を向上させたという報告は、AIの数学的推論能力の現在地を示す一つの指標として注目されます。今後の査読結果と、より厳密な評価枠組みの整備が楽しみなところです。

この記事が気に入ったら
フォローしてね!

  • URLをコピーしました!
  • URLをコピーしました!
目次