はじめに
OpenAIが2026年6月30日、計算生物学分野のAIエージェントを評価するための研究用ベンチマーク「GeneBench-Pro」を発表しました。単なる知識の暗記や定型手順の実行ではなく、データの曖昧さに対処し、分析方針を都度判断する「研究センス」を測ることを目的としています。
参考記事
- タイトル: Introducing GeneBench-Pro
- 著者: OpenAI
- 発行元: OpenAI
- 発行日: 2026年6月30日
- URL: https://openai.com/index/introducing-genebench-pro/
関連記事



要点
- GeneBench-Proは、ゲノム科学・定量生物学・トランスレーショナルメディシンなど10ドメイン・21サブドメインにわたる129問で構成された、計算生物学向けの研究レベルベンチマークである
- 各問題は合成データ(データ生成過程が既知)で構成されており、恣意的な正解パスや近道を排除した厳密な評価が可能である
- OpenAIの最強モデルGPT‑5.6 Sol(Proモード)でも正解率は31.5%にとどまり、フロンティアモデルにとっても依然として高難度であることが示された
- テスト時の計算スケーリング(推論深度の引き上げ)が性能向上に大きく寄与しており、同一モデルでも推論レベルの違いが6倍近い差を生む
- オープンソースモデルはコーディングベンチマークより本ベンチマークでの性能低下が大きく、コーディング特化と汎用科学推論の乖離が示された
詳細解説
なぜ今、「研究判断力」を測るのか
科学的なデータ分析において、AIが「何をするか」だけでなく「どう判断するか」を評価する試みは、これまで乏しいままでした。OpenAIの発表によれば、ゲノム解析などの生物学研究では、データ生成のコスト(例:ゲノムシーケンシング)が急落した結果、現在のボトルネックはデータ収集ではなく下流の計算・分析に移っています。GeneBench-Proは、この分析ボトルネックを解消するAIの能力を評価することを目的に設計されました。
OpenAIが「研究センス(research taste)」と呼ぶのは、データが支持できる問いの選択、初期診断が分析方針をどう変えるべきかの判断、そして計画の修正が必要なタイミングの見極めといった、一連の判断の連鎖です。こうした能力はコーディングの正確さとは異なる次元のものであり、既存のベンチマークでは捉えにくかった側面と言えます。
データセットの設計思想
GeneBench-Proは、統計遺伝学・集団遺伝学・ゲノム機能解析・臨床薬理ゲノミクスなど10ドメイン・21サブドメインにわたる計129問で構成されています。各問題はAIエージェントが独立したワークスペース内でPythonや科学計算ライブラリ、PLINK 2.0などのバイオインフォマティクスツールを使いながら分析を実施し、JSON形式で最終回答を提出する形式です。
大きな特徴は、すべての問題を 合成データ(データ生成過程をOpenAIが完全に把握したシミュレーション)で構成していることです。これにより、問題ごとに「適切な分析経路」と「誤りの経路」を検証でき、分析手順の選択ミスが数値的に失敗として現れるよう調整されています。外部の専門家(大学院生・博士研究員・教授・産業界の科学者)が82問をレビューし、「博士課程の学生でも経験豊富な指導者からの繰り返しのフィードバックなしには完了が難しい」という評価を得ています。
評価結果:依然として難しい
OpenAIの発表によれば、現時点での最強モデルGPT‑5.6 Sol(Proモード)でも正解率は31.5%です。開発初期のGPT‑5では5%未満だったことから、フロンティアモデルの進化は顕著ながら、依然として7割以上の問題が解けていないことになります。
特筆すべきはテスト時の計算スケーリング(推論に費やす計算量の増加)の効果です。最低推論レベルでは1桁台の正解率にとどまるGPT‑5.6 Solが、最高推論レベルでは同世代の低推論設定モデルGPT‑5.2の約6倍の問題を解くとされています。また、使用トークン数はGPT‑5.2より約3割少ないことも示されており、推論の深さと効率が同時に改善していることが確認できます。
他モデルとの比較では、GPT系のほかに、Anthropic Claude Opus 4.8(16.0%)、GLM 5.2(4.6%)、DeepSeek V4 Pro(2.4%)、Google Gemini 3.1 Pro(3.1%)などが公表されています。OpenAIは、オープンソースモデルとGPTモデルの性能差がコーディングベンチマークから予測される以上に大きいと指摘しており、現行のオープンソースモデルがコーディング特化型に偏っている可能性を示唆しています。
専門家が指摘したモデルの弱点
OpenAIが公開したケーススタディでは、GPT‑5.5とGPT‑5.6 Solの回答パターンの差異が示されています。薬理ゲノミクスの時系列応答問題では、GPT‑5.5は時変共変量を扱うCoxモデルを適用したものの治療-交絡フィードバックを考慮できなかったのに対し、GPT‑5.6 Solは逆確率重み付けを用いた周辺構造Coxモデルを選択し、より適切な因果推論アプローチを取りました。
外部レビュアーからは、「エージェントの多くがデータの問題(アーティファクトや異常値)に対して慎重さが足りない」「何が分析として許容されるかをプロンプトの表現に依存しすぎる傾向がある」といった指摘もあります。現状のモデルは観察や部分的な分析は行えても、それを問題全体の文脈に統合して結論を出す段階で躓くとされており、専門家と初学者の差に似た構造を示しているとOpenAIは述べています。
今後の展開と経済的含意
OpenAIは、代表的な10問をHugging Face上にオープンソースとして公開しており、インタラクティブなウェブインターフェースでも閲覧できます。また、50問のサブセットを第三者評価機関Artificial Analysisに提供し、独立したベンチマーク評価を近日中に実施するとしています。
OpenAIの発表では、GeneBench-Proに相当する問題を人間の専門家が解くには1問あたり20〜40時間(保守的な見積もりで数千ドル相当)かかる一方、現行モデルの推論コストは1問あたり数ドル程度だとされています。OpenAIが創薬AI「GPT-Rosalind」を強化した発表でも示されたように、ライフサイエンス分野でのAI活用は加速しており、GeneBench-Proはその進捗を測る尺度の一つとして機能することが期待されます。
まとめ
GeneBench-Proは、「知識の再現」から「研究判断の実行」へとAI評価の軸を移した点で注目に値します。最高性能のモデルでも正解率は3割台であり、科学的推論の自動化には依然として大きな余地があることが改めて示されました。この分野の進展がどのように加速するか、今後のモデル世代に注目したいと思います。
