はじめに
Google DeepMindが2026年2月2日、Kaggleと共同で運営するAIベンチマークプラットフォーム「Game Arena」の大幅な拡張を発表しました。従来のチェスに加え、Werewolf(人狼)とポーカーという2つの新しいゲームを導入し、AIモデルの社会的推論能力やリスク管理能力を評価する体制を整えました。本稿では、この発表内容をもとに、各ゲームベンチマークの特徴と最新のリーダーボード結果を解説します。
参考記事
- タイトル: Advancing AI benchmarking with Game Arena
- 著者: Oran Kelly
- 発行元: Google DeepMind Blog
- 発行日: 2026年2月2日
- URL: https://blog.google/innovation-and-ai/models-and-research/google-deepmind/kaggle-game-arena-updates/

要点
- Google DeepMindは、Kaggle Game Arenaに人狼(Werewolf)とポーカーという2つの新しいゲームベンチマークを追加した
- チェスベンチマークではGemini 3 ProとGemini 3 Flashが最高Eloレーティングを記録している
- 人狼ベンチマークは自然言語による社会的推論能力を評価し、Gemini 3 ProとGemini 3 Flashが上位2位を占めている
- ポーカーベンチマークではリスク管理能力を評価し、2月4日に最終リーダーボードが公開予定である
- 2月2日から4日にかけて、プロ棋士やポーカープレイヤーによる解説付きライブストリームイベントが開催される
詳細解説
Game Arenaの目的と拡張の背景
Game Arenaは2025年に開始された独立系の公開ベンチマークプラットフォームで、AIモデルが戦略的ゲームで競い合うことで能力を評価します。チェスは完全情報ゲームとして推論能力と戦略的計画能力の測定に適していますが、現実世界の意思決定は不完全な情報のもとで行われることがほとんどです。このギャップを埋めるため、今回の拡張では曖昧性や不確実性に対処する能力を測定するゲームが追加されました。
ゲームベンチマークは、客観的な評価が可能で、難易度が対戦相手のレベルに応じてスケールするという特徴があります。また、制御された環境でエージェントの安全性を評価できるため、現実世界での展開前にモデルの振る舞いを観察する手段としても機能すると考えられます。
チェス:推論と戦略的思考の評価
チェスベンチマークは2025年にリリースされ、モデル同士が対戦することで戦略的推論、動的適応、長期計画能力を評価します。Google DeepMindの発表では、従来のチェスエンジン(Stockfishなど)が毎秒数百万の局面を評価する「特化型スーパー計算機」として機能するのに対し、大規模言語モデルは力ずくの計算ではなく、パターン認識と「直感」によって探索空間を大幅に削減するアプローチを取ると説明されています。これは人間のプレイスタイルに近い手法と言えます。
最新のリーダーボードでは、Gemini 3 ProとGemini 3 Flashが最高Eloレーティングを記録しています。モデルの内部的な「思考」を分析すると、駒の機動性、ポーン構造、キングの安全性といった馴染みのあるチェス概念に基づいた戦略的推論を使用していることが確認されています。Gemini 2.5世代からの大幅な性能向上は、モデルの急速な進化を示すとともに、Game Arenaが時間経過に伴う改善を追跡する価値を実証していると考えられます。
Werewolf(人狼):社会的推論と対話能力
今回新たに追加されたWerewolfベンチマークは、Game Arena初のチームベースゲームで、完全に自然言語を通じてプレイされます。Google DeepMindによれば、このゲームでは「村人」チームが協力して真実と欺瞞を見分け、隠れた「人狼」を特定する必要があります。
このベンチマークは、次世代AIアシスタントに求められる「ソフトスキル」を評価するために設計されています。具体的には、コミュニケーション、交渉、曖昧性への対処能力といった、エージェントが人間や他のエージェントと効果的に協働するために必要な能力を測定します。企業環境でのAI活用を考えると、これらの能力は実用上非常に重要と考えられます。
さらに、Werewolfはエージェントの安全性研究のための安全な環境としても機能します。ゲームでは真実を求める側(村人)と欺く側(人狼)の両方をプレイする必要があるため、モデルが他者の操作を検出する能力と、モデル自身の欺瞞能力の両方を、実世界での展開に伴うリスクなしにテストできます。この研究は、悪意ある行為者に対する信頼性の高い防御策となるAIエージェントの構築に不可欠だと思います。
現在のリーダーボードでは、Gemini 3 ProとGemini 3 Flashが上位2位を占めており、複数のゲームラウンドにわたって他のプレイヤーの発言と行動について効果的に推論する能力を示しています。例えば、プレイヤーの公開発言と投票パターンの間の矛盾を特定し、その洞察をチームメイトとの合意形成に活用する様子が観察されています。
ポーカー:リスク管理能力の測定
ポーカーベンチマークは、チェスの推論能力やWerewolfの社会的推論とは異なる新しい次元、すなわちリスク管理能力を導入します。Google DeepMindの説明によれば、Werewolfと同様にポーカーも不完全情報ゲームですが、チャレンジの焦点は同盟構築ではなく、不確実性の定量化にあります。モデルは配られた手札の運を克服するために、相手の手札を推測し、プレイスタイルに適応して最適な行動を決定する必要があります。
これらのスキルをテストするため、新しいポーカーベンチマークが開始され、トップモデルがヘッズアップ・ノーリミット・テキサスホールデムで競うAIポーカートーナメントが開催されています。最終的なポーカーリーダーボードは、トーナメント決勝終了後の2026年2月4日にkaggle.com/game-arenaで公開される予定です。
ポーカーは、ビジネスにおける意思決定のように、限られた情報から相手の意図を推測し、確率的思考に基づいて行動を選択する能力を評価できるため、実用的なAIシステムの開発において重要な指標になると考えられます。
ライブストリームイベントとプロによる解説
Google DeepMindは、これらの新しいベンチマークと更新されたベンチマークの開始を記念して、チェスグランドマスターのHikaru NakamuraとポーカーレジェンドのNick Schulman、Doug Polk、Liv Boereeと提携し、専門家による解説と分析を含む3日間のライブストリームイベントを制作しています。
配信スケジュールは以下の通りです(すべて太平洋時間午前9時30分、kaggle.com/game-arenaで視聴可能):
- 2月2日(月): ポーカーリーダーボード上位8モデルがAIポーカーバトルで対決
- 2月3日(火): ポーカートーナメント準決勝の実施と並行して、Werewolfとチェスリーダーボードのハイライトマッチを特集
- 2月4日(水): 最終2モデルがポーカー王座をかけて競うとともに、完全なリーダーボードを公開。チェスリーダーボード上位2モデル(Gemini 3 ProとGemini 3 Flash)の対局と、上位Werewolfモデルのゲームハイライトを配信
プロプレイヤーによる解説は、AIモデルの判断プロセスや戦略を理解する上で貴重な視点を提供すると期待されます。
まとめ
Google DeepMindのGame Arena拡張により、AIモデルの評価軸は戦略的推論(チェス)、社会的推論(Werewolf)、リスク管理(ポーカー)という3つの重要な次元をカバーすることになりました。Gemini 3世代のモデルが各ベンチマークで優れた性能を示していることは、汎用AI能力の進化を示唆しています。今後、これらのベンチマークが実世界のAIエージェント開発にどのような影響を与えるか、注目されるところです。
