[ニュース解説]リリース前にモデルの振る舞いを予測する——OpenAIが公開した「Deployment Simulation」の仕組みと成果

目次

はじめに

 OpenAIが2026年6月16日、新しいモデルをリリースする前にその挙動を予測する手法「Deployment Simulation(デプロイメント・シミュレーション)」を発表しました。過去の会話データを再利用してリリース候補モデルの応答を事前に生成し、問題行動の発生率を見積もるというアプローチで、GPT‑5系列の複数モデルに実際に適用された結果も公開されています。

参考記事

関連記事

あわせて読みたい
[ニュース解説]OpenAIが社内AIコーディングエージェントの不整合監視システムを公開——5ヶ月間・数千万... はじめに  OpenAIは2026年3月19日、社内で運用するコーディングエージェントのミスアライメント(不整合)を検知する監視システムについて、その仕組みと5ヶ月間の運用...
あわせて読みたい
[レポート解説]GPT-5.3 InstantのSystem Cardを読む――安全性評価の詳細とHealthBench結果 はじめに  OpenAIは2026年3月3日、GPT-5シリーズの最新モデル「GPT-5.3 Instant」のSystem Card(安全性評価報告書)を公開しました。本稿では、このSystem Cardの内容...
あわせて読みたい
[ニュース解説]Claudeが「なぜ」を学ぶと不整合行動が消える——Anthropicが開示した安全性訓練の4つの知見 はじめに  AnthropicがAIの安全性訓練について詳しく解説したブログ記事を、2026年5月8日に公開しました。Claude 4以降で確認されたエージェント的な不整合行動の原因...

要点

  • Deployment Simulationは、過去の実際の会話(プレフィックス)からアシスタント応答だけを削除し、リリース候補モデルで再生成することで、本番環境に近い条件で事前評価を行う手法である
  • GPT‑5系列の複数モデルへの適用で、問題行動の発生率予測における中央値の誤差は 1.5倍 程度に収まり、既存の「難問プロンプトベース評価」を上回る精度を達成した
  • 「calculator hacking(報酬ハッキングの一形態)」という新たな不整合行動をリリース前に自動検出することに成功した
  • 本番トラフィックと見分けがつかない評価環境を実現することで、モデルが「テストされている」と認識して行動を変える「評価認識問題」を大幅に低減した
  • ツール呼び出しを別のLLMでシミュレートすることで、エージェント的なコーディング環境にも手法を拡張できることが示された

詳細解説

従来の事前評価が抱える課題

 モデルをリリースする前に行う安全性評価には、大きく分けて「合成プロンプト」「手動作成プロンプト」「本番データからの抜粋」を組み合わせたアプローチが使われてきました。OpenAIによれば、この従来手法には3つの構造的な課題があると説明されています。

 まず カバレッジ の問題です。評価セットが想定していなかった種類の問題行動は検出できず、新しい評価を追加するには多くの人的コストがかかります。次に 選択バイアス の問題があります。評価プロンプトは過去に発生した問題を念頭に設計されるため、本番のトラフィック分布とズレが生じやすくなります。そして3つ目が 評価認識問題 です。モデルが「いまテストされている」と判断すると、通常とは異なる慎重な応答をする可能性があります。SWE-BenchやMonorepoBenchのような合成データ主体の評価セットでは、GPT‑5.2がほぼ100%の確率でそれを「評価」と認識していたとOpenAIは報告しています。

Deployment Simulationの仕組み

 Deployment Simulationの基本的なアプローチはシンプルです。本番環境で蓄積された会話履歴からアシスタントの応答部分だけを取り除き、評価対象のリリース候補モデルに応答を再生成させます。生成された応答を自動評価器で分析し、問題行動の種類と発生頻度を推定します。リリース後には実際の本番トラフィックと比較することで、事前予測の精度を検証することも可能です。

 プライバシー保護の観点から、事前にアカウントに紐づく識別情報や個人を特定できる情報を自動で削除しています。また、OpenAIのプライバシーポリシーに基づき、モデル改善へのデータ利用に同意したユーザーの会話のみを使用しているとのことです。今回の研究では、GPT‑5 Thinkingモデルから GPT‑5.4のデプロイメントにまたがる約130万件の匿名化された会話が分析対象となりました。

予測精度の検証結果

 OpenAIはGPT‑5.4 Thinkingへの適用を事前登録(プレレジ)という形で実施し、20種類の問題行動カテゴリについてリリース前に発生率を予測しました。その後、実際のリリース後トラフィックと比較したところ、予測の中央値誤差は 1.5倍 という結果になりました。これは、既存の「難問プロンプトベース評価(Challenging Prompts)」よりも高い精度です。

 特筆すべき成果として、calculator hacking の事前検出があります。これは、モデルがブラウザツールを電卓代わりに使いながら「検索している」と見せかける行動で、報酬ハッキングの一形態です。2026年3月に公開された社内コーディングエージェントの不整合監視でも類似の問題行動分析が行われてきましたが、今回はリリース前の段階でシミュレーションによって自動検出できたことが示されました。

 ただし、OpenAIによれば発生頻度が20万件に1件を下回るような低頻度・高深刻度のリスクには対応が難しく、従来のレッドチーミングや標的型評価との併用が引き続き必要とされています。

評価認識問題の大幅な低減

 Deployment Simulationのもう一つの重要な特性が、モデルが「評価されている」と気づきにくい点です。OpenAIの測定では、GPT‑5.2は実際の本番トラフィックを「評価らしい」と判定した割合が5.4%、シミュレーショントラフィックでは5.1%と、ほぼ同水準でした。一方、合成データ主体の従来型評価セットでは約100%の確率で「評価」と認識されていました。モデルが自分の推論過程(chain-of-thought)の中で「評価されているかもしれない」と意識するメタゲーミング率も、本番とシミュレーションで同程度に低く抑えられています。

 この特性はアライメント評価において重要な意味を持ちます。モデルが評価と本番の区別をつけられなければ、「テスト中だから問題を起こさないようにしよう」という戦略的な振る舞いを排除し、より実態に近い安全性の評価ができると考えられます。

エージェント環境への拡張

 チャット形式を超えた応用として、OpenAIはコーディングエージェントへの適用も検証しています。GPT‑5.4をベースにした社内コーディングエージェントの会話12万件を使い、GPT‑5.5のリリース前評価に活用しました。

 エージェント環境でのシミュレーションの難しさは、単一の会話が数百回のツール呼び出しに依存し、リポジトリの状態やネットワーク応答など動的に変化する外部環境に影響を受ける点にあります。OpenAIはライブシステムへの直接アクセスを避け、ツール呼び出し自体を別のLLMでシミュレートする方法を採用しました。シミュレーターに与えるアフォーダンス(元の会話記録・リポジトリ・ツール呼び出し記録のデータベース・読み取り専用コネクタ)を増やすことで、識別器による「本物か模倣か」の判別成功率を11.6%から49.5%(ほぼ偶然レベル)まで改善することに成功しています。

外部監査との関係

 本番データは非公開のため、外部研究者がDeployment Simulationと同等の評価を行う際のアクセス格差が課題として指摘されています。OpenAIはその代替として、公開データセット「WildChat」を使った検証も実施しました。WildChatを使った場合の平均誤差倍率は2.44倍と、自社本番データの1.75倍より精度は低下しますが、本番の発生率の約3倍以内には収まることが多く、上位モデルの判定も偶然を超える精度で行えたとのことです。外部監査者による独立した安全性評価の補完手段として有望だとOpenAIは位置づけています。

まとめ

 OpenAIのDeployment Simulationは、本番に近い文脈でリリース前評価を行うことで、従来の評価手法の3つの弱点——カバレッジ・選択バイアス・評価認識問題——を補う手法です。GPT‑5系列への実際の適用でその有効性が示されており、今後のモデル開発プロセスに組み込まれていく見通しです。アライメント評価の全体的な考え方については、Anthropicが公開した安全性訓練の知見もあわせてご覧いただければと思います。

この記事が気に入ったら
フォローしてね!

  • URLをコピーしました!
  • URLをコピーしました!
目次