はじめに
OpenAIが2026年3月10日、AIモデルが複数の命令源から受け取る指示を正しく優先処理するための強化学習データセット「IH-Challenge」を発表しました。本稿では、その設計思想と実験結果、そして安全性への実用的な影響について解説します。
参考記事
- タイトル: Improving instruction hierarchy in frontier LLMs
- 著者: OpenAI
- 発行元: OpenAI
- 発行日: 2026年3月10日
- URL: https://openai.com/index/instruction-hierarchy-challenge/
要点
- AIモデルは「システム > 開発者 > ユーザー > ツール」という命令階層に従って動作するよう設計されており、この優先順位が崩れると安全上の問題が生じる
- 命令階層トレーニングには「複雑な命令による失敗の混同」「評価の主観性」「過剰拒否などのショートカット学習」という3つの落とし穴が存在する
- OpenAIが設計したIH-Challengeは、客観的に採点可能でショートカットを排除したタスク設計により、これらの課題に対処している
- IH-Challengeで訓練した内部モデル「GPT-5 Mini-R」は、複数のベンチマークで命令階層の堅牢性・安全性誘導可能性・プロンプトインジェクション耐性が向上した
- IH-Challengeデータセットは研究促進のためHugging Faceで公開されている
詳細解説
命令階層とは何か
AIモデルは実際の運用において、システムメッセージからの安全ポリシー、開発者からの製品ガイダンス、ユーザーからのリクエスト、オンラインデータに埋め込まれた情報など、複数の発信源から命令を受け取ります。OpenAIのモデルはこれらを「System(システム)> developer(開発者)> user(ユーザー)> tool(ツール)」という優先順位で処理するよう設計されており、上位の命令が下位の命令と競合する場合は上位を優先する原則が適用されます。
例えば、開発者が「数学のチューターとして、答えは教えずに問題を解くヒントだけを示せ」と指定したにもかかわらず、ユーザーが「答えをそのまま教えてほしい」と求めた場合、モデルは開発者の指示を優先してヒントのみを提示するのが正しい振る舞いです。このような優先順位付けが機能しないと、禁止コンテンツの生成、プライベート情報の漏洩、プロンプトインジェクション攻撃への脆弱性といった安全上の問題につながる可能性があります。
命令階層トレーニングの3つの落とし穴
命令の優先順位を強化学習で教える方法は自然なアプローチですが、OpenAIは単純に適用した場合の3つの落とし穴を特定しました。
1点目は「命令追従失敗と命令階層失敗の混同」です。命令自体が複雑すぎると、優先順位の判断の問題ではなく命令の理解の問題として失敗が現れてしまい、何を改善すべきかが判別しにくくなります。2点目は「評価の主観性」です。命令の競合は微妙で主観的な場合があり、別のLLMを評価者として報酬を割り当てる方式でも、その評価者自身が誤る可能性があります。3点目は「ショートカット学習」です。モデルは高い報酬を得るための近道を学習しがちで、典型例が過剰拒否(オーバーリフューザル)です。何でも拒否すれば安全性スコアは上がりますが、実用上は無意味な振る舞いになってしまいます。
IH-Challengeの設計思想
OpenAIはこれら3つの課題に対処するため、IH-Challengeというデータセットを設計しました。設計原則は3つです。「命令の追従自体はシンプルであること」「Pythonスクリプトで客観的に採点可能であること」「高報酬を保証するショートカットが存在しないこと」です。
各タスクは、高権限ロールからの命令(例: 「YesまたはNoのみで答えよ」)と、それを違反させようとする低権限ロールからの命令を組み合わせた会話形式で構成されています。命令自体がシンプルであるため、失敗した場合の原因が「命令の理解不足」ではなく「優先順位判断の失敗」として明確に特定でき、改善が容易になっています。応答がその制約を満たしているかはプログラムで検証するため、主観的な評価のぶれも生じません。
GPT-5 Mini-Rの実験結果
IH-Challengeで訓練した内部モデル「GPT-5 Mini-R」の評価結果は、複数のベンチマークで改善を示しています。OpenAIの発表によれば、学術ベンチマークでは、TensorTrust(sys-user)が0.86から0.94へ、TensorTrust(dev-user)が0.76から0.91へ向上しています。社内ベンチマークでは、System対User間の命令競合への対応が0.84から0.95、Developer対User間が0.83から0.95へ改善しました。また、人間によるレッドチーミングに対する堅牢性も0.73から0.90へと大きく向上しています。

能力回帰のチェックも行われており、GPQA DiamondやAIME 2024などの能力ベンチマークではほぼ変化なく維持されています。過剰拒否スコアは0.79から1.00へ改善しており、安全性の強化によってむしろ過剰拒否が減少したことが示されています。一方、Chat WinRate(対o1)やPreference Scoreはわずかに低下しており、この点については継続的な改善が期待されます。
安全性の誘導可能性への影響
安全性の誘導可能性(Safety Steerability)とは、システムプロンプトに安全仕様を記述した際に、モデルがその仕様に従って動作するかを示す指標です。OpenAIはカテゴリー別の安全仕様をシステムプロンプトに付与した状態で生産環境を想定したベンチマークを実施しました。

GPT-5 Mini-Rは違法コンテンツ、ハラスメント、性的コンテンツ、暴力など複数のカテゴリーにわたって、安全な応答率と拒否率がベースラインのGPT-5 Miniと比較して向上しています。注目すべき点は、この改善が全体的な有用性スコアの低下を伴っていないことです。安全性と有用性のトレードオフは従来から課題とされてきましたが、命令階層の強化によってバランスを保ちながら両方を改善できる可能性が示されたと考えられます。


プロンプトインジェクション耐性への影響
プロンプトインジェクションとは、ツールの出力や外部ドキュメントに悪意のある命令を埋め込み、AIモデルにそれを正規の命令として実行させようとする攻撃手法です。AIがウェブを参照したり外部ツールを呼び出したりするエージェント型の利用が増える中で、特に重要な脅威として注目されています。

OpenAIは学術ベンチマーク「CyberSecEval 2」と社内プロンプトインジェクションベンチマークの両方でGPT-5 Mini-Rを評価しました。結果として、GPT-5 Mini-Rはベースラインと比較して両ベンチマークで耐性が向上し、特に社内の静的プロンプトインジェクション評価では大幅な改善が確認されたとのことです。命令階層の強化が、外部からの悪意ある命令を無視する能力にも波及することが示された点は、実用上重要な知見だと思います。
データセットの公開と今後の展望
AIモデルがツールを呼び出し、信頼性の低い外部ドキュメントを読み、実世界でアクションを取るエージェント型の運用が今後さらに広がっていくと考えられます。そうした環境では、信頼できる命令を常に優先する能力が安全性の核心となります。OpenAIはIH-Challengeデータセットを研究コミュニティへの貢献としてHugging Faceで公開しており、今後の関連研究や他のモデルへの応用に活用されることが期待されます。
まとめ
OpenAIが公開したIH-Challengeは、AIが複数の命令を適切に優先処理するための強化学習データセットです。訓練されたGPT-5 Mini-Rでは安全性の誘導可能性とプロンプトインジェクション耐性が向上し、有用性を維持しながら安全性を高められることが示されました。エージェント型AIが普及する中で、命令階層の堅牢化は今後も重要な研究領域として注目されそうです。
