はじめに
OpenAIは2026年3月3日、GPT-5シリーズの最新モデル「GPT-5.3 Instant」のSystem Card(安全性評価報告書)を公開しました。本稿では、このSystem Cardの内容をもとに、モデルの訓練データ・安全性ベンチマーク・医療応答性能の各項目を網羅的に解説します。
参考記事
- タイトル: GPT-5.3 Instant System Card
- 著者: OpenAI
- 発行元: OpenAI(deploymentsafety.openai.com)
- 発行日: 2026年3月3日
- 記事URL: https://openai.com/index/gpt-5-3-instant-system-card/
- 論文URL: https://deploymentsafety.openai.com/gpt-5-3-instant
要点
- GPT-5.3 Instantは応答速度の向上と、ウェブ検索時の回答品質改善、不要な留保表現の削減を特徴とするGPT-5シリーズの最新版である
- 安全性のProduction Benchmarksでは、非暴力的違法行為カテゴリで前バージョンを大きく上回る一方、性的コンテンツ・グラフィック暴力などで後退が確認されている
- メンタルヘルス・感情的依存・自傷を対象とした動的マルチターン評価が新たに導入され、長期会話での安全性評価が強化された
- HealthBenchではgpt-5.2-instantをわずかに下回る結果だが、情報不足時の追加質問と不確実性の高い状況での慎重な回答で改善が見られる
詳細解説
1. Introduction(はじめに)
GPT-5.3 InstantはGPT-5シリーズへの最新追加モデルです。前バージョンと比べ、応答速度が向上し、ウェブ検索時にはより豊かで文脈に即した回答を提供できるようになっています。また、会話の流れを妨げる不要な行き詰まり・過度な留保表現・宣言的すぎる言い回しが削減されています。安全性対策の全体的な枠組みは、GPT-5.2 InstantのSystem Cardで説明された内容と基本的に同様です。
System Card(システムカード)とは、AIモデルのリリースに際して公開される安全性評価報告書で、モデルの能力・リスク・評価結果をまとめた文書です。OpenAIは各モデルリリース時にこれを公表しており、透明性確保の取り組みとして位置づけられています。
2. Model Data and Training(モデルデータとトレーニング)
本モデルはインターネット上で公開されている情報、サードパーティとの提携を通じて取得した情報、ユーザーや人間のトレーナー・研究者が提供・生成した情報など、多様なデータセットで訓練されています。データ処理パイプラインには、データ品質の維持とリスク低減のための厳格なフィルタリングが組み込まれています。
また、訓練データから個人情報を削減するための高度なフィルタリング処理が用いられており、未成年者に関する性的コンテンツを含む有害・センシティブなコンテンツの使用を防止・低減するための安全分類器も採用されています。
なお、以前のモデルとの比較値はそれらモデルの最新バージョンに基づくものであり、各モデルのリリース時に公表された値とわずかに異なる場合があります。
3. Safety(安全性)
3.1 Disallowed Content(禁止コンテンツ)
OpenAIは禁止コンテンツの各カテゴリについてベンチマーク評価を実施しています。ここで報告されているのはProduction Benchmarksと呼ばれる評価セットで、実際のプロダクションデータから収集した難易度の高い事例で構成されています。OpenAIが注記しているように、このベンチマークは既存モデルが理想的な回答をまだ十分に出せていない事例をもとに意図的に難しく設計されており、記録されたエラー率は平均的なプロダクショントラフィックを代表するものではありません。評価指標は「not_unsafe」(OpenAIのポリシーに違反しない出力かどうか)で、値が1.000に近いほど安全性が高いことを示します。
Table 1: Production Benchmarks(高いほど良好)
| カテゴリ | gpt-5.1-instant | gpt-5.2-instant | gpt-5.3-instant |
|---|---|---|---|
| 暴力的違法行為 | 0.962 | 0.965 | 0.926 |
| 非暴力的違法行為 | 0.656 | 0.832 | 0.921 |
| 自傷 | 0.874 | 0.923 | 0.895 |
| 生物学 | 1.000 | 1.000 | 1.000 |
| 性的コンテンツ | 0.930 | 0.926 | 0.866 |
| 過激主義(プロパガンダ・賞賛・支援) | 1.000 | 0.979 | 0.981 |
| ヘイト(保護対象属性への侮辱的行為) | 0.959 | 0.851 | 0.868 |
| グラフィック暴力・身体的傷害 | 0.889 | 0.852 | 0.781 |
全体的にはgpt-5.1-instantを上回り、gpt-5.2-instantをやや下回る結果です。特に性的コンテンツについてはgpt-5.2-instantおよびgpt-5.1-instantの両方を下回る後退が確認されており、自傷についても標準・動的評価の両方でgpt-5.2-instantを下回っています。一方、グラフィック暴力と暴力的違法行為の後退は統計的有意性が低いとされています。非暴力的違法行為カテゴリでは0.656から0.921へと大きく改善されており、その他のカテゴリでは前バージョンと同水準か改善が見られます。
ベンチマーク評価に加えて、オンライン実験中の安全性レビューも実施されており、自傷に関して望ましくない回答の増加は観測されなかったとOpenAIは述べています。今後のリリースに向けて改善を継続するとしており、性的コンテンツについてはChatGPTにシステムレベルのセーフガードを導入することで対処する方針です。
Table 2: Dynamic Mental Health Evaluations(動的メンタルヘルス評価)
GPT-5.3 Instantのリリースに先立ち、OpenAIはメンタルヘルス・感情的依存・自傷に関する動的マルチターン評価を新たに導入しました。従来の静的評価が固定された対話内での単一回答を評価するのに対し、この方式ではモデルの出力に応じて会話が展開していく形式を採用しています。これにより、長期的な会話の中でのみ現れる問題の検出が可能になり、現実的かつ対抗的なユーザーシミュレーションを活用することで、従来の評価枠組みが飽和状態に達していた領域での安全性向上が実現しています。
この動的評価では、最終的な回答だけでなく、すべての回答がポリシーに準拠しているかを評価し、ポリシー準拠回答の割合(not_unsafe)を測定します。
| カテゴリ | gpt-5.1-instant | gpt-5.2-instant | gpt-5.3-instant |
|---|---|---|---|
| メンタルヘルス | 0.832 | 1.000 | 0.985 |
| 感情的依存 | 0.945 | 0.952 | 0.992 |
| 自傷 | 0.845 | 0.920 | 0.911 |
OpenAIによれば、動的評価においてgpt-5.3-instantはgpt-5.2-instantをやや下回るものの、gpt-5.1-instantを大きく上回る結果となっています。感情的依存カテゴリでは0.992と特に高いスコアを記録しています。
4. Health Performance(健康応答性能)
4.1 HealthBench(HealthBench)
OpenAIはGPT-5.3 InstantをHealthBenchで評価しています。HealthBenchは健康分野における性能と安全性を評価するための評価セットで、最大5,000件の現実的な(マルチターンを含む)健康関連会話で構成されています。モデルの回答は事例ごとに設定されたルーブリック(評価基準)で採点されます。評価は以下の3つのバリアントで報告されています。
- HealthBench(標準):全体的な健康応答品質
- HealthBench Hard:難易度の高い事例に絞った評価
- HealthBench Consensus:複数の評価者が合意した基準に基づく評価
Table 3: HealthBench
| 指標 | gpt-5.2-instant | gpt-5.3-instant |
|---|---|---|
| HealthBench | 55.4% | 54.1% |
| Hard | 26.8% | 25.9% |
| Consensus | 95.8% | 95.3% |
| 平均応答長 | 2101文字 | 2140文字 |
OpenAIによれば、gpt-5.3-instantはHealthBenchで54.1%(-1.3%)、Hardで25.9%(-0.9%)、Consensusで95.3%(-0.5%)と、gpt-5.2-instantをわずかに下回る結果でした。平均応答長はほぼ同等(+1.9%)であり、同程度の長さで若干性能が低下した形となっています。
OpenAIが公表したConsensusの基準における主な強みは次の2点です。重要情報が欠けている際にコンテキストを収集する行動の改善(+4.4%)と、不確実性が解消できない状況での慎重な回答行動の改善(+4.0%)です。
一方、主な弱みとして2点が挙げられています。紹介(referral)前のコンテキスト収集行動の低下(-10.1%)と、地域の医療文脈が関連していると考えられるが明示されていない場合の正確性低下(-5.5%)です。referral前のコンテキスト収集とは、専門医への受診を勧める前に患者の状況をより詳しく把握しようとする行動を指し、医療応答の質に直結する項目と言えます。
まとめ
GPT-5.3 InstantのSystem Cardは、応答速度と会話品質の向上を達成しながら、安全性評価の一部に後退があることも率直に開示しています。動的マルチターン評価の新導入は、長期的な会話における安全性検証の精度向上に向けた取り組みとして注目されます。HealthBenchの結果とあわせ、今後のバージョンアップでどのように改善されていくか、継続的なモニタリングが重要と思います。
