[ニュース解説]OpenAIが「Safety Bug Bounty」プログラムを開始——AIの悪用・安全リスクを外部研究者とともに発見へ

目次

はじめに

 OpenAIは2026年3月25日、AIの悪用や安全上のリスクを発見・報告するための「Safety Bug Bounty」プログラムを公開しました。本稿では、このプログラムの概要と対象となるリスク領域、参加方法について解説します。

参考記事

要点

  • OpenAIは2026年3月25日、AIの悪用・安全リスクを対象とした「Safety Bug Bounty」プログラムを公開した
  • 従来のセキュリティバグバウンティとは別に設立され、セキュリティ脆弱性に該当しない安全上のリスクも対象となる
  • 対象領域はエージェント型リスク(MCPを含む)、OpenAIの独自情報、アカウント・プラットフォームの完全性の3カテゴリである
  • ジェイルブレイク(制限回避)は対象外だが、バイオリスクなど特定の害種を対象とした非公開キャンペーンが別途実施される
  • 提出された報告はOpenAIのSafety・Securityバグバウンティチームが審査し、内容に応じて適切なプログラムに振り分けられる

詳細解説

プログラムの概要と背景

 OpenAIは、AI技術の急速な進化に伴い、悪用やリスクの手口も多様化していることを背景に、このプログラムを立ち上げました。OpenAIによれば、新プログラムは既存の「Security Bug Bounty」を補完するものとして位置づけられており、従来のセキュリティ脆弱性には該当しないものの、実質的な悪用・安全上のリスクをもたらす問題も受け付けます。

 バグバウンティとは、ソフトウェアや製品の脆弱性・問題点を発見・報告した外部の研究者や倫理的ハッカーに対して報奨金を支払う制度です。セキュリティの分野では広く普及した仕組みですが、今回OpenAIはこれをAI固有の「安全上のリスク」にも拡張した形となります。提出された報告はSafetyチームとSecurityチームが共同で審査し、内容に応じて適切なプログラムへ振り分けられます。

対象となる3つのリスク領域

 OpenAIの発表では、プログラムの対象として3つのカテゴリが示されています。

エージェント型リスク(MCPを含む)

 第1のカテゴリは、AIエージェントに関するリスクです。具体的には、攻撃者のテキストによってエージェント(Browser、ChatGPT Agentなど)が乗っ取られ、有害な行動の実行やユーザーの機密情報の窃取が行われる「サードパーティプロンプトインジェクション」が挙げられています。プロンプトインジェクションとは、AIモデルへの入力に悪意ある指示を混入させ、モデルを意図しない動作へ誘導する攻撃手法です。有効な報告として認められるには、当該動作が50%以上の確率で再現可能であることが条件とされています。

 また、OpenAIのエージェント製品がOpenAIのサイト上で禁止された行動を大規模に実行するケースや、その他の潜在的に有害な行動(実質的な被害が見込まれるもの)も対象です。MCP(Model Context Protocol)に関連するテストを実施する場合は、サードパーティの利用規約を遵守することが求められます。MCPとは、AIモデルと外部ツール・データソースを接続するためのプロトコル規格で、エージェント型AIの普及とともに活用が広がっています。

OpenAIの独自情報

 第2のカテゴリは、OpenAIが保有する独自情報に関するリスクです。モデルの生成結果として推論プロセスに関わる独自情報が漏えいするケースや、その他のOpenAI独自情報が外部に露出する脆弱性が対象となります。

アカウント・プラットフォームの完全性

 第3のカテゴリは、アカウントやプラットフォームの健全性に関する問題です。自動化防止機能(BOT対策)のバイパス、アカウント信頼シグナルの操作、アカウント制限・停止・BAN回避などが対象として挙げられています。なお、権限を超えてデータや機能にアクセスできる問題については、既存のSecurity Bug Bountyプログラムへの報告が求められます。

対象外と特別キャンペーンの位置づけ

 OpenAIの発表では、ジェイルブレイク(AIの制限を回避する行為)は今回のプログラムの対象外と明記されています。「検索エンジンで容易に得られる情報の取得」や「単に無礼な言語を使用させる程度」のジェイルブレイクは、実質的な安全上・悪用上のリスクに直接つながらないとして、対象外の具体例として挙げられています。

 一方、OpenAIはバイオリスクコンテンツをテーマとした非公開のバグバウンティキャンペーン(ChatGPT Agent向け・GPT-5向け)を別途実施しており、関心のある研究者に応募を呼びかけています。上記カテゴリ以外でも、ユーザーへの直接的な被害につながり、かつ具体的な修正手順が明示できる問題は、個別に報奨の対象となる可能性があるとされています。

参加方法

 プログラムへの参加は、Bugcrowd上の公式ページ(Safety Bug Bountyページ)から申請できます。OpenAIは研究者、倫理的ハッカー、安全・セキュリティコミュニティとの連携を通じて、安全なAIエコシステムの実現を目指すとしています。

まとめ

 OpenAIが開始したSafety Bug Bountyプログラムは、AIの安全性確保に外部の知見を積極的に活用しようとする取り組みと言えます。エージェント型AIの普及が進む中、プロンプトインジェクションをはじめとする新たなリスクへの対応として、今後の運用と報告事例の蓄積が注目されます。

この記事が気に入ったら
フォローしてね!

  • URLをコピーしました!
  • URLをコピーしました!
目次