[ニュース解説]ChatGPTはどのように暴力を防ぐか?OpenAIが公開したコミュニティ安全への包括的取り組み

目次

はじめに

 OpenAIが2026年4月28日、ChatGPTにおける暴力や有害行為を防ぐための取り組みをまとめた文書「Our commitment to community safety」を公開しました。モデルのトレーニング方針から自動検知・人的審査の仕組み、法執行機関への通報プロセス、そして未成年者保護機能の拡充まで、その全体像を解説します。

参考記事

関連記事

あわせて読みたい
[ニュース解説]ChatGPTの安全性向上への取り組み:心のケアと若者保護に向けた新機能の解説 はじめに  本稿では、AI開発の最前線を走る OpenAI が発表した「Building more helpful ChatGPT experiences for everyone」という記事をもとに、ChatGPTをより安全で...
あわせて読みたい
[開発者向け]OpenAI、Model Specに18歳未満向け保護原則を追加——発達科学に基づく安全対策とは? はじめに  OpenAIが2025年12月18日、AIモデルの行動規範を定めた「Model Spec」に、18歳未満のユーザー向けの保護原則「U18 Principles」を追加したと発表しました。本...
あわせて読みたい
[AIツール利用者向け]OpenAI、ChatGPTに年齢予測機能を導入——18歳未満ユーザーの安全対策を強化 はじめに  OpenAIが2026年1月20日、ChatGPTのコンシューマープランに年齢予測機能の導入を開始したと発表しました。この機能は、アカウントが18歳未満のユーザーによる...

要点

  • ChatGPTは暴力の実行につながる指示・戦術・計画の要求は拒否するよう訓練されているが、歴史的・教育的・予防的な文脈での議論は許容される
  • 自動検知システム(分類器・推論モデル・ハッシュマッチング技術など)と訓練された人的審査を組み合わせて、有害活動を検出・評価している
  • 暴力目的での利用にはゼロトレランスポリシーを掲げており、アカウントの即時失効・新規アカウント開設防止を含む措置がとられる
  • 差し迫った現実の暴力リスクが認められる場合、法執行機関に通報する体制が整えられている
  • 未成年者向けのペアレンタルコントロールに加え、成人ユーザー向けの「信頼できる連絡先」機能も近く導入予定である

詳細解説

拒否と許容の線引き:モデルのトレーニング方針

 OpenAIはChatGPTを、暴力の実行を実質的に可能にするような指示・戦術・計画の要求には応じないよう訓練しています。一方で、事実確認や歴史の理解、予防を目的とした暴力に関する議論は許容する設計としています。同社が公開しているModel Spec(モデルの行動指針をまとめた文書)には、ユーザーの自由度を最大化しながら有害リスクを最小化するという基本原則が示されており、今回の発表はその原則の実際の運用体制を詳しく説明するものです。

 この線引きが微妙なケースも多いため、OpenAIは心理学者・精神科医・公民自由専門家・法執行機関の専門家らの助言を受けながら、継続的に基準を精緻化しているとしています。2025年12月にModel Specに18歳未満向けの保護原則が追加されたことも、こうした取り組みの一環と位置づけられます。

自動検知と人的審査の組み合わせ

 OpenAIは、懸念される活動を大規模に特定するための自動検知システムを活用しています。具体的には、分類器(テキストのカテゴリを判定するAI)、推論モデル、ハッシュマッチング技術、ブロックリストなど複数のツールを組み合わせて、ポリシー違反や有害活動の可能性を示すシグナルを解析しているとのことです。

 自動でフラグが立ったアカウントややり取りは、次に訓練された担当者が文脈ごとに評価します。担当者は確立されたプライバシー・セキュリティ基準のもとで限定的な情報にアクセスし、フラグの立った行動が実際にポリシー違反にあたるか、または深刻なリスクを示すかを判断します。単一のメッセージだけでは問題なく見えても、長い会話の中のパターンが懸念を示す場合もあるため、こうした文脈を踏まえた審査が重要だとOpenAIは説明しています。近い将来、長く高リスクな会話にわたる微妙な警告サインをChatGPTがより適切に認識できるよう、取り組みをさらに強化したとも述べています。

ゼロトレランスポリシーと法執行機関への通報

 暴力を助長する目的でChatGPTを使用した場合、OpenAIはゼロトレランス(一切容認しない)ポリシーを掲げており、即時のアクセス失効・同一ユーザーの他アカウントの停止・新規アカウント開設の防止を含む措置をとります。ユーザーは判定に対して異議申し立てができ、OpenAIはその内容を再検討するとしています。

 深刻なリスクが認められるケースについては、より詳細な調査のために段階的にエスカレーションする仕組みも設けています。差し迫った現実の危害リスクがあると判断された場合には、法執行機関に通報する体制が整えられています。通報の判断基準については、会話の中に計画対象・手段・時期が明示されていない場合でも暴力リスクがあると評価できる柔軟性を持たせているとのことで、過度に形式的な基準に縛られない運用を目指しているようです。

メンタルヘルス対応と未成年者保護の拡充

 メンタルヘルス上の危機にある利用者への対応についても詳細が示されています。OpenAIによれば、ChatGPTは危機状況においてローカライズされた支援リソースを表示し、専門家や信頼できる人への相談を促したり、最も深刻なケースでは緊急の助けを求めるよう案内したりする機能を持っています。

 未成年者保護については、昨秋導入されたペアレンタルコントロール機能により、保護者が自身のアカウントと10代の子どものアカウントをリンクできるようになっています。保護者は子どもの会話内容にはアクセスできませんが、システムと審査担当者が深刻な苦境の兆候を検知した場合、必要最小限の情報を含む通知がメール・SMS・プッシュ通知で届く仕組みです。ChatGPTへの年齢予測機能の導入もこうした保護の流れを受けたものと考えられます。

 さらに、成人ユーザー向けの「信頼できる連絡先(trusted contact)」機能が近く導入される予定だとOpenAIは発表しています。ユーザーが追加サポートを必要としている可能性が検知された際、指定した連絡先に通知が届く機能で、Well-Being・AI評議会や世界医師ネットワークの専門家と連携して開発が進められているとのことです。

まとめ

 OpenAIは今回、ChatGPTにおける暴力防止・安全対応の取り組みを体系的に公開しました。モデル訓練・自動検知・人的審査・法執行機関連携という多層的な体制と、ペアレンタルコントロールや「信頼できる連絡先」機能の拡充は、AIサービスの安全性を考えるうえで参考になると思います。ChatGPTの安全機能の変遷についてより詳しく知りたい方は、過去記事でも整理していますのであわせてご覧いただければと思います。

この記事が気に入ったら
フォローしてね!

  • URLをコピーしました!
  • URLをコピーしました!
目次