[ニュース解説]Anthropic、Claudeのユーザー保護機能を強化——自殺・自傷対応と追従性削減の取り組みを公開

目次

はじめに

 AnthropicのSafeguardsチームが2025年12月19日、AIチャットボット「Claude」におけるユーザー保護の取り組みについて詳細を公開しました。本稿では、自殺・自傷に関する会話への対応、追従性(sycophancy)の削減、18歳以上の年齢制限など、Claudeの安全機能の実装方法と評価結果を解説します。

参考記事

要点

  • Claudeは自殺・自傷の会話を検出する分類器を導入し、170カ国以上の危機支援リソースへユーザーを誘導する
  • 最新モデル(Opus 4.5、Sonnet 4.5、Haiku 4.5)は明確なリスクを含む要求に対し98.6%以上の確率で適切に応答する
  • 追従性削減の取り組みにより、Claude 4.5シリーズは前世代Opus 4.1と比較して70-85%改善した
  • オープンソース評価ツール「Petri」を公開し、他の主要モデルと比較して最高性能を達成した
  • Claude.aiは18歳以上の利用制限を設け、未成年ユーザーの検出と保護を強化している

詳細解説

自殺・自傷に関する会話への対応

 Anthropicによれば、Claudeは専門的なアドバイスや医療ケアの代替ではなく、個人的な苦悩を表現するユーザーに対して、ヘルプライン、メンタルヘルスの専門家、信頼できる友人や家族への相談を促す設計になっています。

 この対応を実現するため、Anthropicは「システムプロンプト」と呼ばれる包括的な指示セットをClaudeに提供しています。システムプロンプトはすべての会話の開始前にClaudeが参照するもので、機密性の高い会話をどのように扱うべきかのガイダンスが含まれています。これらのシステムプロンプトは公開されており、透明性が確保されています。

 さらに、「強化学習」と呼ばれるプロセスを通じてモデルの行動を形成しています。強化学習は、トレーニング中に適切な回答を提供した際にモデルが「報酬」を受け取る仕組みです。この学習プロセスでは、実際の人々から収集したフィードバックデータと、Anthropicが理想とするClaudeのキャラクターに基づいて生成したデータを組み合わせています。社内の専門家チームが、機密性の高い会話においてClaudeがどのような行動を示すべきか、あるいは示すべきでないかを定義する役割を担っています。

製品安全機能の導入

 Anthropicは、ユーザーが専門的なサポートを必要とする可能性がある状況を特定し、必要に応じてそのサポートへ誘導する新機能を導入しました。Claude.aiの会話には「自殺・自傷分類器」が実装されています。

 分類器とは、進行中の会話の内容をスキャンする小規模なAIモデルで、この場合は追加のリソースが有益となる可能性がある瞬間を検出します。たとえば、自殺念慮の可能性を含む議論や、自殺・自傷を中心とした架空のシナリオにフラグを立てます。

 この機能が作動すると、Claude.ai上にバナーが表示され、ユーザーは人間のサポートを求める場所へと誘導されます。具体的には、訓練を受けた専門家とのチャット、ヘルプラインへの電話、または国別の専門リソースへのアクセスが可能になります。

 バナーに表示されるリソースはThroughLineによって提供されています。ThroughLineはオンライン危機支援のリーダーであり、170カ国以上にわたる検証済みのグローバルなヘルプラインとサービスのネットワークを維持しています。これにより、ユーザーは米国とカナダでは988 Lifeline、英国ではSamaritans Helpline、日本ではLife Linkなどにアクセスできます。Anthropicは、共感的な危機対応のベストプラクティスを理解するためThroughLineと緊密に連携し、これらを製品に組み込んでいます。

 さらに、Anthropicは国際自殺予防協会(IASP)との協力も開始しています。IASPは、臨床医、研究者、自殺や自傷の考えに対処した個人的経験を持つ人々を含む専門家を招集し、Claudeが自殺関連の会話をどのように扱うべきかについてガイダンスを共有しています。このパートナーシップは、Claudeのトレーニング方法、製品介入の設計、アプローチの評価をさらに改善する情報源となります。

評価方法と性能指標

 Claudeがこれらの会話をどのように扱うかを評価することは困難です。ユーザーの意図は本質的に曖昧であることが多く、適切な応答は常に明確とは限りません。この課題に対処するため、Anthropicは複数の評価手法を使用し、さまざまな角度からClaudeの行動と能力を研究しています。これらの評価は、モデルの基本的な傾向をより明確に把握するため、Claudeのシステムプロンプトなしで実行されます。

 単一ターン応答の評価では、事前の会話や文脈なしに、自殺や自傷に関連する個別のメッセージにClaudeがどのように応答するかを評価します。Anthropicは、明確に懸念される状況(危機的状況にあるユーザーによる自傷方法の詳細を求める要求など)、良性の要求(自殺予防研究などのトピック)、ユーザーの意図が不明確な曖昧なシナリオ(フィクション、研究、または間接的な苦痛の表現など)にグループ化された合成評価を構築しました。

 明確なリスクを含む要求に対して、最新モデルであるClaude Opus 4.5、Sonnet 4.5、Haiku 4.5は、それぞれ98.6%、98.7%、99.3%の確率で適切に応答しました。前世代のフロンティアモデルであるClaude Opus 4.1は97.2%でした。また、良性の要求に対する拒否率も一貫して非常に低く(Opus 4.5で0.075%、Sonnet 4.5で0.075%、Haiku 4.5で0%、Opus 4.1で0%)、Claudeが会話の文脈とユーザーの意図を適切に判断できることを示しています。

 複数ターン会話の評価では、ユーザーがより多くの文脈を共有するにつれて、モデルの行動が会話の過程でどのように進化するかを評価します。Claudeが長い会話全体で適切に応答するかを評価するため、Anthropicは「複数ターン」評価を使用しています。これは、Claudeが明確化のための質問をするか、押し付けがましくならずにリソースを提供するか、過度な拒否と過度な共有の両方を避けるかといった行動をチェックします。

 最新の評価では、Claude Opus 4.5とSonnet 4.5はそれぞれ86%と78%のシナリオで適切に応答しました。これは、56%を記録したClaude Opus 4.1と比較して大幅な改善を示しています。Anthropicは、最新モデルがユーザーの信念を強化することなく共感的に認識する能力が向上したことが、この改善の一因と考えています。

 実際の会話でのストレステストでは、会話がすでに懸念される方向に進んでいる場合に、Claudeが軌道修正できるかをテストします。このため、「プリフィル」と呼ばれる技術を使用しています。これは、ユーザーがメンタルヘルスの苦悩、自殺、または自傷の苦悩を表現した実際の会話(フィードバックボタンを通じて匿名で共有されたもの)を取得し、Claudeに会話の途中から続けるよう求めるものです。モデルはこの事前の対話を自分自身のものとして読み取り、一貫性を保とうとするため、プリフィルはClaudeが方向を変えることをより困難にします。これは、すでに動いている船の舵を切るようなものと考えられます。

 これらの会話は、時に適切に扱われなかった古いClaudeモデルからのものです。したがって、この評価はClaude.ai上で会話の開始時からClaudeがどの程度適切に応答する可能性があるかを測定するものではなく、新しいモデルが整合性の低いバージョンの自分自身から回復できるかを測定するものです。このより困難なテストでは、Opus 4.5は70%、Sonnet 4.5は73%の確率で適切に応答しました。これに対してOpus 4.1は36%でした。

追従性(Sycophancy)の削減

 追従性とは、真実や実際に役立つことではなく、誰かが聞きたいことを伝える、つまり一時的に気分を良くさせることを指します。これはしばしばお世辞として現れ、追従的なAIモデルはプレッシャーの下で正しい立場を放棄する傾向があります。

 AIモデルの追従性を削減することは、あらゆる種類の会話にとって重要です。しかし、ユーザーが現実からの断絶を経験しているように見える可能性がある文脈では、特に重要な懸念事項となります。追従性がなぜ重要か、そしてユーザーがそれをどのように見つけられるかについて、Anthropicは説明動画を提供しています。

 Anthropicは2022年、最初の公開リリース前にClaudeの追従性を評価し始めました。それ以来、トレーニング、テスト、追従性削減の方法を着実に改良してきました。最新のモデルはこれまでで最も追従性が低く、最近リリースされたオープンソース評価セット「Petri」において、他のどのフロンティアモデルよりも優れた性能を発揮しています。

 追従性を評価するため、Anthropicはシンプルな単一ターン評価に加えて、以下を測定しています:

 複数ターン応答の評価では、「自動化された行動監査」を使用し、1つのClaudeモデル(「監査人」)にテスト対象のモデルとの数十回のやり取りにわたって懸念される可能性のあるシナリオを演じさせます。その後、別のモデル(「審判」)が会話記録を使用してClaudeの性能を採点します。Anthropicは審判の正確性を確保するために人間による抜き打ちチェックを実施しています。

 Anthropicによれば、最新モデルはこの評価で以前のリリースよりも大幅に優れた性能を示し、全体的に非常に良好な結果を示しました。Claude Opus 4.5、Sonnet 4.5、Haiku 4.5は、以前は非常に低い追従性率を示すと考えられていたOpus 4.1と比較して、追従性とユーザーの妄想の助長の両方で70-85%低いスコアを記録しました。

 Anthropicは最近、自動化された行動監査ツールのバージョンである「Petri」をオープンソース化しました。これは現在無料で利用可能で、誰でもモデル間でスコアを比較できます。4.5モデルファミリーは、テスト時点で他のすべてのフロンティアモデルよりもPetriの追従性評価で優れた性能を示しました。

 Petriは100以上のシード指示とカスタマイズ可能なスコアリング次元を含む公開版ですが、Anthropicが内部で使用するリアリズムフィルター(モデルがテストされていることを認識するのを防ぐ)はまだ含まれていません。

 実際の会話でのストレステストでは、自殺・自傷の評価と同様に、「プリフィル」方式を使用して、Claudeが追従的であった可能性がある会話から軌道修正する能力の限界を調査しました。ここでの違いは、不適切な応答を特にフィルタリングせず、代わりにClaudeに古い会話の広範なセットを与えたことです。

 現在のモデルは、10%(Opus 4.5)、16.5%(Sonnet 4.5)、37%(Haiku 4.5)の確率で適切に軌道修正しました。表面的には、この評価はすべてのモデルに大きな改善の余地があることを示しています。Anthropicは、この結果が一方でモデルの温かさや友好性と、他方で追従性とのトレードオフを反映していると考えています。Haiku 4.5の比較的強い性能は、このモデルのトレーニングの選択が反論を強調した結果であり、テストではユーザーに時々過度に感じられる可能性があることがわかりました。対照的に、Anthropicはこの傾向をOpus 4.5で削減しました(上記の複数ターン追従性ベンチマークでは依然として極めて良好な性能を示しながら)。これが、この特定の評価での低いスコアを説明している可能性が高いと考えられます。

年齢制限と今後の取り組み

 若いユーザーはAIチャットボットとの会話による悪影響のリスクが高いため、AnthropicはClaude.aiユーザーに製品を使用するための18歳以上の年齢制限を設けています。すべてのClaude.aiユーザーは、アカウント設定時に18歳以上であることを確認する必要があります。

 18歳未満のユーザーが会話中に自分の年齢を明らかにした場合、Anthropicの分類器がこれをレビューのためにフラグを立て、未成年者に属することが確認されたアカウントを無効にします。また、Anthropicはユーザーが未成年である可能性があるより微妙な会話の兆候を検出する新しい分類器を開発しています。

 Anthropicは、子どもと家族のための安全なオンライン体験の提唱者である家族オンライン安全研究所(FOSI)に参加し、この作業における業界の進歩を強化する支援を行っています。

 今後について、Anthropicはユーザーの幸福を保護するための新しい保護機能とセーフガードを構築し続け、評価方法も反復し続けると述べています。同社は、方法と結果を透明性を持って公開し、研究者やその他の専門家を含む業界の他者と協力して、これらの分野でのAIツールの行動を改善することに取り組んでいます。

 Claudeがこれらの会話をどのように扱うかについてフィードバックがある場合、[email protected]に連絡するか、Claude.ai内の「親指」反応を使用できます。

まとめ

 AnthropicはClaudeのユーザー保護機能を多層的に強化し、自殺・自傷対応では98%以上の適切な応答率、追従性削減では前世代比70-85%の改善を達成しました。オープンソース評価ツールPetriの公開や外部組織との連携により、AI安全性への透明性の高いアプローチを示しています。今後もAIチャットボットの責任ある開発において、技術的な性能評価と倫理的配慮の両立がより重要になると考えられます。

この記事が気に入ったら
フォローしてね!

  • URLをコピーしました!
  • URLをコピーしました!
目次