はじめに
Anthropicが2026年2月24日、AI開発における安全指針「Responsible Scaling Policy(RSP)」の第3版を公開しました。本稿では、この発表をもとに、RSPの改訂背景、3つの主要な変更点、そしてこの枠組みが持つ意味について解説します。
参考記事
- タイトル: Anthropic’s Responsible Scaling Policy: Version 3.0
- 著者: Anthropic
- 発行元: Anthropic
- 発行日: 2026年2月24日
- URL: https://www.anthropic.com/news/responsible-scaling-policy-v3
要点
- RSP第3版は、Anthropic単独で実施できる対策と、AI業界全体が取り組むべき対策を明確に分離した構成になっている
- 新設された「Frontier Safety Roadmap」では、セキュリティ・アライメント・セーフガード・政策の4分野における具体的な目標を公表し、進捗を公開で評価する仕組みを導入した
- 「Risk Report」を3〜6ヶ月ごとに公開する義務を設け、状況によっては第三者による外部レビューも実施する
- 過去2年半の振り返りとして、ASL-3対応の実現可能性や他社への波及効果は一定の成果を上げた一方、政府との連携や「能力の曖昧ゾーン」への対処には課題が残ったことを率直に認めている
- RSPは今後も「生きたドキュメント」として継続的に改訂される方針である
詳細解説
RSPとは何か——その目的と仕組み
RSP(Responsible Scaling Policy)は、Anthropicが2023年9月に策定した自主的な安全指針で、AIモデルの能力が一定の水準を超えた場合に導入すべき安全対策を「条件付き約束(if-then commitments)」として定めたものです。たとえば「生物兵器の製造を支援できる能力を持つモデルには、より厳格なセーフガードを適用する」という形で、能力水準に応じた対策を段階的に規定しています。
この能力水準ごとの対策セットは「AI Safety Level(ASL)」と呼ばれ、ASL-2、ASL-3、ASL-4以降と段階的に定義されています。ASL-2およびASL-3については詳細な要件が設定されており、Anthropicによれば2025年5月にASL-3に対応したセーフガードを主要モデルに適用したとのことです。
2年半の振り返り——何がうまくいき、何が課題だったか
Anthropicは今回の改訂にあたり、従来のRSPの成果と限界を率直に評価しています。
成果として挙げられているのは3点です。第一に、RSPが社内での安全対策強化の「強制力」として機能し、入出力分類器(classifier)などの具体的な技術開発を促進したこと。第二に、ASL-3対応が実際に実現可能であることが証明されたこと。第三に、RSP発表後数ヶ月以内にOpenAIやGoogle DeepMindが同様のフレームワークを採用し、カリフォルニア州のSB 53、ニューヨーク州のRAISE Act、EU AI Actの実施規則など、各国・各地域の政策にも反映されていったことです。
一方、課題として認識されているのは主に3点です。まず「能力の曖昧ゾーン」問題。モデルの能力がRSPの閾値に近づいていても、実際に超えているかどうかを確定的に判断するための評価手法が十分に成熟していないため、多国間での協調行動を促す根拠が弱くなってしまうという問題です。生物兵器リスクについては、既存のテストでは「低リスク」と言い切れない一方で「高リスク」と断言するにも証拠が不十分という状況が続いているとされています。
次に、政府との連携の難しさ。AI能力の急速な進歩にもかかわらず、米国連邦レベルでの安全規制の議論は進んでいないのが現状で、競争力や経済成長を優先する政策環境が続いていると説明されています。
そして、より高い能力水準(ASL-4以上)に対応する対策は、一企業だけでは達成が困難なものになり得るという点も課題として挙げられています。RANDレポートでは、最も高水準のセキュリティ基準(SL5)は「現時点では実現不可能」であり、国家安全保障機関の支援が必要になる可能性があると指摘されているとのことです。
これらの課題を踏まえ、Anthropicは「達成容易な基準でASL-4以上を定義して形式的な遵守を図る」のではなく、現実的に達成可能な自社対応と、業界全体で取り組むべき対策を明確に切り分けるという方向で改訂を決断したとしています。
3つの主要な変更点
① 自社対応と業界提言の分離
改訂版RSPでは、Anthropicが他社の動向に関わらず独自に実施する対策と、AI業界全体が取り組むことで初めて十分なリスク管理が実現できる対策とを、明確に区別して記載する構造になりました。これにより、一企業の限界と業界全体に求められる水準の違いが可視化されると考えられます。
② Frontier Safety Roadmapの新設
「Frontier Safety Roadmap」は、セキュリティ・アライメント・セーフガード・政策の4分野にわたる具体的な目標を公表し、その達成度を公開で評価する仕組みです。「拘束力のない公開目標」という形式で、達成状況を透明性をもって示すことを目指しています。
現在のロードマップに含まれる目標の例としては、前例のないレベルの情報セキュリティを達成するための「ムーンショットR&D」プロジェクトの立ち上げ、バグバウンティ参加者の集合的貢献を超える自動化を活用したレッドチーミング手法の開発、Claudeが設計思想に沿って動作することを確保するための体系的な措置の実装、AIを活用したインサイダー脅威の検出などが挙げられています。
③ Risk Reportと外部レビューの導入
Risk Reportは、モデルの安全プロファイルを体系的に記録した報告書で、3〜6ヶ月ごとに公開されます。モデルの能力だけでなく、脅威モデルや現在の対策との関係性、リスク全体の評価も含む包括的な内容になるとのことです。
また、一定の状況下では、AI安全研究に精通した独立した第三者レビュアーによる外部評価も実施されます。レビュアーは利益相反がなく、報告書の未編集版または最小限の編集版にアクセスできる権限を持ち、Anthropicの判断や意思決定プロセスを公開審査するとされています。現在のモデルはまだ外部レビューの対象ではないものの、既にパイロット運用が始まっているとのことです。
まとめ
AnthropicのRSP第3版は、2年半の実績を率直に振り返り、一企業でできることの限界を認めたうえで、透明性と現実性を高める方向へと改訂されました。自社対応と業界提言の分離、ロードマップの公開評価、定期的なRisk Reportの発行という3つの仕組みが、今後のAI安全管理においてどのように機能していくか、注目していきたいと思います。
