はじめに
Anthropicは2026年6月30日、約3週間にわたり適用されていたClaude Fable 5およびClaude Mythos 5への輸出規制が解除されたと発表しました。本稿では、規制に至った経緯と講じたセーフガード強化の内容、さらにAnthropicが主導するジェイルブレイク評価の業界共通フレームワーク構築に向けた取り組みを解説します。
参考記事
- タイトル: Redeploying Fable 5
- 著者: Anthropic
- 発行元: Anthropic
- 発行日: 2026年6月30日
- URL: https://www.anthropic.com/news/redeploying-fable-5
関連記事



要点
- 6月12日に適用されたFable 5・Mythos 5への輸出規制は6月30日付で解除され、Fable 5は7月1日より全世界のユーザーに再提供される
- 規制の契機となったのはAmazon研究者によるFable 5のセーフガード迂回報告で、Anthropicの検証では同等の動作が他の複数モデルでも再現可能だったことが確認された
- Anthropicは改良版セーフガード分類器を新たに訓練し、問題となった手法を99%超の確率でブロックできるよう対応した
- Amazon・Microsoft・Googleなどのパートナーと協力し、AIジェイルブレイクの重大度を評価する業界共通フレームワークの策定を開始した
- 米国政府との協力関係を深化させ、フロンティアモデルのリリース前評価や情報共有体制の強化を約束した
詳細解説
輸出規制に至った経緯
Anthropicは2026年6月9日、Claude Fable 5とClaude Mythos 5を公開しました。両モデルは同一の基盤モデルを共有しますが、Fable 5は一般公開向けに強力なセーフガードを施したモデルとして、Mythos 5はより少ないセーフガードのもとでProject Glasswingの限られた信頼パートナー向けに提供されました。
その後、6月12日に米国政府がFable 5とMythos 5への輸出規制を適用しました。きっかけはAmazonの研究者がFable 5のセーフガードを迂回してソフトウェア脆弱性を特定させ、一件については脆弱性の悪用方法を示すコードを生成させる手法を報告したことです。規制は即時発効となり、国籍のリアルタイム確認手段がなかったため、Anthropicは全ユーザーへのアクセスを一時停止せざるを得ませんでした。
Anthropicが実施した検証では、Fable 5が報告された手法で示した脆弱性の特定は、Claude Opus 4.8やGPT-5.5、Kimi K2.7など複数のモデルでも同様に行えることが確認されました。さらに、問題となった脆弱性悪用のデモンストレーションについても、Claude Haiku 4.5からOpus 4.8、GPT-5.4/5.5、Kimi K2.7まで、テストしたすべてのモデルが同じ出力を生成できたとしています。AnthropicはこれをFable 5固有の危険な能力ではなく、セーフガードの「境界事例」にあたるものと評価しています。
セーフガードの構造とジェイルブレイクの分類
Anthropicによれば、Fable 5は「多層防御」(defense in depth)の考え方に基づき、複数の安全機構を組み合わせて提供されています。その中核となるのが、危険なサイバーセキュリティタスクへの要求をリアルタイムで検出するセーフガード分類器です。
この分類器には意図的に「安全マージン」が設けられており、有害である可能性がごくわずかしかない要求でも確実にブロックされるよう設定されています。Fable 5ではこのマージンを従来より大幅に広げたため、無害な要求が拒否されるケースが増えたものの、それは意図的なトレードオフだったとしています。
ジェイルブレイクの重大度について、Anthropicは大きく3つに分類しています。安全マージン内に留まり実害に至らない軽微なもの、特定の有害行動を解放する「狭域有害ジェイルブレイク」、そして広範な有害行動を一括解放する「ユニバーサルジェイルブレイク」です。今回報告された手法は軽微なカテゴリに位置づけられており、執筆時点でFable 5のユニバーサルジェイルブレイクは確認されていないとしています。
改良版セーフガードの展開
Anthropicは問題の報告を受け、米国政府と緊密に連携しながら改良版セーフガード分類器を訓練しました。Anthropicによれば、新しい分類器は報告された具体的な手法を99%超の確率でブロックします。ブロックされた場合はOpus 4.8に処理が引き継がれる形となっています。
ただし、新しい分類器は通常のコーディングやデバッグ作業において誤検知が増える可能性もあるとして、今後も正当なリクエストと悪用を精度よく区別できるよう改良を続けるとしています。米国商務省のAI標準・イノベーションセンター(CAISI)も新旧双方のセーフガードをテストし、「非常に強固」と評価したと報告しています。
業界共通フレームワークの構築
今回の事例を受け、Anthropicは重大なジェイルブレイクを評価する共通基準が業界全体に欠如していることを問題として提起しています。統一された基準がなければ、開発者はどの発見を優先すべきか判断しにくく、政府もいつ介入すべきかの根拠を持てないためです。
AnthropicはAmazon・Microsoft・Googleなどのパートナー企業とともに、ジェイルブレイクの重大度を評価する共通フレームワークの策定を開始しました。現在提案されている評価軸は4つです。①既存ツールと比較した能力向上の度合い(Capability gain)、②同じ手法が通用する攻撃タスクの幅(Breadth)、③攻撃への転用に要する労力(Ease of weaponization)、④その手法の入手しやすさ(Discoverability)、の4点で各ジェイルブレイクをスコアリングする構成です。
これはソフトウェア脆弱性の共通評価基準であるCVSS(Common Vulnerability Scoring System)になぞらえた発想と言えます。このフレームワークは発展途上であり、他の業界パートナーにも参加を呼びかけています。また、セキュリティ研究者がFable 5のサイバーセキュリティ分野のジェイルブレイクを報告できる新たなHackerOneプログラムも立ち上げる予定とされています。
米国政府との協力深化
Project Glasswingの拡大とも連動しながら、Anthropicは政府との協力体制を4点で強化することを表明しています。
まず、国家安全保障に関わる領域でフロンティアを前進させるモデルについて、リリース前に政府パートナーへの拡大アクセスを提供し、独立した能力評価とセーフガード検証を可能にします。次に、重大なジェイルブレイクや悪用パターンが判明した際に適切な政府機関へ迅速に通知し、新たなセーフガードを共有します。さらに、政府のテストと研究を支援する専用の計算リソースを提供します。最後に、フロンティアモデル開発者向けの共有・任意のセキュリティ評価基準の策定に取り組むとしています。
まとめ
Fable 5の輸出規制解除は、単なるサービス再開にとどまらず、AIセーフガードのあり方と業界横断的なガバナンスの議論を加速させる契機となっています。ジェイルブレイク評価の共通フレームワークや政府との協力体制の整備が、今後のフロンティアモデル公開においてどのような規範を形成していくか、注目だと思います。
