[開発者向け]Claudeから能力を不正抽出——Anthropicが明かしたディスティレーション攻撃の実態

目次

はじめに

 Anthropicが2026年2月23日、中国のAIラボ3社によるClaudeへの組織的な不正アクセス・能力抽出攻撃を公式ブログで公表しました。本稿では、その手口・規模・対応策について詳しく解説します。

参考記事

要点

  • Anthropicは、DeepSeek・Moonshot AI・MiniMaxの3社が不正アカウント約2万4,000件を使い、合計1,600万件超のやり取りを通じてClaudeの能力を不正抽出したと特定した
  • 使用された手法は「ディスティレーション攻撃」と呼ばれ、強力なモデルの出力で弱いモデルを訓練することにより、独自開発より短期間・低コストで能力を取得するものである
  • 不正蒸留されたモデルにはAnthropicが組み込んでいる安全装置が引き継がれない可能性があり、生物兵器開発支援や悪意あるサイバー活動への悪用リスクが生じると指摘されている
  • 各社はプロキシサービスや「ハイドラクラスター」と呼ばれる分散型不正アカウント網を利用してアクセス制限を回避していた
  • AnthropicはAPIトラフィック分析・業界横断の情報共有・アクセス制御強化などの対策を既に開始しており、業界・政策立案者との連携を呼びかけている

詳細解説

ディスティレーション(蒸留)とは

 ディスティレーション(知識蒸留)とは、高性能なモデルの出力結果を教師データとして、より小さなモデルを訓練する技術です。フロンティアAIラボが自社モデルをコンパクトな派生版に落とし込む際などに広く使われており、それ自体は合法的な手法です。しかし、Anthropicが今回問題視しているのは、他社モデルに無断でアクセスし、その出力を大規模に収集して自社モデルの訓練に活用する「不正ディスティレーション」です。この手法を使えば、高度なAI能力を独自に研究開発するより、はるかに低コスト・短期間で獲得できると考えられます。

3社の攻撃規模と手口

 Anthropicによれば、今回特定された3社はいずれも類似した手口を使っていました。不正アカウントとプロキシサービスを組み合わせて検知を回避しつつ、Claudeのエージェント推論・ツール使用・コーディングといった主要能力に集中したプロンプトを大量送信していました。

 DeepSeekは約15万件のやり取りを実施しました。同期された複数アカウントへのトラフィック分散や、共通の決済手段を用いた組織的な運用が確認されています。特徴的な手法として、回答が生成された後の「内部推論プロセス」をClaudeに言語化させるプロンプトが繰り返し使われており、これは強化学習のための連鎖思考(Chain-of-Thought)訓練データを効率的に収集する狙いがあったとみられます。また、政治的に敏感な質問に対するいわゆる「検閲回避型」の代替表現を生成させるタスクも確認されており、DeepSeek自身のモデルがそうした話題を自然に回避できるよう訓練しようとしていた可能性があります。

 Moonshot AI(Kimiモデルを開発)は約340万件のやり取りを行っていました。複数のアクセス経路にまたがる数百の不正アカウントを使い、単一の組織的キャンペーンと特定されにくいよう工夫していました。後半のフェーズではより精緻な手法に移行し、Claudeの推論トレース(思考過程)の抽出・再構築を試みていたとのことです。

 MiniMaxは最大規模で、約1,300万件のやり取りが確認されています。Anthropicがこのキャンペーンを検知したのはMiniMaxが訓練中のモデルをリリースする前で、これによりディスティレーション攻撃のライフサイクル——データ生成からモデルリリースまで——を初めて包括的に観察できたとAnthropicは述べています。キャンペーン実施中にAnthropicが新モデルをリリースすると、MiniMaxは24時間以内にトラフィックの約半数を新モデルへ切り替えていたことも明らかになりました。

アクセス回避の仕組み——「ハイドラクラスター」とは

 Anthropicによれば、中国ではClaudeへの商用アクセスが提供されていません(国家安全保障上の理由)。これを回避するため、各社はClaudeや他のフロンティアモデルへのアクセスを仲介するプロキシサービスを利用していました。こうしたサービスは「ハイドラクラスター」と呼ばれる構造をとっており、APIおよびサードパーティのクラウドプラットフォームにまたがる大規模な不正アカウント網を運用します。一つのアカウントが停止されても別のアカウントがすぐに代わりを果たす設計で、ある事例では単一のプロキシネットワークが同時に2万件超の不正アカウントを管理しており、蒸留トラフィックを通常の顧客リクエストに紛れ込ませることで検知を困難にしていました。

安全装置が引き継がれないリスク

 この問題が単なる知的財産侵害にとどまらない理由として、Anthropicは安全保障上のリスクを強調しています。Anthropicをはじめとする米国のAI企業は、生物兵器開発支援や悪意あるサイバー活動への悪用を防ぐ安全装置をモデルに組み込んでいます。しかし、不正蒸留によって生成されたモデルにはこれらの安全装置が引き継がれない可能性があります。そうしたモデルが軍・情報・監視システムに転用されたり、オープンソースとして公開されたりした場合、危険な能力が広範に拡散するリスクがあると考えられます。また、Anthropicはこうした攻撃が輸出規制の効果を実質的に損なうとも指摘しています。先進的なチップへのアクセス制限は、直接的なモデル訓練だけでなく、大規模な不正蒸留の実行そのものを制約するという点で、輸出規制の意義は依然として有効だという立場です。

Anthropicの対応策

 Anthropicはすでに複数の対策を講じていると発表しています。まず、APIトラフィックのパターン分析を行う複数の分類器と行動フィンガープリンティングシステムを構築し、連鎖思考(Chain-of-Thought)を引き出すためのプロンプトパターンも検知対象に含めています。次に、他のAIラボ・クラウドプロバイダー・関係当局と技術的な指標を共有し、業界横断での状況把握を進めています。さらに、教育アカウントやセキュリティ研究プログラム、スタートアップ向けプログラムなど、不正利用に多く使われてきた経路での本人確認を強化しました。加えて、正規ユーザーの体験を損なわずに蒸留攻撃の有効性を低下させる製品・API・モデルレベルの対策を開発中とのことです。

まとめ

 Anthropicが今回の公表に踏み切った背景には、業界全体・政策立案者・AI開発コミュニティへの問題提起という意図があると思います。ディスティレーション攻撃は一企業だけの問題ではなく、安全装置の剥奪という観点から見ると社会的な問題とも言えます。今後、業界横断での対策や政策的な対応がどのように進むか、注目されるところです。

この記事が気に入ったら
フォローしてね!

  • URLをコピーしました!
  • URLをコピーしました!
目次