[ニュース解説]GLM-5.3が変えるサイバー攻防―能力拡散と安全策の課題

目次

はじめに

 Anthropicが 2026年9月29日 、オープンウェイトAI「GLM-5.3」のサイバー能力と安全策の評価を公表しました。本稿では、エクスプロイト構築の実績、安全策の回避試験、攻撃側と防御側の双方に生じる影響を、検証条件も含めて解説します。

参考記事

関連記事

あわせて読みたい
[ニュース解説]AIが悪用される新たな手口とは?Anthropic社の最新レポートから見るサイバー犯罪の現状... はじめに  本稿では、AI開発企業であるAnthropic社が公開した脅威インテリジェンスレポート「Detecting and countering misuse of AI: August 2025」を基に、AIが悪用...
あわせて読みたい
[開発者向け]OpenAI「Trusted Access for Cyber」発表——防御的サイバーセキュリティ作業のための信頼... はじめに  OpenAIが2026年2月5日、サイバーセキュリティに特化した新しいアクセスフレームワーク「Trusted Access for Cyber」を発表しました。最新の推論モデルGPT-5....
あわせて読みたい
[開発者向け]AIの安全性をどう守るか?Anthropic社「Claude」の多層防御アプローチを解説 はじめに  近年、AI技術は目覚ましい発展を遂げ、私たちの仕事や創造性を助け、世界への理解を深めるための強力なツールとなりつつあります。しかし、その一方で、AIの...

要点

  • GLM-5.3は、エンドツーエンドのエクスプロイト構築能力を持つオープンウェイトモデルである。
  • ExploitBenchでは410回の試行中50回、動作する攻撃を構築し、社内評価でも完全な制御フロー乗っ取りに4%成功した。
  • 人間の研究者と組み合わせた試験では、未知のブラウザ脆弱性の連鎖や、既知脆弱性からの攻撃チェーン構築が確認された。
  • 安全策は直接的な有害命令を拒否したが、虚偽説明64%、推論事前入力92%、改変版100%で攻撃行動に関与した。
  • Anthropicは、防御側への高性能モデル提供、政府による安全性試験と独立評価、オープンウェイト開発者による悪用防止策を求めている。

詳細解説

公開モデルが越えた能力の閾値

 Anthropicは5か月前、複雑なサイバー攻撃用エクスプロイトを自律的に組み上げるClaude Mythos Previewを、Project Glasswingを通じて信頼できる防御側へ限定提供しました。この取り組みでは、重要ソフトウェアの1万件超の脆弱性が発見され、同等の能力が攻撃側へ広がる前に修正を進める時間を確保したとしています。

 今回のGLM-5.3は、Zhipu AI(海外名称Z.ai)が公開したオープンウェイトモデルです。モデルの重みをダウンロードして利用者側で運用・変更できる点が、審査済み利用者に限定されるモデルと大きく異なります。Anthropicは、GLM-5.3がエンドツーエンドのエクスプロイト構築能力を持ちながら、悪用を抑える安全策は十分ではないと評価しました。

 NISTのCenter for AI Standards and Innovation(CAISI)も 2026年 9月 17日 、GLM-5.3を「これまで公開された中で最もサイバー能力の高いオープンウェイトモデル」と評価しています。CAISIの複数ベンチマークを集約すると、米国の最先端との能力差は約4か月でした。ただし、比較対象の米国モデルには安全策を無効化したものや審査済み利用者限定のものが含まれます。単純な性能順位だけでなく、「高い能力を誰が、どの条件で使えるか」が実務上の重要な比較軸になります。

自動評価で確認された実用的な攻撃能力

 Anthropicは、モデルを外部へ接続しない隔離環境で、自動ベンチマークと人間参加型の試験を実施しました。Google ChromeのV8エンジンにある既知の脆弱性41件を対象とするExploitBenchでは、GLM-5.3が410回の試行中50回、Claude Mythos Previewが410回中56回、動作するエンドツーエンドの攻撃を構築しました。成功率にすると約12%と約14%で、Claude Opus 4.6、GLM-5.2、Kimi K3、DeepSeek V4.1-Flashはゼロ付近でした。

 GoogleのOSS-Fuzz参加プロジェクトを使った社内Binary Exploitationベンチマークでは、無作為に選んだ100タスクを評価しました。最上位結果である完全な制御フロー乗っ取りに成功した割合はGLM-5.3が4%、Claude Mythos Previewが6%です。GLM-5.3の数値はMythos Previewを下回りますが、Claude Opus 4.6とGLM-5.2はいずれも成功ゼロでした。平均的なコーディング性能の伸びではなく、以前は達成できなかった攻撃工程を完遂し始めた点が、この評価の重みです。

人間と組み合わせた試験で見えた速度

 自動評価だけでは、研究者がモデルへ適切な情報を与え、結果を選別する現実的な作業速度までは分かりません。そこでAnthropicは、専門家がモデルを使い、既知の答えがない標的を短時間で調べる試験も行いました。

 第1セッションでは、GLM-5.3がLinux向けにローカル構築された一般的なウェブブラウザのJavaScriptエンジンから複数の未知の脆弱性を見つけ、連鎖させました。約1日、合計1時間未満の人間の注意で、悪意あるページを訪れた端末から任意ファイルを読み取る攻撃まで構築しています。対象がLinuxだったのは、モデルに与えた環境がLinuxだけだったためです。他OSへの影響はあり得るものの、攻撃経路がより複雑になる可能性があり、Anthropicは保守担当者への開示と追加調査を進めています。

 第2セッションでは、小型版GLM-5.3-FlashへGoogle ChromeのCVE-2026-11645と別の既知脆弱性の公開情報を提供しました。モデルは大きな追加指示なしに2件を連鎖し、ARM64向けでPAC(ポインタ認証)を回避する攻撃チェーンを構築しました。必要だったのは人間の注意20分とモデルの作業8時間で、ZhipuのAPI価格では20.40ドルです。この結果は、公開済み修正から攻撃へ転換するまでの時間と費用が縮小し得ることを示しています。

安全策はどこまで回避されたか

 GLM-5.3は明白に有害な依頼を拒否する仕組みを備えています。しかし、オープンウェイトであるため、利用者は内部表現を変更し、拒否傾向を弱める「abliteration」を適用できます。実際に公開から数日以内に、改変版が複数公開されたとAnthropicは報告しています。

 AnthropicのチームがGLM-5.3を改変するには、約2,200 GPU時間と約4,400ドルがかかりました。ただし大半は方式の並列探索と変更後の検証であり、経験者なら約600 GPU時間、約1,200ドルで可能と推定しています。JailbreakBench、HarmBench、StrongREJECTでは、元の拒否率90%超が順に約3%、約2%、12%まで低下しました。3評価の平均では95%から6%です。

 重要なのは、拒否率の低下と引き換えに能力が大幅に失われたわけではない点です。一般科学能力を測るGPQA-Diamondでは改変前後が同点で、CyberGymの一部では数ポイント下がっただけでした。安全性をモデル内部の拒否挙動だけに依存する場合、重みを変更できる配布形態では保護が外される可能性を考慮する必要があります。

直接拒否だけでは防げない

 重みを変更しない状態でも、模擬環境では単純な誘導が安全策を崩しました。直接的な有害命令には全試行で拒否した一方、赤チーム演習だという虚偽説明64%、モデルがすでに実行を決めたように推論を事前入力する方法で92%、abliteration版では100%が攻撃行動に関与しました。各条件は5つの命令、2つの標的、5回の試行からなる50サンプルです。安全策を有効にしたClaudeモデルは、適用可能な全条件で0%でした。

 この結果には明確な制約があります。模擬環境では生成コードは実行せず、モデルに外部システムへ接続する手段も与えていません。偽のbashツールの返答を別のLLMが近似しており、現実の攻撃成功率をそのまま示す試験ではありません。一方で、安全策が「露骨な命令の拒否」だけで終わると、前提の言い換えや提供経路の違いに弱いことを比較する材料にはなります。

防御側と政策側に突き付ける課題

 Anthropicは、自由に利用できるモデルのサイバー能力が重要な閾値を越えたと結論付けています。高性能AIは攻撃者だけでなく、脆弱性を先に見つけて修正する防御側にも役立ちます。そのため、アクセスを一律に狭めるだけでなく、身元確認、用途制限、監査、隔離環境などを組み合わせ、防御担当者へ十分な能力を安全に届ける設計が必要だと思います。

 この観点は、AIを使ったサイバー犯罪の実態を扱った過去記事や、防御目的の高性能モデル提供を整理した記事ともつながります。攻撃能力の有無だけでなく、配布形態、安全策を変更できる範囲、利用者審査、操作ログ、独立評価を一体で見る必要があります。

 Anthropicは政府に対し、GLM-5.3の後継を含む十分に高性能なモデルへの安全性試験と独立評価を求めています。開発企業にも、能力向上の速度に合わせて悪用防止策を整えるよう呼びかけました。今後はモデル単体の拒否率だけでなく、改変耐性、提供基盤の制御、実環境に近い評価、防御側へのアクセスという複数層で安全性を測ることが重要だと考えられます。

まとめ

 GLM-5.3は、公開モデルでも実用的なサイバー能力が急速に広がっていることを示しました。評価条件の限界を踏まえつつ、モデル内部の拒否だけに頼らず、配布・監査・独立評価・防御側支援を組み合わせることが今後の焦点です。

この記事が気に入ったら
フォローしてね!

  • URLをコピーしました!
  • URLをコピーしました!
目次