[ニュース解説]Claude Fable 5の生物学セーフガードが更新——誤検知を抑え、生物関連のフォールバックが約85%減

目次

はじめに

 Anthropicが 8月 7, 2026 、Claude Fable 5の生物学セーフガードを更新したと発表しました。同社のテストでは、生物学関連の「フォールバック」(能力の低いモデルへの自動切り替え)が約85%減少したとされています。本稿では、更新の内容と背景にある分類器の設計思想を解説します。

参考記事

関連記事

あわせて読みたい
[ニュース解説]Claude Fable 5が一般公開——Mythos級の能力に安全対策を組み込んだ新アーキテクチャとは はじめに  AnthropicがClaude Fable 5およびClaude Mythos 5を2026年6月9日に発表しました。Fable 5はMythos級(最上位クラス)の能力を持ちながら、サイバーセキュリ...
あわせて読みたい
[ニュース解説]Claude Fable 5のサイバー安全対策を公開——4段階の分類とジェイルブレイク重大度フレー... はじめに  Anthropicは2026年7月2日、世界で再公開されたClaude Fable 5について、サイバーセキュリティ領域の安全対策(セーフガード)の詳細と、AIのジェイルブレイク(...
あわせて読みたい
[開発者向け]AIの「危険な知識」だけを着脱可能に——AnthropicとAE Studioが開発した新手法「GRAM」とは はじめに  Anthropicが2026年7月8日、AE Studioと共同で実施した研究として、AIモデル内の「デュアルユース(両用)」な知識を用途に応じて着脱できる新手法「GRAM」を公...

要点

  • Anthropicは 8月 7, 2026 、Claude Fable 5の生物学セーフガードを更新し、同社のテストで生物学関連のフォールバックが約85%減少したと発表した
  • 検査値の解釈、症状の理解、教育目的での生物学の学習といった日常的な質問では、フォールバックが起きにくくなる
  • ウイルス学・毒性学・分子設計などデュアルユースと判断される領域は引き続きOpus 5へ振り分けられ、専門的な生物学研究や創薬の用途には依然として使えない
  • 更新は、分類器の「憲法」(安全対象と許可対象を判別する規則群)を書き直したうえで学習データを作り直し、再学習する手順で行われた
  • 全体のフォールバック数も、Claude.aiで約67%、Coworkで約55%、Claude Codeで約17%、Claude Platformで約7%減少する見込みである

詳細解説

何が変わったのか

 Fable 5は、生物学やサイバーセキュリティなど特定領域の質問を検知すると、回答をOpus 5に振り分ける仕組みを備えています。この切り替えがフォールバックと呼ばれるもので、6月のFable 5一般公開時から組み込まれていた仕組みです。今回の更新は、この判定の精度を上げ、無害な質問まで振り分けてしまう誤検知(false positive)を減らすことを狙ったものだと説明されています。

 Anthropicによれば、更新後は検査値の読み解き、症状に関する理解、教育目的での生物学の学習といった日常的な質問でフォールバックが大きく減り、医療従事者は臨床業務に関する支援をより多く受け取れるようになります。同社のテストでは、生物学関連のフォールバックは約85%減少しました。あわせて、理由を問わないフォールバック全体の件数も、Claude.aiで約67%、Coworkで約55%、Claude Codeで約17%、Claude Platformで約7%減ると見込まれています。

 プロダクトごとに削減率が大きく異なる点は、それぞれの利用実態を反映していると考えられます。日常的な質問が多いチャット系のサービスでは生物学が誤検知の主因になりやすい一方、Claude Codeのように開発作業が中心の環境では、そもそも生物学以外の要因によるフォールバックの比重が大きいためだと推測されます。

なぜ広範なセーフガードから始めたのか

 Anthropicは、Fable 5が一部の高度な生物学的タスクで専門家を上回り、他のタスクでも実務的な支援を行えるとしています。この能力は新しい治療法を開発する研究者にとって有益である一方、悪意ある行為者の手に渡れば生物兵器の開発などに使われうるものであり、同社の能力評価では、他では入手できない水準の支援(uplift)を与えうると位置づけられています。

 問題を難しくしているのは、生物学では有益な用途と有害な用途の線引きがそもそも難しいという事情です。同社は例として、生ワクチンの開発では予防したい病原体そのものを培養する必要があること、また高血圧治療薬カプトプリルの開発ではヘビ毒の血圧を下げる有毒成分を単離する作業が必要だったことを挙げています。目的が正当でも、途中の手順は危険な内容と見分けがつきにくいという構図です。

 こうした曖昧さは、意図を隠したい行為者にとって好都合な余地にもなります。同社は米国情報コミュニティの2026年年次脅威評価を引きながら、合成生物学やゲノム編集の進展が新たな生物学的脅威につながりうること、複数の国家主体が攻撃的な生物・化学兵器計画を維持しているとみられることに触れています。これらの点を踏まえ、Fable 5は公開当初、生物学関連の質問をほぼすべてブロックする設定で出発しました。正当な利用者にとって不便になることを承知のうえで、他分野での提供を先に進めるための判断だったとされています。

分類器の仕組みと再設計のプロセス

 この振り分けを担っているのが 安全性分類器 と呼ばれる仕組みです。分類器は、保護対象の生物学タスクや有害な出力を検知する小規模な自動判定システムで、同様の仕組みはサイバーセキュリティ領域でも先行して導入されています。分類器が反応すると、その質問はFable 5ではなくOpus 5に回されます。Opus 5も高性能なモデルですが、生物学分野ではFable 5ほどの能力を持たないため、悪用時の支援度合いも限定されるという設計です。

 分類器の調整が難しいのは、誤検知と見逃し(false negative)の両方を同時に抑える必要があるためです。判定を厳しくすれば無害な質問まで弾かれ、緩めれば保護すべき内容が通過してしまいます。さらに、判定をすり抜けようとする試み、いわゆるジェイルブレイクへの耐性も求められます。この三つを同時に満たす調整には、時間と反復が必要になります。

 今回Anthropicは、数週間をかけて分類器の 憲法 (保護対象と許可対象を判別するための規則群)を書き直したと説明しています。無害な用途を細かく切り分けて明記したうえで、社内外の専門家からフィードバックを集め、新しい規則にもとづく学習データを作成して分類器を再学習させました。その後、有害な内容やデュアルユースの研究生物学には従来どおり反応しつつ、無害な質問はより広く通せることを検証したとしています。

 同社は分類器の挙動を、「明らかに無害」「安全マージン」「デュアルユース」「明らかに有害」という帯が並ぶ図として示しています。公開時の分類器は境界がかなり手前に置かれ、ほぼ確実に無害と見られる質問まで安全マージンとして遮断していました。今回の更新はこの境界を後ろへ動かし、無害な質問とデュアルユースの質問の微妙な違いをより細かく判別できるようにしたものと整理できます。判定基準そのものを緩めたというより、判別の解像度を上げた結果として通過範囲が広がった、と読むのが近いと考えられます。

残る制約と今後

 更新後も、Fable 5はウイルス学・毒性学・分子設計といったデュアルユースと判断される要求についてはOpus 5へのフォールバックを続けます。 専門的な生物学研究や創薬の用途には、現時点では使えないまま という点は変わっていません。Anthropicは、この差を埋める手段として、信頼できる利用者に限定して能力を開放する「トラステッドアクセス」の経路を整備すると表明しています。

 また、安全マージンの内側に残る低リスクの質問については、今後も誤検知が完全になくなるわけではないとしています。生物学分野でAIを本格的に使いたい研究者にとっては、モデルの能力そのものよりも、アクセス経路がいつ・どのような条件で開かれるかが実務上の焦点になると考えられます。デュアルユース領域の扱いは業界全体の課題でもあり、能力を残したまま危険な知識だけを切り離す研究も並行して進んでいます。

まとめ

 今回の更新は、Fable 5の生物学セーフガードを緩めたというより、無害な質問とデュアルユースの質問を見分ける精度を高めたものだと言えます。専門研究や創薬の用途は引き続き制限されており、トラステッドアクセスの設計が次の焦点になりそうです。デュアルユース知識の扱いについては、過去記事でも整理していますので、あわせてご覧いただければと思います。

この記事が気に入ったら
フォローしてね!

  • URLをコピーしました!
  • URLをコピーしました!
目次