はじめに
OpenAIは 2026年8月18日 、次期モデルAstraがサイバーセキュリティ分野で自社の「Critical」能力しきい値へ達する可能性があるとして、一部の強化学習を減速・停止したと発表しました。本稿では、何を止め、どの対策を整え、どの条件で再開しようとしているのかを整理します。
参考記事
- タイトル: Pacing model development for critical cyber capabilities
- 著者: OpenAI
- 発行元: OpenAI
- 発行日: 2026年8月18日
- URL: https://openai.com/index/pacing-model-development-cyber-capabilities/
関連記事


要点
- 次期モデルAstraがPreparedness FrameworkのCriticalサイバー能力に達する可能性があり、OpenAIは一部の強化学習を減速した
- 最新の展開モデル向け強化学習を2週間停止し、最大規模のフロンティア強化学習は発表時点でも保留している
- 監視、アライメント、セキュリティの3層で対策し、コード・ツール・ネットワークを使う高リスク処理を厳格に分離する
- トークン単位の分類器と自動調査エージェントを用い、30分以内の警告と追加30分以内の判断を目標にする
- 監視には推論計算量の約20%を追加で使い、今後の技術報告とPreparedness Framework改訂で詳細を示す予定である
詳細解説
「Critical」到達の可能性を前提に判断
OpenAIのPreparedness Frameworkは、モデルがもたらす重大リスクを能力段階で評価します。今回、開発中のAstraがサイバー分野のCriticalしきい値を満たす可能性があると判断し、能力向上を続ける前に安全策を強化する方針を選びました。実際にCriticalと確定したという発表ではなく、その可能性を踏まえた予防的な対応です。
OpenAIは最新の展開モデルを対象とする強化学習を2週間停止し、計画していた最大規模のフロンティア強化学習を発表時点でも保留しています。停止対象はすべての研究開発ではなく、コード実行、ツール利用、ネットワーク接続を伴い、高いサイバー能力へつながる処理が中心です。
インフラを分離して被害範囲を狭める
きっかけの一つとして、OpenAIとHugging Faceに関係するインシデント後、コード・ツール・ネットワークを使うフロンティア推論を一時停止したことが説明されています。その後、ワークロードの分離、サンドボックス、ネットワーク分離、継続的なセキュリティ試験、ログ、最小権限を強化しました。複数の実験が共有していたサービスも減らしています。
能力の高いモデルでは、モデル自身の安全調整だけでなく、実行環境が侵害された場合の影響範囲を限定する必要があります。Astraとサイバー関連ワークロードには最も厳しい保護を適用し、条件を満たさない処理は引き続き停止します。
トークンごとの監視と自動調査
監視層では、モデルが生成するサンプルの各トークンに対して分類器を動かし、危険な挙動の兆候を検出します。さらに、自動調査エージェントがツール操作、推論、活動履歴を調べ、担当チームへ証拠をまとめます。目標は異常から30分以内に警告し、その後30分以内に誤検知と判断できなければ活動を停止することです。
この仕組みは、Sol相当以上の能力を対象にしたツール利用型の強化学習評価・訓練へ適用されます。 8月 6, 2026 からは、ツールを使うAstraの推論すべてにも適用したとしています。監視には推論計算量の約20%という大きな追加コストがかかりますが、能力向上の速度だけを優先しない判断です。
学習段階のアライメントを広げる
OpenAIは、モデルが高能力になった後で外部フィルターを追加するだけでは不十分だと考え、訓練段階から安全な行動を学ばせるアライメントを拡大しています。検出、実行環境、モデル行動の三つを重ね、一つの対策が破られても即座に重大な操作へ進まない構成を目指します。
ただし、記事は技術報告の予告段階であり、分類器の精度、誤検知率、停止解除の基準などは十分に公開されていません。Preparedness Frameworkも今後改訂する予定です。第三者が評価するには、後日公開される詳細と実際の展開条件を確認する必要があります。
企業が参考にできること
一般企業が同じ規模の監視基盤を再現する必要はありませんが、原則は応用できます。AIエージェントへ与える権限を最小化し、コード実行、外部通信、資格情報、重要データへの経路を分離します。高リスク操作は監視と人間承認を通し、異常時に処理を止められる仕組みを先に用意します。
評価指標には検出時間、停止までの時間、誤検知率、監視コスト、復旧手順の実行時間を含めます。安全対策を導入の最後に加えるのではなく、能力と権限を広げる前提条件として扱うことが重要です。
まとめ
OpenAIはAstraがCritical級のサイバー能力へ達する可能性を受け、一部訓練を減速しました。監視、アライメント、セキュリティの三層を強化し、30分単位で検知と停止を判断します。未公開の評価条件もあるため、今後の技術報告を確認する必要があります。
