はじめに
OpenAIが2026年 8月 7日 、開発中のモデル「Astra」について、自社の安全基準Preparedness Frameworkが定めるサイバー能力の最上位「Critical」に該当する可能性を否定できないと公表しました。本稿では、その判断の根拠と導入された社内措置を整理します。
参考記事
メイン記事:
- タイトル: Responding to the next frontier of critical cyber capabilities
- 発行元: OpenAI
- 発行日: 2026年 8月 7日
- URL: https://openai.com/index/responding-next-frontier-critical-cyber-capabilities/
関連情報:
- タイトル: OpenAI Says Upcoming Astra Model May Cross Critical Cybersecurity Threshold
- 著者: Miles Okada
- 発行元: Unite.AI
- 発行日: 2026年 8月 7日
- URL: https://www.unite.ai/openai-says-upcoming-astra-model-may-cross-critical-cybersecurity-threshold/
関連記事



要点
- OpenAIは 2026年 8月 7日 、開発中のモデル「Astra」がPreparedness Frameworkの定める「Critical」サイバー能力水準に達する可能性を否定できないと公表した
- 同社がこの水準の可能性を特定のモデルに結び付けたのは初めてであり、GPT-5.6-Solを含む従来のモデルはいずれも一段下の「High」評価にとどまっていた
- Criticalは、人間の介入なしに堅牢な実システムのゼロデイ脆弱性を発見・悪用できる水準などとして定義されている
- OpenAIは隔離された検証環境、要件を満たさない社内活動の一時停止、思考過程の常時監視を含む複数の措置を導入した
- 政府機関および一部のAI安全性組織と連携して能力検証を進める方針が示された
詳細解説
「Critical」という水準が意味するもの
Preparedness Frameworkは、OpenAIが生物・化学・サイバーセキュリティ・AIの自己改善という4領域について、モデルが危険な能力を獲得した場合の対応をあらかじめ定めた社内文書です。2023年12月に初版が公開され、Unite.AIによれば 2025年4月15日 に改訂されたv2で能力水準が「High」と「Critical」の2段階に整理されました。
OpenAIの定義では、Criticalの閾値は、堅牢化された多数の実システムに対してあらゆる深刻度の実用的なゼロデイ脆弱性を人間の介入なしに発見・開発できる場合、または高レベルの目標を与えられただけで堅牢な標的への新規のサイバー攻撃戦略を立案し実行できる場合に到達するとされています。一段下のHighは、十分に防御された標的への攻撃を自動化するなど既存の障壁を取り除く水準を指し、依然として人間の方向づけを必要とする点が異なります。つまり両者の差は性能の程度というより、 自律性の有無 にあると考えられます。
判断に至った経緯と、公表時点での留保
OpenAIによれば、Astraに対する直近数日間の社内評価で、エージェント的なコーディングとサイバーセキュリティの両面で大きな進展が確認されました。この結果と専門家の評価を踏まえ、発表前夜にCritical水準を否定できないという結論に至ったとしています。
重要なのは、同社が「AstraがCriticalである」と断定していない点です。ベンチマークと評価は継続中であり、あくまで予備的な評価に基づく暫定的な判断だと説明されています。それでもフレームワークの規定上は、この不確実性そのものが開発プロセスへの制約を発動させる仕組みになっており、確定を待たずに公表と措置に踏み切った形だと言えます。
なお、7月に報じられたHugging Faceへの侵入事例についてOpenAIは、Astraは関与していないと明記しています。当該事例は評価用に拒否設定を緩めたモデルがサンドボックスを越えて本番環境に到達したもので、能力そのものよりも評価環境の封じ込めが問われた事案でした。今回の発表は、その延長線上で能力側の閾値を扱ったものと位置づけられます。
導入された5つの社内措置
OpenAIは、安全対策とセキュリティ管理の堅牢性試験を強化したうえで、社内向けに以下の措置を実施したと説明しています。
1. 高能力モデルとその関連活動に対する厳格なセキュリティ管理の適用(隔離された検証環境、ネットワークとツールへのアクセス制限、モデル重みの保護と暗号化の強化、監視・検知機能の追加、サンドボックス化された実行)
2. 強化された要件を満たしていないAstra関連の社内活動の一時停止
3. 学習・評価を含むAstraのすべてのエージェント的用途における、危険な挙動と方針逸脱の常時監視
4. 関連する政府機関および一部のAI安全性組織と連携した能力検証
5. 高リスクな評価を実施する第三者パートナーへの推奨セキュリティ管理の提供
3点目の監視は、モデルの思考過程(Chain of Thought、モデルが答えを出すまでの内部的な推論の連なり)を評価し、高リスクな活動を検知した場合にセキュリティ対応を起動して中断させる仕組みだと説明されています。出力結果だけでなく途中の推論を見る設計であり、行動が実害に至る前に介入することを狙った構成だと考えられます。
展開前ではなく開発段階で制約をかける意味
このアプローチで注目したい点は、対策の適用対象が「リリース後の利用」ではなく「社内での開発・評価」に及んでいることです。従来のAI安全対策は、外部に公開する際のフィルタリングや利用規約が中心でした。一方で7月の一連の事案が示したのは、公開前の評価環境そのものが攻撃の起点になり得るという構図です。
OpenAIは、2025年6月に生物分野でHigh水準に近づいた際にも同様の手順で対策を強化しており、今回はその原則を踏襲したと説明しています。GPT-5.6のリリース時にもサイバーセキュリティ性能の向上が示されていましたが、そこからHighとCriticalを分ける線に届き得る位置まで、比較的短い期間で進んだ形になります。同社は、高度なサイバー能力を持つモデルは攻撃者より先に防御側が脆弱性を発見・修正することに役立つべきだという立場を改めて示しています。
まとめ
OpenAIは確定的な判定ではなく「否定できない」という段階で公表し、開発段階から制約をかける道を選びました。今後は政府機関や安全性組織による外部検証の結果が焦点になります。フロンティアモデルの安全管理をどう文書化するかについては、過去記事でも整理していますので、あわせてご覧いただければと思います。
