はじめに
OpenAIが2026年6月26日、次世代モデルシリーズ「GPT‑5.6」の限定プレビューを開始しました。上位モデルのSolを筆頭に、BalancedモデルのTerra、軽量モデルのLunaの3本立てで構成され、コーディング・生物・サイバーセキュリティの各分野で新たな性能水準を示しています。本稿では、発表内容をもとに各モデルの性能と安全対策の仕組みを解説します。
参考記事
- タイトル: Previewing GPT‑5.6 Sol: a next-generation model
- 発行元: OpenAI
- 発行日: 2026年6月26日
- URL: https://openai.com/index/previewing-gpt-5-6-sol/
関連記事



要点
- GPT‑5.6シリーズはSol・Terra・Lunaの3モデルで構成され、「世代番号+能力ティア名」という新命名体系を採用している
- コーディング指標のTerminalBench 2.1でGPT‑5.6 Sol Ultraが91.9%、Solが88.8%を記録し、競合モデルを上回る最高性能を達成した
- サイバーセキュリティでは高い能力を持つ一方、フル攻撃チェーンを自律生成するには至らず、「Cyber Critical」の閾値を下回る評価である
- 安全対策はモデル内学習・リアルタイム分類器・アカウントレビュー・差別化アクセスの4層構造で構成されている
- 米政府との事前協議を経て限定プレビューを開始しており、今後数週間で一般提供へ移行する予定である
詳細解説
新命名体系と3モデルの位置付け
OpenAIによれば、GPT‑5.6からモデル名の構造が刷新されました。番号部分が世代を示し、Sol・Terra・Lunaという名称がそれぞれ「最高性能」「バランス」「軽量・低コスト」という能力ティアを表します。ティアごとに独自のペースで進化できる体系を意図しており、開発者がモデルを選ぶ際の指針が明確になったと考えられます。
TerraはGPT‑5.5と競合する性能を持ちながらコストは2分の1、Lunaは最低コストで高い実用性を提供するとOpenAIは説明しています。価格はSolが入力$5・出力$30、Terraが入力$2.50・出力$15、Lunaが入力$1・出力$6(いずれも1Mトークンあたり)です。
コーディング・生物分野での性能
コーディングの評価には Terminal‑Bench 2.1 が用いられました。これはコマンドライン環境でのプランニング・反復実行・ツール連携を総合的にテストするベンチマークです。OpenAIによれば、GPT‑5.6 Sol Ultraが91.9%、Solが88.8%を記録し、比較対象のClaude Mythos 5(84.3%)やGemini 3.1 Pro Preview(70.7%)を上回りました。
Ultraモードは複数のサブエージェントを組み合わせて並列処理を行う新しい動作モードで、単一エージェントの限界を超える複雑な作業に対応するとされています。こうした「エージェント同士を連携させる」アーキテクチャは、複数のAIシステムが協調して課題を解く方向性として業界全体で注目されつつあります。
生物分野では GeneBench v1 で評価が実施されました。ゲノミクスと定量生物学の長期解析タスクを測定するこの指標では、GPT‑5.6 SolはGPT‑5.5比で同等以上の性能を維持しながら使用トークン数を削減しています。
サイバーセキュリティ性能と「Cyber Critical」評価
サイバーセキュリティの評価には ExploitBench と ExploitGym の2種が使われました。ExploitBenchでは、GPT‑5.6 Solは出力トークンをMythos Previewの約3分の1に抑えながら同水準の性能を達成しています。ExploitGymはUC Berkeleyの研究者とOpenAI等フロンティアラボが共同開発したベンチマークで、Sol・Terra・Lunaの全モデルがサイバー能力で前世代を大きく上回りました。
一方、OpenAIは自社の準備フレームワーク(Preparedness Framework)における 「Cyber Critical」の閾値を下回る と評価しています。ChromiumとFirefoxを対象とした評価では、バグの発見と攻撃の構成要素(プリミティブ)の特定はできたものの、完全な攻撃チェーンを自律的に完成させるには至らなかったとのことです。サイバー能力の向上に伴いリスクも増すため、フロンティアAIのサイバー活用に関する米大統領令の枠組みとも関連が深く、今後の動向が注目されます。
4層の安全対策スタック
GPT‑5.6では「単一の対策では十分ではない」という前提のもと、以下の多層構造が実装されています。
- モデル内学習:禁止されたサイバー支援の拒否をモデル自体に学習させており、ジェイルブレイク試行にも対応する設計です。
- リアルタイム分類器:生成中にサイバー・生物分野の違反を検知します。リスクが高いと判断された場合、生成を一時停止してより大きな推論モデルが内容をレビューし、問題ありと判断された出力はユーザーに届く前に差し止めます。
- アカウントレベルの監視:複数の会話にわたるシグナルを分析し、悪意ある行動パターンと正当なセキュリティ研究を区別します。
- 差別化アクセス:能力と用途に応じてアクセスレベルを分け、高リスクな機能をデフォルトで広く公開しない運用をとります。
OpenAIは700,000 A100相当GPU時間を自動レッドチーミングに投入し、単一のプロンプトではなく多様な文脈をまたぐ「汎用的なジェイルブレイク」の発見に注力したと説明しています。これは過去のGPT‑5.5‑Cyberの段階的リリースでも採用されたアプローチの延長線上にあり、能力向上に合わせて安全対策の精度を高める姿勢が継続されています。
政府連携と段階リリースの背景
今回のリリースは、米政府との事前協議を踏まえた限定プレビューという形をとっています。OpenAIは「このような政府アクセスプロセスを長期的なデフォルトにすべきではない」としつつも、サイバー大統領令の枠組み整備と繰り返し可能なプロセス確立を目的とした短期的な措置と位置付けています。プレビュー期間中はAPI・Codex経由で信頼パートナーのみが利用でき、数週間以内にChatGPT・Codex・APIを通じた一般公開へ移行する予定です。また、Cerebrasとの連携により7月から毎秒750トークンの高速推論オプションも予定されています。
まとめ
GPT‑5.6 Solは、コーディング・生物・サイバーの3分野で現時点の最高水準を更新しつつ、自動レッドチームと多層安全スタックによって強化された安全対策を同時に展開した発表です。政府との段階的な連携プロセスも含め、高性能モデルの公開に向けた丁寧な手順を踏んでいる点が印象的だと思います。一般公開後の実際の使われ方が注目されます。
