はじめに
OpenAIが2026年2月12日、リアルタイムコーディングに特化した新モデル「GPT-5.3-Codex-Spark」を発表しました。Cerebrasとの提携により実現した超低レイテンシのハードウェア上で、1000トークン/秒以上の速度を実現しながら、実用的なコーディングタスクでも高い性能を維持します。本稿では、このCodex-Sparkの技術的特徴、性能評価、そして開発体験への影響について解説します。
参考記事
- タイトル: Introducing GPT-5.3-Codex-Spark
- 発行元: OpenAI
- 発行日: 2026年2月12日
- URL: https://openai.com/index/introducing-gpt-5-3-codex-spark/
要点
- GPT-5.3-Codex-Sparkは、GPT-5.3-Codexの小型版として開発された、リアルタイムコーディングに特化したモデルである
- Cerebrasのウェーハースケールエンジン3上で動作し、1000トークン/秒以上の生成速度を実現している
- SWE-Bench ProとTerminal-Bench 2.0において、GPT-5.3-Codexと比較して大幅に短時間でタスクを完了しながら高い精度を維持している
- WebSocket接続の導入により、クライアント・サーバー間のラウンドトリップオーバーヘッドを80%削減、最初のトークン表示までの時間を50%短縮した
- ChatGPT Proユーザー向けの研究プレビューとして、Codexアプリ、CLI、VS Code拡張機能で利用可能である
詳細解説
リアルタイムコーディングへの最適化
OpenAIによれば、Codex-Sparkは「リアルタイムでの作業」に最適化されており、レイテンシとインテリジェンスの両方が重要な対話的作業に適しているとされています。開発者はモデルと共同作業を行いながら、作業中に割り込んだり方向転換したりでき、ほぼ瞬時の応答で迅速に反復できます。
速度を重視して調整されているため、Codex-Sparkはデフォルトの作業スタイルを軽量に保ち、最小限の的を絞った編集を行います。また、明示的に要求しない限り、自動的にテストを実行しないという設計になっています。
この設計思想は、長時間実行されるタスクを得意とする従来のフロンティアモデルとは対照的です。OpenAIの最新フロンティアモデルは、数時間、数日、または数週間にわたって介入なしで自律的に作業する能力に特に強みを示してきました。Codex-Sparkは、こうした長期実行タスクと、その場での作業完了の両方をサポートする最初のモデルと位置づけられています。
ベンチマーク性能
OpenAIの評価によれば、Codex-Sparkはエージェント的なソフトウェアエンジニアリング能力を評価する2つのベンチマークで強力な性能を示しました。
SWE-Bench Proでは、GPT-5.3-Codexと比較して大幅に短時間でタスクを完了しながら、高い精度を維持しています。グラフから読み取ると、Codex-Sparkは約4-6分程度でタスクを完了し、精度は約50%前後を記録しています。一方、GPT-5.3-Codexは約16-18分かかりながら精度は約60%、GPT-5.1-Codex-miniは約8-10分で精度約40%という結果です。
Terminal-Bench 2.0では、Codex-Sparkが58.4%の精度を達成しました。これはGPT-5.3-Codexの77.3%と比較すると低いものの、GPT-5.1-Codex-miniの46.1%を大きく上回っています。
これらのベンチマークにおける「タスク完了時間」は、(1)出力生成時間(出力トークン÷サンプリング速度)、(2)プリフィル時間(プリフィルトークン÷プリフィル速度)、(3)合計ツール実行時間、(4)合計ネットワークオーバーヘッドの合計として推定されています。
一般的なコーディングアシスタントでは、精度と速度のトレードオフが存在します。Codex-Sparkは精度を一部犠牲にしながらも、実用的なレベルを維持しつつ、大幅な速度向上を実現していると考えられます。リアルタイムの対話的作業では、完璧な精度よりも迅速なフィードバックが重要な場面も多く、この設計は理にかなっていると言えます。
エンドツーエンドのレイテンシ改善
OpenAIによれば、Codex-Sparkのトレーニング過程で、モデルの速度だけがリアルタイムコラボレーションの方程式の一部に過ぎないことが明らかになりました。リクエスト・レスポンスパイプライン全体のレイテンシを削減する必要があったとのことです。
OpenAIは、すべてのモデルに恩恵をもたらすエンドツーエンドのレイテンシ改善をハーネスに実装しました。具体的には、クライアントからサーバー、そして戻る際のレスポンスのストリーミング方法を合理化し、推論スタックの主要部分を書き直し、セッションの初期化方法を再設計して、最初の可視トークンがより早く表示され、反復作業中もCodexが応答性を維持できるようにしました。
永続的なWebSocket接続の導入とResponses API内の的を絞った最適化により、OpenAIはクライアント・サーバーのラウンドトリップごとのオーバーヘッドを80%削減し、トークンごとのオーバーヘッドを30%削減し、最初のトークンまでの時間を50%短縮しました。WebSocketパスはCodex-Sparkではデフォルトで有効化されており、近日中にすべてのモデルでデフォルトになる予定です。
WebSocketは、HTTP/HTTPSと異なり、クライアントとサーバー間の双方向通信チャネルを確立し、接続を維持したまま複数のメッセージをやり取りできるプロトコルです。従来のHTTPベースのリクエスト・レスポンスモデルでは、各やり取りごとに新しい接続を確立する必要があり、これがオーバーヘッドの原因となっていました。WebSocketの採用により、この接続確立のコストが大幅に削減されたと推測されます。
Cerebrasとの提携
Codex-SparkはCerebrasのウェーハースケールエンジン3上で動作します。これは高速推論用に特別に設計されたAIアクセラレーターで、Codexにレイテンシ優先のサービング層を提供しています。
OpenAIはCerebrasと提携して、この低レイテンシパスを他のフリート全体と同じ本番サービングスタックに追加しました。これにより、Codex全体でシームレスに機能し、将来のモデルをサポートする基盤が整います。
Cerebrasの共同創業者兼CTOであるSean Lie氏は次のようにコメントしています。「GPT-5.3-Codex-Sparkについて最もワクワクするのは、OpenAIと開発者コミュニティとのパートナーシップを通じて、高速推論が何を可能にするかを発見することです—新しいインタラクションパターン、新しいユースケース、そして根本的に異なるモデル体験。このプレビューは始まりに過ぎません」
OpenAIによれば、GPUはトレーニングおよび推論パイプライン全体で依然として基盤であり、幅広い用途に最もコスト効率の高いトークンを提供します。Cerebrasはその基盤を補完し、極めて低いレイテンシを要求するワークフローで優れた性能を発揮し、反復作業時のCodexの応答性を高めるエンドツーエンドのループを短縮します。GPUとCerebrasは、単一のワークロードに組み合わせて使用することで、最高のパフォーマンスに到達できるとされています。
この記述から、OpenAIは異なるハードウェアを適材適所で活用する戦略を取っていることが分かります。コスト効率が重要な一般的な推論にはGPU、レイテンシが最優先の対話的タスクにはCerebrasという使い分けです。
利用可能性と今後の展開
Codex-Sparkは2026年2月12日から、ChatGPT ProユーザーがCodexアプリ、CLI、VS Code拡張機能の最新バージョンで利用できる研究プレビューとして展開されています。専用の低レイテンシハードウェア上で動作するため、使用量は別個のレート制限によって管理され、研究プレビュー期間中は需要に応じて調整される可能性があります。
現在、Codex-Sparkはテキストのみ対応で、コンテキストウィンドウは128kトークンです。OpenAIは、これが超高速モデルファミリーの最初のモデルであるとしています。開発者コミュニティとともに、高速モデルがコーディングのどこで輝くかについてさらに学ぶにつれて、より大きなモデル、より長いコンテキスト長、マルチモーダル入力を含む、さらに多くの機能が導入される予定です。
加えて、OpenAIは少数の設計パートナーに対してAPI経由でCodex-Sparkを提供し、開発者がCodex-Sparkを自社製品にどのように統合したいかを理解しようとしています。実際のワークロード下で統合を調整し続ける中で、今後数週間でアクセスを拡大する予定です。
安全面では、Codex-Sparkにはサイバー関連のトレーニングを含む、メインラインモデルと同じ安全トレーニングが施されています。OpenAIは標準的な展開プロセスの一環としてCodex-Sparkを評価し、サイバーセキュリティや生物学における高い能力について、Preparedness Frameworkの閾値に達する可能性がないと判断したとのことです。
OpenAIのビジョンによれば、Codex-Sparkは「2つの補完的なモード」を持つCodexへの第一歩です。長期的な推論と実行、そして迅速な反復のためのリアルタイムコラボレーションです。時間の経過とともに、これらのモードは融合していきます。Codexは、バックグラウンドで長時間実行される作業をサブエージェントに委任したり、幅と速度が必要な場合に多数のモデルにタスクを並列展開したりしながら、ユーザーを緊密な対話ループに保つことができるため、最初から単一のモードを選択する必要がなくなります。
モデルがより高性能になるにつれて、インタラクション速度が明確なボトルネックになると考えられます。超高速推論はそのループを短縮し、Codexをより自然に使えるようにし、アイデアを動作するソフトウェアに変える人々にとって可能なことを拡大します。
まとめ
OpenAIのGPT-5.3-Codex-Sparkは、1000トークン/秒以上の速度でリアルタイムコーディングを実現する、新しいタイプのAIモデルです。Cerebrasとの提携により、レイテンシを大幅に削減しながらも実用的な精度を維持し、対話的な開発体験を向上させます。今後、長期実行タスクとリアルタイム作業の融合が進めば、AI支援コーディングの可能性はさらに広がると思います。
