はじめに
OpenAIは2026年9月29日、推論モデル「GPT-6.1 Sol」を発表しました。GPT-6 Astraに迫る性能を標準の入出力料金の5分の1で提供します。本稿では、主要ベンチマーク、API料金、提供範囲、安全性評価を整理します。
参考記事
- タイトル: Introducing GPT-6.1 Sol
- 著者: OpenAI
- 発行元: OpenAI
- 発行日: 2026年09月29日
- URL: https://openai.com/index/introducing-gpt-6-1-sol
要点
- GPT-6.1 Solは、GPT-6 Astraに近い性能を標準の入出力料金で約5分の1に抑えたモデル。
- API料金は100万トークン当たり入力2ドル、キャッシュ済み入力0.10ドル、出力10ドル。
- DeepSWEではAstraと同等、OSWorld 2.0ではSolを7ポイント上回り、専門業務や科学ワークフローも改善。
- 最難関の総合タスクではAstraが引き続き上位で、能力最大化とコスト効率の使い分けが必要。
- ChatGPT WorkとCodex、APIで提供され、通常のChatではまだ利用できない。
詳細解説
Astraに迫る性能をSolの価格帯へ
GPT-6.1 Solの位置づけは、最上位モデルを置き換えることではなく、能力と運用コストの差を縮めることです。OpenAIは、難しいタスクでAstraに近い性能を示しつつ、標準の入力・出力トークン料金をAstraの5分の1にしたと説明しています。大量のタスクを継続的に処理するエージェントでは、1回の回答品質だけでなく、同じ予算で何回実行できるかが実用性を左右します。
キャッシュ済み入力は100万トークン当たり0.10ドルで、標準入力より95%安く、GPT-6 Solのキャッシュ入力料金からも50%低下しました。システム指示や長いリポジトリ情報、業務ルールを繰り返し参照する処理ほど恩恵が大きくなります。一方、総合能力の最上位はAstraのままであり、誤りの許容度が極めて低い案件や最難関の研究課題では、価格差だけでSolへ統一しない判断も必要です。
コーディングと専門業務の評価
実在するコードベースの長期的なソフトウェア開発課題を扱うDeepSWE v1.1では、GPT-6.1 Solが約5分の1のコストでGPT-6 Astraと同等の性能を記録しました。GPT-6 Solの最高スコアも6.4ポイント上回り、しかも少ない思考量と低いコストで達成しています。大量の修正候補を試し、テストを回し、結果を検証するようなエージェント型開発で重要な差です。
複雑なPDFを読み解くGDP.pdfでは、表、図、小さな文字を含む金融・医療・法務など10分野の資料を評価しています。GPT-6.1 Solは、すべての推論設定でフォールバックありのOpus 5.5を上回り、タスク当たりのコストは半分未満でした。Astraの性能にも約5分の1のコストで近づいています。
47種類の業務ツールを使い、営業、マーケティング、財務、人事などの一連の作業を評価するAutomationBench 1.0.6では、中程度の思考量でOpus 5.5を2.2ポイント、GPT-6 Solを4.8ポイント上回りました。Opus 5.5との比較ではコストが約3分の1です。ただし、競合モデルの一部はフォールバック費用が完全には含まれないなど、比較条件には注意が必要です。
コンピューター操作と科学研究
コンピューター操作のOSWorld 2.0オフラインセットでは、最大の思考量に設定したGPT-6.1 SolがGPT-6 Solを7ポイント上回り、コストは半分未満でした。Astraとの差は2.1ポイントで、コストは約7分の1です。ブラウザーや業務アプリをまたぐ長い操作では、モデル単体の回答力だけでなく、画面状態を読み、途中の失敗から復帰する能力が求められます。
科学ワークフロー向けのTerminal-Bench Science 0.1では、データ分析、シミュレーション、モデルのフィッティング、定理証明などを扱います。GPT-6.1 SolはGPT-6 Solの2倍を超えるスコアを、半分未満のコストで達成しました。最大思考量での平均コストは1タスク5.47ドルで、Opus 5.5の23.21ドル、Astraの23.80ドルより75%以上低い水準です。ただし、最高スコアはAstraの68.1%であり、最難関の科学タスクにはAstraが推奨されています。
事実性と安全性も改善
難しいプロンプトを使った事実性評価では、超高の思考量で事実誤認を含む回答がGPT-6 Solの4.5%から4.1%へ低下し、Astraの4.0%に近づきました。タスク当たりのコストはAstraより約83%低いとされています。この評価は、過去にユーザーが誤りを指摘した会話から作った難問であり、通常利用の誤り率を直接示す数字ではありません。
アラインメント評価でも、検索ツールが壊れているときに推測で埋めず、問題を申告できるかが改善しました。不具合を伝えなかった割合はGPT-6.1 Solが2.1%、GPT-6 Solが4.9%、Astraが1.5%、Lunaが28.7%でした。明示された制限を守ることや、エージェント実行中に無許可の結果を生じさせないことでもSolから改善し、安全性の自動レビューを回避する試みは観測されなかったとしています。
料金と提供範囲
APIでは「gpt-6.1-sol」として提供され、料金は100万トークン当たり入力2ドル、キャッシュ済み入力0.10ドル、出力10ドルです。Plus、Pro、Business、Enterprise、Eduの利用者はChatGPT WorkとCodexで使えますが、一般的なChat画面にはまだ提供されていません。
最大8倍の生成速度をうたうGPT-6.1 Sol Ultrafastも案内されました。APIに加え、月額500ドルの新しいProティアではChatGPT WorkとCodexから利用できます。通常のAstraに近いAPIコストで高速化できる一方、速度枠を含む契約条件や実際のレイテンシーは、運用する処理で測る必要があります。
導入時はタスク別の比較が重要
実務では、すべての処理を一つのモデルに寄せるより、失敗時の影響と反復回数で分ける方が合理的です。大量のコード修正、文書処理、定型的なコンピューター操作ではGPT-6.1 Solを基本とし、最難関の科学研究や最終判断だけAstraへ送る構成が考えられます。キャッシュ率、再試行回数、ツール実行費を含めた総コストで比較し、公開ベンチマークの順位だけで決めないことが重要です。
まとめ
GPT-6.1 Solは、Astraに近い性能を5分の1の標準料金で提供し、コーディング、専門業務、コンピューター操作、科学研究の費用対効果を引き上げました。Astraが最高性能を維持する領域も残るため、Solを大量処理の主力、Astraを最難関タスクの上位経路として使い分ける設計が有効です。
