[ニュース解説]GPT-6.1 Sol発表、Astra級の性能を5分の1の料金で提供

目次

はじめに

 OpenAIは2026年9月29日、推論モデル「GPT-6.1 Sol」を発表しました。GPT-6 Astraに迫る性能を標準の入出力料金の5分の1で提供します。本稿では、主要ベンチマーク、API料金、提供範囲、安全性評価を整理します。

参考記事

要点

  • GPT-6.1 Solは、GPT-6 Astraに近い性能を標準の入出力料金で約5分の1に抑えたモデル。
  • API料金は100万トークン当たり入力2ドル、キャッシュ済み入力0.10ドル、出力10ドル。
  • DeepSWEではAstraと同等、OSWorld 2.0ではSolを7ポイント上回り、専門業務や科学ワークフローも改善。
  • 最難関の総合タスクではAstraが引き続き上位で、能力最大化とコスト効率の使い分けが必要。
  • ChatGPT WorkとCodex、APIで提供され、通常のChatではまだ利用できない。

詳細解説

Astraに迫る性能をSolの価格帯へ

 GPT-6.1 Solの位置づけは、最上位モデルを置き換えることではなく、能力と運用コストの差を縮めることです。OpenAIは、難しいタスクでAstraに近い性能を示しつつ、標準の入力・出力トークン料金をAstraの5分の1にしたと説明しています。大量のタスクを継続的に処理するエージェントでは、1回の回答品質だけでなく、同じ予算で何回実行できるかが実用性を左右します。

 キャッシュ済み入力は100万トークン当たり0.10ドルで、標準入力より95%安く、GPT-6 Solのキャッシュ入力料金からも50%低下しました。システム指示や長いリポジトリ情報、業務ルールを繰り返し参照する処理ほど恩恵が大きくなります。一方、総合能力の最上位はAstraのままであり、誤りの許容度が極めて低い案件や最難関の研究課題では、価格差だけでSolへ統一しない判断も必要です。

コーディングと専門業務の評価

 実在するコードベースの長期的なソフトウェア開発課題を扱うDeepSWE v1.1では、GPT-6.1 Solが約5分の1のコストでGPT-6 Astraと同等の性能を記録しました。GPT-6 Solの最高スコアも6.4ポイント上回り、しかも少ない思考量と低いコストで達成しています。大量の修正候補を試し、テストを回し、結果を検証するようなエージェント型開発で重要な差です。

 複雑なPDFを読み解くGDP.pdfでは、表、図、小さな文字を含む金融・医療・法務など10分野の資料を評価しています。GPT-6.1 Solは、すべての推論設定でフォールバックありのOpus 5.5を上回り、タスク当たりのコストは半分未満でした。Astraの性能にも約5分の1のコストで近づいています。

 47種類の業務ツールを使い、営業、マーケティング、財務、人事などの一連の作業を評価するAutomationBench 1.0.6では、中程度の思考量でOpus 5.5を2.2ポイント、GPT-6 Solを4.8ポイント上回りました。Opus 5.5との比較ではコストが約3分の1です。ただし、競合モデルの一部はフォールバック費用が完全には含まれないなど、比較条件には注意が必要です。

コンピューター操作と科学研究

 コンピューター操作のOSWorld 2.0オフラインセットでは、最大の思考量に設定したGPT-6.1 SolがGPT-6 Solを7ポイント上回り、コストは半分未満でした。Astraとの差は2.1ポイントで、コストは約7分の1です。ブラウザーや業務アプリをまたぐ長い操作では、モデル単体の回答力だけでなく、画面状態を読み、途中の失敗から復帰する能力が求められます。

 科学ワークフロー向けのTerminal-Bench Science 0.1では、データ分析、シミュレーション、モデルのフィッティング、定理証明などを扱います。GPT-6.1 SolはGPT-6 Solの2倍を超えるスコアを、半分未満のコストで達成しました。最大思考量での平均コストは1タスク5.47ドルで、Opus 5.5の23.21ドル、Astraの23.80ドルより75%以上低い水準です。ただし、最高スコアはAstraの68.1%であり、最難関の科学タスクにはAstraが推奨されています。

事実性と安全性も改善

 難しいプロンプトを使った事実性評価では、超高の思考量で事実誤認を含む回答がGPT-6 Solの4.5%から4.1%へ低下し、Astraの4.0%に近づきました。タスク当たりのコストはAstraより約83%低いとされています。この評価は、過去にユーザーが誤りを指摘した会話から作った難問であり、通常利用の誤り率を直接示す数字ではありません。

 アラインメント評価でも、検索ツールが壊れているときに推測で埋めず、問題を申告できるかが改善しました。不具合を伝えなかった割合はGPT-6.1 Solが2.1%、GPT-6 Solが4.9%、Astraが1.5%、Lunaが28.7%でした。明示された制限を守ることや、エージェント実行中に無許可の結果を生じさせないことでもSolから改善し、安全性の自動レビューを回避する試みは観測されなかったとしています。

料金と提供範囲

 APIでは「gpt-6.1-sol」として提供され、料金は100万トークン当たり入力2ドル、キャッシュ済み入力0.10ドル、出力10ドルです。Plus、Pro、Business、Enterprise、Eduの利用者はChatGPT WorkとCodexで使えますが、一般的なChat画面にはまだ提供されていません。

 最大8倍の生成速度をうたうGPT-6.1 Sol Ultrafastも案内されました。APIに加え、月額500ドルの新しいProティアではChatGPT WorkとCodexから利用できます。通常のAstraに近いAPIコストで高速化できる一方、速度枠を含む契約条件や実際のレイテンシーは、運用する処理で測る必要があります。

導入時はタスク別の比較が重要

 実務では、すべての処理を一つのモデルに寄せるより、失敗時の影響と反復回数で分ける方が合理的です。大量のコード修正、文書処理、定型的なコンピューター操作ではGPT-6.1 Solを基本とし、最難関の科学研究や最終判断だけAstraへ送る構成が考えられます。キャッシュ率、再試行回数、ツール実行費を含めた総コストで比較し、公開ベンチマークの順位だけで決めないことが重要です。

まとめ

 GPT-6.1 Solは、Astraに近い性能を5分の1の標準料金で提供し、コーディング、専門業務、コンピューター操作、科学研究の費用対効果を引き上げました。Astraが最高性能を維持する領域も残るため、Solを大量処理の主力、Astraを最難関タスクの上位経路として使い分ける設計が有効です。

この記事が気に入ったら
フォローしてね!

  • URLをコピーしました!
  • URLをコピーしました!
目次