はじめに
OpenAIは2026年9月22日、フラッグシップモデルGPT-6 Astraに続き、コスト効率を高めた新モデル「GPT-6 Sol」と「GPT-6 Luna」を発表しました。API価格は前世代のプロモーション価格比で50%引き下げられています。本稿ではこの内容をもとに、性能とコストの両面を紹介します。
参考記事
- タイトル: Introducing GPT‑6 Sol and Luna
- 著者: OpenAI
- 発行元: OpenAI
- 発行日: 2026年9月22日
- URL: https://openai.com/index/introducing-gpt-6-sol-and-luna/
関連記事



要点
- OpenAIは、フラッグシップモデルGPT-6 Astraに続き、コスト効率を高めた新モデル「GPT-6 Sol」と「GPT-6 Luna」を発表した。
- API価格は、GPT-5.6 Solの入力トークンが100万あたり4ドルから2ドルへ、GPT-5.6 Lunaは0.2ドルから0.1ドルへと、いずれも50%引き下げられた。
- 業務ワークフローを測るAutomationBenchでは、GPT-6 SolがClaude Opus 5を上回るスコアを、その9%のコストで記録したとされている。
- コーディングを評価するDeepSWE v1.1では、GPT-6 SolがClaude Fable 5の最高スコアに1.1ポイント差まで迫りつつ、コストは約80%低いとされている。
- プロンプトキャッシュの改善により、キャッシュされた入力トークンの読み取りには90%の割引が適用される。
詳細解説
GPT-6 SolとLunaとは——Astraの技術をより安く提供する2つの新モデル
OpenAIは今月、「世界で最も知能が高く、アラインメントの取れたモデル」と位置づけるGPT-6 Astraを発表しましたが、最も要求水準の高いプロジェクトには引き続きAstraの深い能力が必要とされる一方、日々の業務は異なる規模・頻度・予算で行われるとしています。GPT-6 SolとLunaは、Astraと同様の手法で訓練され、専門的な業務・事実の正確性・コーディング・コンピュータ操作・アラインメントにおけるAstraの性能向上を、より高速で手頃な価格のモデルに反映させたものだとされています。
キャッシュや推論の改善によりコストを抑えられるようになったとして、OpenAIはその削減分をそのまま価格に反映し、GPT-5.6 Sol・Lunaのプロモーション価格と比べてAPI価格を50%引き下げています。入力トークンはGPT-5.6 Solの100万あたり4ドルから2ドルへ、GPT-5.6 Lunaは0.2ドルから0.1ドルへ、それぞれ引き下げられたとされています。なおGPT-6 Astraは、引き続き全体を通じて最良のモデルと位置づけられています。
業務ワークフローでの性能——AutomationBenchとAgents’ Last Exam
47種類のツールを横断する業務ワークフローを評価するAutomationBenchでは、GPT-6 Sol(xhigh設定)が33.2%のスコアを、Claude Opus 5(max設定)の26.9%を上回りながら、そのコストの9%で記録したとされています。ただしOpenAIは、比較対象に含めたClaude Fable 5.1(Opus 5フォールバック付き、max設定、31.4%)について、タスクの約4割でOpus 5への切り替え(フォールバック)が発生しており、そのコストが集計に含まれていないため、実際のコストはこのグラフが示す値より高くなる可能性があると注記しています。
複雑な専門業務のワークフローを評価するAgents’ Last Examでは、GPT-6 Sol(max設定)が56.4%を記録し、評価内でのClaude Opus 5の最高スコアを、60%低いコストで上回ったとされています。
事実の正確性はどう改善したか
OpenAIは、実際のユーザーが過去のモデルの誤りを指摘した会話をもとにした社内の事実性評価において、GPT-6 Solの誤りの発生率が前世代の約半分になり、はるかに低いコストでAstraに近い信頼性に迫っていると説明しています。GPT-6 Lunaも大幅に改善しており、高い推論努力度の設定では、GPT-5.6 Solとほぼ同水準の精度を、その約100分の1のコストで達成しているとされています。
コーディング性能——FrontierCodeとDeepSWEでの結果
実際のコードベースにマージできる品質のコードを生成できるかを評価するFrontierCodeでは、GPT-6 SolがGPT-5.6 Solから大きく性能を向上させ、Claude Fable 5.1のxhigh設定にはるかに低いコストで匹敵する結果を示したとされています。複雑なソフトウェアエンジニアリングのタスクを評価するDeepSWE v1.1では、GPT-6 Sol(max設定)が68.8%を記録し、評価内でのClaude Fable 5の最高スコア(xhigh設定、69.9%)にわずか1.1ポイント差まで迫りながら、コストは約80%低いとされています。GPT-6 Luna(max設定)は66.6%を記録し、medium設定のClaude Opus 5・Fable 5に匹敵する水準ながら、Opus 5比でコストが93%、Fable 5比で96%低いとされています。
OpenAIは、コーディングエージェントの利用が急拡大しており、API価格換算で1日あたりのトークン利用額が、社内の研究者の中央値で600ドルを超え、上位10%の研究者では7,000ドルを超えていると紹介しています。コーディングエージェントがより長時間・高難度のタスクを担うようになるほど、継続利用のコストが重要になるとされています。
コンピュータ操作タスクでの立ち位置
GPT-6 Astraは、引き続きコンピュータ操作タスクで世界最高のモデルとされていますが、GPT-6 SolとLunaは前世代よりコスト効率の高い性能を示しています。長時間のコンピュータ操作ワークフローを評価するOSWorld 2.0のオフラインセットでは、GPT-6 Sol(xhigh設定)がClaude Opus 5(medium設定)とほぼ同等のスコア(60.5%対60.3%)を、約80%低いコストで達成したとされ、GPT-6 Luna(max設定)はGPT-5.6 Sol(medium設定)を、その10分の1のコストで上回ったとされています。
コミュニケーションスタイルの変化
OpenAIは、GPT-6 Astraで改善したコミュニケーションスタイルをSol・Lunaにも反映しており、特に技術的な会話やコーディングの会話でその違いが分かりやすいとしています。明瞭さの向上、専門用語の削減、不自然な言い回しの減少、価値の低い詳細の削減、全体的にやや短い応答が期待されるとされ、ウェブサイトのデザイン変更を依頼する例では、GPT-6 Solの回答の方が、結論を急がず、聞き手にとって当たり前と思われる詳細の繰り返しが少なく、曖昧な表現も少ないとOpenAI自身が評価しています。
エージェント向けキャッシュの改善
OpenAIは、トークン価格の引き下げに加え、アプリケーションが再利用する文脈についてもコストを抑えられるよう、プロンプトキャッシュ(繰り返し送信される文脈を再利用してコストを下げる仕組み)を改善し、既定でのキャッシュヒット率を高めたとしています。キャッシュされた入力トークンの読み取りには90%の割引が適用されるとされています。開発者向けには、キャッシュ利用状況を可視化する「プロンプトキャッシュダッシュボード」と、キャッシュが効かなかった原因を診断するツールが提供され、推論努力度やツールの有効・無効をキャッシュを崩さずに変更できるようになったほか、キャッシュされるプロンプトの接頭辞を明示的に区切れる機能も追加されたとされています。GitHubの報告によれば、これらの改善により、OpenAIのモデルへの数十億件規模のリクエストにおいて、新規に処理が必要なプロンプトトークンの割合が50%以上削減され、Copilotの応答速度向上につながっているとされています。
アライメント(安全性)の改善
GPT-6 SolとLunaは、Astraで導入されたアライメント(AIの挙動を人間の意図や価値観に沿わせる取り組み)の手法を踏襲しており、コーディング作業に関する誤解を招く主張の発生率など、複数の評価でGPT-5.6世代からの改善が確認されているとされています。これらの評価はあえて難しい状況を想定したもので、通常利用時の失敗率を示すものではないとOpenAIは注記しています。
提供状況
GPT-6 SolとGPT-6 Lunaは、ChatGPT WorkとCodexにおいて、Plus・Pro・Business・Enterprise・Eduの各ユーザー向けに提供が始まっています。無料版およびGoユーザーは、デスクトップアプリでGPT-6 Lunaを利用できるとされ、Chatでの提供はまだ始まっていません。OpenAI APIでは、それぞれgpt-6-sol・gpt-6-lunaとして利用できます。サービスの安定性を保つため、ChatGPTへの展開は当日中に段階的に行われるとされています。
まとめ
GPT-6 SolとLunaは、GPT-6 Astraの技術をより低いコストで日常業務に届けるモデルです。複数のベンチマークで競合モデルに匹敵、あるいは上回る結果が示される一方、いずれもOpenAI自身が実施・公開した比較である点には留意が必要です。本稿としては、性能とコストの両面から、用途に応じたモデル選びの参考になればと考えています。
