はじめに
SpaceXAI(xAI)は2026年9月21日、コーディングと知的業務向けの新モデル「Grok 4.7」を発表しました。Grok 4.6と同じ価格・速度のまま、長時間タスクへの対応を強めています。本稿では、公式発表とドキュメントをもとに性能・安全性・提供形態を整理します。
参考記事
メイン記事:
- タイトル: Introducing Grok 4.7
- 著者: SpaceXAI
- 発行元: SpaceXAI(xAI)
- 発行日: 2026年9月21日
- URL: https://x.ai/news/grok-4-7
関連情報:
- タイトル: Release Notes
- 著者: SpaceXAI
- 発行元: SpaceXAI Docs
- URL: https://docs.x.ai/developers/release-notes
- タイトル: Grok 4.7 is now available in GitHub Copilot
- 著者: GitHub
- 発行元: GitHub Changelog
- 発行日: 2026年9月21日
- URL: https://github.blog/changelog/2026-09-21-grok-4-7-is-now-available-in-github-copilot/
関連記事



要点
- Grok 4.7はGrok 4.6より大きな新しいベースモデルを採用し、数時間かかる難しいタスクを重視した長期の強化学習で訓練されている
- 料金は入力100万トークンあたり2ドル、出力6ドルで、Grok 4.6と同額である
- 電気工学(EEBench)や法務(Harvey Legal Agent Benchmark)では比較対象の他社モデルを上回るスコアを示している
- 新たな安全対策の仕組みを導入し、サイバーセキュリティ分野では危険な依頼の通過率を3.3%に抑えている
- Cursor、Grok Build、Grok APIなどで即日提供され、GitHub Copilotでも順次展開される
詳細解説
Grok 4.7の位置づけ
SpaceXAIはGrok 4.7を、コーディングと知的業務において同社で最も高性能なモデルと位置づけています。難しいタスクにより長く取り組み、自分の作業をより丁寧に検証し、同社としてこれまでで最も調整された安全対策を備えている、というのが公式の説明です。キャッチコピーでは「同等クラスのモデルと比べて2倍の速さ、半分の価格」とうたっています。
7月に発表されたGrok 4.5から約2か月半で、4.6を挟んで4.7が登場したことになります。本稿としては、性能の上積みを価格に転嫁せず据え置いた点に、このシリーズの一貫した方針が表れていると受け止めています。
モデルの改良点
公式発表によれば、Grok 4.7では主に次の点が改良されています。
- 新しい大型ベースモデル: Grok 4.6より大きな、新しいベースモデルを採用
- 長期の強化学習: より難しいタスクの組み合わせで、より長く強化学習を実施。特に完了まで何時間もかかる問題に比重を置いている
- 自己検証と長い文脈の管理: 自分の作業結果を確かめる力と、長い文脈(コンテキスト)を扱う力が向上
- Grok Bot環境への最適化: Grok Botのハーネス(モデルを動かすための実行環境)をネイティブに理解するよう訓練され、会話型タスクや一般的な知的業務が得意になった
強化学習(Reinforcement Learning)は、モデルに試行錯誤させ、良い結果に報酬を与えて振る舞いを改善する学習手法です。長時間タスクに重みを置いた学習は、途中で方針を見失わずに作業を続ける力、いわゆるエージェント的な粘り強さを狙ったものと考えられます。Grok Botはアプリを横断して働くAIチームメイトとして発表されたサービスで、自社製品との一体運用を強める意図が読み取れます。
ベンチマーク結果と料金の比較
SpaceXAIは、Grok 4.7(xHigh設定)、Grok 4.6(High)、GPT-5.6 Sol(Max)、Fable 5.1(Max)の料金とベンチマークスコアを次のように公表しています。
| 項目 | Grok 4.7 | Grok 4.6 | GPT-5.6 Sol | Fable 5.1 |
| 入力料金(100万トークンあたり) | $2 | $2 | $4 | $10 |
| 出力料金(100万トークンあたり) | $6 | $6 | $20 | $50 |
| CursorBench 4.0(ソフトウェア開発) | 46.3% | 40.4% | 41.7% | 51.8% |
| DeepSWE v1.1(ソフトウェア開発) | 71.0%※ | 65.2% | 72.7% | 70.0% |
| EEBench(電気工学) | 64.0% | 53.0% | 39.4% | 56.4% |
| AA Briefcase v1.1(数時間規模のオフィス業務) | 1,657 | 1,546 | 1,487 | 1,678 |
| Terminal-Bench 4.0(数時間規模のターミナル作業) | 38.0% | 20.3% | 37.3% | 57.9% |
| Harvey Legal Agent Benchmark(法務) | 19.6% | 15.8% | 2.5% | 6.7% |
| HealthBench Professional(臨床推論) | 56.7% | 48.5% | 60.5% | 62.1% |
※DeepSWEのGrok 4.7はhigh設定でのスコア
長時間のコーディングタスクを重視するCursorBench 4.0について、SpaceXAIはGrok 4.7が価格対性能の面で最前線にあるとしています。スコア自体はFable 5.1が上回りますが、1タスクあたりの平均コストを横軸にとると、Grok 4.7は低コスト側で高い位置にあるという見せ方です。
表から読み取れるのは、分野によって得意不得意がはっきり分かれている点です。電気工学と法務では他社モデルを上回る一方、ターミナル作業(Terminal-Bench 4.0)ではFable 5.1と約20ポイントの差があります。出力料金はFable 5.1の約8分の1なので、本稿としては「最高スコアが必要な処理は上位モデル、量の多い処理はGrok 4.7」といった使い分けの判断材料になる数字だと考えています。なお、これらはSpaceXAIによる自己申告の結果であり、実際の業務での評価は自社のタスクで確かめるのが確実だと思います。
文書作成と専門職の業務
Grok 4.7は文書やプレゼンテーションの作成も得意になったとされています。GDPvalとAA Briefcaseは、弁護士・看護師・金融アナリストなど専門職が行う業務をAIに担わせて評価するベンチマークで、Grok 4.7はどちらでもGrok 4.6から向上し、他の最前線モデルと同等の水準にあるとSpaceXAIは説明しています。
GDPvalのEloスコア(対戦形式の相対評価で算出するレーティング)は次のとおりです。
- Fable 5.1(max): 1735
- Grok 4.7(xhigh): 1695
- Grok 4.6(high): 1605
- GPT-6 Astra(max): 1542
Grok 4.6から約90ポイント伸びており、首位のFable 5.1との差は40ポイントほどです。Eloスコアは差が小さいほど勝率が五分に近づく仕組みのため、この差であれば用途によっては体感差が小さい場面もあると考えられます。
安全性とサイバーセキュリティ
Grok 4.7はまったく新しい安全対策の仕組み(セーフガードスタック)で構築されており、SpaceXAIがテストした中で、拒否の適切さと脱獄(ジェイルブレイク:安全制限を回避させる攻撃)への耐性が最も高いモデルだとされています。サイバーセキュリティや生物学のように善用と悪用の両面がある「デュアルユース」領域でも、無害な作業への有用性と危険な依頼の拒否の両方で首位に立ち、LatchBioのバイオセーフティ評価では62.4%でトップになったと発表されています。
サイバー分野では、防御能力の高さと正当な利用に対する低い拒否率を両立させたとしています。
- 危険・悪意あるサイバータスクを測る自社ベンチマーク「HackerBench v0.3」で最高の安全性を記録
- 危険なデュアルユースのプロンプトの通過を3.3%に抑えつつ、正当なセキュリティ業務はほとんどブロックしない
- 一部のサイバーセキュリティ企業に、防御研究を目的としてGrok 4.7のレッドチーム(攻撃者視点での検証)機能を招待制で提供開始
安全対策を強めるほど正当な依頼まで断る「過剰拒否」が起きやすくなるため、両者のバランスを数字で示そうとしている点は、セキュリティ業務で使う側にとって判断しやすい材料だと思います。
料金と提供形態
Grok 4.7は発表当日からCursorとGrok Buildで利用でき、Grok API、他社のコーディング用ハーネス、モデルルーター、クラウドプラットフォーム経由でも提供されています。料金は入力100万トークンあたり2ドル、出力6ドルからで、出力速度が2倍・価格も2倍の高速版も用意されています。
開発者向けドキュメント(Release Notes)によれば、APIでのモデル名は grok-4.7 です。主な仕様は次のとおりです。
- コンテキストウィンドウ(一度に扱える入力の長さ)は50万トークン
- 入力はテキストと画像、出力はテキストのみ
- 料金はプロンプトが20万トークン未満なら入力2ドル・キャッシュ入力0.5ドル・出力6ドル、20万トークン以上なら4ドル・1ドル・12ドル(いずれも100万トークンあたり)
- 推論の深さ(reasoning effort)はlow / medium / high(既定)/ xhighから選択
- 高速版「Grok 4.7 Fast」はCursorとGrok Build限定で、公開APIでは提供されない
また、GitHubによれば、Grok 4.7はGitHub Copilotでも段階的に展開が始まっており、Pro、Pro+、Max、Business、Enterpriseの各プランで利用できる予定です。BusinessとEnterpriseでは、管理者がCopilot設定のモデルポリシーから利用可否を管理できます。
長文を扱う場合は20万トークンを境に単価が倍になるため、大規模なコードベースを丸ごと渡すような使い方ではコスト見積もりに注意が必要だと思います。
Grok Buildで試す
公式発表では、Grok Buildで無料で試せることも案内されています。Windowsの場合、PowerShellで次のコマンドを実行するとCLI(コマンドラインで操作するツール)をインストールできます(WSL向けの手順も用意されています)。
# SpaceXAI公式のインストールスクリプトをダウンロードして実行するコマンドです
# irm(Invoke-RestMethod)でスクリプトを取得し、iex(Invoke-Expression)で実行します
irm https://x.ai/cli/install.ps1 | iex注意: インターネット上のスクリプトを直接実行する形式のため、URLが公式のものか確認してから実行してください。APIを使う場合は、SpaceXAIのコンソールでAPIキーを作成し、docs.x.aiのドキュメントを参照する流れです。
まとめ
Grok 4.7は、価格据え置きで長時間タスクと自己検証の力を高め、安全対策も刷新したモデルです。分野ごとに強弱があるため、自社業務で試しながら使い分けるのが現実的だと思います。Grok 4.6のGoogle企業向けAI基盤への対応もあわせてご覧ください。
