はじめに
SpaceXAI(xAI)は2026年9月18日、音声をテキストに変換する新モデル「Grok Voice Transcribe 2.0」を発表しました。前モデルと同じ価格のまま、電話音声や多言語の短い発話など、実環境で難しい音声の認識精度を高めた点が特徴です。本稿では、精度の評価結果と機能、料金、APIでの使い方を整理します。
参考記事
メイン記事:
- タイトル: Introducing Grok Voice Transcribe 2.0
- 著者: SpaceXAI
- 発行元: SpaceXAI(xAI)
- 発行日: 2026年9月18日
- URL: https://x.ai/news/grok-voice-transcribe-2
関連情報:
- タイトル: Speech to Text(Model Capabilities)
- 著者: SpaceXAI
- 発行元: SpaceXAI Docs
- URL: https://docs.x.ai/developers/model-capabilities/audio/speech-to-text
- タイトル: Voice Overview
- 著者: SpaceXAI
- 発行元: SpaceXAI Docs
- URL: https://docs.x.ai/developers/model-capabilities/audio/voice
関連記事



要点
- Grok Voice Transcribe 2.0は、前モデルと同じ価格で精度が2倍になったとされる音声認識モデルである
- Artificial Analysisの公開リーダーボードで、ストリーミング型32モデル中、精度1位となっている
- 前モデルからの最大の改善点は多言語対応で、多言語の短い発話の単語誤り率は20.6%から6.8%に下がっている
- 料金はバッチ処理が音声1時間あたり0.10ドル、ストリーミングが0.20ドルで、話者分離なども追加料金なしである
- 既存のSpeech-to-Text API連携はコード変更なしで新モデルの精度向上を得られ、旧モデルは数週間以内に非推奨となる
詳細解説
Grok Voice Transcribe 2.0の概要
SpaceXAIによれば、Grok Voice Transcribe 2.0は同社の実環境での評価において、現在利用できる中で最も正確な文字起こしモデルの1つであり、前モデルGrok Voice Transcribe 1.0と同じ価格で2倍の精度を持つとされています。
このモデルは、Grok Voiceを支える音声基盤モデルの上に構築されています。Grok Voiceはすでに、1日数万件のカスタマーサポート通話を処理し、数百万時間分の動画ナレーションを文字起こしし、Tesla車に搭載されたGrokアシスタントなど物理的な製品の音声エージェントを動かしています。学習には、多様な環境で録音された、雑音を含む多言語のライブ音声という独自のデータセットを使い、事後学習(ポストトレーニング)で調整したと説明されています。
Grok Voiceの基盤は、Starlinkのカスタマーサポートで問い合わせの7割を自律解決したと発表された音声エージェントでも使われています。本稿としては、実際のサポート通話という大量の本番音声を持っていることが、電話音声での精度の高さにつながっていると読めます。
公開ベンチマークでの精度
多くの文字起こしモデルは、雑音のない1人の話し手の音声ではよく機能します。しかし実際の音声には、不安定な電話回線、重なり合う声、地域のなまり、読み上げられる電話番号やメールアドレスといった難しさがあります。SpaceXAIは、こうした条件や環境を問わず最も難しい音声に向けてこのモデルを作ったとしています。
SpaceXAIによれば、音声認識モデルを比較するArtificial Analysisの公開リーダーボードで、Grok Voice Transcribe 2.0はストリーミング型32モデルの中で精度1位となりました。公式ページでは、単語誤り率と1,000分あたりの価格を2軸にとった図で、Gemini 3.5 Transcribe Live、GPT Live Transcribe、Scribe v2 Realtime、Nova-3 Realtimeなど他社モデルとの位置関係を示しています。
単語誤り率(WER:Word Error Rate)は、正解の文字起こしに対して、置き換え・脱落・挿入された単語の割合を示す指標で、低いほど正確です。音声認識の性能を比較する際の代表的な指標と言えます。
社内評価:4つの実環境データセット
公開ベンチマークに加え、SpaceXAIは本番環境のトラフィックから作った4つの社内データセットで単語誤り率を測っています。Grok Voice Transcribe 2.0は4つすべてで前モデルを上回り、電話音声では同社がテストしたすべてのモデルの中で最も良い結果となりました。公式ページのグラフで示された数値は次のとおりです(単位は%、低いほど良い)。
| モデル | 電話音声(8kHz) | Grokとの会話 | 認証情報 | 短い発話(19言語) |
|---|---|---|---|---|
| Grok Voice Transcribe 2.0 | 7.1 | 3.3 | 3.2 | 6.8 |
| Grok Voice Transcribe 1.0 | 10.6 | 8.7 | 7.2 | 20.6 |
| Gemini 3.5 Transcribe | 15.9 | 5.7 | 10.4 | 7.8 |
| MAI-Transcribe-2 | 9.3 | 7.0 | 2.6 | 7.2 |
| ElevenLabs Scribe v2 | 12.6 | 22.7 | 4.0 | 7.1 |
| Deepgram Nova-3 | 12.4 | 18.3 | 9.6 | 9.6 |
| Whisper Large v3 | 15.8 | 10.2 | 7.6 | 9.7 |
各データセットの中身は次のとおりです。
- 電話音声: 英語のカスタマーサポート通話(8kHzの電話品質)
- Grokとの会話: 英語でのGrokとの対話
- 認証情報: 英語で読み上げられた電話番号、メールアドレス、住所、アカウントコードなど
- 短い発話: 19言語の音声アシスタント向けの短い指示
表を見ると、電話音声と会話では他モデルとの差が大きい一方、認証情報ではMAI-Transcribe-2(2.6%)がGrok Voice Transcribe 2.0(3.2%)をわずかに上回っています。電話番号やメールアドレスの聞き取りが重要な用途では、複数のモデルを自分の音声で比べてみる価値があると思います。なお、これらはSpaceXAIが自社で作成したデータセットでの結果であり、評価データが自社の本番環境に近い点は割り引いて見る必要があると考えています。
多言語対応の強化
Grok Voice Transcribe 2.0は数十の言語を文字起こしでき、言語を自動で判別し、録音の途中で言語が切り替わっても1回の処理で追従できます。SpaceXAIによれば、多言語の精度が前モデルからの最大の改善点です。公式ページでは、イタリア語、中国語、日本語、スペイン語、アラビア語、ヒンディー語など19言語について、ElevenLabs Scribe v2やDeepgram Nova-3と単語誤り率を比較したグラフが示されています。
車内での指示のような短い発話は、言語を判別する手がかりが少なく難しいとされますが、短い発話のデータセットでは単語誤り率が20.6%から6.8%に下がりました。約3分の1になった計算で、多言語の音声アシスタントを作る際には大きな違いになると考えられます。日本語の具体的な数値は本文中に記載がないため、日本語で使う場合は自分の音声で精度を確かめるのが確実だと思います。
主な機能とAPIパラメータ
Grok Voice Transcribe 2.0は高度な設定と制御に対応しています。既存のSpeech-to-Text APIとの連携は、コードを変更せずに精度向上の恩恵を受けられるとされています。
- バッチとストリーミング: 録音済みのファイルやURLを文字起こしするか、音声ストリームをリアルタイムで文字起こしする
- 単語単位のタイムスタンプ: 各単語に正確な開始・終了時刻と信頼度スコアが付く
- 話者分離(ダイアライゼーション): 文字起こしの各発言に話者のラベルを付ける。追加料金なし
- マルチチャンネル文字起こし: 最大8チャンネルを個別に文字起こしする
- キーワードの重み付け: 製品名や医療用語など、分野固有の用語を1リクエストあたり最大100個指定できる
- テキストの整形: 数字、日付、通貨、電話番号、メールアドレスを書き言葉の形式で返す
- フィラーの除去: 「えー」「あー」のようなつなぎ言葉(フィラー)を除く
- スマートなターン検出: 音声エージェント向けに、話し手の発言の終わりを検出する
開発者向けドキュメントでは、これらの機能に対応するリクエストパラメータが次のように説明されています。
- model: grok-voice-transcribe-1.0 または grok-voice-transcribe-2.0 を指定する
- diarize: trueにすると話者分離を有効にし、各単語に話者を示す情報が付く
- filler_words: 既定はfalseで、フィラーは自動的に除去される。trueにするとフィラーも含める
- multichannel / channels: チャンネルごとの文字起こしと、チャンネル数(最大8)の指定
- keyterm: 重み付けする用語を指定する。複数指定する場合はパラメータを繰り返し、最大100語、各50文字まで
- smart_turn: 発言の終わりを検出するしきい値(0.0〜1.0)
また、Voice Overviewのドキュメントでは、バッチ処理を1回のAPI呼び出しで行うcurlの例が示されています。以下は、そのサンプルに日本語のコメントを加えて掲載しています。
# 音声ファイルrecording.mp3をGrok Voice Transcribe 2.0で文字起こしするリクエストです
# 事前に環境変数XAI_API_KEYにSpaceXAIのAPIキーを設定しておきます
curl -X POST https://api.x.ai/v1/stt \
-H "Authorization: Bearer $XAI_API_KEY" \
-F model=grok-voice-transcribe-2.0 \
-F [email protected]-F はフォーム形式でデータを送るcurlのオプションで、[email protected] の @ はローカルのファイルを添付する指定です。話者分離を使いたい場合は、上記のパラメータ表に沿って -F diarize=true のように追加する形になると考えられます。同ドキュメントによれば、音声形式は12種類、言語は25言語に対応し、ストリーミングはWebSocket(双方向でリアルタイム通信する方式)経由で行います。
注意: 既定モデルについて、ドキュメント内で grok-voice-transcribe-2.0 と grok-voice-transcribe-1.0 の表記が混在していました。公式発表でも「近く既定になる」とされているため、移行期間中は model パラメータで使いたいモデルを明示しておくのが安全だと思います。
導入事例:Atlassian Loom
画面録画の記録・共有に広く使われているAtlassian Loomでは、Loomの動画の文字起こしにおいて、Grok Voice Transcribe 2.0が既存の仕組みより正確だと評価されました。正確な文字起こしは新しいAIワークフローにつながるとされ、たとえばLoomで作業計画を録画し、その文字起こしをCursorに渡すと、Cursorが直接コードを更新するといった使い方が紹介されています。
AtlassianのSanchan Saxena氏(Teamwork Collection担当SVP)は、文脈を一度記録すればそれがあらゆる場所に流れていくのが仕事を進める最善の方法だとし、LoomとCursorの組み合わせで「文脈からコードまで」をつなぐことが、AI支援開発の行き先を示していると述べています。
話し言葉で意図を伝え、それがそのまま開発ツールへの指示になるという流れは、文字起こしの精度が低ければ成立しません。本稿としては、音声認識の精度向上がエージェント型の開発ワークフローの入り口を広げている例として受け止めています。
料金と移行スケジュール
料金はGrok Voice Transcribe 1.0と同じで、バッチ処理は音声1時間あたり0.10ドル、ストリーミングは0.20ドルです。話者分離、タイムスタンプ、キーワードの重み付けも料金に含まれます。SpaceXAIが公式ページで示した他社との比較は次のとおりです(音声1時間あたり)。
| モデル | バッチ | ストリーミング |
|---|---|---|
| Grok Voice Transcribe 2.0 | $0.10 | $0.20 |
| Grok Voice Transcribe 1.0 | $0.10 | $0.20 |
| ElevenLabs Scribe v2 | $0.22 | $0.39 |
| Deepgram Nova-3 | $0.26 | $0.46 |
Grok Voice Transcribe 2.0は近くSpeech-to-Text APIの既定モデルとなり、1.0は数週間以内に非推奨となる予定です。移行期間中も1.0を使い続けたい場合は、grok-voice-transcribe-1.0 を指定して固定するよう案内されています。
1時間0.10ドルは、1日8時間の音声を月22日分バッチで文字起こししても、約18ドルの計算です。コスト面の障壁はかなり低く、精度や日本語対応、応答の速さといった要件で選ぶ段階に入っていると考えられます。
まとめ
Grok Voice Transcribe 2.0は、価格を据え置いたまま電話音声や多言語の短い発話での精度を高めた音声認識モデルです。既存の連携はそのまま恩恵を受けられます。比較対象となったGoogleのGemini 3.5 Transcribeもあわせて、自分の音声で試すのがよいと思います。
