音声生成– tag –
-
AIツール
[ニュース解説]Googleが「Gemini 3.8 Live」を発表、推論と対話を並行処理する音声AI
はじめに Googleが2026年9月15日、高度な推論能力と流暢な対話を可能にする最新の音声モデル「Gemini 3.8 Live」と「Gemini 3.8 Live Extended Thinking」を発表しました。本稿では、複雑なタスク実行と自然な対話を両立する本モデルの性能と、実用化に... -
AIニュース
[開発者向け]OpenAI「GPT-Live-1」API公開——全二重音声と低遅延を実現
はじめに OpenAIは 2026年9月10日 、全二重音声モデル「GPT-Live-1」をAPIで公開しました。音声の聞き取りと発話を単一モデルで同時に処理し、割り込み対応や低遅延化を狙います。本稿では、性能指標、バックエンド委譲、料金、実装上の注意点を整理しま... -
AIツール
[開発者向け]OpenAIの新音声システム「GPT-Live」——ターン検出を廃した全二重アーキテクチャの舞台裏
はじめに OpenAIは2026年8月3日、公式ブログで音声AI「GPT-Live」の内部構造を解説する記事を公開しました。ターン検出を排した全二重会話の仕組みと、応答速度を支える通信・推論基盤の設計について、本稿で紹介します。 参考記事 タイトル: How we bui... -
AIツール
[AIツール利用者向け]xAIがGrok Voiceに新音声21種を追加——用途別キャラクターと多言語対応が進化
はじめに xAIは2026年7月6日、音声AIサービス「Grok Voice」に新たな音声21種を追加したと発表しました。既存5種と合わせ、サポートやキャラクター、教育など用途別に設計された音声が利用可能になったほか、既存音声の自然さも向上しています。本稿では... -
AIツール
[AIツール利用者向け]xAIが「Voice Agent Builder」を発表——コード不要で2分の音声AIエージェント構築
はじめに xAIは2026年7月1日、コードを書かずに音声AIエージェントを構築できるプラットフォーム「Voice Agent Builder」のベータ版を発表しました。同社の音声モデル「Grok Voice」上で、電話応対エージェントを最短2分で構築できるとしています。本稿... -
AI技術
[開発者向け]OpenAIが音声APIを刷新——推論・翻訳・文字起こしの新モデル3本が同時登場
はじめに OpenAIが2026年5月7日、Realtime APIに3つの新しい音声モデルを追加しました。GPT-5クラスの推論能力を持つ「GPT-Realtime-2」、70以上の言語を13の出力言語にリアルタイム翻訳する「GPT-Realtime-Translate」、そして低遅延のストリーミング文... -
AI技術
[開発者向け]xAI「Custom Voices」全解説——声をクローンしてVoice Agent APIに組み込むまでの実装ガイド
はじめに xAIは2026年4月30日、Grok TTSおよびVoice Agent APIに対応するカスタム音声クローン機能「Custom Voices」と、ボイスカタログを一元管理する「Voice Library」を発表しました。本稿では、発表ブログとxAI公式ドキュメントをもとに、Custom Voi... -
AI技術
[開発者向け]xAI新フラッグシップ音声エージェント「Grok Voice Think Fast 1.0」——Starlinkの実運用で70%の問い合わせを自律解決
はじめに xAIが2026年4月23日、最新フラッグシップ音声エージェントモデル「Grok Voice Think Fast 1.0」をAPI経由で公開しました。音声AIの業界標準ベンチマーク「τ-voice Bench」でトップを獲得し、すでにStarlinkのカスタマーサポートに実運用されて... -
AI技術
[開発者向け]xAI、Grok音声APIを公開——高精度STTとSpeech Tags対応TTSが競合比最安値で登場
はじめに xAI(イーロン・マスク氏が設立したAI企業)が2026年4月17日、音声認識(STT)と音声合成(TTS)の2種類のスタンドアロンAPIを公開しました。Grok VoiceやテスラのNPCシステム、Starlinkのカスタマーサポートを動かしているのと同じ技術基盤を... -
AIツール
[開発者向け]GoogleのTTSモデル「Gemini 3.1 Flash TTS」登場—音声タグで表現をきめ細かく制御
はじめに Googleが2026年4月15日、テキスト読み上げ(TTS)の最新モデル「Gemini 3.1 Flash TTS」を発表しました。新たに導入された「音声タグ」機能により、声のトーンや速度・アクセントをテキスト内の自然言語で直感的に制御できるようになっています...
12