音声認識– tag –
-
AIツール
[開発者向け]OpenAIの新音声システム「GPT-Live」——ターン検出を廃した全二重アーキテクチャの舞台裏
はじめに OpenAIは2026年8月3日、公式ブログで音声AI「GPT-Live」の内部構造を解説する記事を公開しました。ターン検出を排した全二重会話の仕組みと、応答速度を支える通信・推論基盤の設計について、本稿で紹介します。 参考記事 タイトル: How we bui... -
AIツール
[AIツール利用者向け]Claudeの音声モードがOpus・Sonnetに対応、連携ツールも操作可能に
はじめに Anthropicは2026年7月23日、Claudeの音声モードでOpusとSonnetを利用できるようにしたと発表しました。GmailやSlackなど連携ツールへのアクセスや対応言語の拡充も同時に行われています。本稿では、この刷新内容と実用面での変化を解説します。... -
AI技術
[開発者向け]NVIDIA、多言語音声AIの障壁を低減する新データセットとモデルを公開
はじめに 本稿では、NVIDIAが新しく公開した多言語音声AIのためのデータセットとモデルについて、その技術的なポイントや意義を詳しく解説します。音声認識や翻訳AIは急速に発展していますが、対応言語の数には大きな偏りがあるのが現状です。今回NVIDIA... -
AI技術
[技術紹介]声でAIを自由自在に操る時代へ!Gemini 2.5の音声生成技術の最前線
はじめに 本稿では、Google DeepMindが発表した最新AIモデル「Gemini 2.5」に搭載された、高度な音声対話および音声生成機能についてGoogle Blogに掲載された「Advanced audio dialog and generation with Gemini 2.5」をもとに詳しく解説します。 引用...
1