[開発者向け]Googleがアフリカ27言語の音声データセット「WAXAL」を公開——デジタル格差是正へ向けた取り組みとは

目次

はじめに

 Google Researchが2026年3月6日、サハラ以南のアフリカ地域に固有の27言語を対象とした大規模オープン音声データセット「WAXAL」を公開しました。本稿では、このデータセットの概要と収集方法、アフリカのAIエコシステムとの協働体制、および今後の展望について解説します。

参考記事

要点

  • WAXALはサハラ以南アフリカの27言語を対象とした大規模音声データセットで、26カ国以上に住む1億人超の話者をカバーする
  • 音声認識(ASR)用に約1,846時間の書き起こし済み音声、音声合成(TTS)用に565時間超の高品質録音が含まれる
  • Creative Commons(CC-BY-4.0)ライセンスで公開されており、研究・商用を問わず自由に利用できる
  • データ収集はアフリカの大学・コミュニティ組織が主導し、パートナーがデータの所有権を保持する仕組みを採用している
  • 2021年から複数年にわたるプロジェクトであり、今後もデータを継続的に拡充する予定である

詳細解説

音声技術とアフリカ言語が抱える課題

 バーチャルアシスタントや自動文字起こしなどの音声技術は、コンピューターとのインタラクションを大きく変えてきました。しかし、その恩恵を受けているのは世界の一部の言語に偏っています。特にサハラ以南アフリカは2,000を超える言語が存在する地域であるにもかかわらず、音声技術のインフラが極めて限られており、数億人の人々が母語でテクノロジーを利用できない状況が続いています。Google Researchはこの課題に取り組むべく、2021年からWAXALプロジェクトを開始しました。

 音声認識や音声合成を高精度に実現するには、大量の学習データが不可欠です。英語や中国語といった高リソース言語では学習データが豊富に存在しますが、多くのアフリカ言語は「低リソース言語」に分類され、データ不足がシステム開発の大きな障壁になっていると考えられます。

WAXALの2つのデータセット構成

 WAXALは音声認識と音声合成の両方を支える2つの専門的なデータセットから構成されています。

 WAXAL-ASRは、約1,846時間の書き起こし済み音声からなる音声認識用データセットです。特徴的なのは収集手法で、参加者にスクリプトを読み上げさせる従来の方式ではなく、50以上のトピックを扱う画像を視覚的な刺激として提示し、母語で自由に描写してもらう「画像プロンプト誘導法」を採用しています。Google Researchによれば、この手法によって音調の微妙なニュアンスやコードスイッチング(複数言語を混在させた話し方)を含む、より自然な発話を収録することができたとのことです。

 WAXAL-TTSは、565時間超の高品質・高忠実度録音からなる音声合成用データセットです。地域コミュニティのメンバーが2人1組となり、10,000〜20,000語のスクリプトを交互に読み上げ・録音する協働方式で収集されました。録音品質へのこだわりも注目で、一部の参加者はプロジェクトの資金を活用して専用の防音ボックスを自作したとも報告されています。収録後は音声をセグメントに分割し、スクリプトテキストとの照合・品質審査を経て最終的なデータセットとして整備されました。

 この2種類のデータを組み合わせることで、音声入力(ASR)と音声出力(TTS)の双方に対応したフルデュプレックスの対話システム開発が可能になります。

アフリカのAIエコシステムとの協働体制

 WAXALの大きな特徴のひとつが、データ収集の主体をアフリカの組織に置いた点です。マケレレ大学(ウガンダ)が9言語のASR・TTSデータを担当し、ガーナ大学が8言語に注力しました。また、Digital UmugandaとアジスアベバのAddis Ababa Universityが複数の地域言語のASR収集をリード。TTS録音にはMedia Trust、Loud n Clear、アフリカ数理科学研究所セネガル校(AIMS Senegal)が携わっています。

 特筆すべきは所有権の扱いで、各パートナー組織が自ら収集したデータの所有権を保持したまま、全データをオープンアクセスで公開するという枠組みを採用しています。この設計思想は、コミュニティが主体となってデータを蓄積・管理する「コミュニティドリブン」なアプローチといえ、外部組織が一方的にデータを収集・所有する従来型の手法との違いが際立ちます。

派生研究と成果

 このプロジェクトを通じて、すでにいくつかの注目すべき研究成果が生まれています。

 障がい者の音声収集に関しては、脳性麻痺や吃音を持つAkan語(ガーナ)話者向けの初のオープンソースデータセットが公開されました。この研究では、テキストベースのプロンプトよりも対面での画像プロンプト誘導が効果的であることが示されており、低リソース環境でインクルーシブな音声技術を開発する際の指針として活用できると考えられます。

 また、ガーナの5言語(Akan、Ewe、Dagbani、Dagaare、Ikposo)を対象に5,000時間の音声コーパスを構築した研究も発表されており、ASR・TTS両システムの基盤整備に貢献しています。さらに、WhisperやXLS-R、MMS、W2v-BERTという4つの最先端モデルを13のアフリカ言語でベンチマーク評価した研究では、学習データを増やした際の性能向上が言語の複雑さやドメインの適合度に大きく依存することが示されました。加えて、111のアフリカ言語にわたる74のデータセットを整理した体系的な文献調査も公開され、多ドメイン対話コーパスの整備や言語的特性に対応した評価指標(文字誤り率:CER)の活用が急務であるとの見解が示されています。

まとめ

 WAXALは、音声技術の恩恵から取り残されてきたアフリカ言語話者を支援するための、大規模かつ開放的なデータ基盤です。アフリカの研究機関やコミュニティが主体となって構築されたこの取り組みは、データ所有権やコミュニティの自律性を尊重する点でも新しいモデルを示しています。今後の言語拡充にも注目です。

この記事が気に入ったら
フォローしてね!

  • URLをコピーしました!
  • URLをコピーしました!
目次