はじめに
GoogleのResearchチームが2026年3月12日、GeminiをAIエンジンとして活用し、世界中のニュース記事から洪水イベントデータを自動抽出する手法「Groundsource」を発表しました。同日、このデータセットを活用した都市型フラッシュフラッド予報モデルもFlood Hubに追加されています。本稿では、Groundsourceの技術的な仕組み、都市型洪水予報モデルの詳細、そして既存のFlood Hub体制との統合について、3本の発表記事をもとに包括的に解説します。
参考記事
- タイトル: Introducing Groundsource: Turning news reports into data with Gemini
- 著者: Oleg Zlydenko, Rotem Mayo, Deborah Cohen
- 発行元: Google Research
- 発行日: 2026年3月12日
- URL: https://research.google/blog/introducing-groundsource-turning-news-reports-into-data-with-gemini/
- タイトル: Protecting cities with AI-driven flash flood forecasting
- 著者: Oleg Zlydenko, Deborah Cohen
- 発行元: Google Research
- 発行日: 2026年3月12日
- URL: https://research.google/blog/protecting-cities-with-ai-driven-flash-flood-forecasting/
- タイトル: Groundsource: using AI to help communities better predict natural disasters
- 著者: Yossi Matias
- 発行元: Google Blog
- 発行日: 2026年3月12日
- URL: https://blog.google/innovation-and-ai/technology/research/gemini-help-communities-predict-crisis/
要点
- GoogleはGeminiを活用して150カ国以上のニュース記事を解析し、2000年以降の洪水イベント260万件を収録したオープンデータセット「Groundsource」を構築した
- 従来の衛星ベースのデータベース(GFD・DFO)や国連・EU共同運営の監視システムGDACS(約1万件)では捕捉しきれなかった局所的・短時間の洪水を大規模にカバーしている
- 抽出イベントの60%が位置・時刻ともに正確であり、実用分析に耐える精度を持つものは82%、GDACSが記録した重大洪水の85〜100%を捕捉することが確認されている
- Groundsourceを学習データとして構築した新モデルは、都市域のフラッシュフラッドを最大24時間前に予測でき、米国気象局のフラッシュフラッド警報と同等以上の性能を多くの国で達成した
- GoogleのFlood Hubに都市型洪水予報が追加され、既存の河川洪水予報(150カ国以上・20億人対象・最大7日前警告)と統合された体制が整った
- Groundsourceの手法は洪水以外にも地滑り・干ばつ・雪崩など他の自然災害へ応用可能とされており、今後の展開が注目される
詳細解説
背景——自然災害データの「砂漠」という課題
自然災害は毎年、世界中で数百万人の生活に影響を与え、直接的な被害だけで数十億ドル規模の損失をもたらします。こうした災害に対して地域社会が十分な備えを整えるためには、過去の発生記録に基づく歴史的ベースラインが不可欠です。歴史データは、水文モデルを通じたハザード軽減や、将来予測の実証的な検証、さらには都市計画・保険・緊急対応といった実用的な応用にまで幅広く活用されます。
自然災害の中でも地震は、グローバルなセンサーネットワークによって均一に観測・記録されてきました。一方、洪水に代表される水文気象ハザードには、標準化された観測インフラが存在しません。とりわけフラッシュフラッド(鉄砲水)は、発生が局地的かつ短時間(強雨から6時間以内が典型的)に限られるため、従来の観測手法では記録が極めて困難な災害類型です。
既存のデータベースとして、衛星ベースの「Global Flood Database(GFD)」や「Dartmouth Flood Observatory(DFO)」がありますが、雲による観測妨害・衛星の再訪頻度・大規模かつ長期間の災害のみを捕捉しやすいという物理的制約を抱えています。また、国連と欧州委員会が共同運営する「GDACS(Global Disaster Alert and Coordination System)」は約1万件のイベントデータを保有していますが、主に高影響の災害に絞った記録であり、局所的なフラッシュフラッドの多くは対象外となってきました。
グローバル規模のAIモデルを学習・検証するには、1万件というデータ規模では量的に大きく不足しています。この「データ砂漠」が、フラッシュフラッドの高精度な予測を長年にわたって困難にしてきた根本的な要因です。
Groundsource——ニュース記事をデータに変換する新手法
Googleが新たに開発したGroundsourceは、このデータ不足を解消するためのスケーラブルなフレームワークです。世界各地のニュース記事・政府報告・地域の広報資料といった非構造化データを一次情報源として活用し、構造化された洪水イベントのアーカイブを生成します。膨大な量の非構造化データは存在するものの、人手でのスケールアップは不可能であり、ここにAIを活用するアプローチが意義を持ちます。
処理パイプラインの流れ
Groundsourceの処理フローは以下のとおりです。
まず、Google Read Aloudのクローラー(ユーザーエージェント)を使用して、洪水を主題とするニュースページから本文テキストを抽出します。このクローラーは80言語に対応しており、広範な地域のニュースを収集できます。抽出したテキストは、Cloud Translation APIを通じて英語に統一します。
次に、最も重要なステップとして、Geminiを活用した精緻なプロンプト設計によって以下の3つの判定を自動的に行います。
- 分類(Classification):記事が実際に発生した洪水(過去・現在進行中)を報じているのか、将来の警報・政策会議・一般的なリスクモデリングに関する記事なのかを区別する
- 時間的推論(Temporal reasoning):「先週の火曜日」のような相対的な日時表現を、記事の公開日を基準に逆算して正確な発生日時を特定する
- 位置情報の精緻化(Spatial precision):近隣・街路レベルの細粒度な地名情報を抽出し、Google Maps Platformを通じて標準的な空間ポリゴンにマッピングする
データセットの規模と精度
このパイプラインによって生成されたGroundsourceデータセットは、150カ国以上・2000年以降のフラッシュフラッドイベントを260万件収録しています。また、近年(2020〜2025年)のデジタルニュースの指数関数的な増加に伴い、データ密度も大幅に向上していることが確認されています。
精度面では、Googleによれば以下の検証結果が報告されています。
- 手動レビューにおいて、抽出されたイベントの60%が位置・時刻ともに正確
- 実用上の分析に耐える精度(例:正しい行政区域の特定、ピーク日の前後1日以内での特定)を持つものは82%
- GDACSが2020〜2026年に記録した重大洪水イベントの85〜100%をGroundsourceが時空間的に捕捉
これらの数値は、従来の監視システム(約1万件)と比較して、Groundsourceがいかに大規模なデータ拡張を実現したかを示しています。
フラッシュフラッドが「見えない洪水」と呼ばれる理由
洪水全体の中でも、フラッシュフラッドは特に予測が難しい災害です。世界気象機関(WMO)によれば、フラッシュフラッドは世界の洪水関連死の約85%を占め、毎年5,000人以上の命を奪っています。また、12時間の事前警告があれば洪水被害を最大60%削減できるという研究結果もあり、早期予報の実現は人命保護の観点から重要な意義を持ちます。
しかし、早期警報システム(EWS)の整備には国家間で大きな格差があります。先進国は充実した予報インフラを持つ一方で、途上国の半数以上はマルチハザード型EWSへのアクセスがなく、数十億人が十分な事前通知を受けられない状況に置かれています。
なぜフラッシュフラッドの予測は難しいのでしょうか。従来の河川洪水予報は、河川の水位を計測するストリームゲージ(流量計)のデータを学習データとして使用します。しかしフラッシュフラッドはゲージのない場所でも(都市部では透水性の低い舗装面や排水システムとの複雑な相互作用を経て)どこでも発生し得ます。都市環境では、強雨・不透水面・排水システムの相互作用を物理的にモデル化することはグローバル規模では計算量的に現実的ではなく、さらに過去の発生記録がなければ機械学習モデルの訓練も困難です。これが「見えない洪水」と称される理由です。
既存の早期警報システムとその限界
フラッシュフラッドに対する既存のアプローチにも、それぞれ課題があります。
局所特化型のシステムとしては、米国フロリダ州・コロンビアのバランキージャ・フィリピンのマニラ・タイのナコーンシータンマラート・プエルトリコのマヤグエス・スペインのバルセロナなどで高精度な早期警報システムが稼働しています。これらは降水量・水位・流量などを計測する物理センサーネットワークに依拠しており、特定地点では高い精度を持ちますが、センサー設置コスト・サイト固有のキャリブレーション・専門的な工学知識が必要なため、グローバルへの展開は困難です。
広域カバレッジを目指すシステムとしては、WMOのフラッシュフラッド・ガイダンス・システム(FFGS)、欧州のERIC(European Runoff Index based on Climatology)、米国気象局(NWS)のフラッシュフラッド警報などがあります。これらはリモートセンシングや数値気象モデルを活用していますが、高解像度の水文マップやレーダーベースの気象予報への依存度が高く、途上国(Global South)ではこれらのリソースが十分に整備されていないことが大きな障壁になっています。また、複雑なモデル出力を解釈して実用的な警報を発令するためには専門的な水文学者が必要であり、人的資源の面でも課題があります。
都市型フラッシュフラッド予報モデルの設計
Groundsourceデータセットを学習データとして構築されたGoogleの新モデルは、こうした既存システムの課題を踏まえ、グローバルスケールでの実用性を最優先に設計されています。
モデルアーキテクチャ
モデルはRecurrent Neural Network(RNN、再帰型ニューラルネットワーク)の一種であるLSTM(Long Short-Term Memory、長短期記憶)アーキテクチャを採用しています。LSTMは時系列データの処理に適した構造を持ち、過去の降雨パターンや気象の推移を考慮した予測を行うのに向いています。
モデルへの入力は、気象の時系列データ(動的特徴量)と、地理的・地球物理学的・人為的な静的属性の組み合わせです。静的属性には以下が含まれます。
- 都市化密度(urbanization density)
- 地形(topography)
- 土壌吸水率(soil absorption rates)
使用する気象データ
グローバルな運用を可能にするため、モデルはすべて公開されているグローバル気象プロダクトのみを入力として使用します。具体的には以下の通りです。
- NASA IMERG:衛星・ゲージ統合降水量データ
- NOAA CPC:全球降水量データ
- ECMWF IFS HRES:欧州中期予報センターの高解像度数値予報モデル
- Google DeepMindのAI中期天気予報モデル:AIベースのグローバル気象予測
現時点では20×20キロメートルの空間解像度で運用されており、これはグローバルに利用可能なデータの解像度上の制約に起因するとのことです。
カバレッジの対象
モデルは現在、人口密度が1平方キロメートルあたり100人以上の都市域を対象としており、世界人口の大部分をカバーしています。学習データとなるニュース記事が都市部に集中しやすいという特性を考慮した設計です。なお、今後は農村部への展開も進める計画が示されています。
評価結果——途上国でも先進国と同等の精度を達成
モデルの評価にあたっては、現実の洪水が報道されずに見逃されるケースがあるため、適合率(Precision)の数値は過小評価されている可能性があることをGoogleは明示しています。実際、各大陸からランダムに100件の警報を手動で検証したところ、「誤警報」と分類されたものの多くが実際には洪水が発生していた事例であり、実際の精度は生の指標よりも高いことが確認されています。再現率(Recall)については、GDACSが記録した最も影響の大きい洪水イベントを基準に評価しています。
評価結果の重要な知見は、南米・東南アジアなど先進的な観測インフラを持たない地域においても、欧米先進国と同等の精度・再現率を達成したという点です。
比較指標として、米国気象局(NWS)のフラッシュフラッド警報システムを同じ評価基準(20×20kmグリッド・24時間窓)で測定したところ、再現率22%・適合率44%という結果が報告されています(この適合率も同様に過小評価されている可能性あり)。問題の難しさを示す数値として参考になりますが、Googleのモデルが世界の多くの地域でこれと同等以上の性能を達成したことは、実用性の観点から注目に値すると考えられます。
一方、アフリカの一部の国では、Groundsource以外のグラウンドトゥルースデータが依然として不足しており、モデルの精度推定そのものが難しい状況が残っています。評価に最低10件のGDACSイベントが必要なため、データの乏しい国については指標を算出できていません。
Flood Hub——既存システムとの統合
今回の発表で、都市型フラッシュフラッド予報はGoogleのFlood Hubに追加されました。Flood Hubは、洪水データと予報を視覚的に提供する公開プラットフォームであり、政府・地域支援組織・リスクにさらされた住民を主な対象としています。
既存の河川洪水予報との関係を整理すると、以下のとおりです。GoogleはこれまでのFlood Forecasting Initiativeで、河川が堤防を越えるような「河川洪水」に注力してきました。このシステムは2つのAIモデルを組み合わせています。
- 水文モデル(Hydrologic Model):降水量・気象・流域データをもとに、河川の今後数日間の水位を予測する
- 氾濫モデル(Inundation Model):水文予測と衛星画像をもとに、どのエリアがどの程度の水位で浸水するかをシミュレーションする
このシステムは、世界で広く利用されているグローバルモデル「GloFAS」と比較してより行動可能で精度の高い予報を提供するとされており、最大7日前に洪水警報を発令できます。現在、150カ国以上の河川流域をカバーし、7億人に洪水予報を提供しています。また専門家向けには、APIや「GRRR」データセット(バーチャルゲージを含む仮想計測地点ベースの拡張カバレッジ)、氾濫データセット、約25万地点の予測ポイントを含む専門家向けデータレイヤーも提供されています。
警報はFlood Hubのほか、Google検索・Googleマップ・Androidの通知を通じても配信されており、情報へのアクセスを広く確保しています。
今回の都市型フラッシュフラッド予報の追加により、河川洪水では届かなかった急速発生型の都市水害もFlood Hubの予報対象となり、カバレッジが大きく拡張されました。Google Blog上でYossi Matias氏(VP Engineering & Research)は、既存の河川洪水予報が20億人以上を対象としていることに加え、今回の都市型予報が新たな人口層への保護を広げるものと位置づけています。
オープンソース公開とパートナーへの提供
GroundsourceデータセットおよびGoogleの都市型洪水予報モデルはオープンソースとして公開されており、研究者・政府機関・国際組織が自由に活用できます。Yossi Matias氏によれば、とりわけ歴史的なフラッシュフラッドデータが乏しかった都市部において、パートナーや研究者がインパクトをスケールさせるための大規模なオープンソースベンチマークとして機能するとのことです。
今後の展望——他の自然災害への応用可能性
Googleは今後の取り組みとして以下を表明しています。
- 農村部への展開:現在都市部中心のモデルを農村域にも拡張する
- 空間解像度の向上:現行の20×20kmをより細粒度な超局所予報へ
- リアルタイムデータソースの追加統合:より多くの観測データを取り込む
また、Groundsourceの方法論は洪水にとどまらず、地滑り・干ばつ・熱波・雪崩など、歴史的な観測記録が乏しい他の自然災害にも応用できる可能性があるとされています。ニュース報告から検証済みのグラウンドトゥルースを抽出するというアプローチは、データの乏しいあらゆるハザードに対して有効と考えられます。
Googleはこの取り組みを、気候変動への対応と地域社会のレジリエンス(回復力)強化に向けたGoogle Earth AIファミリー(地理空間モデル・データセット群)の一環と位置づけており、「誰も自然災害に不意を打たれない世界」という目標に向けた継続的な取り組みの一部としています。
まとめ
GoogleはGroundsourceを通じて、世界中のニュース記事という「非構造化データ」をAIが活用可能な洪水の歴史的記録へと変換し、260万件という従来の数百倍規模のデータセットを構築しました。このデータセットをもとに訓練した都市型フラッシュフラッド予報モデルは、最大24時間前の予報を実現し、観測インフラが整備されていない途上国においても先進国と同等の精度を達成しています。Flood Hubへの統合で河川洪水・都市型洪水の両面をカバーする体制が整った今、他の自然災害への応用も視野に入れた今後の展開が注目されます。
