はじめに
Googleが2026年1月22日、小型マルチモーダルLLMを使ってモバイル端末やウェブブラウザ上のユーザー操作から意図を理解する新しい手法を発表しました。この手法は、自然言語処理分野の主要国際会議EMNLP 2025で発表された論文に基づくもので、大型モデルと同等の性能をより小さなモデルで実現できることを示しています。本稿では、この2段階アプローチの仕組みと評価方法、実用的な意義について解説します。
参考記事
- タイトル: Small models, big results: Achieving superior intent extraction through decomposition
- 著者: Danielle Cohen、Yoni Halpern
- 発行元: Google Research Blog
- 発行日: 2026年1月22日
- URL: https://research.google/blog/small-models-big-results-achieving-superior-intent-extraction-through-decomposition/
要点
- Googleは、小型マルチモーダルLLMを使ってUI操作からユーザー意図を理解する2段階の手法を開発した
- 第1段階で各画面を個別に要約し、第2段階でその要約から全体の意図を抽出することで、小型モデルでも高精度な理解を実現する
- 評価にはBi-Factアプローチを用い、予測された意図と正解の意図を「原子的事実」に分解してprecision、recall、F1スコアを算出する
- Gemini 1.5 Flash 8Bを使った2段階アプローチは、Chain of Thoughtプロンプティングやエンドツーエンドファインチューニングを上回る性能を示した
- モバイル端末のデータセットでは、小型のGemini 1.5 Flash 8Bが大型のGemini 1.5 Proと同等の性能を達成し、コストと速度の面で優位性がある
詳細解説
ユーザー意図理解の課題とアプローチ
Googleによれば、AIエージェントがユーザーのニーズを先回りして理解するには、ユーザーが何をしようとしているのかを把握する必要があります。例えば、ユーザーがヨーロッパ各地の音楽フェスティバルを検索した後にロンドン行きの航空券を探している場合、エージェントはその日程でロンドンのフェスティバルを提案できます。
大型のマルチモーダルLLMは、UI操作の履歴からユーザー意図を理解することが既に得意です。マルチモーダルLLMとは、テキストだけでなく画像なども処理できる言語モデルを指します。しかし、大型モデルを使うには通常サーバーに情報を送信する必要があり、これは速度、コスト、機密情報の漏洩リスクの面で課題があります。
この課題に対し、Googleの研究チームは小型モデルをデバイス上で動作させる方法を提案しました。オンデバイスAIとは、クラウドサーバーではなくスマートフォンやタブレットなどの端末上でAIモデルを実行する技術で、プライバシー保護、通信コストの削減、レスポンス速度の向上といったメリットがあります。
第1段階: 画面ごとの要約生成
第1段階では、各画面での個別の操作を小型マルチモーダルLLMで要約します。

具体的には、前後の画面を含む3画面のスライディングウィンドウを使い、以下の3つの質問に答えます。
- 関連する画面の文脈は何か。現在の画面の重要な詳細を短いリストで示す
- ユーザーは何をしたか。この操作でユーザーが取った行動のリストを提供する
- 推測。ユーザーはこの操作で何を達成しようとしているか
スライディングウィンドウとは、一定の範囲のデータを順次移動させながら処理する手法です。この場合、現在の画面だけでなく前後の画面も見ることで、より正確な文脈理解が可能になります。
論文では、これらの質問に対する回答を生成することで、各操作の包括的な要約を作成できることが示されています。第3の質問である「推測」を含めることで、第1段階でより完全な要約が生成されますが、興味深いことに第2段階ではこの推測部分は使用されません。
第2段階: 要約からの意図抽出
第2段階では、ファインチューニングされた小型モデルを使って、画面要約のシーケンスから単一の意図文を抽出します。ファインチューニングとは、既に学習済みのモデルを特定のタスクに適応させるための追加学習を指します。

Googleによれば、以下の3つのテクニックが有効でした。
まず、ファインチューニングです。「良い」意図文がどのようなものかの例を示すことで、モデルは要約の重要な部分に焦点を当て、不要な部分を省略できるようになります。Googleは、公開されている自動化データセットを訓練データとして使用しました。これらのデータセットには、意図と一連の行動を対にした良い例が含まれています。
次に、ラベル準備です。要約には情報が欠けている可能性があるため、完全な意図で訓練すると、モデルは存在しない詳細を埋めること、つまりハルシネーション(幻覚)を学習してしまいます。これを避けるため、訓練用の意図から要約に現れない情報を事前に削除します。この処理には別のLLM呼び出しを使用します。
そして、推測の除外です。第1段階で推測を出力する場所を指定することで、より完全な要約が作成されますが、第2段階の意図抽出では推測が混乱を招く可能性があります。そのため、第2段階では推測を使用しません。第1段階で推測を求めながら第2段階で除外するというのは直感に反するように思えますが、この方法が性能向上に役立つことが確認されています。
評価手法: Bi-Factアプローチ
性能評価には、Bi-Factアプローチと呼ばれる手法を使用しています。
この手法では、予測された意図と正解の意図を、それ以上分解できない詳細である「原子的事実(atomic facts)」に分割します。例えば、「片道航空券」は1つの原子的事実ですが、「ロンドンからキガリへの航空券」は2つの原子的事実になります。
次に、正解の意図に含まれる事実のうち予測された意図で捉えられているものの数と、予測された意図に含まれる事実のうち正解の意図で支持されているものの数を数えます。

これにより、precision(適合率)とrecall(再現率)を計算できます。precisionは予測された事実のうち正しいものの割合を示し、recallは真の事実のうち正しく予測できたものの割合を示します。そして、この2つの調和平均であるF1スコアを算出します。F1スコアは、精度と網羅性のバランスを評価する指標として、機械学習分野で広く使われています。

また、原子的事実を使った評価により、2段階アプローチの各段階がエラーにどのように寄与しているかを追跡することも可能です。論文では、見逃された詳細やハルシネーションが各段階でどのように発生するかを分析する手法も示されています。
主要な結果
画面を個別に要約してから意図を抽出する2段階アプローチは、小型モデルを使用する場合に有効であることが示されました。

Googleによれば、この手法を標準的なアプローチと比較したところ、Chain of Thoughtプロンプティング(CoT)とエンドツーエンドファインチューニング(E2E)の両方を上回る性能を示しました。Chain of Thoughtプロンプティングとは、モデルに段階的な思考プロセスを示させることで回答の精度を高める手法です。
この結果は、モバイル端末とウェブブラウザの両方の操作履歴で、またGeminiとQwen2の両方のベースモデルで確認されました。
特に注目すべきは、Gemini 1.5 Flash 8Bに2段階アプローチを適用すると、Gemini 1.5 Proを使用した場合と同等の結果を、はるかに低いコストと速度で達成できることです。Gemini 1.5 Flash 8Bは80億パラメータの小型モデルですが、この分解アプローチにより、より大規模なProモデルと遜色ない性能を実現しています。これは、計算リソースが限られたモバイル端末での実用性を考えると、重要な成果と言えます。
論文では、AndroidとWebの両方の操作履歴でBi-Fact F1スコアを比較した結果、すべての設定で2段階手法がベースラインを上回り、モバイル端末のデータセットでは大型のGemini Proモデルの性能に匹敵することが示されています。
まとめ
Googleが発表した2段階の分解アプローチは、小型マルチモーダルLLMでも大型モデルと同等のユーザー意図理解を実現できることを示しました。Gemini 1.5 Flash 8Bを使用することで、コストと速度の面で優位性を保ちながら、Gemini 1.5 Proに匹敵する性能を達成しています。今後、モバイル端末の処理能力向上と合わせて、オンデバイスでの意図理解が様々な支援機能の基盤になっていく可能性があります。
