[ビジネスマン向け]機関投資家の議決権行使をAIが変える——RAGアーキテクチャで精度99.2%を実現したプロキシリサーチの今

目次

はじめに

 機関投資家の議決権行使(プロキシ投票)業務にAIが本格導入され始めています。ハーバード大学ロースクール企業ガバナンスフォーラムが2026年3月3日に掲載した論考では、TumeloのWill Goodwin氏が、RAG(検索拡張生成)アーキテクチャを活用した議決権調査プラットフォームの実態と、業界全体の変化について詳しく解説しています。

参考記事

要点

  • 大手機関投資家は1プロキシシーズンに6,000件以上の株主総会を対象とし、従来は第三者のプロキシアドバイザーに調査を外部委託してきたが、JPモルガンが自社AI基盤への移行を発表するなど、インハウス化の流れが加速している
  • 汎用LLM(ChatGPTやClaudeなど)のプロキシ書類に対する正解率は約84%にとどまり、議決権行使業務の精度基準を満たさない
  • TumeloのRAGベースプラットフォーム「ProxyBeacon」は、SEC提出書類を公表後1時間以内に取り込み、マルチステージ検索により現在の検証済み正解率99.2%を達成している
  • カスタムポリシーの自然言語定義・バックテスト機能や、カスタムピアグループによる役員報酬比較など、運用の自律性を高める機能が実装されている
  • 主観的判断を要するルールへのAI単独適用には限界があり、客観的基準に適したAI評価と、人間によるスチュワードシップ判断の役割分担が重要とされている

詳細解説

プロキシ投票の業務課題とインハウス化への圧力

 機関投資家によるプロキシ投票は、資産運用業務のなかでも特に運用負荷の高い分野の一つです。規模の大きい機関投資家では、1つのプロキシシーズンに6,000件以上の株主総会に対応する必要があり、それぞれについて調査・ポリシー適用・合理的な根拠の作成が求められます。締め切りも厳しく、人的リソースも限られているため、過去20年ほどにわたり業界の主流は外部委託——第三者プロキシアドバイザーのベンチマーク推奨に沿って投票する——でした。

 しかしこのモデルは現在、複数の要因から見直しを迫られています。受託者責任への説明責任強化、機関投資家の投票行動における「横並び」への批判の高まり、そしてAI技術の実用化がその主な要因です。JPモルガンが自社AI基盤への移行を発表したことは、こうした業界全体の変化を象徴する動きと言えます。

汎用LLMの限界とRAGアーキテクチャの優位性

 プロキシリサーチにAIを活用する際、まず直面するのが汎用大規模言語モデルの精度問題です。ChatGPTやClaudeのような汎用モデルは流暢なテキストを生成しますが、プロキシ書類のような長く複雑な文書に対する正解率は内部ベンチマークで約84%にとどまるとされています。議決権行使や関与スタンス、クライアントへのレポートに影響する業務では、このレベルの誤りは許容できません。

 この課題を解決するアーキテクチャとして注目されるのが、RAG(Retrieval-Augmented Generation、検索拡張生成)です。RAGとは、モデルが学習データから情報を想起するのではなく、クエリの時点で特定の文書を検索し、その内容のみをもとに回答を生成する仕組みです。出力には情報源への明示的な引用が付き、検索されたコンテンツに情報が存在しない場合は、回答を作り出す代わりに「情報なし」を返します。この設計により、ハルシネーション(事実と異なる内容の生成)のリスクを大幅に抑えられると考えられます。

ProxyBeaconの実装——データ取り込みから検索最適化まで

 TumeloのAIプラットフォーム「ProxyBeacon」はRAGアーキテクチャを採用しており、DEF 14A(委任状説明書)、10-K(年次報告書)、8-Kなど、対象企業のSEC提出書類を公表後1時間以内に取り込めます。各文書は表・グラフ・画像を含めてテキストに変換・構造化されたうえで、キーワードではなく意味に基づく検索を可能にするセマンティックベクターデータベースに格納されます。

 技術上の大きな課題となるのが検索段階の精度です。単純なRAG実装では、特定の箇所にある明確な情報を探す「ピンポイント型」の質問には有効ですが、複数年にわたる報酬比較や、複数の書類をまたいだ取締役の兼任状況の調査など、より広範なクエリに対しては、無関係な情報(「ノイズ」)が混入して精度が低下します。ProxyBeaconではこれに対処するため、クエリを分類したうえで検索計画を構築し、言語モデルに渡す前に結果をランキング・フィルタリングするマルチステージ検索を採用しています。

精度の検証フレームワーク——ガバナンス要件としての99.2%

 精度は単に主張するだけでなく、測定・監査可能である必要があります。ProxyBeaconでは、実際のユーザークエリから抽出した質問と回答のペアで構成されるベンチマークデータセットを構築し、内部チームによる手動レビューとLLMベースの評価ツールを組み合わせて継続的に検証しています。評価指標には「根拠整合性(出力が取得した一次情報に基づいているか)」や「時制認識(複数の提出期間にまたがるデータを正確に扱えるか)」が含まれます。

 この評価フレームワークは継続的インテグレーションパイプラインに直接組み込まれており、更新のたびに自動テストが走り、既知のエッジケースで問題が発生するたびにテストケースが追加される仕組みです。現在の検証済み正解率は99.2%とされています。スチュワードシップチームが投資委員会やコンプライアンス部門、そして最終的にはクライアントに対して説明責任を果たすためには、こうした追跡可能な精度の裏付けが不可欠と言えます。

カスタムポリシーの適用とピア比較機能

 ProxyBeaconのもう一つの特徴は、各機関が自分たちのポリシーを自然言語で定義し、市場・セクター・テーマ別に適用できる点です。従来、カスタムポリシーの構築には外部プロバイダーとの長いやり取りが必要でしたが、このプラットフォームでは自社完結型で設計・バックテストが可能であり、ポリシー変更のコストと時間を大幅に削減できると考えられます。

 ピア比較機能では、企業が自ら報告するピアグループに依存せず、ユーザーが独自にピアグループを定義したうえで、CEO報酬と株主総利回りの関係など、さまざまな指標の比較レポートを一次情報付きで生成できます。エンゲージメント対話や投票判断の文脈整理に活用できる機能と言えます。

AIが苦手とする領域——主観的判断と変化への追随

 記事では現在のAIシステムの限界についても率直に論じられています。「80/20問題」として指摘されているのは、良好な出力を大部分のケースで達成するのは比較的早くできる一方、修正提案・追補書類・特殊な報酬構造・事実の対立といったエッジケースで一貫した精度を維持するには継続的な投資が必要だという点です。

 また、AIが評価を行うべき領域と人間が判断すべき領域についても明確な整理がなされています。「報酬増加率が定められた閾値を超えたら反対票を投じる」のような客観的ルールはAIに適しています。一方、「この提案が会社にとって重要かどうか」のような主観的判断は、モデルによって学習時のバイアスが異なるため、AI単独での評価は適切でないとされています。こうした場合、AIの役割は投票履歴や支持率、提案者の実績といった関連情報を提示することにとどめ、判断はスチュワードシップチームが下す——という役割分担の考え方は、AI活用の原則として広く参考になると思います。

まとめ

 プロキシ投票業務におけるAI導入は、JPモルガンの動きに象徴されるように、もはや「これから起きること」ではなく進行中の変化です。RAGアーキテクチャによる高精度な一次情報検索、監査可能な出力、カスタムポリシーの自律的運用など、これらは機関投資家のスチュワードシップの質を高める可能性を持っています。一方で、主観的判断が必要な領域でのAI単独運用には慎重さが求められています。

この記事が気に入ったら
フォローしてね!

  • URLをコピーしました!
  • URLをコピーしました!
目次