はじめに
Anthropicは2026年9月17日、運用資産約380億ドルの投資会社Balyasny Asset Management(BAM)がClaude Fable 5をどう評価・導入したかを、同社Chief AI Officerへのインタビューとして公開しました。本稿ではこの内容をもとに、評価プロセスと業務への影響を紹介します。
参考記事
- タイトル: Working at the frontier: How Balyasny Asset Management evaluates and governs Claude Fable 5
- 著者: Anthropic(Charlie Flanagan氏へのインタビュー)
- 発行元: Anthropic
- 発行日: 2026年9月17日
- URL: https://claude.com/blog/working-at-the-frontier-how-balyasny-asset-management-evaluates-and-governs-claude-fable-5
関連記事



要点
- Balyasny Asset Management(BAM)は、運用資産約380億ドル・約2,000人体制の投資会社である。
- BAMの検証では、Claude Fable 5は実務タスクで89.4%を記録し、従来の本番モデルの86.1%を上回った。
- 合併・買収の初期分析パッケージ作成は、従来3〜5日かかっていた作業がエージェント活用で1日未満に短縮された。
- BAMは、社内エージェント基盤「BAMAgent」を6ヶ月かけて構築し、数千体の自律エージェントを24時間稼働させている。
- 節税目的の含み損益調整(タックスロスハーベスティング)分析では、エージェントが9万件のデータベーステーブルを探索した。
詳細解説
「検索するAI」から「働くAI」へ——ハーネスが変えた業務
Flanagan氏によれば、2026年はBAMにとって、AIが「検索するシステム」から「働くシステム」へ移行した年だとされています。変化の鍵は、モデル単体の性能だけでなく、Claude Codeのような「ハーネス」(モデルの周りでツールの実行やタスク管理を担う実行環境)にあり、プロンプトではなく「達成すべき結果」を与えて完了まで作業を継続させられるようになった点が大きいとされています。
具体例として挙げられているのが、M&A(合併・買収)案件の初期分析です。案件発表後、エージェントが取引の成立可能性や所要期間を見積もり、主要な経済条件・法的条件を抽出し、条件やマイルストーンを特定し、投資判断が必要な論点を洗い出す、というワークフローが自動化されました。従来は手作業のリサーチと個別ツールに分かれ、一連の作業を最後まで任せられるエージェントは存在しなかったため3〜5日を要していましたが、現在はエージェントが約30分稼働し、重要な出力は人間のレビューを経た上で1日未満に短縮されているとされています。なお、Anthropicのフロンティアモデルを利用しつつも、実行ハーネスやデータアクセス、レビュー統制などのインフラの大部分はBAM社内で構築されている点が強調されています。
Claude Fable 5をどう評価したか——数千件の実務タスクによる検証
BAMは、汎用的なベンチマークや個別のデモではなく、株式・マクロ・コモディティにまたがる数千件の実務タスク(検証可能な正解がある実際の金融タスク)でモデルを評価する仕組みに、数年前から投資してきたとされています。こうした実務ベンチマークによる評価は、JetBrainsによるClaude Fable 5の導入判断でも同様に重視されていましたが、BAMはモデル単体の性能だけでなく、実際のツール・ファイル・要件を伴うエージェント環境内での挙動(計画立案、適切なツールの選択、証拠の発見と分析、エラーからの回復、中間結果の検証、根拠に基づく成果物の作成)も併せて検証しているとされています。
該当するタスク群において、Claude Fable 5は89.4%のスコアを記録し、従来の本番モデルの86.1%を上回りました。特に、複雑な計画立案・分析・エージェントによる実行で優れた結果を示したとされています。さらに、これまでどのモデルも解けなかった一連の経済学の問題をFable 5が初めて解いたことが「驚きの結果」として紹介されており、BAMは評価の不具合を疑って再検証やタスク・採点ロジックの独立確認を行い、Anthropicとも結果を確認した上で、この改善が実際のものだと結論づけたとされています。現在、投資チームは体系的な作業やコーディング作業の主要モデルとしてFable 5を使い、効率とコストに応じて他モデルとの使い分けの指針も示されているとされています。
安全性は「製品」であり「運用モデル」の問題
Flanagan氏は、安全性を一度きりのモデル選定の問題としてではなく、製品設計と運用体制の問題として扱っていると述べています。重要なのは、モデルが何をできるかだけでなく、どのデータにアクセスできるか、どのツールを使えるか、どの行動を取れるか、何を人間の承認が必要な範囲にとどめるか、そして問題が起きたときにどう把握するかだとされています。
BAMは、承認済みのデータ境界、最小権限のアクセス、ツール単位の権限設定、ログ記録と追跡可能性、重要な出力に対する人間レビュー、例外時のエスカレーション経路といった統制をモデルの周囲に配置しています。こうした統制は当初から優先事項であり、Fable 5の導入によって安全面の考え方が根本的に変わったわけではないとされています。より高性能なモデルであっても、推論や計画の能力が高いからといって自動的に権限が広がることはなく、モデルは利用者とタスクに応じて承認された範囲のツール・データソースしか使えず、自ら権限を拡張することもできない設計になっているとされています。
社内エージェント基盤「BAMAgent」とFable 5の役割
BAMは、承認済みの業務フローにエージェントを安全に展開するための社内基盤「BAMAgent」を6ヶ月かけて構築し、数千体の自律エージェントを24時間体制で稼働させているとされています。ヘッジファンドのミレニアムがAnthropicと共同開発した「デジタルリスクアナリスト」も同様の「人間の監督下で働くAIチームメイト」という発想に基づいていますが、BAMAgentはチャットの延長ではなく、数時間から数日にわたる複数ステップの調査・分析を、複数のエージェントを並行稼働させながら遂行し、最終的に人間がレビューできる成果物にまとめる仕組みとして位置づけられています。企業調査資料の作成・維持、決算やマクロイベントへの準備、新たな証拠の金融シナリオへの変換などに使われているとされています。
BAMは、計画立案と分析の段階ではFable 5を優先的に使用しているとされています。この段階での誤りはその後のすべての成果物に影響するため、問題をどう分解し、どの証拠が重要で、矛盾する情報をどう整合させるかを判断する部分には、最も高性能なモデルを充てる方針だとされています。
実際の成果——タックスロスハーベスティングと中央銀行分析
BAMが挙げた具体例の一つが、含み損のある資産を売却して節税につなげる「タックスロスハーベスティング」分析です。あるBAMAgentは9万件のデータベーステーブルを探索して該当する投資信託の保有データを見つけ出し、独自の加重方式を構築したとされ、チームのレビューを経た結果は、従来の手法より網羅的な内容になったと報告されています。
また、同社のチーフエコノミストは、定例の中央銀行分析にかかる時間を、従来の約2日から約30分に短縮するエージェントのワークフローを構築したとされ、判断とレビューはエコノミスト自身が担っているとされています。BAMは、モデルが推論・統合・多段階の問題解決を担う一方、ワークフロー設計や承認済みデータ・ツールへのアクセス、権限設定、監視、人間レビューの統制といった部分はBAM側のハーネスが担っており、両者が揃って初めて実務に耐える成果物になると説明しています。
「ツール」から「チームメイト」へ——今後の展望
Flanagan氏は、2026年を「人がツールを持つ時代」から「チームメイトを持つ時代」への転換点と位置づけています。一部のチームでは既に300体を超えるエージェントが継続的に新しいデータの分析を行っており、洞察を得る速度の向上と見落としの防止につながっているとされています。BAMは、既存の業務プロセスを自動化するという発想から、より良い方法で結果に到達できないかを問う発想へと視点を移しつつあるとしています。
まとめ
BAMの事例は、数千件の実務タスクによる検証と、権限やアクセスを絞り込む運用統制を組み合わせることで、フロンティアモデルを金融業務に安全に組み込もうとする試みだと言えます。本稿としては、モデルの性能向上だけでなく、それを取り囲む評価と統制の仕組みが実務導入の鍵になっている点が示唆的だと考えています。
