はじめに
JetBrainsは2026年8月13日、Claude Fable 5の評価方法と結果を公開しました。非公開リポジトリやモノレポを使い、品質、速度、タスク単価を比較しています。本稿では性能差と、企業が新モデルを本番展開するときの評価・安全対策を整理します。
参考記事
- タイトル:Securing the frontier: How JetBrains evaluates and deploys Claude Fable 5
- 著者:Anthropic
- 発行元:Anthropic
- 発行日:2026年8月13日
- URL:https://claude.com/blog/how-jetbrains-evaluates-and-deploys-claude-fable-5
関連記事


要点
- JetBrainsは公開ベンチマークではなく、非公開リポジトリとモノレポで品質、速度、タスク単価を測定している
- Python課題の合格率はFable 5が44.3%、Claude Opus 4.8が28.2%で、約16ポイントの差が確認された
- Fable 5はOpus 4.8より約22%少ない手順で課題を完了し、複雑な作業では高い単価を補う可能性がある
- モデルの挙動を弱めるのではなく、実行基盤とエージェントハーネス側に安全策を置く方針が採用されている
- 本番導入ではモデル性能だけでなく、データ保持、監査、権限、失敗時の停止条件を含む運用設計が必要である
詳細解説
実務と公開ベンチマークの差を埋める
JetBrainsはIntelliJ IDEAやPyCharm、Kotlinなどを提供し、1,250万人以上の利用者を抱える開発ツール企業です。同社は新モデルを評価するとき、公開ベンチマークの順位をそのまま採用判断には使いません。実際の製品で扱う非公開リポジトリや大規模モノレポを用い、課題を解けたか、必要な時間と手順はどの程度か、1タスク当たりの費用はいくらかを測ります。
AIコーディングでは、短い関数生成と大規模な改修で求められる能力が異なります。公開評価で高得点でも、社内のビルドシステム、独自フレームワーク、複雑な依存関係へ適応できるとは限りません。自社の代表的な仕事を課題セットにし、失敗の種類まで記録する方法が重要です。
Fable 5で確認された性能差
JetBrainsのPython課題では、Fable 5の合格率が44.3%、Claude Opus 4.8が28.2%でした。Fable 5はOpus 4.8が解けなかった18件を解決し、反対にOpus 4.8だけが解けた課題は2件でした。さらに、完了までの手順数は約22%少なかったとされています。
トークン単価が高いモデルでも、少ない試行で正しい結果へ到達すれば、タスク全体の費用は下がる場合があります。逆に、簡単な補完へ常に高性能モデルを使うと費用対効果は悪化します。JetBrainsが品質、速度、タスク単価を同じ画面で評価するのは、モデルを用途別に割り当てるためです。
得意な仕事と人の役割
Fable 5は、単発の修正だけでなく、要件を理解して設計を相談するような仕事に向くと評価されています。JetBrainsでは、リッチテキストエディタの実装をほぼ一度で仕上げた例や、アプリケーション、ランタイム、フレームワーク、言語にまたがる長時間の改修実験が紹介されました。
ただし、結果をそのまま本番へ反映するのではありません。モデルは候補を作成し、人が設計意図、互換性、テスト結果、運用影響を確認します。高性能モデルほど広い変更を提案できるため、変更範囲の上限や承認の場所を明確にする必要があります。
安全性を実行基盤で支える
JetBrainsは、危険な操作を避けるためにモデル能力を一律に弱めるのではなく、エージェントが動く基盤とハーネスへ安全策を置いています。権限を必要最小限にし、利用できるツールを制限し、実行ログを残し、異常時に停止できる構造です。白箱型のセキュリティテストにもFable 5を利用し、攻撃者が高度なモデルを使う状況を想定した防御準備も進めています。
データ保持については、原則として保持しない運用を望みつつ、重大な安全上のフラグが立った事例を限定的に確認する必要とのトレードオフも示されています。企業導入では「保存するか、しないか」だけでなく、何を、誰が、どの条件で、何日確認できるかを契約と運用の両面で決めることが大切です。
導入判断を継続的な評価にする
モデルは更新され、ハーネスやリポジトリも変化します。一度の比較で恒久的な採用モデルを決めるのではなく、代表課題を定期実行し、品質、費用、速度、安全性の変化を追う必要があります。JetBrainsが目指すのは、人が複数のエージェントを管理し、開発全体を協働して進める「コックピット」です。その実現には、どのモデルがどの仕事で価値を出したかを説明できる評価基盤が欠かせません。
まとめ
JetBrainsの事例で重要なのは、自社課題で品質、速度、費用を測る仕組みです。実行基盤へ安全策を置き、人の承認を残すことで、モデルの能力を実務へ接続しています。新モデルの導入は製品選定だけでなく、継続的な評価と運用設計の更新として捉える必要があります。
