はじめに
GitHubが2026年6月25日、GitHub Copilotのアジェンティックハーネスについて、複数のベンチマークにおける性能とトークン効率の評価結果を公開しました。本稿では、その内容をもとに、ハーネスの設計思想・ベンチマーク結果・マルチモデル対応の仕組みを解説します。
参考記事
- タイトル: Evaluating performance and efficiency of the GitHub Copilot agentic harness across models and tasks
- 著者: Shibani Basava / Carlos Castro
- 発行元: GitHub Blog
- 発行日: 2026年6月25日
- URL: https://github.blog/ai-and-ml/github-copilot/evaluating-performance-and-efficiency-of-the-github-copilot-agentic-harness-across-models-and-tasks/
関連記事



要点
- GitHub Copilotのアジェンティックハーネスは、SWE-bench Verifiedをはじめとする5つのベンチマークで、Claude Code・Codex CLIなどモデルベンダー提供のハーネスと同等のタスク解決率を達成している
- タスク解決率が同水準でありながら、多くの設定でトークン消費量が競合より少ない結果が示されている
- 評価対象モデルはClaude Sonnet 4.6・Claude Opus 4.7・GPT-5.4・GPT-5.5の4種で、ハーネスを固定したうえで各モデルと比較している
- 単一ハーネスがGPT・Claude・Gemini・MAIファミリーを含む20以上のモデルに対応しており、タスクに応じてモデルを選択または自動選択できる
- TerminalBench 2.0の5回反復試験では、コスト・完了率ともに競合と同等以上の結果を示し、モデル間のトレードオフ(GPT系は低コスト、Claude Opusは高解決率)が可視化されている
詳細解説
ハーネスとは何か、なぜ重要か
AIコーディングエージェントの性能は、モデルの能力だけで決まるわけではありません。モデルに対してどのようなツール・コンテキスト・ワークフローを与えるかを制御する「ハーネス」の設計が、実際の成果に大きく影響します。
GitHubが提供するアジェンティックハーネスは、GitHub Copilot SDK の共通コンポーネントとして、GitHub Copilot CLI・Copilot app・Copilot コードレビューなど複数のサービスを横断して動作しています。つまりハーネスの改善は、これらすべての体験に波及する構造になっています。ハーネスに求められるのは「速さ・トークン効率・予測可能な動作」であり、今回の評価はその点を定量的に検証したものです。
5つのベンチマークと評価の設計
GitHubによれば、今回の評価では以下の5つのベンチマークが使用されています。
- SWE-bench Verified: オープンソースPythonリポジトリの500件のバグ修正タスク。コーディングエージェント評価の業界標準とされる指標です
- SWE-bench Pro: より難易度が高く、深い推論と広範なコード変更を要する多段階タスク
- SkillsBench: エージェントがスキルを使ってタスクを解決する能力を評価
- TerminalBench: ターミナルベースのタスクにおけるエージェント性能を測定
- Win-Hill: Windows コンテナ上での動作を検証するGitHub社内ベンチマーク
比較対象として、Claude Sonnet 4.6・Claude Opus 4.7にはClaude Code、GPT-5.4・GPT-5.5にはCodex CLIが使用されています。コンテキストウィンドウのサイズ・推論努力・ツール設定・MCPサーバーの有無を統一したうえで比較しており、ハーネスの差異のみを変数として切り出す設計です。
タスク解決率とトークン効率の結果
GitHubの発表によれば、タスク解決率はClaude Code・Codex CLIなどのベンダーハーネスと「実質的に同等(effective parity)」とされています。両者の差異はモデルの確率的な性質に由来するランツーランの分散の範囲内であり、統計的に有意な差はないとのことです。
注目すべきは、この同水準のタスク解決率を「より少ないトークン消費」で達成している点です。トークン消費はAPIコストに直結するため、チームでの継続利用や大規模な自動化を検討する際の実用的な指標になります。ただし、論文や公開ベンチマークの提出値とは条件が異なるため(GitHubの評価は推論努力「中」、ツール検索・MCP無効など)、数値を単純に他の報告と比較する際には注意が必要だと思います。
TerminalBench 2.0:繰り返し試験で見えた安定性
TerminalBench 2.0では各設定につき5回の試行が行われ、「タスク解決率(縦軸)」と「タスクあたりコスト(横軸)」の散布図として結果が可視化されています。上左に位置するほど「より多く解いて、より安く」を意味します。
GitHubの分析によれば、3つの傾向が読み取れます。第一に、GitHub Copilot(紫のマーカー)は競合と比べてタスク完了率・コストともに同等以上の位置に収まっており、劣後する設定は見られませんでした。第二に、各設定にはランツーランの分散(±1σ)が可視化されており、再現性の高い設定と変動が大きい設定の違いを確認できます。第三に、モデル間のトレードオフが明確で、GPT系モデルは低コストで安定した解決率を示し、Claude Opusは最高解決率をより高いコストで達成しています。GitHub Copilotはその両方を同一ハーネスで利用できる点が差別化要素として挙げられています。
マルチモデル対応の設計と「Rubber Duck」機能
サブエージェントの委任戦略に関する最適化など、ハーネスレベルの取り組みが続いていますが、今回の発表でも注目点はマルチモデル対応の設計にあります。
GitHub Copilotのハーネスは、GPT・Claude・Gemini・MAIファミリーを含む20以上のフロンティアモデルに加え、独自のAPIキーを使ったオープンソース・ローカルモデルにも対応しています。タスクごとにモデルを選択するか、「Auto model selection」機能によってタスクの意図とモデルの状態を踏まえた自動選択も可能です。
また、「Rubber Duck」という機能では、異なるモデルファミリー間でのクロスモデルクリティーク(一方のモデルがもう一方の出力をレビューする仕組み)が実装されており、単一モデルだけでは得られない精度改善が期待できると説明されています。単一ベンダーのハーネスでは実現が難しいアーキテクチャだと思います。
まとめ
GitHubのアジェンティックハーネスは、5つのベンチマークでClaude Code・Codex CLIと同等のタスク解決率を示しつつ、多くの設定でトークン効率に優位性があることが示されました。20以上のモデルを単一ハーネスで扱える柔軟性は、コストと品質のバランスを実務に合わせて調整したい場面で実用的だと思います。今後の改善の継続にも注目したいところです。
