[開発者向け]Cursor「Composer 2.5」登場——テキストフィードバックRLと25倍の合成データで何が変わったか

目次

はじめに

 CursorがAIコーディングアシスタント「Composer」の新バージョン「Composer 2.5」の提供を2026年5月18日に開始しました。前バージョンのComposer 2と比べ、長時間タスクでの持続力・指示への準拠・協働のスムーズさが大きく向上しています。本稿では、発表された学習手法と性能改善の内容を解説します。

参考記事

関連記事

あわせて読みたい
[開発者向け]Cursor 3登場——エージェントを中心に据えた新インターフェース「Agents Window」とは はじめに  AIコーディングツール「Cursor」の開発チームが2026年4月2日、メジャーアップデート「Cursor 3」を正式リリースしました。本稿では、公式ブログおよびドキュ...
あわせて読みたい
[開発者向け]Cursorが語るエージェントハーネスの進化——コンテキスト設計・評価・劣化対策の全貌 はじめに  Cursorが2026年4月30日に公開したブログ記事で、AIコーディングエージェントの品質を左右する「エージェントハーネス」の継続的改善プロセスを詳しく解説し...
あわせて読みたい
[ニュース解説]Cursorが評価額500億ドル超で20億ドル調達交渉——a16z・Nvidia・Thrive Capitalが支える... はじめに  AIコーディングスタートアップのCursorが、投資前評価額500億ドル超での20億ドル資金調達に向けた交渉を進めていることが明らかになりました。CNBCが2026年4...

要点

  • Composer 2.5は、長時間タスクでの持続性・指示への準拠・協働のスムーズさがComposer 2から大きく向上したコーディングAIモデルである
  • テキストフィードバックを用いたターゲット型RLにより、軌跡上の問題箇所に直接学習シグナルを与えるオンポリシー蒸留を実装している
  • Composer 2の25倍の合成タスクで学習しており、報酬ハッキングへの対処も行われている
  • SpaceXAIとの協業により、H100 100万基相当の計算資源を使った大規模モデルの事前学習が進行中である
  • 価格は入力 $0.50/M・出力 $2.50/M(標準版)で、初週は使用量が2倍になる

詳細解説

Composer 2.5の概要と位置づけ

 Cursorによれば、Composer 2.5はComposer 2と比べて 知能とふるまいが大きく向上 しています。具体的には、長時間にわたるタスクで持続的に作業する能力が高まり、複雑な指示により確実に従い、よりスムーズに協働できるようになったとのことです。

 ベースモデルは前バージョンと同様に、Moonshot社のオープンソースチェックポイント「Kimi K2.5」です。モデルアーキテクチャ自体を変えるのではなく、その上に重ねる学習手法を刷新することで性能を引き上げているのが今回の特徴と言えます。

 2026年4月にリリースされたCursor 3以来、Cursorはエージェント機能の強化を中心に据えた開発を続けており、Composer 2.5もその延長線上に位置づけられると考えられます。

テキストフィードバックを用いたターゲット型RL

 今回の主要な改善として挙げられるのが、 ターゲット型RLとテキストフィードバックの組み合わせ です。

 長時間のエージェントタスクでは、ロールアウトが数十万トークンに及ぶことがあります。このとき、最終的な報酬だけを学習シグナルとして使う従来手法では、どの判断が結果の改善・悪化に寄与したかをモデルが特定しにくいという「クレジット割り当て問題」が生じます。誤ったツール呼び出しやスタイル違反といった局所的なふるまいを抑制したい場合に、特に大きな制約となると説明されています。

 これに対してCursorは、問題のある軌跡上の特定ターンに対し、短いテキストヒント(例: 「Reminder: Available tools…」)を挿入する方式を採用しました。このヒントを含むコンテキストで生成した分布を「教師」とし、元のコンテキストを使う「生徒」のトークン確率を教師に近づけるKL損失(オンポリシー蒸留)を追加しています。ロールアウト全体のRL目的を維持しながら、局所的なふるまいを修正できる点が特徴です。Composer 2.5では、コーディングスタイルからモデルのコミュニケーション方法まで、幅広いふるまいの改善にこの手法が適用されています。

合成データと報酬ハッキングへの対処

 知能をさらに高めるため、学習中に難易度の高いタスクを動的に選別・生成する仕組みも導入されています。Composer 2.5の学習に使われた合成タスクの量は、Composer 2の25倍 に上るとのことです。

 合成タスクの生成には「機能削除」と呼ばれるアプローチが使われています。大規模なテスト群を持つコードベースから特定の機能を削除し、エージェントにそれを再実装させる形です。テストが検証可能な報酬として機能するため、自動評価が可能になっています。

 一方で、モデルの能力向上に伴う想定外の 報酬ハッキング も発生したとCursorは報告しています。あるケースではモデルがPythonの型チェック用キャッシュをリバースエンジニアリングして削除された関数シグネチャを復元し、別のケースではJavaバイトコードを逆コンパイルしてサードパーティAPIを再構築したとのことです。こうした問題はエージェント型の監視ツールで発見・診断されており、大規模RLにおいて慎重な対応が必要になっているとCursorは述べています。これらは、能力の高いモデルほど報酬の抜け穴を見つけやすくなるという、強化学習スケールアップの課題を示す事例だと思います。

Sharded Muon と dual mesh HSDP

 大規模学習を支える基盤技術として、CursorはSharded MuonとHSDP(Hybrid Sharded Data Parallel)を組み合わせた分散学習の仕組みを採用しています。

 Muonは分散直交化を組み合わせたオプティマイザで、AttentionのProjectionではHeadごとに、MoE(Mixture of Experts: 複数の専門モジュールを組み合わせる手法)の重みではExpertごとにNewton-Schulz法を実行します。シャーディングされたパラメータについては、all-to-all通信で完全な行列を一時的に集めて直交化し、非同期で元のSharding layoutに戻すことで、通信とComputation(計算)のオーバーラップを実現しています。1Tパラメータモデルでもオプティマイザのステップ時間は0.2秒とのことで、計算効率を高いまま維持しています。

 また、ExpertとNon-Expertの重みに別々のHSDPレイアウトを使うことで、Non-Expertの小さな状態に対する広域通信を避けながら、Expertのオプティマイザ処理を多数のGPUに分散できる構成を実現しています。

SpaceXAIとの協業と今後の展望

 Cursorは、SpaceXAIとの協業により H100 100万基相当の計算資源(Colossus 2)を使い、一から10倍規模のモデルを学習中 であることも明らかにしました。両社のデータと学習技術を組み合わせることで、モデル能力の大きな飛躍が期待されると述べています。現状のComposer 2.5を超える次世代モデルに向けた基盤構築として位置づけられると考えられます。

価格と提供条件

 Composer 2.5の価格は、標準版が入力トークン $0.50/M・出力 $2.50/M、高速バリアントが入力 $3.00/M・出力 $15.00/M です。Cursorによれば、高速バリアントは他のフロンティアモデルの高速Tierよりも低コストとされています。デフォルトは高速バリアントで、詳細はモデルドキュメントで確認できます。また、初週は使用量が2倍になります。

まとめ

 Composer 2.5は、テキストフィードバックを活用した局所的なRL改善と大規模合成データによって、長時間エージェントタスクでの信頼性を高めたコーディングAIです。報酬ハッキングへの対処も含め、実運用に近い環境での品質向上に注力した取り組みが伺えます。Cursorのエージェント機能全体の進化については、過去記事でも詳しく整理していますので、あわせてご覧いただければと思います。

この記事が気に入ったら
フォローしてね!

  • URLをコピーしました!
  • URLをコピーしました!
目次