[開発者向け]Claude Opus 5.5は長いコーディングセッションでなぜ安いのか——キャッシュ値下げと3つの仕組み

目次

はじめに

 Anthropicは2026年9月24日、Claudeの公式ブログで、Claude Opus 5.5が長く文脈の多いコーディングセッションでコストを抑えられる仕組みを解説しました。本稿では、Claude Codeの利用傾向データと、料金・ハーネス・モデル挙動の3つの変化、キャッシュを守る実践のコツを整理します。

参考記事

メイン記事:

関連情報:

関連記事

あわせて読みたい
[開発者向け]Claude Codeのセッションはなぜコストが変わるのか——トークン消費を抑える6つのコツ はじめに  Anthropicは2026年8月14日、公式ブログで「Maximizing the value of your Claude Code sessions」を公開しました。同じタスクでも進め方によってトークン消...
あわせて読みたい
[ニュース解説]Claude Opus 5登場——Fable 5に迫る性能を半額程度で、Claude Max・Proの新標準に はじめに  Anthropicは2026年7月24日、新モデル「Claude Opus 5」を発表しました。Opus 4.8の後継モデルにあたり、同社の最上位モデルFable 5に迫る性能を、半額程度の...
あわせて読みたい
[開発者向け]「短くする」ではなく「終わらせる」——GitHub Copilotのコスト最適化に学ぶ はじめに  GitHubは2026年9月2日、AIコーディングエージェント「GitHub Copilot」において、タスクの完了品質を落とさずにコストを抑えるための4つの改善を公開しまし...

要点

  • 2026年3月から9月にかけて、Claude Codeの1リクエストあたりの文脈量は2.6倍に増え、入出力トークン比は189:1から324:1に変化した
  • Opus 5.5は入出力トークンを20%、キャッシュ読み取りを60%値下げした
  • Claude Code側の改善により、キャッシュを外れる入力は50%以上減少した
  • 自由度の高い難しいタスクほど、Opus 5.5はターン数を減らしてコストを抑えられる可能性がある
  • /usage でキャッシュ読み取りの割合を確認し、それを守る3つの習慣が推奨されている

詳細解説

前提: プロンプトキャッシュとは

 本題に入る前に、用語を整理しておきます。プロンプトキャッシュ(prompt caching)とは、直前のリクエストと先頭部分が同じ入力を再利用し、処理と課金を軽くする仕組みです。Claude Codeでは、システムプロンプト、ツール定義、それまでの会話履歴といった「毎回ほぼ同じ前置き」がキャッシュの対象になります。

 キャッシュには有効期限(TTL: Time To Live)があり、期限が切れたり、前置き部分が途中で変わったりすると「キャッシュミス」となって、文脈全体を通常料金で読み直すことになります。以下の話はすべて、このキャッシュをいかに安く、いかに外さずに使うかという観点でまとめられています。

Claude Codeの利用傾向——Claudeは「長く、多く読む」ようになった

 Anthropicは、2026年3月から9月までのClaude Codeの集計データを公開しました。セッションあたりのプロンプト数はほぼ横ばいでしたが、次のような変化が見られたとしています。

  • 1つのプロンプトあたりのClaudeの作業時間が3.3倍に伸び、モデル呼び出し回数は40%以上増えた。一方で、開発者による中断は68%減った
  • ツールサーバー(MCPサーバーなど、外部ツールをClaudeにつなぐ仕組み)の接続やスキルの利用が約2倍に増え、プロンプトへのテキスト貼り付けは3分の1ほど減った
  • 1リクエストあたりの文脈量は2.6倍に増え、入力と出力のトークン比は189:1から324:1に変化した

 Anthropicは、開発者がより大きく自由度の高いタスクに、より多くの情報を持たせたClaudeを向けていると読み取っています。つまり、Claudeが読むトークンが増えているため、渡す文脈が本当に必要なものかを見直し、できるだけ多くをキャッシュから読ませることが重要になるという説明です。

 入出力比324:1という数字は、出力1トークンに対して324トークンを読んでいることを意味します。本稿としては、コーディングエージェントのコストはもはや「何を書かせるか」より「何を読ませるか」で決まる段階に入っていると受け止めています。

変化1: キャッシュが安くなった

 Opus 5.5が長く文脈の多いセッションで有利になる理由として、Anthropicは料金、Claude Codeのハーネス(モデルを動かす周辺の仕組み)、モデルの挙動という3つの変化を挙げています。

 1つ目は料金です。トークン単位で課金される利用では、入出力トークンを20%、キャッシュ済みトークンの読み取りを60%値下げしました。Anthropicによれば、キャッシュ読み取りはエージェント作業やコーディングのコストの大半を占めています。Opus 5.5の発表記事によれば、100万トークンあたりのキャッシュ読み取り料金は0.50ドルから0.20ドルに下がりました。

 文脈量が半年で約2.6倍に増えているため、同じ値下げでも、半年前より今のClaude Codeの利用でより大きな節約になるとAnthropicは説明しています。請求額のうち、読み直される文脈の占める割合が増えているためです。また、公開時点では、Opus 5.5のキャッシュ済みトークンの価格は競合モデルの5分の1で、性能はそれらを上回っているとしています。ただし、競合比較はAnthropic自身による比較であり、利用するモデルやプランの条件によって差は変わると考えられます。

変化2: Claude Codeがキャッシュをうまく使えるようになった

 2つ目はOpus 5.5固有というより、過去半年間にClaude Codeへ加えられた機能の成果です。セッションが長くなり、文脈が増えればキャッシュミスも増えると予想されるところですが、実際にはキャッシュを外れる入力は50%以上減ったとされています。改善点は次のとおりです。

  • ログインの更新のような小さな操作で、意図せずキャッシュが壊れにくくなった
  • 会話の途中で指示を追加したり、ツールを必要に応じて読み込んだりする大きな操作でも、キャッシュが壊れにくくなった
  • Opus 5.5やFable 5.1などの新しいモデルでは、セッション中に努力度(effort)を変えてもキャッシュがリセットされなくなった
  • APIキーやクラウドプロバイダー経由の開発者も、1時間のキャッシュ有効期限を設定できるようになった(サブスクリプション利用者はすでに利用可能だった)
  • 分岐したサブエージェント(親から切り出された補助エージェント)が、同じ文脈に改めて課金せず、親のキャッシュから開始するようになった

 特にサブエージェントの改善は、タスクを複数のエージェントに分担させる使い方が広がるなかで、効いてくる場面が多いと思います。親と同じ前置きを何度も読み直すコストが省けるためです。

変化3: 同じタスクを少ないターンで終える

 3つ目はモデルの挙動です。Opus 5.5は、同じタスクをほかのモデルより少ないターンで終えられる場合があります。Zeta Labsの事例では、Opus 5よりタスクあたりのターン数とツール呼び出しが少なく、コストはほぼ半分で、最も難しいタスクの完了数は2倍になったと報告されています。

 ただし、Anthropicはこれがすべてのタスクに当てはまるわけではないとしています。関連記事「The cost of a task on Opus 5.5」でAddy氏は、範囲が明確なタスクでは両モデルのターン数はほぼ同じで、得られるのは値下げ分だけだと述べています。差が最も大きくなるのは、間違った方針に多くのターンを費やしうる自由度の高いタスクであり、どのコードベースにも当てはまる単一の数値はないので実際に測定してほしい、という趣旨です。

 Anthropicは、ターンを1回減らすことはトークンをキャッシュから読むことよりもさらにコスト効率が高いと説明しています。また、Opus 5.5の出力生成はOpus 5より30%以上速く、キャッシュヒット率やトークン量には影響しないものの、長時間の実行での待ち時間を短縮します。本稿としては、単純作業は値下げ分、探索的な作業はターン削減分と、タスクの性質によって効果の出どころが異なる点を押さえておくと、導入効果の見積もりがしやすくなると考えています。

実践: キャッシュ読み取りを守る3つの習慣

 Anthropicは、エージェント型コーディングが成熟するにつれて、組織の関心が「何としても規模を広げる」から「効率よく広げる」へ移っていると指摘しています。そのうえで、まずClaude Codeで /usage を実行し、利用量のうちキャッシュ読み取りがどれだけを占めるかを確認することを勧めています。

 /usage はターミナルのコマンドではなく、Claude Codeの対話画面で入力するスラッシュコマンドです。

# Claude Codeの入力欄で実行します(利用量の内訳を表示するコマンドです)
/usage

 確認した数値を守るための習慣として、次の3つが挙げられています。

  1. モデルはセッションの最初に選ぶ: 途中で切り替えない。キャッシュはモデルごとに保持されるため、切り替えると文脈を読み直すことになると考えられます
  2. 離席する前にコンパクト化する: 離席した後ではなく、前に行う。コンパクト化(compact)とは、会話履歴を要約して文脈を小さくする操作です
  3. 長いセッションでは1時間のキャッシュ有効期限を設定する: APIキーやクラウドプロバイダー経由で使う場合が対象です

 2つ目の習慣について補足すると、離席中にキャッシュの期限が切れると、戻った後の最初のリクエストで長い文脈全体を通常料金で読み直すことになります。先に要約して文脈を小さくしておけば、期限切れ後に読み直す量そのものを減らせるため、このような順序が推奨されていると考えられます。Claude Codeでは次のスラッシュコマンドで実行できます。

# 会話履歴を要約して文脈を圧縮するコマンドです(離席前に実行するのが推奨)
/compact

 3つ目の1時間キャッシュについて、参考記事ではClaude Codeのドキュメントへのリンクのみが示されています。以下は筆者が補足したサンプルで、動作は未確認です。Claude Platformのドキュメントでは、APIで直接呼び出す場合、cache_control に ttl を指定することで1時間の有効期限を選べると説明されています。

{
  "cache_control": { "type": "ephemeral", "ttl": "1h" }
}

 "ephemeral" はキャッシュの種類、"ttl": "1h" は有効期限を1時間にする指定です。既定値は5分です。

 注意: 同ドキュメントによれば、1時間キャッシュの書き込みは基本入力料金の2倍かかります。1回しか使わない短い処理に設定すると割高になるため、同じ前置きを1時間のうちに何度も読み直す長いセッションに限って使うのがよいと思います。Claude Codeでの具体的な設定方法(環境変数や設定ファイル)は、利用しているバージョンや契約形態によって異なる可能性があるため、公式ドキュメントのプロンプトキャッシュのページで確認してから設定することをおすすめします。

 トークン消費を抑える一般的な工夫については、Claude Codeのセッションコストが変わる理由と6つのコツも参考になると思います。

まとめ

 Opus 5.5のコスト効率は、キャッシュ読み取りの60%値下げ、Claude Codeのキャッシュ改善、ターン数の削減という3つの要素の組み合わせで生まれています。まずは /usage でキャッシュ比率を測ることから始めるのが現実的だと思います。前モデルOpus 5の特徴と比べてみるのもおすすめです。

この記事が気に入ったら
フォローしてね!

  • URLをコピーしました!
  • URLをコピーしました!
目次