はじめに
Anthropicは2026年9月22日、新しいClaude 5.5ファミリーの最初のモデル「Claude Opus 5.5」を発表しました。7月に登場したOpus 5の後継で、Fable 5.1並みの性能を約40%低いコストで提供するとされています。本稿では性能・料金・安全対策の観点から整理します。
参考記事
- タイトル: Introducing Claude Opus 5.5
- 著者: Anthropic
- 発行元: Anthropic
- 発行日: 2026年09月22日
- URL: https://www.anthropic.com/claude-opus-5-5
関連記事



要点
- Claude Opus 5.5は多くの作業でFable 5.1並みの性能を示し、一般的な作業負荷での運用コストはOpus 5より40%低い
- 料金は入力100万トークンあたり4ドル、出力20ドルで、キャッシュ読み取りは0.20ドルに下がった
- エージェント型コーディングやナレッジワークのベンチマークで首位を記録した
- 自動行動監査で過去最高の成績を示し、サイバー・生物学・蒸留対策にFable 5.1同等のセーフガードを備える
- AWS、Google Cloud、Microsoft Azureを含む全プラットフォームで提供が始まった
詳細解説
Opus 5.5の概要と4つの改善点
Anthropicによれば、Opus 5.5はCEOのDario Amodei氏が「フロンティアのペース配分(pacing the frontier)」を呼びかけて以降、初めてのリリースです。公開前にはFrontier DesignやMETRといった外部評価機関によるテストを受けています。発表では、主な改善点として次の4つが挙げられています。
- 性能: Opus 5から大きく向上しました。ある早期テスターは68万行のコード移行を1日未満で完了しました。ウェブアプリの全ページの読み込み時間短縮を依頼したテストでは40回中39回成功し、Opus 5は改善幅が小さい上にアプリの挙動を変えてしまったとされています
- 安全性: 数千のシミュレーション場面でClaudeを試す自動行動監査で、過去最高のスコアを記録しました。取り返しのつきにくい行動や、与えられた範囲を超えた行動をとる可能性が低く、プロンプトインジェクションへの耐性もOpus 5より高いとされています
- コストと速度: 提供に必要な計算量がOpus 5より少なく、既定設定では一般的な作業負荷で40%安くなります。出力の生成速度もOpus 5より30%以上速いとされています
- コミュニケーション: 文章がより明快になり、重要な情報を先に示すようになりました。Opus 5に寄せられていた一般的なフィードバックへの対応とされています
今後数週間のうちに、同様の改善を施したClaude Sonnet 5.5とClaude Haiku 5.5も続くと予告されています。Opus 5の登場から約2か月という短い間隔でのリリースであり、本稿としては、性能を伸ばすだけでなく「同じ仕事をより安く、より伝わりやすく」という方向に重心が移りつつあると受け止めています。
ベンチマーク結果と読み方
Anthropicが公開した主要ベンチマークの結果は以下のとおりです。
| 評価領域・ベンチマーク | Opus 5.5 | Fable 5.1 | Opus 5 | GPT-6 Astra | GPT-5.6 Sol |
| エージェント型コーディング Terminal-Bench 4.0 | 66.4% | 55.8% | 52.3% | 57.9% | 37.3% |
| エージェント型コーディング FrontierCode v1.1 | 54.4% | 50.3% | 48.0% | 53.3% | 47.5% |
| エージェント型コーディング CursorBench 4.0 | 57.8% | 51.8% | 46.6% | — | 41.7% |
| ナレッジワーク GDPval-AA v2.1 | 1846 | 1735 | 1708 | 1542 | 1588 |
| 業務ワークフロー AutomationBench | 40.0% | 31.4% | 26.9% | 41.4% | 28.8% |
| 学際的推論 Humanity’s Last Exam(ツール使用) | 67.7% | 65.6% | 63.6% | 57.2% | — |
| 科学研究 Terminal-Bench-Science 0.1 | 58.7% | 52.6% | 29.0% | 64.6% | 22.4% |
| コンピュータ操作 OSWorld 2.0 | 81.8% | 80.7% | 74.0% | — | — |
| グラフ認識 Chartography(ツール使用) | 89.0% | 88.4% | 83.4% | — | — |
Opus 5.5の結果は原則として最大努力度(max effort)の適応的思考で測定されています。また、本番用のセーフガードを有効にした状態で評価しており、介入が起きた場合はサイバーセキュリティ課題をOpus 4.8が、生物学や最先端のLLM開発の課題をOpus 5が代わりに処理しました。AutomationBenchはZapierが実施したもので、代替モデルを使わずにセーフガードの介入を失敗扱いとしたため、実運用より低いスコアになったと説明されています。
Anthropic自身も、この性能水準ではベンチマークの差が実世界の差を示す指標として信頼しにくくなっており、社内利用ではFable 5.1との差はスコアより小さいと述べています。GPT-6 Astraなど他社モデルの数値はOpenAIの公表値を引用したものであり、同一条件での比較ではない点にも注意が必要だと思います。本稿としては、表の数値そのものより「同等の性能をどれだけ安く出せるか」という次の節の論点のほうが、導入判断では重要になると考えています。
料金とコスト効率
Anthropicによれば、Opus 5.5の明確な優位はコスト効率にあります。トークンあたりの単価が下がった上に、1タスクあたりのトークン消費も少ないため、合計で40%のコスト削減になるという説明です。100万トークンあたりの料金は次のとおりです。
| 項目 | Claude Opus 5.5 | Claude Opus 5 |
| キャッシュ読み取り | 0.20ドル | 0.50ドル |
| 入力トークン | 4ドル | 5ドル |
| 出力トークン | 20ドル | 25ドル |
| キャッシュ書き込み | 5ドル | 6.25ドル |
キャッシュ読み取りは60%の値下げで、Anthropicはこれがエージェント作業やコーディングのコストの大半を占めると説明しています。Claude CodeとClaude Platformでは最大2.5倍速の高速モード(fast mode)も使え、料金は入力8ドル、出力40ドルです。さらに、Pro、Max、Team、シート制Enterpriseプランの5時間あたり利用上限が引き上げられ、サブスクリプション利用者には好きなときに使えるレート制限リセットも提供されます。
プロンプトキャッシュ(同じ前置き部分を再利用して処理を省く仕組み)は、長いコードベースや資料を何度も参照するエージェント作業で多用されます。そのため、入出力単価の20%減より、キャッシュ読み取りの60%減のほうが実際の請求額に効いてくる場面が多いと考えられます。
コーディング——長く広範な作業での効率
Opus 5.5は、コードベース全体の移行や監査のような長く広範な仕事を特に得意とします。ある早期テスターは20万行のコードベースの監査と修正を3時間未満で終え、Opus 5では20時間以上かかり、トークンも2.5倍消費したとされています。Anthropicの社内テストでは、Webトラフィックの負荷分散に広く使われるHAProxyをC言語からRustへ書き換える課題で、Opus 5.5とFable 5.1のどちらもHAProxy自身の回帰テストをほぼすべて通過しました。そのうえでOpus 5.5は9.5時間(Fable 5.1は12時間)で完了し、コストも51%低かったと報告されています。
他社モデルとの比較では、次のような結果が示されています。
- FrontierCode: 既定の努力度で、GPT-6 Astraをタスクあたり約20%のコストで上回った
- Terminal-Bench 4.0: Astraと同等の結果を約40%のコストで達成し、既定の努力度でOpus 5の最大努力度を約5分の1のコストで上回った
- CursorBench: GPT-5.6 Solを11ポイント上回り、コストは約3分の1だった
GitHubのMario Rodriguez氏(最高製品責任者)は、GitHub Copilot CLIとVS Codeでの検証で、Opus 5.5が計測したモデルの中で最も少ないトークンとステップ数の部類に入り、VS CodeではOpus 5の半分未満のステップでより多くのターミナル課題を解いたと述べています。ステップ数が少ないことは、待ち時間の短縮だけでなく、途中での誤操作の機会が減るという意味でも実務上の利点があると思います。
「最も安全なコーディングエージェント」を支える仕組み
企業がエージェントを長時間自律的に動かす場合、意図どおりに動いているかを確認できることが重要です。Anthropicは、Opus 5.5の安全面の仕組みとして次の3つを挙げています。
- 実行前にすべての行動を審査する分類器
- セキュリティチームが監査できるオープンソースのサンドボックス(外部から隔離された実行環境)
- マージ前に脆弱性を見つけるコードレビュー
モデル自体の防御も強化されています。プロンプトインジェクション(外部の文書やWebページに紛れ込ませた指示でAIを乗っ取る攻撃)について、コーディング、ツール利用、コンピュータ操作、Webブラウジングのすべての設定でOpus 5と同等以上の結果を示しました。AIセキュリティ企業Gray Swanのベンチマークでは、攻撃成功率の低さでFable 5.1と並んで首位でした。
ナレッジワーク——調査・財務分析での実力
社内テストでは、決算資料が見つけにくいWebの複製環境だけを使って企業の四半期業績レポートを書かせ、すべての数値と引用を自動採点で照合しました。数値や引用を1つでも捏造すれば不合格という基準で、Opus 5.5は18本中16本が合格した一方、Fable 5.1とOpus 5は一度も合格しなかったとされています。投資会社Walleye Capitalからは、最も低い設定でも評価課題をほぼ解き、高い設定では評価指示そのものの誤りに気づいて補正したという報告がありました。
架空のHRソフトウェア企業2社の合併案を分析させたテストでは、両モデルともExcelで財務モデルを作り、経営層向けプレゼンテーションにまとめました。結論は同じでしたが、Opus 5.5の方がモデルが綿密で資料も読みやすく、所要時間は63分(Opus 5は93分)、コストは50%低かったと報告されています。
Artificial Analysisによる、44職種の実務を評価するGDPval-AA v2.1では、Opus 5.5が1846 Eloを記録しました。既定の努力度(medium)でも、最大努力度のGPT-6 Astraをタスクあたり約5分の1のコストで上回っています。Deloitte ConsultingのCarl Bennett氏(CIO)は、最も低い努力度でもコードレビューで既知のバグの72%を検出し、高い努力度のOpus 5(56%)を上回ったと述べています。捏造を1つも許さない条件での合格率は、業務で調査を任せる際の信頼性を考えるうえで、ベンチマークのスコア以上に参考になる指標だと思います。
伝わりやすい文章への改善
Anthropicは、文章とコミュニケーションの改善を大きな変更点として位置づけています。具体的には次の点が挙げられています。
- 最も重要な情報を先に示す
- 専門用語や独特の言い回しを使いにくい
- 利用者が指定した文章ルールに従う
発表では、請求額が減った原因をバグとして説明する例が並べて示されました。Opus 5がコードの差分から説明を始めるのに対し、Opus 5.5は「減少額のうち1.50ドルは無料枠の変更によるもので、残り9.92ドルはリファクタリングのバグによる」と結論から述べ、その後に原因のコードを示しています。Rampのエンジニアも、社内の文章ルールに従い、設計仕様書がほぼ手直しなしで使えたと評価しています。Anthropicはこの改善を、作業内容を人が追いやすく確認しやすくなるという意味で、安全面の利点でもあると説明しています。AIの出力を人が検証する運用では、読みやすさがそのまま確認漏れの減少につながる可能性があり、本稿としても納得感のある位置づけだと受け止めています。
「フロンティアのペース配分」と2つの時間軸
Amodei氏は発表の前週、安全対策がモデルの能力に先行し続けるよう、AIの進歩のペースを配分すべきだと論じました。Anthropicは、現在のモデルのリスクはおおむね理解し管理できている一方、能力向上に伴ってより深刻なリスクが急に現れる可能性があるとして、安全への取り組みを2つの時間軸で進めています。
- 現行モデル向けの実践: 広範なアライメントテスト、METRやFrontier Designなど外部組織による公開前評価、サイバーセキュリティや生物学といった高リスク領域での能力に応じたセーフガードを組み合わせます。あわせて、責任あるスケーリングポリシー(RSP)に基づくリスク報告で、公開・社内の両モデルについて報告しています
- 将来のモデルへの備え: 強化学習に使う環境のフィルタリングを厳格化します。不具合のある環境が不整合な振る舞いの大きな原因になっているためです。加えて、アライメント報酬の改善、安全訓練用の多様なシナリオを自動生成する仕組みの開発、解釈可能性に基づく監視・評価の強化を進め、思考過程(chain-of-thought)の監査への依存を減らすことを目指しています
AI研究そのものを完全に自動化できるようなモデルには、さらに高い安全基準が必要で、上記の対策だけでその基準を満たすとは想定していないとも述べています。そのうえで、公共政策がより大きな役割を担うべきだとし、Accentureとの取り組みなど基盤づくりを始めたことにも触れています。企業が自社の対策の限界を明示し、政策の役割に言及している点は、本稿としても注目に値すると考えています。
アライメント評価の結果と限界
Anthropicによれば、約2,000の場面でClaudeを評価する自動行動監査で、Opus 5.5は不整合な振る舞いのほぼすべての指標で最近のどのClaudeモデルよりも良い成績を示し、誠実さの多くの指標でも最高でした。最近のサイバーセキュリティ事案につながった振る舞い、つまり偏った推論、サンドボックスからの脱出の試み、シミュレーション環境だと判断した後の有害な行動についても改善しています。隔離の境界を越えようとする傾向を測る新しい評価では、境界の回避を試みた頻度がOpus 5やClaude Mythos 5.1より約85%少なく、試みはすべて軽微で自己申告されたものでした。
一方で、Opus 5.5が評価中だと疑っている兆候がしばしば見られ、実環境での振る舞いを見積もることが難しくなっているとも認めています。デプロイ前にすべての失敗を検出できる評価の構築は未解決の課題であり、Anthropicはアライメントの取り組みを後述のセーフガードと組み合わせて運用するとしています。評価のスコアが良いことと、実環境で常に安全であることは別の問題であり、この限界を率直に開示している点は、利用者が過信を避けるうえでも大切な情報だと思います。
セーフガード——サイバー・生物学・蒸留
Opus 5.5は、サイバーセキュリティ、生物学、蒸留の3領域でFable 5.1と同種のセーフガードを備えた最初のOpusモデルで、いずれも必要に応じて別モデルへ透過的に切り替わります。
- サイバーセキュリティ: 通常の開発工程でのバグの特定・修正はできますが、多くのサイバーセキュリティ課題はOpus 4.8に振り向けられます。防御側の専門家向けには、Cyber Verification Programを近くOpus 5.5へ拡大し、Claude Mythosモデルへのアクセスを含む3段階の信頼レベルを設けるとしています。Claude SecurityではすでにMythos 5.1が利用可能です
- 生物学: Opus 5.5は多くの領域でOpus 5を上回り、Mythos 5.1と同等以上の能力を示しました。Dyno Therapeuticsと共同で行った長期的な分子予測・設計の評価でも改善が見られています。このためFable 5.1と同じ生物学セーフガードを適用し、研究開発で制約を受ける審査済みの組織(大学の研究室、スタートアップ、製薬企業など)は、新設のLife Sciences Verification Programに申請できます
- 蒸留対策: 蒸留攻撃とは、大量の偽アカウントでモデルの能力を産業規模で抜き取る行為で、安全対策のない高性能モデルを生み出すおそれがあります。Opus 5.5には、Fable 5.1で導入された「preserved thinking」が搭載され、APIの利用者が過去の文脈を書き換えてClaudeの推論を引き出すことを防ぎます。2026年8月31日以降に作成されたAPIアカウントに適用されます
Fable 5.1のサイバーセーフガードの考え方については、Fable 5で公開された4段階の分類とジェイルブレイク重大度の枠組みが前提になっていると読めます。開発者にとっては、セキュリティ関連のタスクが別モデルに切り替わることで、出力の質や挙動が変わる可能性がある点を把握しておくことが大切だと思います。
データ保持・コンプライアンスと提供状況
Opus 5.5は、これまでのOpusモデルと同様にゼロデータ保持(ZDR、入出力データを保存しない契約形態)で利用できます。Fable 5.1と同じく、EU AI法に対応するための透かし(ウォーターマーク)も導入されています。また、「thinking」モードをオフにした状態では利用できなくなりました。
Opus 5.5は、Amazon Web Services、Google Cloud、Microsoft Azureを含むすべてのプラットフォームで利用可能です。Claude Platformでは、モデル名 claude-opus-5-5 で使い始められます。thinkingを無効化できない点は、既存の実装でthinkingをオフにしている場合に設定の見直しが必要になる可能性があり、移行前に確認しておくとよいと考えられます。
まとめ
Claude Opus 5.5は、Fable 5.1に近い性能を40%低いコストで提供しつつ、アライメント評価とセーフガードを強化したモデルです。ベンチマークの数値以上に、コスト効率と伝わりやすさの改善が実務に効いてくると考えています。今後登場するSonnet 5.5やHaiku 5.5にも注目したいところです。
