はじめに
Anthropicは2026年9月28日、Claude 5.5ファミリーの2つ目のモデル「Claude Sonnet 5.5」を公開しました。Sonnet 5と同じ料金のまま出力が30%以上速くなり、1タスクあたりのコストは最大30%下がるとされています。本稿では、性能・料金・安全対策と、導入時の注意点を整理します。
参考記事
- タイトル: Introducing Claude Sonnet 5.5
- 著者: Anthropic
- 発行元: Anthropic
- 発行日: 2026年9月28日
- URL: https://www.anthropic.com/claude-sonnet-5-5
関連記事



要点
- Claude Sonnet 5.5はClaude 5.5ファミリーの2つ目のモデルで、Opus 5.5を補う高速・低コストのモデルと位置づけられている
- Terminal-Bench 4.0のスコアは70.6%で、Sonnet 5の10.3%から大きく向上している
- 料金はSonnet 5と同じ入力100万トークンあたり2ドル、出力10ドルで、出力速度は30%以上向上している
- Sonnetとして初めて、Opus 5.5と同様のサイバーセキュリティの安全対策と、推論の抽出を防ぐ分類器を備えている
- APIのモデル名はclaude-sonnet-5-5で、Haiku 5.5も今後数週間のうちに加わる予定である
詳細解説
Sonnet 5.5の位置づけ
Anthropicによれば、Sonnet 5.5はSonnet 5から明確に性能が上がり、30%以上高速で、多くの作業でコストが最大30%下がるモデルです。6月末に登場したSonnet 5の後継にあたり、6日前に公開されたOpus 5.5を補完する役割を担います。
Opus 5.5が慎重な判断を要する複雑な作業向けであるのに対し、Sonnet 5.5は範囲が明確な日常のタスク、バグ修正、見栄えのよい文書・スライド・表計算の作成を最も得意とします。デザインを見る目も鋭いとされています。大量処理やコスト重視の用途に向けたClaude Haiku 5.5も、今後数週間のうちにClaude 5.5ファミリーに加わる予定です。
Sonnet 5からの改善点として、Anthropicは次の5点を挙げています。
- 性能: エージェント型コーディングの評価Terminal-Bench 4.0で70.6%(Sonnet 5は10.3%)。さまざまな職種の実務を測るGDPval-AAではOpus 5.5に2ポイント差まで迫る。長時間の作業と画像理解にも強く、スクリーンショットだけを頼りに『ポケットモンスター 赤』をクリアした初のSonnetモデルとなった
- 協働: Opus 5.5と同様に前世代より文章が明快になり、早期テスターからはSonnet 5より協働の相手として優れているという声が上がった。速度の速さから、それほど複雑でないタスクを素早く繰り返す用途にも向いている
- コスト: 料金はSonnet 5と同じで、同じ作業に必要なトークンがはるかに少ない。Anthropicのテストでは、1タスクあたりのコストが前モデルより最大30%低かった
- 速度: 出力の生成がSonnet 5より30%以上速く、これまでで最も速いSonnetモデル
- アライメントと安全性: 自動の行動監査で、多くの指標においてSonnet 5と同等以上。サイバーセキュリティの能力がOpus 5に匹敵するため、最上位モデル向けと同様の安全対策を備えて公開された
ベンチマーク結果
Sonnet 5.5はあらゆる分野でSonnet 5を上回り、場合によっては大幅に改善しています。いくつかの評価では、最大エフォート(Max)のSonnet 5.5がOpus 5.5に匹敵する結果を示しました。Anthropicが公表した主なスコアは次のとおりです。
| 評価 | Sonnet 5.5 | Sonnet 5 | Opus 5.5 | GPT-6 Sol |
| Terminal-Bench 4.0(エージェント型コーディング) | 70.6% | 10.3% | 66.4%※1 | — |
| FrontierCode 1.1 Main(同上) | 46.2%(Max)/52.1%(Xhigh)※2 | 42.4% | 54.4% | 49.3% |
| CursorBench 4.0(同上) | 55.5% | 34.1% | 57.8% | — |
| GDPval-AA v2.1(知的業務) | 1844 | 1449 | 1846 | 1487 |
| AA-Briefcase v1.1(知的業務) | 1811 | 1359 | 1822 | 1483 |
| Humanity’s Last Exam(学際的推論、ツールあり) | 64.5% | 54.9% | 67.7% | — |
| OSWorld 2.1(コンピューター操作) | 80.1% | 57.0% | 81.8% | — |
| Chartography(グラフ読み取り、ツールなし) | 61.6% | 15.6% | 64.4% | 53.6% |
※1 Opus 5.5はXhighエフォートでの結果(同モデルの最高スコア)
※2 FrontierCodeは人の手直しなしでマージできる変更かを評価し、タスクの範囲外の変更には減点される。Maxでは、作業を多数のサブエージェントに分けるClaude Codeのコードレビュースキルをより多く実行し、タイムアウトや範囲外の編集につながったためXhighより低くなった
ただしAnthropicは、ベンチマークのスコアはモデルの能力の一面しか捉えておらず、自社と外部のテストでは、持続的な判断を要する複雑で自由度の高い作業ではOpus 5.5が明らかに強いままだとしています。
また、Artificial AnalysisがGDPval-AAとAA-Briefcaseを実施したのは公開前の環境で、構造化出力を使うリクエストの応答が劣化しうる不具合があったとされています(すでに修正済み)。GPT-6 Solについても、画像理解を劣化させる不具合がOpenAIによって最近修正されており、一部のスコアが最新版を反映していない可能性があると注記されています。
表のうち、Terminal-Bench 4.0でSonnet 5.5がOpus 5.5を上回っている点は目を引きますが、Opus 5.5の値はXhighでの結果と注記されています。本稿としては、エフォートの条件がそろっているかどうかも含めて読む必要があり、「SonnetがOpusを超えた」と単純に受け止めるのは慎重であるべきだと考えています。
エフォートごとのコストと性能
公式ページには、各モデルのスコアをエフォートごとの1タスクあたりのコストに対してプロットしたグラフが掲載されています。エフォートを上げるとモデルは長く作業するため、1タスクあたりのコストは上がりますが、スコアも上がるのが一般的です。グラフの左上に近いほど、1ドルあたりの能力が高いことを示します。
Anthropicによれば、いくつかのベンチマークでは、LowまたはMediumのSonnet 5.5が、Sonnet 5の最高スコアを約10分の1のコストで上回りました。たとえばTerminal-Bench 4.0では、ClaudeアプリのデフォルトであるMediumで、Sonnet 5の最高スコアを大きく上回り、1タスクあたりのコストは10分の1未満です。Sonnet 5.5は低いエフォート設定で1タスクあたりのコストが安くなる場面で、Opus 5.5を最もよく補完します。高い設定では、同程度のコストで同程度の性能を示すこともあるとされています。
本稿としては、「高いエフォートで上位モデルに迫る」ことよりも、「低いエフォートで前モデルの最高性能を大幅に安く超える」ことの方が、日常業務での使い分けには意味が大きいと受け止めています。
コーディング
性能向上が特に目立つのはコーディングです。FrontierCodeのHighエフォートでは、同じ設定のSonnet 5より10ポイント高く、1タスクあたりのコストは約15分の1です。実際のCursorのコーディングセッションから作られたタスクで評価するCursorBenchでは、最高スコアがOpus 5.5に約2ポイント差まで迫りました。
早期テスターは、Sonnet 5.5がコードベースを素早く理解できる点を評価しました。効率の良さも注目され、直接比較の実行では、Sonnet 5よりツール呼び出しをまとめて行う傾向が強く、ステップ数が減ってコストも下がったといいます。
Epic Gamesの最高執行責任者Daniel Vogel氏は、同社の早期テストでSonnet 5.5が上位モデルに期待される品質基準を満たし、システム設計の監査やデータフローのレビューにも耐えたと述べています。ゲームプレイのシステム構造に関わる数万行のコードを扱い、応答の速さを保ったまま数時間規模のタスクをこなし、細かく指示しなくても成果を出したとしています。
ツール呼び出しをまとめて行い、ステップ数を減らすという特徴は、トークン単価が同じでもタスク全体の費用を下げる方向に働きます。単価より「完了までに何ターンかかるか」が総額を左右するという点は、Claude Codeを業務で使う際にも意識しておきたいところだと思います。
知的業務
知的業務でも複数の領域で向上が見られます。44の職種と9つの主要産業にわたる実務タスクで評価するGDPval-AAでは、Opus 5.5とほぼ並び、Sonnet 5より約400ポイント高いスコアでした。コンピューター操作とグラフの読み取りでもOpus 5.5に近く、長時間の知的業務ではSonnet 5とGPT-6 Solを明確に上回っています。
早期テスターは、数値では測りにくい改善も挙げています。より自然な会話の相手になったこと、UIに洗練さを加えるデザインの感覚、スライドのテンプレートに沿って手直しの少ない資料を作れることなどです。Anthropicの社内テストでは、上場企業の四半期決算資料と決算説明会の書き起こし、スライドのテンプレートを渡して10枚の業績レビュー資料を依頼したところ、2人の専門家が最初の草案をそのまま送れる水準だと判断しました。
SlackのプリンシパルエンジニアCurtis Allen氏は、プロンプトを一切変えずに、Slackbotのオフライン評価のほぼすべてでSonnet 5より良い結果を出し、ステップ数も減り、出力トークンは約14%少なかったと述べています。
料金と速度
Sonnet 5.5とOpus 5.5の料金は次のとおりです(100万トークンあたり)。
| 項目 | Claude Sonnet 5.5 | Claude Opus 5.5 |
| キャッシュ読み取り | $0.20 | $0.20 |
| キャッシュ書き込み | $2.50 | $5 |
| 入力 | $2 | $4 |
| 出力 | $10 | $20 |
入力・出力の単価はOpus 5.5のちょうど半分で、キャッシュ読み取りは同額です。Sonnet 5.5はSonnet 5より1タスクあたりのトークンが少なく、実行コストが下がります。出力速度も30%以上速く、公式ページでは、400羽のムクドリの群れを1つのHTMLファイルで描くといったプロンプトで、Sonnet 5との生成の違いを比較するデモが示されています。
エフォートを調整すると、コストと速度を全体の品質とのバランスで決められます。Claude CodeとClaudeアプリのデフォルトはMedium、Claude PlatformのデフォルトはHighです。低い設定では速く答え、トークンも少なく済むため定型作業に向き、高い設定では長く推論し、作業をより念入りに確認します。
API経由で使う場合は、デフォルトがHighである点に注意が必要だと思います。定型的な処理を大量に流す用途では、Mediumやそれ以下を試すと、同じ品質のままコストを抑えられる可能性があります。
安全性:アライメント評価
Sonnet 5.5はAnthropicのモデルの能力の最先端を押し上げるものではないため、アライメント評価は、能力の水準を問わず当てはまる特定のリスクに絞って行われました。利用者の利益に反する行動、利用者を誤解させること、重大な悪用への協力などです。
約1,850のシナリオでClaudeを試す自動の行動監査では、アライメント、悪用への耐性、誠実さの多くの指標で、Sonnet 5.5はSonnet 5と同等以上でした。新しい封じ込め(コンテインメント)の評価では、サンドボックス(隔離された実行環境)からの脱出を試みる頻度の低さでOpus 5.5に近く、コンテナの限界を探る可能性はAnthropicのモデルの中で最も低いとされています。監査全体ではOpus 5.5がわずかに上回るものの、Sonnet 5.5が利用者の意図と相反する目標を追求する証拠は見つからなかったと報告されています。
同時にAnthropicは、どのような評価でもすべての失敗を確実に捉えられるわけではなく、見つかっていない傾向がある可能性もあるとし、そのため以下の安全対策と組み合わせているとしています。
安全性:3つのセーフガード
サイバーセキュリティでは、Sonnet 5.5の能力がSonnet 5から大きく向上したため、Opus 5.5と同様の安全対策を適用しています。通常のソフトウェア開発の一環としてバグを見つけて直すことは引き続きできますが、リスクの高いサイバーセキュリティのタスクは、利用者に見える形でSonnet 5に切り替わります(フォールバック)。近く、サイバー防御の担当者は拡張版のCyber Verification Programに申請でき、Sonnet 5.5、Opus 5.5、Claude Mythosモデルのより高度な機能を段階的に利用できるようになります。
生物学では、Sonnet 5と同じ安全対策を使っています。有害な依頼を対象としており、研究・教育・臨床の多くの作業には影響しませんが、微生物学やウイルス学の一部の依頼が誤ってフラグ付けされる場合があります。組織はLife Sciences Verification Programに申請すると、生物学関連の幅広い作業向けに設計された安全対策を利用できます。
蒸留(ディスティレーション)は、攻撃者が数千の偽アカウントを使ってモデルの能力を大規模に抜き出す攻撃で、Claudeに組み込まれた安全対策を持たない高性能なモデルを作ることを可能にします。Sonnet 5.5は前モデルよりはるかに高性能なため、推論の抽出を防ぐ安全分類器を備えて公開される初のSonnetモデルとなりました。また、preserved thinking(思考の保持)の仕組みを拡張し、Claudeの思考をそれを生成したアカウントから切り離せないようにしています。多くの開発者は変化に気づかないとされていますが、アカウント間で会話を移す場合(Claude Codeでセッション中にアカウントを切り替える場合を含む)は、ドキュメントで変更点を確認する必要があります。
本稿としては、能力の上がった中位モデルに上位モデルと同じ安全対策を「下ろしてくる」運用は、性能が一定の水準を超えたら価格帯にかかわらず同じ扱いにするという考え方と読めます。セキュリティ業務でSonnetを使っている場合は、フォールバックが起きうる前提で運用を見直しておくのがよいと思います。
利用開始と移行時の注意点
Opus 5.5やSonnet 5と同様に、Sonnet 5.5はゼロデータ保持(データを保存しない契約形態)で利用できます。Amazon Web Services、Google Cloud、Microsoft Azureを含むすべてのプラットフォームで提供されており、開発者はClaude Platformで claude-sonnet-5-5 を指定して使い始められます。
注意: 思考(thinking)をオフにしてSonnetを使っている場合は、Sonnet 5.5に移行する前に、事前の思考をオフに保つ新しい設定 between_tools に切り替える必要があります。詳細は公式の移行ガイドで確認できます。
まとめ
Sonnet 5.5は、日常のコーディングや資料作成を速く安くこなす役割を担い、複雑な判断はOpus 5.5に任せるという分担が明確になりました。エフォートの選び方で費用は大きく変わるため、Claude Codeでトークン消費を抑えるコツもあわせてご覧ください。
