Anthropicは9月28日、新しいAIモデル「Claude Sonnet 5.5」を発表した。同社によると、前世代のSonnet 5からAPIのトークン単価を据え置きながら、出力速度を30%以上高め、同じ作業にかかるコストを最大30%削減したという。

文書やスライドの作成、範囲が明確なコード修正など、日常的な作業をより短時間かつ少ないトークンで処理することを狙った更新だ。ただし、公表された評価結果には、最大の推論設定より一段低い設定のほうが高得点になった例もある。上位モデルのOpus 5.5や、標準API料金が同じGPT-6 Solと比較する際には、ベンチマークの点数だけでなく、推論設定や実際の処理コストも見る必要がある。

AD

単価据え置きで、出力速度とトークン効率を改善

Sonnet 5.5の通常API料金は、100万トークン当たり入力2ドル、出力10ドル。入力をキャッシュして再利用する場合の読み取り料金は0.20ドルで、いずれもSonnet 5と同じだ。Anthropicの発表が示すコスト削減は値下げによるものではなく、同じ作業を完了するまでに必要なトークン数を減らした効果である。

「30%以上高速」という数字も、モデルが出力を生成する速度を指している。検索や外部ツールからの応答待ちまで含めた処理全体が、一律に30%短縮されるという意味ではない。

「最大30%のコスト削減」もAnthropicのテスト結果に基づく。入力する資料の量や推論に使うトークン数、ツールの呼び出し回数などが変われば、実際の請求額も変わる。

Anthropicは、Sonnet 5.5をバグ修正や日常的な資料作成など、目的や範囲が比較的明確な作業に適したモデルと位置づける。一方、Opus 5.5は、長時間にわたって慎重な判断を続ける必要がある複雑な作業を想定している。

Sonnet 5.5はAWS、Google Cloud、Microsoft Azureを含む各プラットフォームで提供が始まった。さらに、低価格で大量処理向けのHaiku 5.5も今後数週間以内に加わる予定だ。

旧Sonnet、Opus、GPT-6 Solとの性能比較

コマンドライン上で複数段階の作業をこなすTerminal-Bench 4.0では、Sonnet 5.5が70.6%、Sonnet 5が10.3%だった。旧モデルから大きく伸びている。

一方、同じ表に掲載されたOpus 5.5は66.4%だったからといって、Sonnet 5.5のほうがあらゆるソフトウェア開発で優れていると結論づけることはできない。

下表は、Anthropicが公表した比較表を基に、評価内容と条件を整理したものだ。Claudeの値は原則として最大推論設定のmaxだが、一部に例外がある。また、外部機関による測定結果も含まれており、すべてのモデルを同じ環境・条件で測定した比較ではない。

評価と測る仕事 Sonnet 5.5 Sonnet 5 Opus 5.5 GPT-6 Sol
Terminal-Bench 4.0/コマンドラインでの複数段階の作業 70.6% 10.3% 66.4%(xhigh) 未掲載
FrontierCode 1.1 Main/コード変更の品質 46.2%(max)、52.1%(xhigh) 42.4% 54.4% 49.3%
CursorBench 4.0/実際の開発に近い作業 55.5% 34.1% 57.8% 未掲載
GDPval-AA v2.1/職業別の成果物、Elo 1844 1449 1846 1487
AA-Briefcase v1.1/長時間にわたる知識労働、Elo 1811 1359 1822 1483
Humanity's Last Exam/分野横断の推論、ツールあり 64.5% 54.9% 67.7% 未掲載
OSWorld 2.1/画面操作、部分点あり 80.1% 57.0% 81.8% 未掲載
Chartography/専門的な図表の読解、ツールなし 61.6% 15.6% 64.4% 53.6%

Eloは、複数のモデルが作った成果物を比較して算出する相対評価で、正答率ではない。「未掲載」はAnthropicの比較表に数値が掲載されていないことを示しており、モデルが評価に失敗した、あるいは対応していないという意味ではない。

GPT-6 Solの数値は外部で公開された評価結果を参照したもので、Claudeと同じ推論量や実行条件で測定されたとは限らない。

システムカードの8.5節によると、Terminal-Bench 4.0では66の課題を使い、Sonnet 5.5とOpus 5.5をそれぞれ5回ずつ、計330回実行して評価した。

Sonnet 5.5はmax、Opus 5.5は一段低いxhighで、各試行が独立していると仮定した標準誤差は、それぞれ±2.5ポイントと±2.6ポイントだった。スコアの差は70.6−66.4=4.2ポイントだが、推論設定と測定誤差が異なるため、この結果だけから両モデルの総合的な優劣を判断することはできない。

この評価では外部通信を認めず、必要な資源をあらかじめ用意した環境が使われた。Sonnet 5.5では安全機能がリクエストの1.2%で作動し、旧モデルへ切り替えて応答したケースなども結果に含まれる。実際の開発現場をそのまま再現した試験ではない点にも注意が必要だ。

他社モデルとの比較では、測定時期も重要になる。

OpenAIは9月25日、GPT-6 Solの画像理解能力を低下させていた画像処理の不具合を修正した。表に掲載されたChartographyの53.6%が修正前と修正後のどちらの状態で測定されたのかは確認できないため、現在の視覚性能を直接比較する数値として扱うのは難しい。

また、Terminal-Bench 4.0ではGPT-6 Solの結果が公開されていない。ここを旧世代のGPT-5.6 Solの値で補って比較することも適切ではない。

AD

推論量を最大にすれば、性能も上がるのか

Sonnet 5.5はFrontierCode 1.1 Mainで、xhighの52.1%に対し、さらに推論量を増やしたmaxでは46.2%だった。差は5.9ポイントある。

つまり、より多く考えさせれば必ず成績が上がるわけではない。

FrontierCode 1.1 Main:推論設定で変わる得点横棒グラフ。カテゴリ 5 件、系列: 評価スコア(単位: %)Sonnet 5(max)Sonnet 5(max)Sonnet 5(max) — 評価スコア: 42.4%42.4Sonnet 5.5(max)Sonnet 5.5(max)Sonnet 5.5(max) — 評価スコア: 46.2%46.2Sonnet 5.5(xhigh)Sonnet 5.5(xhigh…Sonnet 5.5(xhigh) — 評価スコア: 52.1%52.1Opus 5.5(max)Opus 5.5(max)Opus 5.5(max) — 評価スコア: 54.4%54.4GPT-6 Sol(公表値)GPT-6 Sol(公表値…GPT-6 Sol(公表値) — 評価スコア: 49.3%49.3単位: %
データを表で見る
評価スコア (%)
Sonnet 5(max)42.4
Sonnet 5.5(max)46.2
Sonnet 5.5(xhigh)52.1
Opus 5.5(max)54.4
GPT-6 Sol(公表値)49.3
FrontierCode 1.1 Main:推論設定で変わる得点Cognitionによる評価。ClaudeはClaude Code、GPTはCodex CLIを使用。推論量をそろえた実測比較ではない。出典: Anthropic Sonnet 5.5 System Card 8.1・8.4節

Sonnet 5.5はmaxではGPT-6 Solの公表値を下回る一方、xhighでは上回る。モデル名だけを並べた単純な順位表では、こうした推論設定による違いが見えなくなる。

Cognitionが開発したFrontierCodeは、150件のソフトウェア開発課題について、機能が正しく動くかだけでなく、変更が依頼された範囲に収まっているか、コードが一定の品質を満たしているかも評価する。

依頼範囲を超えた変更は、内容自体が有用でも減点の対象になる。この仕組みだけでSonnet 5.5のmaxが低得点になった原因をすべて説明できるわけではないが、時間やトークンを多く使って変更を増やせば、その分だけ評価が高くなる試験ではない。

一方、文書作成などの評価では、推論量を増やす効果が別の形で表れている。

Artificial Analysisが独立して実施し、Anthropicがシステムカードに掲載したGDPval-AAとAA-Briefcaseでは、Sonnet 5.5をmaxで動かした場合、Opus 5.5に近い結果となった。

  • GDPval-AA v2.1
  • AA-Briefcase v1.1
知識労働の評価:最大設定でOpus 5.5に接近横棒グラフ。カテゴリ 4 件、系列: GDPval-AA v2.1, AA-Briefcase v1.1(単位: Elo)Sonnet 5Sonnet 5Sonnet 5 — GDPval-AA v2.1: 1,449Elo1,449Sonnet 5 — AA-Briefcase v1.1: 1,359Elo1,359Sonnet 5.5Sonnet 5.5Sonnet 5.5 — GDPval-AA v2.1: 1,844Elo1,844Sonnet 5.5 — AA-Briefcase v1.1: 1,811Elo1,811Opus 5.5Opus 5.5Opus 5.5 — GDPval-AA v2.1: 1,846Elo1,846Opus 5.5 — AA-Briefcase v1.1: 1,822Elo1,822GPT-6 SolGPT-6 SolGPT-6 Sol — GDPval-AA v2.1: 1,487Elo1,487GPT-6 Sol — AA-Briefcase v1.1: 1,483Elo1,483単位: Elo
データを表で見る
GDPval-AA v2.1 (Elo)AA-Briefcase v1.1 (Elo)
Sonnet 51,4491,359
Sonnet 5.51,8441,811
Opus 5.51,8461,822
GPT-6 Sol1,4871,483
知識労働の評価:最大設定でOpus 5.5に接近Artificial Analysisの結果をAnthropicが掲載。Claudeはmax。Eloは各評価内の相対値で、異なる評価間の点差・倍率を比べる指標ではない。出典: Anthropic発表・Sonnet 5.5 System Card 8.14.3〜8.14.4節

GDPval-AAではSonnet 5.5とOpus 5.5の差は2ポイント、AA-BriefcaseではOpus 5.5の1822に対してSonnet 5.5は1811だった。ただし、Eloの差は正答率の差ではなく、どの実務でも両モデルが同等の成果を出すという意味でもない。

GDPval-AAは44職種、9産業にまたがる220の課題で、文書やスプレッドシートなどの成果物を比較する。

Sonnet 5.5の設定をxhighに下げるとEloは1725になる一方、出力トークンはmaxより約67%少なくなった。AA-Briefcaseでも、xhighでは1746、maxでは1811だったが、xhighは出力トークンを約61%削減している。

最高得点を狙うのか、それとも十分な品質を保ちながらコストを抑えて多くの処理をこなすのかによって、適した推論設定は変わる。

なお、両評価のSonnet 5.5は正式公開前の環境で測定され、構造化出力に不具合があったとAnthropicは注記している。不具合自体はすでに修正されているが、ここに掲載されているスコアは修正後に再測定した値ではない。

API単価が半分でも、実際の処理コストが半分とは限らない

9月22日に登場したGPT-6 SolとSonnet 5.5は、通常の入力、出力、キャッシュ読み取りのAPI単価が同じだ。

一方、Opus 5.5は通常の入力・出力料金がSonnet 5.5の2倍だが、キャッシュ読み取りは同じ100万トークン当たり0.20ドルとなっている。

長い資料や会話履歴を何度も再利用する処理では、この料金構造の違いが効いてくる。Claudeのモデル一覧によると、Sonnet 5.5とOpus 5.5はいずれも最大100万トークンのコンテキストに対応する。

モデル 入力 出力 キャッシュ読み取り
Claude Sonnet 4.6 3ドル 15ドル 0.30ドル
Claude Sonnet 5 2ドル 10ドル 0.20ドル
Claude Sonnet 5.5 2ドル 10ドル 0.20ドル
Claude Opus 5 5ドル 25ドル 0.50ドル
Claude Opus 5.5 4ドル 20ドル 0.20ドル
GPT-6 Sol 2ドル 10ドル 0.20ドル

単位は100万トークン当たりの米ドル。Claudeの料金表、Sonnet 5.5の発表、GPT-6 Solのモデル文書に基づく通常API料金で、月額プランの料金ではない。キャッシュ書き込み、ツール利用、地域ごとの追加料金や割引は含めていない。GPT-6 Solについては、入力が272,000トークン以下の場合の料金を示している。

複数回の呼び出しを合計して入力100万トークン、出力1万トークンと仮定すると、入力の90%をキャッシュから読み込む場合、Opus 5.5の費用はSonnet 5.5の2倍ではなく約1.63倍になる。

これは9月28日時点のAPI単価を使った試算であり、両モデルに実際の仕事をさせて測定した結果ではない。複数回のAPI呼び出しで使う入力を合計100万トークン、出力を1万トークンに固定し、そのうちキャッシュから読み込む入力の割合だけを変えている。

入力のキャッシュ読み取り比率 Sonnet 5.5の計算額 Opus 5.5の計算額 Opus/Sonnet
0% 2.10ドル 4.20ドル 2倍
90% 0.480ドル 0.780ドル 約1.63倍
99% 0.318ドル 0.438ドル 約1.38倍

計算式は「入力単価×未キャッシュ比率+キャッシュ読み取り単価×キャッシュ比率+出力単価×0.01」だ。

90%の行なら、Sonnet 5.5は

2×(1−0.9)+0.20×0.9+10×0.01=0.48ドル

Opus 5.5は

4×(1−0.9)+0.20×0.9+20×0.01=0.78ドル

となり、比率は

0.78÷0.48=1.625倍

となる。

ただし、この試算にはキャッシュを最初に作成・更新する費用を含めていない。そのため、実際の請求総額をそのまま示すものではない。

また、同じ仕事を両モデルに依頼しても、使う入力・出力トークン数や最終的な成果物の品質が同じになるとは限らない。

それでも、入力・出力の通常単価が2倍だからといって、Opus 5.5を利用した際の実際のコストが常にSonnet 5.5の2倍になるわけではないことは分かる。

反対に、キャッシュをほとんど利用せず、大量の出力を生成する処理では、Sonnet 5.5の低い通常単価がそのまま効きやすい。

GPT-6 Solにも料金が変わる境界がある。1回のリクエストで入力が272,000トークンを超えると、そのリクエスト全体について入力とキャッシュの単価が2倍、出力単価が1.5倍になる。

長大な文書や大量の資料を一度に入力する用途では、標準単価だけを見て費用を比較することはできない。

旧Sonnet 4.6から移行する場合も、単純な単価比較には注意が必要だ。

移行ガイドによると、Sonnet 5.5はSonnet 5と同じトークン化方式を採用しており、Sonnet 4.6と比べると、同じテキストでもトークン数がおよそ30%増える。

増加率は文章の内容によって変わるため、旧世代からの移行で実際の料金を比較する場合は、使用するデータを改めてトークン数で計測する必要がある。

AD

API移行では推論設定と安全機能にも注意

Sonnet 5.5の推論設定は、ClaudeアプリとClaude Codeではmedium、Claude PlatformのAPIではhighが既定となっている。同じモデルでも、利用する環境によって初期設定が異なる。

移行ガイドでは、目的や作業範囲が明確なコーディングや複数段階のツール利用ではmediumから始め、より難しい、あるいは長時間にわたる作業ではhighを試すよう案内している。

既存コードで推論を無効にしていた場合は、モデル名を書き換えるだけでは移行できない。

Sonnet 5で使えた

thinking: {"type": "disabled"}

をSonnet 5.5へそのまま送ると、400エラーになる。

事前の推論を行わない新しい設定はbetween_toolsで、low、medium、highの推論設定と組み合わせられる。xhighやmaxとは併用できない。

また、ツールを使う処理では、ツール呼び出しの間にthinkingブロックが返される場合がある。max_tokensには推論に使うトークンと最終回答の両方が含まれ、推論トークンも出力トークンとして課金される。

能力の向上に伴い、サイバーセキュリティ分野の安全機能も強化された。

AnthropicはSonnet 5.5のサイバー能力がOpus 5に近い水準に達したと評価しており、高リスクと判断された一部の要求ではSonnet 5へ切り替えて応答する仕組みを導入している。

通常のソフトウェア開発には影響しないとしているが、セキュリティ関連の用途では、指定したSonnet 5.5がすべての要求にそのまま応答するとは限らない。

導入を検討する場合は、同じ資料と合格条件を用意し、推論設定ごとに成果物の品質、完了までの時間、実際の請求額を比較するのが良いだろう。

Sonnet 5.5をlowやmediumで使っても必要な品質を保てる作業が見つかれば、そこで節約した時間とコストを、より慎重な判断を必要とする仕事へ回せる。Sonnet 5.5の価値は、単純にOpus級の点数へ近づいたことより、仕事に応じて品質・速度・コストのバランスを細かく選べるようになったことにある。