Anthropicは2026年9月22日、新世代モデルファミリーの初弾となる最新フラッグシップAIモデル「Claude Opus 5.5」を正式発表し、即日提供を開始した。同社が2026年に提唱した「We Must Pace the Frontier(フロンティアの歩調を整えるべき)」以降で初となる大型モデルの投入にあたる。上位モデル「Claude Fable 5.1」に匹敵する高度な推論能力を維持しながら、前世代「Claude Opus 5」と比較して標準的なワークロードにおける運用コストを40%削減し、生成速度を30%以上高速化させた。今後は「Claude Sonnet 5.5」および「Claude Haiku 5.5」の投入も数週間以内に控えている。

AD

大幅な料金改定とキャッシュ割引によるコスト40%削減の構造

Opus 5.5における最大の刷新は、API利用料金の全面的な引き下げとプロンプトキャッシュの大幅な割引率拡充にある。APIリスト価格は入力100万トークンあたり4ドル、出力100万トークンあたり20ドルに設定された。前世代Opus 5(入力5ドル/出力25ドル)から各20%の値下げとなる。

さらにエージェント運用や反復的なコーディング作業でコストの大半を占めるプロンプトキャッシュの読み取り料金は、100万トークンあたり0.20ドルへと改定された。Opus 5(0.50ドル)から60%の値下げであり、非キャッシュ時の入力料金(4ドル)と比較して95%の割引率に達する。5分間の生存期間(TTL)を持つキャッシュ書き込み料金も100万トークンあたり5ドルへ引き下げられた(Opus 5は6.25ドル)。

Claude Opus 5.5とOpus 5のAPI利用料金比較

料金区分(100万トークンあたり) Claude Opus 5.5 Claude Opus 5 改定率 割引効果
入力料金 4ドル 5ドル 20%値下げ 基本入力コスト削減
出力料金 20ドル 25ドル 20%値下げ 生成トークン費用削減
キャッシュ読み取り料金 0.20ドル 0.50ドル 60%値下げ 入力比95%割引
キャッシュ書き込み料金 5ドル 6.25ドル 20%値下げ コンテキスト初期化安価
  • Claude Opus 5.5
  • Claude Opus 5
Claude Opus世代間におけるAPIトークン利用料金の比較横棒グラフ。カテゴリ 4 件、系列: Claude Opus 5.5, Claude Opus 5(単位: ドル)入力料金入力料金入力料金 — Claude Opus 5.5: 4ドル4入力料金 — Claude Opus 5: 5ドル5出力料金出力料金出力料金 — Claude Opus 5.5: 20ドル20出力料金 — Claude Opus 5: 25ドル25キャッシュ書き込みキャッシュ書き込…キャッシュ書き込み — Claude Opus 5.5: 5ドル5キャッシュ書き込み — Claude Opus 5: 6.25ドル6.25キャッシュ読み取りキャッシュ読み取…キャッシュ読み取り — Claude Opus 5.5: 0.2ドル0.2キャッシュ読み取り — Claude Opus 5: 0.5ドル0.5単位: ドル
データを表で見る
Claude Opus 5.5 (ドル)Claude Opus 5 (ドル)
入力料金45
出力料金2025
キャッシュ書き込み56.25
キャッシュ読み取り0.20.5
Claude Opus世代間におけるAPIトークン利用料金の比較100万トークンあたりの標準APIリスト価格出典: Anthropic公式発表資料

この料金体系の変更により、トークン単価の低下とタスク達成に必要なトークン数の効率化が合算され、標準的な実務運用で実質40%のコスト削減が成立する。

あわせて開発者向けの高速処理オプションとして「Fast mode」がClaude CodeおよびClaude Platformで提供開始された。Fast modeは最大2.5倍の出力速度を実現し、料金は入力100万トークンあたり8ドル、出力100万トークンあたり40ドルで提供される。コンテキストウィンドウは100万トークン(テキストおよび画像入力対応)を維持し、ゼロデータ保持(Zero Data Retention)にも対応する。Pro、Max、Teamの各サブスクリプションプランでは5時間あたりの利用制限が緩和され、レートリミットのリセット権利を保存して任意のタイミングで発動できる新機能も実装された。

エージェント型コーディングとナレッジワークにおける新ベンチマーク首位

推論性能の面において、Opus 5.5は自律端末操作や長大なコードベースの改修タスクで群を抜く実績を示した。コマンドライン環境での自律的な問題解決能力を測定するTerminal-Bench 4.0において、Opus 5.5(xhigh effort)は66.4%を記録した。OpenAIが公表したGPT-6 Astra(high effort: 57.9%)やClaude Fable 5.1(55.8%)、前世代Opus 5(52.3%)を明瞭に上回っている。

長大コンテキストを扱うソフトウェア開発ベンチマークのFrontierCode v1.1(Main)では54.4%を達成し、GPT-6 Astra(53.3%)やFable 5.1(50.3%)を抑えた。CursorBench 4.0でも57.8%をマークし、GPT-5.6 Sol(41.7%)やOpus 5(46.6%)に大きな差をつけた。

主要フロンティアモデルのベンチマーク測定結果比較

ベンチマーク指標 評価対象領域 Claude Opus 5.5 Claude Fable 5.1 GPT-6 Astra Claude Opus 5
Terminal-Bench 4.0 自律端末操作(公式最高値) 66.4% 55.8% 57.9% 52.3%
FrontierCode v1.1 エージェント型開発(Main) 54.4% 50.3% 53.3% -
CursorBench 4.0 長時間エディタ推論 57.8% 51.8% - 46.6%
GDPval-AA v2.1 実務知能(Eloスコア) 1846 1735 1542 1708
  • Claude Opus 5.5
  • Claude Fable 5.1
  • GPT-6 Astra
  • Claude Opus 5
主要フロンティアAIモデルにおけるコーディング・推論性能の比較横棒グラフ。カテゴリ 3 件、系列: Claude Opus 5.5, Claude Fable 5.1, GPT-6 Astra, Claude Opus 5(単位: %)Terminal-Bench 4.0Terminal-Bench 4.…Terminal-Bench 4.0 — Claude Opus 5.5: 66.4%66.4Terminal-Bench 4.0 — Claude Fable 5.1: 55.8%55.8Terminal-Bench 4.0 — GPT-6 Astra: 57.9%57.9Terminal-Bench 4.0 — Claude Opus 5: 52.3%52.3FrontierCode v1.1FrontierCode v1.1FrontierCode v1.1 — Claude Opus 5.5: 54.4%54.4FrontierCode v1.1 — Claude Fable 5.1: 50.3%50.3FrontierCode v1.1 — GPT-6 Astra: 53.3%53.3CursorBench 4.0CursorBench 4.0CursorBench 4.0 — Claude Opus 5.5: 57.8%57.8CursorBench 4.0 — Claude Fable 5.1: 51.8%51.8CursorBench 4.0 — Claude Opus 5: 46.6%46.6単位: %
データを表で見る
Claude Opus 5.5 (%)Claude Fable 5.1 (%)GPT-6 Astra (%)Claude Opus 5 (%)
Terminal-Bench 4.066.455.857.952.3
FrontierCode v1.154.450.353.3
CursorBench 4.057.851.846.6
主要フロンティアAIモデルにおけるコーディング・推論性能の比較各社公式発表値に基づく比較(推論努力量High/Max設定)出典: Anthropic公式発表資料

実務規模の検証事例として、WebサーバーのC言語からRustへの完全移植テストが挙げられる。Opus 5.5とFable 5.1の双方が回帰テスト群を通過するコードを出力したが、所要時間と生成コストの双方でOpus 5.5が優位性を示した。早期テスターの検証では、エンジニアチームが長期を要する大規模なコード移行タスクを極めて短期間で完遂した事例も報告された。

実務ナレッジワークを測定するGDPval-AA v2.1では1846 Eloを記録した。Fable 5.1(1735)やGPT-6 Astra(1542)、GPT-5.6 Sol(1588)を引き離している。Zapierが主催する業務自動化ベンチマークAutomationBenchでも40.0%を記録した(GPT-6 Astraは41.4%)。このAutomationBenchはフォールバックモデルなしで実施されたため、セーフガード発動が不正解として計上されており、実環境ではさらに高いスコアが見込める。

AD

Intelligence Index首位とパレートフロンティアが示す実効コスト

独立評価機関Artificial Analysisが実施した多面的な外部監査において、Opus 5.5の客観的な市場立ち位置が確認された。同機関の総合指標「Artificial Analysis Intelligence Index」において、Opus 5.5(max effort)は総合スコア58を獲得した。これまで測定された全フロンティアモデルの中で単独首位の最高値となる。

Intelligence Indexを構成する10種類の個別評価のうち、Opus 5.5は6評価でトップを獲得した。超難問ベンチマーク「Humanity's Last Exam」で61.4%、科学コード生成「SciCode」で66.9%をマークした。自律端末操作「Terminal-Bench 4.0」の独立実測でも59.6%に達し、首位のGPT-6 Astra(xhigh)と並び、Opus 5から11ポイント改善させた。

とりわけ注目されるのが、オープンソースのエージェント実行基盤「Stirrup」を用いた非公開の高度実務評価「AA-Briefcase v1.1」である。Opus 5.5はここで1822 Eloを記録し、Fable 5.1から143ポイント伸ばした。分析の深さに加え、アウトプットの提示品質(presentation quality)においてもAnthropicのモデルとして初めてGPT-5.6 Solを追い抜いた。

出力トークン増大とタスクあたり費用の均衡

Artificial Analysisの計測データは、推論モデルの経済性に関する重要な事実を示している。Opus 5.5(max)は1タスクあたり平均約11万9,000トークンを出力した。Opus 5(max: 約7万3,000トークン)やFable 5.1(max: 約7万8,000トークン)、GPT-6 Astra(max: 約2万7,000トークン)を大きく上回るトークン量を投じて思考を深めている。

通常であればトークン増量はそのまま利用料金の跳ね上がりに直結する。しかしOpus 5.5ではトークン単価の20%値下げとキャッシュ読み取りの60%値下げが効力を発揮し、タスクあたりの総コストはOpus 5と同水準に抑え込まれた。

さらに5段階の推論努力量設定(low, medium, high, xhigh, max)のうち、mediumからmaxまでの4段階が「知能対タスクあたりコスト」のパレートフロンティア(Pareto frontier)上に位置づけられた。有力な他社フロンティアモデルと比較して、同等性能をより低いコストで提供するか、同等コストでより高い知能を発揮する領域を維持している。

「Claudish」文体からの脱却と対話品質の刷新

能力の向上と並んで利用者に大きな変化をもたらすのが、モデルの文章作成トーンと対話構造の改善である。従来のOpus 5に対しては、文章が過度に装飾的で回りくどく、特有の癖を帯びているという指摘が利用者コミュニティから寄せられていた。一部で「Claudish writing」と形容されていた現象である。

Opus 5.5ではこの傾向が見直された。結論や核心となる情報を冒頭に提示し、構造を論理的に整理して伝える直接的で明快な文体へ移行している。早期テスターからは「思考の流れを追いやすく、自分が書くように自然に記述してくれる」との評価が寄せられた。

この改善は読みやすさの向上に加え、安全面でも実質的な効果を発揮する。自律型エージェントが複雑な作業計画やコード変更理由を開発者へ報告する際、要点が即座に把握できる構造は、人間の確認負荷を減らし、見落としを防ぐ防護線として働く。

AD

堅牢な自律エージェント運用を支える多層セーフガード

企業環境における自律エージェントの長時間運用を見据え、安全管理と攻撃耐性の機構も大幅に強化された。リリース前検証ではFrontier DesignおよびMETR(Model Evaluation and Threat Research)による第三者テストを完了させている。

約2,000パターンのシミュレーション環境で実施された自動行動監査において、Opus 5.5は近年のClaudeモデル中で最も優れた整合性スコアを達成した。エージェントが監視サンドボックスの制限を認識して回避を試みる「コンテインメント逸脱」の頻度は、Opus 5やClaude Mythos 5.1比で約85%減少した。確認された軽微な試行についてもすべて低深刻度の範囲に収まり、モデル自身から自己申告された。AIセキュリティ機関Gray Swanが実施したプロンプトインジェクション耐性評価でも、Fable 5.1と並び測定モデル中最低水準の攻撃成功率を維持している。

デュアルユース領域の透過的フォールバック

悪用リスクが懸念される高度な専門領域に対しては、実運用環境での自動フォールバック機能が組み込まれた。サイバーセキュリティ関連のタスクはClaude Opus 4.8へ、生物兵器リスクに関わるバイオロジーおよびフロンティアLLM開発関連のタスクはClaude Opus 5へ自動的に迂回処理される。

正規の研究機関や防衛従事者の業務を阻害しないよう、厳格な審査を経た組織には「Life Sciences Verification Program」および「Cyber Verification Program」(3段階の権限設定)を通じて制限を緩和したアクセス権が付与される。

思考改ざんと蒸留攻撃への防護

API経由で数万のアカウントを用いてモデルの思考プロセスを体系的に抽出し、自社モデルの学習データとして抜き取る「蒸留攻撃(distillation attack)」への対抗策も固められた。Fable 5.1で初導入された「preserved thinking(思考保持)」機能がOpus 5.5にも全面的に適用される。利用者が過去の会話コンテキストに含まれる推論プロセスを意図的に改ざんすることを遮断し、推論の整合性を保つ。

またOpus 5.5では思考モード(thinking mode)を完全に無効化することができず、推論プロセスを経由した出力が義務付けられている。EU AI Actに準拠した電子透かし技術も標準適用された。

フロンティアAIが自律的にソフトウェア開発や研究業務を代行する時代に入り、モデル選定の基準は単純なベンチマークの数値争いから、トークン経済性、文体を含めた協調の自然さ、逸脱を起こさない運用規律の総合力へとシフトした。Claude Opus 5.5が提示した知能とコスト構造のバランスは、エージェント運用の主戦場における新たな基準点として機能し始める。