Anthropicは2026年10月7日、小型AIモデル「Claude Haiku 5.5」を発表した。入力が10万トークン以下であれば、APIの入出力単価はHaiku 4.5の10分の1となり、OpenAIのGPT-6 Lunaと同水準になる。
Anthropicが公表した評価では、画面操作や知識労働でも旧Haikuから大きく性能を伸ばした。一方、入力が10万トークンを超えると単価は5倍になり、旧モデルから移行する場合は、同じ文章でも数えられるトークン数が変わる。
低価格モデルに任せられる仕事の範囲は広がったが、Lunaや上位のSonnetと使い分けるには、単純なAPI単価だけでなく、入力の長さや仕事の難易度まで含めて考える必要がある。
「単価90%減」と「平均費用75%減」は何が違うのか
Haiku 5.5の通常API料金は、100万トークン当たり入力0.10ドル、出力0.50ドルからとなった。
トークンはAIが文章を処理する際の単位であり、文字数や単語数とは一致しない。Anthropicの発表では、10万トークン以下の入力について旧Haikuから単価を90%引き下げ、10万トークンを超える場合は50%引き下げたと説明している。
| モデルと入力条件 | 入力 | 出力 | キャッシュの読み取り |
|---|---|---|---|
| Haiku 5.5/10万トークン以下 | $0.10 | $0.50 | $0.01 |
| Haiku 5.5/10万トークン超 | $0.50 | $2.50 | $0.05 |
| Haiku 4.5 | $1 | $5 | $0.10 |
| GPT-6 Luna/27.2万トークン以下 | $0.10 | $0.50 | $0.01 |
| Claude Sonnet 5.5 | $2 | $10 | $0.10 |
| Claude Opus 5.5 | $4 | $20 | $0.20 |
| GPT-6.1 Sol/27.2万トークン以下 | $2 | $10 | $0.10 |
単位は100万トークン当たりの米ドル。2026年10月8日時点の通常API料金で、Claudeは発表と料金文書、OpenAIはLunaとSolのモデル文書に基づく。キャッシュへの書き込み、地域指定、検索などの追加料金は含めていない。Sonnetのキャッシュ読み取り料金は10月7日の値下げ後の額である。
入力が10万トークン以下なら、Haikuの入出力単価はSonnetの20分の1だ。10万トークンを超えると、Haikuの入出力単価はSonnetの4分の1、Opusの8分の1となる。
安さを比較するには、まず自分の入力がどちらの料金帯に入るのかを確認する必要がある。
一方、Anthropicが説明する「平均約75%の費用削減」は、単価が90%下がったという数字とは意味が異なる。
同社によると、旧Haikuへのリクエストの約90%は10万トークン以下だった。ただし、平均費用の計算には、新モデルが同じ仕事を完了するまでに使うトークン数の変化も含まれる。
リクエスト件数の90%が短い入力だったとしても、その90%が請求額全体の90%を占めるとは限らない。そのため、「平均75%削減」という数字を自分の業務へそのまま当てはめることはできない。
モデルの仕様によると、Haiku 5.5のコンテキストウィンドウは100万トークン、通常の最大出力は12.8万トークンである。旧Haikuの20万トークン、6.4万トークンから拡大した。
大量の資料を一度に扱えるようになったが、100万トークンまで最低料金で使えるという意味ではない。
GPT-6 Lunaと同じ単価でも、長い入力では料金差が広がる
GPT-6 Lunaでは、入力が27.2万トークンを超えると追加料金が適用される。
この境界を超えると、リクエスト全体について入力とキャッシュの単価が2倍、出力単価が1.5倍となり、入力0.20ドル、出力0.75ドルへ上がる。
Haikuの料金境界は10万トークン、Lunaは27.2万トークンだ。同じ低価格帯のモデルでも、この違いは長い入力を扱う際の費用に大きく影響する。
Anthropicの料金とOpenAIの料金条件を使い、入力の長さだけを変えて試算すると次のようになる。
出力は、推論を含む課金対象を2万トークンに固定し、1回の通常API呼び出しでキャッシュを使用しないものとする。
| 1回の入力トークン数 | Haiku 5.5 | GPT-6 Luna | Haiku/Luna |
|---|---|---|---|
| 10万 | $0.020 | $0.020 | 1倍 |
| 20万 | $0.15 | $0.03 | 5倍 |
| 30万 | $0.20 | $0.075 | 約2.67倍 |
20万入力・2万出力トークンを使う1回の通常API呼び出しでは、Haiku 5.5は0.15ドル、GPT-6 Lunaは0.03ドルとなり、試算上はHaikuが5倍高くなる。
計算式は、「入力単価×入力トークン数÷100万+出力単価×2万÷100万」である。
20万入力のHaikuなら、
0.50 × 0.20 + 2.50 × 0.02 = 0.15ドル
Lunaなら、
0.10 × 0.20 + 0.50 × 0.02 = 0.03ドル
となる。
30万トークンまで入力が増えるとLuna側にも追加料金が適用されるため、料金差は縮まる。
ただし、これは同じトークン数を使った場合の料金計算であり、実際に両モデルへ同じ仕事をさせた測定結果ではない。
同じ文章でもモデルによってトークン数が異なるうえ、回答や推論に使うトークン数も変わる。検索料金、キャッシュへの書き込み、地域指定などの追加料金も含めていない。
実際の作業1件あたりの費用を比べるなら、失敗して再実行する回数まで含めて確認する必要がある。
旧Haikuから移行する場合には、入力トークンの数え方そのものも変わる。
移行ガイドによると、新しいトークナイザーでは、同じ入力文章でも旧モデルより約30%多いトークンとして数えられる。
実際の増加率は内容によって異なるが、料金境界に近い入力では、この違いによって適用される料金帯そのものが変わる可能性がある。
例えば、旧Haikuで8万トークンだった文章が、新しいトークナイザーでは30%増えて10.4万トークンになったと仮定する。
入力料金だけを見ると、旧モデルでは、
1 × 0.08 = 0.08ドル
新モデルでは10万トークンを超えるため、
0.50 × 0.104 = 0.052ドル
となる。
削減率は、
1 − 0.052 ÷ 0.08 = 35%
である。
出力や推論の料金を含まない仮定の例だが、「単価90%減」という数字から想像する節約幅とはかなり異なる。
移行時には、旧モデルで計測した入力長をそのまま使わず、Haiku 5.5のトークナイザーで数え直す必要がある。
文書本文だけでなく、ツールの説明や会話履歴が積み重なるエージェントでは、処理を繰り返すうちに10万トークンの料金境界を超える可能性もある。
Lunaを上回る公表値もあるが、複雑な開発ではSonnetとの差が残る
Anthropicが10月7日に公開した比較表では、Haiku 5.5はGPT-6 Lunaと共通する評価項目のすべてで、Lunaを上回る値を記録した。
特に画面操作を評価するOSWorld 2.1では、オフラインの一部課題でHaiku 5.5が72.4%となり、Lunaの48.9%を23.5ポイント上回った。
ただし、仕事の種類によって上位モデルとの差は大きく変わる。
| 評価と測る仕事 | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 |
|---|---|---|---|---|
| GDPval-AA v2.1/知識労働の相対評価 | 1620 | 735 | 1437 | 1840 |
| AA-Briefcase v1.1/知識労働の相対評価 | 1578 | 614 | 1336 | 1824 |
| OSWorld 2.1/画面操作、オフラインの一部課題 | 72.4% | 15.7% | 48.9% | 83.9% |
| Terminal-Bench 4.0/端末で複数手順をこなす作業 | 39.2% | 0.0% | 16.4% | 70.6% |
| FrontierCode 1.1 Main/コード変更 | 46.4% | 未掲載 | 42.4% | 52.1%(xhigh) |
| Chartography/図表の推論、ツールなし | 46.4% | 6.4% | 29.1% | 61.6% |
| Humanity’s Last Exam/分野横断の推論、ツールなし | 45.9% | 10.2% | 未掲載 | 56.9% |
| Humanity’s Last Exam/ツールあり | 57.4% | 18.7% | 未掲載 | 64.5% |
GDPval-AAとAA-Briefcaseの数値は相対評価であり、正答率や「何%の仕事を処理できるか」を示す数字ではない。「未掲載」は、Anthropicの発表表に数値が掲載されていないことを示す。
また、SonnetのFrontierCodeは推論設定xhighで測定されており、すべてのモデルで同じ推論量を使った比較ではない。
Terminal-Bench 4.0では、Haiku 5.5とSonnet 5.5の差は31.4ポイントに広がる。
Haiku 5.5の39.2%は旧Haikuの0%から大幅に改善したことを示すが、旧Haikuの0%もこのベンチマークに限った結果であり、「旧モデルはコードを書けなかった」という意味ではない。
Anthropic自身も、複雑なソフトウェア開発を長時間進めるような仕事には、Sonnet 5.5やOpus 5.5を推奨している。
したがって、Haiku 5.5にLunaを上回る公表値があることと、Sonnetの代わりにあらゆる開発作業を任せられることは別の話である。
図表を読み取る、決められた条件で情報を分類する、手順が限定された画面操作を行うといった仕事で必要な品質を満たせるなら、Haikuの低価格を生かせる余地は大きい。
比較した時期にも注意が必要だ。
OpenAIは9月25日、GPT-6 LunaとGPT-6 Solで画像理解を損ねていた画像処理の不具合を修正している。
Anthropicの比較表に掲載されたLunaの視覚評価が、その修正前と修正後のどちらで測定されたのかは明らかにされていない。
推論設定や測定誤差など、すべての条件がそろっていることも確認できない。そのため、この表を現在のあらゆる用途におけるモデルの順位として扱うことはできない。
速度についても同様だ。
Anthropicが「最速」と説明しているのは、Claude各モデルの通常モード同士を比較した場合であり、脚注ではOpusのFast Modeより遅いとしている。
モデルが文字を生成する速さと、ツール操作や待ち時間まで含む仕事全体の処理時間は、分けて評価する必要がある。
低価格のHaikuと、値下げされたSonnetをどう使い分けるか
Haiku 5.5はHaikuシリーズで初めて、推論の強さを調整できるようになった。
既定値はmediumで、必要に応じてモデルが推論する仕組みになっている。
推論設定を下げれば考える量を減らし、単純な処理では推論自体を省略する場合もある。high以下では推論を無効にすることもできる。
単純な分類や情報抽出と、判断を伴う要約で、同じ推論設定を使う必要はない。
Anthropicが用途として挙げているのは、要約、会話履歴の圧縮、データベースへの問い合わせなどだ。
上位モデルが開発方針を決め、Haikuへ対象ファイルの調査や、決められた形式への情報抽出を任せる使い方も想定している。
こうした分担を実用化するには、Haikuへどこまで任せるのか、どの条件なら上位モデルへ処理を戻すのかをあらかじめ決めておく必要がある。
短い指示で完結する仕事なら低価格帯を維持しやすい。一方、毎回すべての会話履歴や資料をHaikuへ渡せば、10万トークンを超えやすくなり、料金面の利点は小さくなる。
Sonnetも同日に値下げされた。
キャッシュ読み取り料金が100万トークン当たり0.20ドルから0.10ドルへ半減し、GPT-6.1 Solの通常料金と、入力、出力、キャッシュ読み取りの3項目が同額になった。
過去の比較表に記載されたSonnetの0.20ドルをそのまま使うと、現在の料金差を読み違えることになる。
ただし、キャッシュ読み取り料金が半額になったからといって、仕事全体の費用も半分になるわけではない。
キャッシュは、一度処理した入力を保存し、後のリクエストで再利用する仕組みである。
複数回の呼び出しを合計して、入力100万トークンのうち90%をキャッシュから読み取り、出力1万トークンを使う処理を考える。最初にキャッシュへ書き込む費用は除外する。
旧料金では、
2 × 0.10 + 0.20 × 0.90 + 10 × 0.01 = 0.48ドル
新料金では、
2 × 0.10 + 0.10 × 0.90 + 10 × 0.01 = 0.39ドル
となり、削減率は18.75%である。
これはAnthropicが説明する「多くのエージェント作業で約20%削減」という数字に近いが、同社の実測を再現したものではない。
キャッシュをまったく使わない場合、同じ入力と出力にかかる料金は新旧とも2.10ドルであり、今回の値下げによる効果はない。
モデルのトークン単価が安くなるほど、検索などの別料金が請求額に占める割合も大きくなる。
Claudeの検索料金は1,000回当たり10ドルで、取得した内容を処理するためのトークン料金も別途かかる。
検索1回あたりの料金は0.01ドルだ。
前述したHaikuの10万入力・2万出力の料金は0.02ドルなので、検索を1回行うだけで、その半分に相当する追加料金が発生する。
トークン単価が下がるほど、検索回数や同じ資料を繰り返し読み込む回数が、総費用に与える影響は大きくなる。
API移行で見直す設定と、Max・Team向けの月次クレジット
Haiku 5.5はClaude Platformに加え、AWS、Google Cloud、Microsoft Azureでも提供が始まった。
Claude APIで使うモデル名はclaude-haiku-5-5である。
ただし、旧Haikuを呼び出していたコードでモデル名だけを変更すると、設定によってはエラーになる。
移行ガイドでは、従来のthinkingでbudget_tokensを指定する方式から、新しい推論設定へ移行するよう求めている。
temperature、top_p、top_kについても、従来の値をそのまま引き継ぐのではなく、省略することを推奨している。
回答の最大量を指定するmax_tokensには推論トークンも含まれる。そのため、上限を小さく設定していると、推論だけで枠を使い切り、最終的な回答本文が返らない場合がある。
安全対策によってモデルが応答を拒否する場合もあり、アプリ側ではstop_reason: "refusal"を適切に処理する必要がある。
Haiku 5.5には、拒否されたリクエストをサーバー側で自動的に別モデルへ渡す仕組みはない。
導入時には、通常時の成功率だけでなく、拒否や出力不足が発生した場合にどう処理するかも確認する必要がある。
同時に、MaxとTeam向けには月次のAPIクレジットも提供される。
Max 5xは100ドル、Max 20xは200ドル。
TeamではStandard席1人当たり20ドル、Premium席1人当たり100ドルを合算し、上限は500ドルとなる。
例えば、Standardが3席、Premiumが2席なら、
20 × 3 + 100 × 2 = 260ドル
となる。
すべてのTeam契約が一律に500ドルを受け取れる制度ではない。
クレジットはClaude Console上の組織へ紐付けて受け取る。
対象となるのは、自作アプリやエージェントなどで利用するAPI料金であり、対話型のClaude Codeや、契約プランの利用枠を超えた追加利用料金には使えない。
数日かけて段階的に提供され、案内が表示されるには、対象プランを7日間利用していることなどの条件もある。
APIを使った開発や検証を支援するクレジットであり、通常のClaudeチャットで利用できる量がそのまま増えるという意味ではない。
Haiku 5.5を導入する際には、同じ資料と合格条件を用意し、まず入力の長さを変え、次に推論の強さを変えながら、品質と実際の請求額を比較するのが分かりやすい。
そのうえで、どの仕事ならHaikuに任せられ、どの条件になったらSonnetやOpusへ戻すのかを決める。
そうすれば、Haiku 5.5の大幅な値下げを、単なる「トークン単価の安さ」ではなく、必要な品質を維持したまま処理できる仕事量の増加へつなげられる。



