OpenAIは9月29日、新しいAIモデル「GPT-6.1 Sol」を発表した。旧GPT-6 Solから通常の入力・出力API単価を据え置きながら、コード修正や業務の自動化などで性能を高め、キャッシュ済み入力の料金は半額にした。
OpenAIは、上位モデルGPT-6 Astraに迫る性能を、Astraの5分の1の入力・出力単価で利用できるモデルと位置付けている。ただし、公開された評価結果を推論設定ごとに見ると、計算量を最大まで増やすより低い設定の方が高得点になるタスクもある。AstraやClaude Opus 5.5との差が依然として大きい分野もあり、単純に「安いAstra」と考えられるモデルではない。
コード修正では「max」より「high」が高得点
GPT-6.1 Solは、ソフトウェア開発能力を測る「DeepSWE 1.1」で、推論設定をhighにしたとき75.2%を記録した。OpenAIが公開したグラフでは、1タスク当たりの費用は0.65ドル。旧Solの最高スコア68.8%を6.4ポイント上回り、そのときの2.74ドルよりも大幅に安い。
DeepSWEは、実際のコードベースを使い、複数の手順を必要とするソフトウェア変更に取り組ませる評価だ。運営するDatacurveは、既存の修正履歴をそのまま利用せずに作成した113の課題を、91のリポジトリと5つのプログラミング言語にまたがって用意したと説明している。短いコードの穴埋めではなく、既存コードを読み、修正し、結果を検証する実際の開発作業に近い。
| 推論設定 | GPT-6 Solの得点 | 旧Solの費用 | GPT-6.1 Solの得点 | 新Solの費用 |
|---|---|---|---|---|
| low(低) | 37.2% | 0.16ドル | 64.4% | 0.17ドル |
| medium(中) | 56.6% | 0.38ドル | 73.0% | 0.42ドル |
| high(高) | 65.3% | 0.64ドル | 75.2% | 0.65ドル |
| xhigh(超高) | 66.6% | 1.00ドル | 71.9% | 0.79ドル |
| max(最大) | 68.8% | 2.74ドル | 71.9% | 1.57ドル |
費用はDeepSWE 1.1の1タスク当たり。数値はOpenAIの発表グラフに基づき、同社の研究環境またはAPIを使った評価である。
新Solはmediumでも、旧Solのmaxを上回っている。従来は高い推論設定が必要だった作業を、より低い設定で処理できる可能性がある。
一方、同じ設定同士で比較すると、lowからhighまでの費用は旧Solとほとんど変わらない。モデル更新によって、すべての使い方が一律に安くなったわけではない。
データを表で見る
| 評価スコア (%) | |
|---|---|
| GPT-6 Sol(max) | 68.8 |
| GPT-6.1 Sol(medium) | 73 |
| GPT-6.1 Sol(high) | 75.2 |
| GPT-6.1 Sol(max) | 71.9 |
| GPT-6 Astra(xhigh) | 74.1 |
新Solではhighの75.2%に対し、maxは71.9%だった。3.3ポイント低い一方、費用は0.65ドルから1.57ドルへ約2.4倍になる。
つまり、推論量を増やせば必ず結果が良くなるわけではない。用途を問わずmaxへ固定するより、実際の仕事で必要な品質を満たせる設定を探す方が合理的だ。
ただし、この結果だけから「長く考えさせると性能が落ちる」という原因まで結論付けることはできない。
Astraのxhighも74.1%・4.43ドルで、数字だけを見れば新Solのhighを下回る。しかし、この小さな差だけから新Solの方が総合的に優れていると判断することもできない。
この結果は、各モデルの能力に順位を付けるというより、「必要な品質を、どの設定なら最も低い費用で達成できるか」を考える材料として見る方がよい。
PDF、業務自動化、画面操作ではAstraとの差が変わる
複雑なPDFを読んで質問に答える「GDP.pdf」では、新Solのhighが32.0%・0.35ドルだった。同じ設定のAstraは31.0%・1.79ドル、Opus 5.5は28.8%・0.83ドル。OpenAIの比較では、低い費用で上位モデルに近いスコアを出している。
Surge AIのGDP.pdfは、金融、医療、法務など10分野の実務で使われるPDFを題材にする。文章を読み取るだけでなく、表、グラフ、図、小さな文字で書かれた情報などを組み合わせて回答する必要がある。
文書やスプレッドシートなど、実際に作成した成果物を比較する「GDPval-AA」とは別の評価だ。
| 評価・設定 | GPT-6 Sol | GPT-6.1 Sol | GPT-6 Astra | Claude Opus 5.5 |
|---|---|---|---|---|
| GDP.pdf/high | 28.0%/0.35ドル | 32.0%/0.35ドル | 31.0%/1.79ドル | 28.8%/0.83ドル |
| AutomationBench 1.0.6/medium | 26.9%/0.21ドル | 31.7%/0.19ドル | 34.1%/1.27ドル | 29.5%/0.65ドル |
| AutomationBench 1.0.6/max | 32.0%/0.34ドル | 36.1%/0.30ドル | 41.4%/1.73ドル | 42.5%/1.44ドル |
| OSWorld 2.0オフライン/max | 64.4%/3.37ドル | 71.4%/1.27ドル | 73.5%/9.44ドル | 今回の図に掲載なし |
各セルは「得点/1タスク当たり費用」。OpenAI発表の比較グラフに基づく。Opus 5.5は別モデルへのフォールバックを含む条件で、競合モデルの値は公開レポートからの引用である。すべてのモデルを同じ環境で一斉に測定した独立試験ではなく、設定名が同じでも使われる計算量が等しいとは限らない。
業務自動化では、推論設定によって競合モデルとの位置関係も変わる。
ZapierのAutomationBenchは、営業、マーケティング、サポート、財務などの業務を47種類のツールを使って最後まで処理できるかを評価する。
mediumでは、新SolがOpus 5.5を2.2ポイント上回り、1タスク当たりの費用は約3分の1だった。しかしmaxでは、Opus 5.5の42.5%に対して新Solは36.1%で、6.4ポイント下回っている。
つまり、比較的低コストで使う場合の強さと、コストを増やして最高スコアを狙う場合の強さは同じではない。
画面上のアプリを操作するOSWorldでは、新Solは旧Solを7.0ポイント上回り、Astraとの差を2.1ポイントまで縮めた。
ここで使われたのはOSWorld 2.0の2026年8月8日版に含まれるオフライン課題で、完全に成功したかどうかだけでなく、途中まで達成した内容にも部分点が与えられる。
そのため、71.4%という数字を「71.4%の仕事を完全に終えた」と解釈することはできない。
科学タスクでは大幅改善、それでも上位モデルとの差は残る
科学分野の「Terminal-Bench Science 0.1」では、新Solのmaxが57.0%、旧Solが27.6%だった。スコアは2倍を超え、平均費用も12.18ドルから5.47ドルへ下がった。
一方、Astraは68.1%、Opus 5.5は63.3%を記録している。
データを表で見る
| max設定の得点 (%) | |
|---|---|
| GPT-6 Sol | 27.6 |
| GPT-6.1 Sol | 57 |
| Claude Opus 5.5 | 63.3 |
| GPT-6 Astra | 68.1 |
Astraとの差は11.1ポイントあり、画面操作のOSWorldほど接近していない。難しい科学タスクで最高水準の結果を求める場合には、Astraなど上位モデルを使う理由が残る。
| モデル(いずれもmax) | 1タスク当たり平均費用 |
|---|---|
| GPT-6 Sol | 12.18ドル |
| GPT-6.1 Sol | 5.47ドル |
| Claude Opus 5.5 | 23.21ドル |
| GPT-6 Astra | 23.80ドル |
新Solの費用は、Astraより約77.0%、Opus 5.5より約76.4%低い。
この価格差とスコア差を合わせて考えると、多数のタスクを繰り返し処理する用途と、難しい少数のタスクへ計算資源を集中させる用途では、適したモデルが変わる。
評価の運営サイトでは、データ分析やシミュレーションなど70の課題を掲載している。同サイトに掲載されたAstraとOpus 5.5の結果では、それぞれCodexとClaude Codeを使用しており、モデルだけの能力差を切り出した試験ではない。
また、Sonnet 5.5の発表などで使われたTerminal-Bench 4.0とも別の評価である。
正確性と安全性も、すべての指標が改善したわけではない
事実誤認を含む回答の割合は、低い推論設定で大きく改善した。
OpenAIの評価では、lowの旧Solが11.4%だったのに対し、新Solは7.7%だった。一方、maxでは両モデルとも4.6%となっている。
| 推論設定 | GPT-6 Solの誤答率 | GPT-6.1 Solの誤答率 | GPT-6 Astraの誤答率 |
|---|---|---|---|
| low | 11.4% | 7.7% | 6.3% |
| xhigh | 4.5% | 4.1% | 4.0% |
| max | 4.6% | 4.6% | 3.9% |
OpenAI発表グラフの値。少なくとも1つの事実誤認を含む回答の割合で、低いほど良い。
評価に使われたのは、過去のモデルが誤った回答をし、その誤りを利用者が指摘したChatGPTの会話から個人を特定できる情報を除いたものだ。
もともと誤答が起きやすい質問を選んでいるため、この数字をChatGPTの日常利用における誤答率とみなすことはできない。
低い推論設定で改善していることは読み取れるが、あらゆる用途で同じ割合だけ誤りが減るという意味ではない。
安全性の評価でも、改善した指標と、わずかに悪化した指標がある。
System Cardの7.4.2節では、検索ツールを利用できない状況で、その事実を最終回答で利用者へ伝えなかった割合が、旧Solの4.92%から新Solでは2.08%へ低下した。
一方、7.4.1節のコード作業で、実際に行ったことと異なる説明をする「misrepresentation」の割合は、新Solが1.50%、旧Solが1.30%、Astraが0.51%だった。
いずれも問題行動を意図的に引き出すよう設計された難しい評価であり、実際の利用環境で同じ割合の問題が起きることを示しているわけではない。
それでも、低コストで多数のタスクを任せる用途では、「最終的な答えが正しいか」だけでなく、「途中で失敗した場合に、その事実を正しく伝えるか」も別に評価する必要がある。
通常料金はSonnet 5.5と同額、キャッシュ済み入力は半額
GPT-6.1 SolとClaude Sonnet 5.5は、通常のAPI料金が100万トークン当たり入力2ドル、出力10ドルで同額だ。
GPT-6.1 Solではさらに、キャッシュ済み入力の料金が0.10ドルになった。旧GPT-6 SolとSonnet 5.5の0.20ドルに対して半額となる。
| モデル | 通常入力 | 出力 | キャッシュ読み取り |
|---|---|---|---|
| GPT-6 Sol | 2ドル | 10ドル | 0.20ドル |
| GPT-6.1 Sol | 2ドル | 10ドル | 0.10ドル |
| GPT-6 Astra | 10ドル | 50ドル | 1ドル |
| GPT-6 Luna | 0.10ドル | 0.50ドル | 0.01ドル |
| Claude Sonnet 5.5 | 2ドル | 10ドル | 0.20ドル |
| Claude Opus 5.5 | 4ドル | 20ドル | 0.20ドル |
単位は100万トークン当たりの米ドル。OpenAIの新Sol発表、旧Solのモデル文書、Anthropicの公開料金に基づく標準価格。長文入力に対する追加料金、Fastモード、キャッシュへの書き込み料金などは含まない。
OpenAIがいうAstraに対する「5分の1」は、通常の入力・出力単価を指す。キャッシュ済み入力については、新Solの0.10ドルに対してAstraは1ドルなので10分の1となる。
同じ長い指示や資料を繰り返し使うワークロードほど、キャッシュ済み入力が安くなった効果は大きくなる。
ただし、Sonnet 5.5との性能の優劣を、この料金表だけから判断することはできない。
AnthropicがSonnet 5.5について公表している評価にはOSWorld 2.1やGDPval-AAなどがあり、OpenAIが今回示したOSWorld 2.0やGDP.pdfとは異なる。測定内容が異なるベンチマークの数字を同列に並べても、直接的な性能比較にはならない。
Sonnet 5.5を扱った記事でも重要だったのは、APIの単価だけでなく、同じ仕事を終えるまでに実際にどれだけのトークンと費用を使うかだった。
今回のSolも、100万トークン当たりの価格だけでなく、「必要な品質へどれだけ少ない処理量で到達できるか」が実際のコストを左右する。
キャッシュ料金が半額でも、総費用が半分になるわけではない
プロンプトキャッシュは、一度処理した入力の共通部分を後続のリクエストで再利用する仕組みだ。
OpenAIのモデル文書では、新Solのキャッシュ書き込み料金は100万トークン当たり2.50ドルで、通常入力2ドルの1.25倍となる。この2.50ドルは通常入力料金への追加料金ではなく、キャッシュへ保存する入力部分そのものに適用される単価だ。
10万トークンの固定入力を最初にキャッシュへ保存し、合計10回利用し、毎回1,000トークンを出力すると仮定すると、キャッシュ済み入力の単価が半額になっても、旧Solからの総費用削減は約17%となる。
9月30日時点の新Solと旧Solの公開料金を使った単純な試算であり、実際のモデルを動かして測定したものではない。
初回に入力全体を一度キャッシュへ保存し、2回目以降はすべて再利用できると仮定している。キャッシュの失効や入力内容の変更はなく、出力した文章を次の入力へ追加しないものとする。
| 同じ固定入力を使う回数 | GPT-6 Sol | GPT-6.1 Sol | キャッシュなし(両モデル) |
|---|---|---|---|
| 1回 | 0.26ドル | 0.26ドル | 0.21ドル |
| 2回 | 0.29ドル | 0.28ドル | 0.42ドル |
| 10回 | 0.53ドル | 0.44ドル | 2.10ドル |
| 100回 | 3.23ドル | 2.24ドル | 21.00ドル |
表は各回数までの累計額で、初回のキャッシュ書き込みと全回分の出力料金を含む。ツール使用料、Fastモード、税、各種割引などは含めていない。
計算式は、
0.1 × キャッシュ書き込み単価 + 0.1 ×(利用回数−1)× キャッシュ読み取り単価 + 0.001 × 利用回数 × 出力単価
となる。
10回の場合、新Solは0.25+0.09+0.10=0.44ドル、旧Solは0.25+0.18+0.10=0.53ドル。削減率は約17%だ。
キャッシュから読み取る部分だけを見れば料金は半額になっているが、最初の書き込み料金と出力料金は変わらないため、総額まで半分になるわけではない。
1回しか使わない入力であれば、キャッシュへ保存する方がかえって高くなる。一方、同じ長い資料やシステムプロンプトを何度も利用する用途では効果が大きくなる。
プロンプトキャッシュの開発者文書では、入力の先頭部分が一致していることが再利用の条件になる。モデルや設定、プロンプトの構成などが変わればキャッシュが一致しない場合もある。
同じ会話を続けているだけで、必ずすべての入力がキャッシュ料金になるわけではない。
導入前に確認したい推論設定と長文料金
GPT-6.1 Solは、Plus、Pro、Business、Enterprise、Eduのユーザー向けに、ChatGPT WorkとCodexで提供される。APIからもgpt-6.1-solとして利用できるが、通常のChatにはまだ提供されていない。
つまり、ChatGPTの対象プランを契約していれば、すべての画面からGPT-6.1 Solを選べるというわけではない。
開発者にとっては、旧Solから移行する際に設定の違いにも注意が必要だ。
モデル文書によると、新Solのreasoning.effortはlow、medium、high、xhigh、maxに対応し、既定値はmediumとなる。
旧Solで利用できたnoneはGPT-6.1 Solでは使えない。
ツール呼び出しを利用する場合はResponses APIを使う必要があり、Chat Completions APIではGPT-6.1 Solによるツール呼び出しには対応していない。
コンテキストウィンドウは105万トークン、最大出力は12万8,000トークンとなる。
ただし、入力が27万2,000トークンを超えるリクエストでは、そのリクエスト全体に長文料金が適用され、入力とキャッシュ関連の料金は2倍、出力料金は1.5倍になる。
長大な資料を一度に投入する場合には、通常の入力2ドル・出力10ドルだけを使って費用を見積もることはできない。
Fastモードも標準料金の2倍となるため、大きなコンテキストや高速処理を利用する場合には、それぞれの追加料金を考慮する必要がある。
高速版のGPT-6.1 Sol Ultrafastについては、9月30日時点でOpenAIの日本語版と英語版の発表に表現の違いがある。
日本語版はGPT-6.1 Sol Ultrafastを「提供開始します」としている一方、英語版では「今後数日以内」にCodexで提供すると説明している。
標準版GPT-6.1 Solがすでに提供されていることと、Ultrafastを実際に利用できるかどうかは分けて確認した方がよい。
導入時には、まず普段の仕事で何を満たせば合格なのかを決める必要がある。
コード修正ならテスト結果と変更範囲、PDF読解なら根拠の正確さ、業務自動化なら必要な処理を最後まで正しく完了できたかを確認し、そのうえで推論設定ごとの費用と処理時間を比べる。
新Solでは、低い推論設定でも必要な品質を満たせる仕事が増える可能性がある。そうした仕事をSolへ任せ、AstraやOpus 5.5の高い性能が必要な難しいタスクだけに上位モデルを使えば、同じ予算でより多くの処理を行える。
