Googleは9月30日、次世代の旗艦AIモデル「Gemini 4 Argon」を発表した。1回の処理で生成できるトークン数の上限を、従来の約6万4000から100万へ大幅に拡大し、長時間にわたるソフトウェア開発や、金融・法務などの複雑な業務をこなすモデルとして打ち出している。
Googleが公開した比較では、金融調査や法務、業務自動化などの評価でOpenAIやAnthropicのモデルを上回った。一方、ソフトウェア開発や科学研究では、評価によって競合モデルが上回るケースもある。
価格も競争力のある水準に設定したが、提供はまず、信頼できるサイバー防御担当者を対象に始める。一般の開発者や利用者への提供開始日は明らかにしていない。性能、価格、提供方法を合わせて見ると、Googleが企業の専門業務や長時間のAIエージェント作業で競争力を高めようとしていることが分かる。
100万トークンの出力上限で、長時間の作業に対応
Argonでは、出力トークンの上限が100万トークンに引き上げられた。
トークンは、AIが文章やコードを処理するときの単位だ。今回大きく増えたのは、入力として読み込める情報量ではなく、1回の処理でモデルが生成できるトークン数の上限である。従来の約6万4000トークンと比べると、約15.6倍になる。
Googleは、1回の処理の中で数十万トークン規模の推論や生成を続けられる余裕を持たせることで、複雑な問題に長時間取り組めるようにしたと説明している。
例えば大規模なコード移植では、既存コードを調べ、修正し、テスト結果を確認し、さらに書き直すといった工程を何度も繰り返す必要がある。出力上限を増やすことで、こうした長い作業を途中で打ち切らずに進めやすくすることが狙いだ。
ただし、100万トークンの回答を必ず生成できるという意味ではなく、長く推論すれば必ず正解に到達できるわけでもない。1回の処理をどこまで長く続けられるかと、実際に仕事を正しく完了できるかは分けて考える必要がある。
Googleによると、すでに数千人の社員がArgonを専門的なコーディングや調査などに利用している。
ただし、外部への提供は段階的に進める。まず「Fairwind Program」を通じて信頼できるサイバー防御担当者に提供し、その後、有料API利用者とGoogle AI Ultra加入者を皮切りに対象を広げる予定だ。
発表時点では、一般の開発者がすぐにAPIから利用できる状態ではない。
金融・法務では高得点、開発や科学では評価ごとに結果が分かれる
Googleが公開した比較を見ると、Argonが特に高い結果を示しているのは、金融調査や法務、業務自動化などの分野だ。
単発の質問に答えるだけでなく、複数の工程を進めて最終的な成果物を作るような仕事を重視して開発されたモデルであることがうかがえる。
| 評価と主な対象 | Gemini 4 Argon | GPT-6 Astra | Claude Opus 5.5 |
|---|---|---|---|
| DeepSWE v1.1:実際のコードベースを使った長時間の開発作業 | 77.9% | 74.1% | 74.2% |
| FrontierSWE v2:ソフトウェア開発 | 55.0% | 65.5% | 62.3% |
| Terminal-Bench 4.0:ターミナルを使った複数段階の作業 | 57.4% | 58.2% | 66.4% |
| Terminal-Bench Science 0.1:科学研究に関する作業 | 57.6% | 68.1% | 63.3% |
| LABBench 2 | 88.8% | 85.4% | 73.1% |
| RiemannBench | 76% | 72% | 69.6% |
| AutomationBench:業務プロセスの一連の実行 | 51.3% | 41.4% | 42.5% |
| Vals Finance Agent v2:複数段階の金融調査 | 65.4% | 53.5% | 58.6% |
| Harvey’s Legal Agent Benchmark:法務調査・文書作成 | 19.6% | 5.4% | 3.8% |
| LVBench:長時間の動画理解 | 91.7% | 87.5% | 83.7% |
| CWE-bench v1:脆弱性の修正 | 68.0% | 68.0% | 67.0% |
出典はGoogleの評価方法と結果。太字は、この3モデルの中で最も高い値を示す。それぞれ独立した評価指標であり、数値を単純に平均してモデル全体の優劣を判断できるものではない。
DeepSWEでは、ArgonがOpus 5.5を3.7ポイント上回った。
一方、別のソフトウェア開発評価であるFrontierSWEではAstraを10.5ポイント下回り、Terminal-Bench 4.0ではOpus 5.5を9.0ポイント下回っている。
科学研究を扱うTerminal-Bench ScienceでもAstraが10.5ポイント上回った。しかし、同じ比較表にあるLABBench 2とRiemannBenchでは、Argonが3モデルの中で最も高い。
ソフトウェア開発や科学研究と一口に言っても、評価する仕事内容によって得意・不得意が異なることが分かる。
法務分野の19.6%についても注意が必要だ。
競合モデルとの差は大きいものの、「実際の法律業務の約2割を自動化できる」という意味ではない。あくまで、そのベンチマークで求められた法務関連の成果物に対する得点だ。絶対値そのものは、難易度の高い法務作業を完全にこなすにはまだ大きな余地があることも示している。
AutomationBenchの51.3%についても、自社業務の半分をそのままArgonに任せられるという意味ではない。
比較条件にも注意が必要だ。
Googleの説明では、Argonは原則として最も高い思考設定で評価し、1回の試行で課題に成功できるかを測っている。一方、競合モデルの数値には各社の発表や公開ランキングから引用したものもあり、すべてのモデルをGoogleが同一環境で再評価した比較ではない。
DeepSWEでも、Argonにはmini-sweの実行環境を使う一方、競合モデルには公開済みの結果を採用している。
動画理解を測るLVBenchでも条件が異なる。Geminiは毎秒1フレームを入力するのに対し、Astraは最大800フレーム、Opus 5.5は600フレームを使用している。
Terminal-Bench Science 0.1では、Argonについて結果を確認する処理のタイムアウトを標準設定の6倍に延長している。
こうした条件差を踏まえると、数値はモデルの得意分野を探る手掛かりにはなるが、単純な総合順位として読むべきではない。
Vals Indexでは首位、ただしモデルによって実行費用は大きく異なる
第三者のAI評価機関Vals AIが公開する「Vals Index v2.1」でも、Argonは68.90%を記録し、10月1日時点で最上位となっている。
Googleの比較表には含まれていないGPT-6.1 SolやClaude Sonnet 5.5まで含めると、モデルごとの性能と実行費用の違いも見えてくる。
| モデル | Vals Index v2.1 | 1テスト当たりの表示費用 |
|---|---|---|
| Gemini 4 Argon | 68.90% | 15.68ドル |
| Claude Sonnet 5.5 | 67.04% | 21.34ドル |
| Claude Opus 5.5 | 66.97% | 32.14ドル |
| GPT-6 Astra | 63.13% | 18.46ドル |
| GPT-6.1 Sol | 61.15% | 3.24ドル |
出典はVals AIのランキングと評価方法、10月1日閲覧時点。Argonの費用計算には導入価格ではなく、入力4ドル・出力20ドルという導入期間終了後の単価が使われている。また、Claudeの得点には、安全対策によって元のモデルが回答を拒否した後、代替モデルで実行した一部の課題も含まれる。
データを表で見る
| Vals AIの表示費用 (米ドル) | |
|---|---|
| Gemini 4 Argon | 15.68 |
| Claude Sonnet 5.5 | 21.34 |
| Claude Opus 5.5 | 32.14 |
| GPT-6 Astra | 18.46 |
| GPT-6.1 Sol | 3.24 |
この評価では、ArgonはOpus 5.5より高い得点を記録しながら、1テスト当たりの費用も低くなっている。
一方、GPT-6.1 Solと比べると、Argonの得点は高いものの、表示された費用は約4.8倍だ。15.68ドルを3.24ドルで割った値である。
この差は単純なAPI単価だけで決まるわけではない。評価中に各モデルが使用したトークン量や、推論の長さ、実行条件なども反映されている。
Vals Indexは、金融、コーディング、法務、税務の4分野の評価結果を、それぞれの分野が米国GDPに占める割合に応じて重み付けした指標だ。
AIが実際の知識労働でどの程度役立つかを測ろうとする試みだが、68.90%という数字が「米国経済の68.9%に対応できる」といった意味ではない。当然、日本企業での業務成功率を示すものでもない。
自社の仕事がどの評価分野に近いかによって、数値の意味は大きく変わる。
またValsによると、Claudeが拒否した課題で代替モデルを使わず、そのまま失敗として扱った場合、Sonnet 5.5は65.85%、Opus 5.5は65.05%となる。
公開ランキングには、モデルそのものの能力だけでなく、実際のサービス運用時の挙動も含まれている点に注意が必要だ。
導入価格はAstraやOpusより安く、SolやSonnet 5.5と同水準
Argonの導入価格は、100万トークン当たり入力2ドル、出力10ドルだ。
Astraの標準価格である入力10ドル・出力50ドルの5分の1で、Opus 5.5の入力4ドル・出力20ドルと比べても半額になる。
ただし、この価格は期間限定だ。Googleは、導入期間終了後に入力4ドル、出力20ドルへ引き上げるとしているが、終了日は明らかにしていない。
| モデル・価格区分 | 入力/100万トークン | 出力/100万トークン | キャッシュ読み出し/100万トークン |
|---|---|---|---|
| Argon:導入価格 | 2ドル | 10ドル | 0.10ドル |
| Argon:導入期間終了後 | 4ドル | 20ドル | 終了後の適用条件を要確認 |
| GPT-6 Astra | 10ドル | 50ドル | 1.00ドル |
| GPT-6.1 Sol | 2ドル | 10ドル | 0.10ドル |
| Claude Opus 5.5 | 4ドル | 20ドル | 0.20ドル |
| Claude Sonnet 5.5 | 2ドル | 10ドル | 0.20ドル |
10月1日時点のGoogleの発表、OpenAIの公式料金、Opus 5.5の公式案内、Sonnet 5.5の発表をもとに比較した。
通常処理の基本単価を対象とし、OpenAIについては短いコンテキストでのStandard料金を採用している。長いコンテキストに対する追加料金、高速処理、キャッシュへの書き込みや保存、ツール利用などの料金は含めていない。
仮に、入力10万トークン、出力2万トークンを使用するとして単純計算すると、Argonの導入価格では0.40ドル、導入期間終了後は0.80ドルとなる。
Astraは2.00ドルで、SolとSonnet 5.5はArgonの導入価格と同じ0.40ドルだ。
計算式は「入力単価×0.10+出力単価×0.02」で、キャッシュは利用しないものとした。例えばArgonの導入価格なら、2×0.10+10×0.02=0.40ドルとなる。
これは、同じトークン数を使った場合の単価差を見るための試算にすぎない。それぞれのモデルが同じ仕事を同じ量の推論や出力で完了できることを意味するものではない。
キャッシュについてGoogleは、入力トークンの通常価格から95%割り引くとしている。導入価格を基準にすると、100万トークン当たり0.10ドルとなり、GPT-6.1 Solのキャッシュ読み出し価格と同額だ。
ただし、各社ではトークンの数え方やキャッシュの課金方式が異なる。APIの単価だけから、長時間動作するAIエージェントの総費用を判断するのは難しい。
Googleが価格面で競う相手も、高価格帯の旗艦モデルだけではない。
Argonの導入価格である入力2ドル・出力10ドルは、GPT-6.1 SolやClaude Sonnet 5.5と同水準だ。そのため実際の導入では、同じ仕事を完了するまでに何回の試行が必要か、どれだけ長く推論するか、修正にどれだけ人間の手間がかかるかまで含めた比較が重要になる。
Google社内では大規模なRust移植やメモリー最適化に活用
GoogleがArgonの活用例として紹介したものの一つが、動画デコーダー「libgav1」のRust版の改良だ。
Argonを使ったエージェントは、既存のRust移植版に含まれていた約3万2000行のSIMDコードを置き換えたという。
SIMDは、一つの命令で複数のデータをまとめて処理することで高速化する仕組みだ。
Argonは実行性能を測定し、コンパイラーが生成したコードを確認する作業を繰り返しながら、安全なRustコードをコンパイラー自身が効率よくベクトル化できる方法を探した。
Googleによると、生成する映像を変えずに、改良前のRust版と比べて2.7倍高速になり、最適化されたC++版の性能に近づいた。
重要なのは、2.7倍という数字の比較対象が最適化済みのC++版ではなく、改良前のRust版であることだ。
Googleはこのほか、re2などのライブラリーから、80万行を超えるFuchsia OSのZirconカーネルまで、C/C++コードをRustへ移行する作業にArgonを利用している。
ただし、こうした大規模な書き換えは、本番環境へ投入する前に自動テストや人間による監査、エミュレーションなどを実施している段階だ。AIがコードを生成できたことと、そのコードがすでに本番環境で使われていることは分けて考える必要がある。
データセンターのメモリー最適化でも、Argonを使ったエージェントが分析と改善を行った。
Googleによると、実際に展開された最適化によって300TiBを超えるメモリーを解放したという。また、最終的な削減効果を500TiB〜1PiBと見積もっている。
実際に削減された300TiB超と、今後を含む推計値の500TiB〜1PiBは区別する必要がある。また、これらはいずれもGoogleによる社内での成果報告であり、第三者が再現した結果ではない。
なぜ最初の提供先がサイバー防御なのか
Argonの一般公開に先立ち、まずサイバー防御の専門家に提供する背景には、モデルのサイバーセキュリティ能力が大幅に高まったことがある。
Googleによると、Argonはソフトウェアの脆弱性を自律的に発見し、その問題を確認したうえで修正まで行える。
Wizも、重要な公共インフラの脆弱性を無償で調査する「Scan for Good」でArgonを利用しているという。
一方、脆弱性を発見して実証する能力は、防御だけでなく攻撃にも転用できる。
そこでGoogleは、信頼できる防御担当者と社内チームには、サイバーセキュリティ向けのガードレールを外した形でArgonを提供する一方、一般向けの提供に備えて安全対策の強化を続けている。
悪用への対策だけでなく、外部のWebページや文書などに埋め込まれた命令によってAIの行動を乗っ取る「間接プロンプトインジェクション」への耐性も強化したという。
さらに、モデルがユーザーの意図を外れて目的を達成しようとする動きを監視し、必要に応じて処理を停止する仕組みも導入する。
リスクの高い学習や評価を行う環境については、外部から隔離したサンドボックスの強化も進めている。
Googleは米政府が実施する、公開前のAIモデルを自主的に共有する取り組みにも参加している。初期利用者から実際の使用結果を集めながら、安全対策を調整し、提供範囲を段階的に広げる方針だ。
今後、有料API利用者やGoogle AI Ultra加入者への提供が始まれば、一般の開発者や企業も自分たちの業務でArgonを競合モデルと比較できるようになる。
その段階では、ベンチマークの得点や100万トークンという上限だけでなく、実際の仕事を完了するまでの推論量、処理時間、API費用、人間による修正の手間まで測る必要がある。
長時間のソフトウェア開発や専門業務をどのAIに任せるべきかは、そこで初めて実務に即した比較ができるようになる。
