xAIは2026年9月21日、コーディングおよび高度なナレッジワーク向けに最適化された最新推論モデル「Grok 4.7」を正式リリースした。前世代「Grok 4.6」の登場からわずか約1か月強での刷新であり、前世代と同等の入力100万トークンあたり2ドル、出力100万トークンあたり6ドルという価格設定を維持している。発表と同時に自社のCursorやGrok Build、公式APIで即時利用可能となったほか、GitHubも同日中にGitHub Copilotの全プラン(Pro、Pro+、Max、Business、Enterprise)へGrok 4.7の段階的ロールアウトを開始した。開発ツールの中心プラットフォームを介して即座に実開発の現場へ浸透する供給体制が整った。

AD

100万トークンあたり2ドル/6ドルの破壊的価格設定

Grok 4.7のAPI利用料金は入力100万トークンあたり2ドル、出力100万トークンあたり6ドルに設定されており、GPT-5.6 Sol(入力4ドル/出力20ドル)と比較して入力で2分の1、出力で3.3分の1、Fable 5.1(入力10ドル/出力50ドル)と比較して入力で5分の1、出力で8.3分の1という大幅な低価格を実現している。通常の2倍の出力速度を備えた高速版(fast variant)も倍額の料金(入力4ドル/出力12ドル)で提供される。

主要フロンティア推論モデルのAPI利用料金比較

モデル名 入力料金(100万トークン) 出力料金(100万トークン) Grok 4.7比(入力) Grok 4.7比(出力)
Grok 4.7 2ドル 6ドル 基準 基準
GPT-5.6 Sol 4ドル 20ドル 2分の1 3.3分の1
Claude Fable 5.1 10ドル 50ドル 5分の1 8.3分の1
  • 入力料金
  • 出力料金
主要推論モデルのAPI利用料金比較横棒グラフ。カテゴリ 3 件、系列: 入力料金, 出力料金(単位: ドル)Grok 4.7Grok 4.7Grok 4.7 — 入力料金: 2ドル2Grok 4.7 — 出力料金: 6ドル6GPT-5.6 SolGPT-5.6 SolGPT-5.6 Sol — 入力料金: 4ドル4GPT-5.6 Sol — 出力料金: 20ドル20Claude Fable 5.1Claude Fable 5.1Claude Fable 5.1 — 入力料金: 10ドル10Claude Fable 5.1 — 出力料金: 50ドル50単位: ドル
データを表で見る
入力料金 (ドル)出力料金 (ドル)
Grok 4.726
GPT-5.6 Sol420
Claude Fable 5.11050
主要推論モデルのAPI利用料金比較100万トークンあたりの通常リスト価格出典: xAI公式発表資料

この比較が示す通り、Grok 4.7は出力トークンにおいて他社フロンティアモデルと3.3倍から8.3倍の価格差をつけており、長大な思考プロセスを前提とするエージェント運用の費用対効果を大きく高めている。

ソフトウェア開発の自動化において、推論モデルが複数ステップにわたり思考を巡らせるエージェント型ワークフローでは、トークン消費量が飛躍的に増大する傾向がある。出力トークンが積み重なるほどAPIコストは急激に膨らむため、最上位モデルを常時稼働させる際の費用負担は多くの企業にとって重い制約となってきた。Grok 4.7は中国勢の低価格モデルに匹敵する価格水準を提示することで、開発組織がコストを抑制しながら高頻度で自律エージェントを実行できる環境を整える。

モデルアーキテクチャと推論訓練の進化

xAIの発表資料によると、Grok 4.7はGrok 4.6と比べて大規模化された新しいベースモデルを基礎としている。訓練プロセスでは、完了までに数時間を要する難度の高い問題群に比重を置いた長時間の強化学習(RL)が実施された。

この追加訓練によって、モデル自らが生成過程で途中結果を検証し、誤りを自己修正する能力が向上した。長大なコンテキストを維持しながら一貫した出力を保つ制御力も引き上げられている。さらにxAIは、独自の自律コーディング環境「Grok Bot」ハーネスの内部構造をネイティブに理解するようGrok 4.7を事前学習させた。外部ツール呼び出しや対話的なファイル編集を伴う実務において、的確なコマンド生成と状況判断が可能となった。

AD

開発プラットフォームへの即時浸透:GitHub Copilot全プランへの同時展開

Grok 4.7の流通戦略における際立った特徴は、自社エコシステムを超えた大手開発プラットフォームへの即時統合にある。CursorやGrok Build、公式APIでの公開と足並みを揃え、GitHubは公式Changelogを通じてGitHub CopilotにおけるGrok 4.7の提供開始を公表した。

対象となるのは、個人向けのProおよびPro+、ヘビーユーザー向けのMax、組織向けのBusinessとEnterpriseを含む全プランである。開発者はVisual Studio Code、Visual Studio、JetBrains各IDE、Xcode、Eclipse、さらにはGitHub Copilot CLIやクラウドエージェント、モバイルアプリのモデルピッカーから直接Grok 4.7を選択できるようになる。

企業向け管理機能も初日から整備されている。Copilot BusinessおよびEnterpriseの管理者は、組織設定のモデルポリシー画面からGrok 4.7の利用可否を統括できる。デフォルトの設定では新モデルが自動的に有効化される仕組みとなっており、利用料金はプロバイダーのリスト価格に基づく従量課金で処理される。開発者の日常的な作業環境に初日から選択肢として組み込まれたことは、モデルの普及速度を大きく後押しする。

公式ベンチマークと第三者評価に見るエージェント推論の乖離

提示されたベンチマーク結果を精査すると、Grok 4.7の得意領域と克服すべき課題が客観的な数値として示されている。公式ベンチマークのCursorBench 4.0ではGrok 4.7が46.3%を記録しGPT-5.6 Sol(41.7%)を上回る一方、自律端末操作を評価するTerminal-Bench 4.0では38.0%にとどまり、Fable 5.1(57.9%)に対して19.9ポイントの開きが存在する。

ソフトウェアエンジニアリングの実務課題を模したDeepSWE v1.1(高推論努力量設定)では71.0%をマークし、Grok 4.6の65.2%やClaude Fable 5.1 Maxの70.0%を上回った(GPT-5.6 Sol Maxは72.7%)。電気工学領域を扱うEEBenchでも64.0%に達し、GPT-5.6 Sol Max(39.4%)やFable 5.1 Max(56.4%)を引き離している。長時間のオフィス実務を模したAA Briefcase v1.1や法務タスクを扱うHarvey Legal Agent Benchmarkなどの専門業務領域においても、前世代を大きく上回る改善が示されている。

主要ベンチマークスコア比較

ベンチマーク 評価対象 Grok 4.7 GPT-5.6 Sol Max Claude Fable 5.1 Max
CursorBench 4.0 長時間コーディング 46.3% 41.7% 51.8%
DeepSWE v1.1 ソフトウェア工学 71.0% 72.7% 70.0%
EEBench 電気工学 64.0% 39.4% 56.4%
Terminal-Bench 4.0 自律端末操作(公式) 38.0% - 57.9%
  • Grok 4.7
  • GPT-5.6 Sol Max
  • Claude Fable 5.1 Max
主要モデルのコーディング・エージェント推論ベンチマーク比較横棒グラフ。カテゴリ 4 件、系列: Grok 4.7, GPT-5.6 Sol Max, Claude Fable 5.1 Max(単位: %)CursorBench 4.0CursorBench 4.0CursorBench 4.0 — Grok 4.7: 46.3%46.3CursorBench 4.0 — GPT-5.6 Sol Max: 41.7%41.7CursorBench 4.0 — Claude Fable 5.1 Max: 51.8%51.8DeepSWE v1.1DeepSWE v1.1DeepSWE v1.1 — Grok 4.7: 71%71DeepSWE v1.1 — GPT-5.6 Sol Max: 72.7%72.7DeepSWE v1.1 — Claude Fable 5.1 Max: 70%70EEBenchEEBenchEEBench — Grok 4.7: 64%64EEBench — GPT-5.6 Sol Max: 39.4%39.4EEBench — Claude Fable 5.1 Max: 56.4%56.4Terminal-Bench 4.0Terminal-Bench 4.…Terminal-Bench 4.0 — Grok 4.7: 38%38Terminal-Bench 4.0 — Claude Fable 5.1 Max: 57.9%57.9単位: %
データを表で見る
Grok 4.7 (%)GPT-5.6 Sol Max (%)Claude Fable 5.1 Max (%)
CursorBench 4.046.341.751.8
DeepSWE v1.17172.770
EEBench6439.456.4
Terminal-Bench 4.03857.9
主要モデルのコーディング・エージェント推論ベンチマーク比較各社公式発表値に基づく比較(推論努力量High/Max設定)出典: xAI公式発表資料

グラフおよび表から読み取れる通り、Grok 4.7はCursorBench 4.0やEEBenchなどの特定ドメインで優れた成果を収める一方、自律端末操作を測定するTerminal-Bench 4.0ではFable 5.1に対して明らかな開きを残している。

一方で、独立評価機関の測定では慎重な見方も提示されている。Artificial Analysisが公表した総合指標「Intelligence Index v4.3.2」(10種類の評価統合)において、Grok 4.7の総合スコアは46と判定された。総合首位に並ぶClaude Fable 5.1(53)やGPT-6(53)との間には7ポイントの開きがあり、フロンティア群の中位グループに位置づけられる。同機関が標準環境で実施したTerminal-Bench 4.0の独立テストでは、Grok 4.7のスコアは26%にとどまり、GPT-6 Astra(60%)やClaude Fable 5.1(55%)に大きく水をあけられている。

これらのデータは、Grok 4.7が特定のコーディング支援や定型的なナレッジワークにおいて卓越した費用対効果を発揮する反面、多段階のシェル操作や予期せぬエラー処理が連続する複雑な自律エージェント運用においては、なお最上位モデルに優位性がある現状を物語っている。

AD

セーフガードスタックの刷新と今後の展望

実務適用の拡大に向けて、安全性とサイバー防衛の設計も改められた。Grok 4.7には完全に再構築されたセーフガードスタックが導入されている。

セキュリティ研究や脆弱性診断などの正当な業務においてAIが過剰に回答を拒絶する「過剰拒否(false refusal)」を抑制しつつ、悪意あるジェイルブレイクや攻撃支援を防ぐバランス調整が施された。悪意あるサイバータスクを評価するベンチマーク「HackerBench v0.3」において、Grok 4.7は危険なデュアルユースプロンプトの通過率を3.3%に抑え込み、正当なセキュリティ業務の遮断を最小限に留めた。生物学領域の安全性指標であるLatchBioのバイオセーフティベンチマークでも62.4%のトップスコアを記録している。xAIは一部の選定されたサイバーセキュリティパートナーに対し、防衛研究を目的としたレッドチーム機能への招待制アクセスを提供し始めた。

Grok 4.7は、フロンティアモデルが直面していた推論強化に伴うコストインフレに対するxAIからの明確な回答と言える。最上位の自律推論モデルとの間には依然として能力差が残るものの、入力2ドル/出力6ドルという低価格とGitHub Copilotへの即時展開は、実用的なコーディング支援ツールの勢力図を着実に塗り替えつつある。