NVIDIAは2026年10月7日(米国時間)、MicrosoftのWindows/Surfaceイベントで、企業向けAIワークステーション「DGX Station for Windows」を改めて披露した。

「GB300 Grace Blackwell Ultra Desktop Superchip」を搭載し、CPUとGPUを合わせて最大748GBのメモリを備える。FP4精度での演算性能は最大20PFLOPSに達し、2026年第4四半期の発売を予定している。

これまでAI開発に使うLinux環境と、業務アプリを利用するWindows環境を行き来していた開発者にとって、両方を1台で扱えるようになる点が特徴だ。

ただし、1兆パラメータ規模のAIモデルをメモリに収められることと、そのモデルを十分な速度で動かせることは別問題である。

AD

Windowsの業務アプリと大規模AIを1台で扱う

DGX Station for Windowsは、Windows上で設計や研究などの業務を進めながら、大規模なAIモデルや常時稼働するAIエージェントも手元で動かしたい企業を想定した製品だ。

従来のDGX StationはLinuxを中心としたシステムだったが、Windows版では、Windowsの業務アプリとGB300の強力な計算資源を同じ端末で利用できる。さらに、Windows Subsystem for Linux(WSL)を通じて、Linux向けのAI開発ツールも実行できるとNVIDIAは説明している。

Windows版が最初に発表されたのは、2026年5月31日のNVIDIAの発表だ。

10月7日のイベントは発売に向けた改めての披露であり、新しいGPUの発表や即日販売を意味するものではない。2026年第4四半期という発売予定も、当初から示されていた。

それでも、今回の披露には意味がある。

Microsoftは同じイベントで、端末内のAIとクラウドのAIを用途に応じて使い分ける、Windowsの新たな方針を示した。

その中でDGX Stationは、研究者や開発者が手元で利用する高性能な計算機としてだけでなく、チームで共有するAI推論基盤としても位置づけられている。

Microsoftは後者の用途として、32以上のAIエージェントを同時に稼働させる例を挙げている。

企業にとって重要なのは、AIを利用するたびに普段の業務環境から離れる手間や、AI専用の計算機を別の仕組みで管理する負担を、どこまで減らせるかという点だ。

常時稼働するAIエージェントは、モデルが文章を生成するだけで仕事を終えるわけではない。業務アプリの操作やファイルの処理などを行い、長時間にわたって作業を続ける場合もある。

こうした処理に必要な計算資源とアクセス権限の管理を、既存のWindows環境に組み込みやすくすることが、今回の製品の狙いとなっている。

748GBの大容量メモリ、ただしすべてが高速なGPUメモリではない

DGX Station for Windowsの中核となるGB300は、72コアのGrace CPUとBlackwell Ultra GPUを、NVLink-C2Cで接続した構成だ。

最大748GBというメモリ容量は、GPU側の252GBとCPU側の496GBを合計したものであり、すべてが高速なGPUメモリというわけではない。

NVIDIAが公開したWindows版の仕様を整理すると、次のようになる。

構成要素 メモリ容量 公称帯域幅 大規模AIでの主な役割
GPU側のHBM3e 252GB 7.1TB/s GPUが高速にアクセスするモデルの重みや計算データを保持
CPU側のLPDDR5X 496GB 396GB/s GPUメモリに収まりきらないモデルの重みやデータを格納
CPUとGPUを接続するNVLink-C2C メモリ容量には含まれない 900GB/s CPUとGPUの間でデータをやり取りするための接続

※数値は2026年10月8日時点のNVIDIA公式仕様に基づく公称値。メモリの帯域幅とCPU・GPU間の接続帯域幅は、それぞれ異なる性能指標であり、単純に足し合わせることはできない。

NVIDIAが「コヒーレントメモリ」と呼ぶのは、CPUとGPUがデータの整合性を保ちながらメモリを利用できる仕組みだ。

GPU側だけでなく、CPU側の大容量メモリも活用できるため、GPUメモリには収まりきらない大規模なAIモデルを扱える可能性が広がる。

ただし、GPU側とCPU側ではメモリの帯域幅が大きく異なり、両者をつなぐNVLink-C2Cにも転送速度の上限がある。

748GBのメモリを利用できるからといって、そのすべてに7.1TB/sの速度でアクセスできるわけではない。

モデルのどの部分をGPU側のHBM3eに置き、どの部分をCPU側のLPDDR5Xに置くかによって、計算処理とデータ転送にかかる時間は変わってくる。

748GBという容量は、利用できるAIモデルの規模を広げるものだが、実際の推論速度を判断するには、メモリの配置や帯域幅まで考慮する必要がある。

最大20PFLOPSはFP4演算のピーク性能

NVIDIAが掲げる最大20PFLOPSという演算性能にも、注意すべき条件がある。

この数値は、FP4精度でTensor Core演算を実行し、スパース性(疎性)を利用した場合の理論上のピーク性能だ。

スパース性とは、所定のデータ構造を利用して一部の演算を省略し、計算効率を高める仕組みを指す。

NVIDIAの仕様表では、スパース性を利用しないFP4演算性能は15PFLOPS、FP16/BF16のTensor Core演算性能は5PFLOPS、FP32演算性能は80TFLOPSとされている。

なお、特に断りのないTensor Coreの性能値にはスパース性を利用した場合の数値が含まれ、ピーク性能はGPUのブーストクロックを前提としている。

FP4は、数値を4ビットで表現する低精度のデータ形式だ。大規模AIモデルを実行する際、必要なメモリ容量や計算量を抑えるために使われる。

しかし、FP4での20PFLOPSという性能を、そのまま高精度な科学技術計算の性能として評価することはできない。

また、文章生成などのAI推論における処理速度へ、単純に換算できる数値でもない。

実際の性能を比較するには、モデルが使用する数値精度や演算方式をそろえる必要がある。

AD

1兆パラメータのAIモデルを動かすには、低精度化とメモリの使い分けが必要

NVIDIAはDGX Station for Windowsについて、最大1兆パラメータ規模のAIモデルに対応できると説明している。

では、1兆パラメータのモデルを動かすには、実際にどれだけのメモリが必要なのだろうか。

AIモデルのパラメータとは、学習によって調整された数値のことだ。大規模なモデルでは、このパラメータを保存するだけでも膨大なメモリを消費する。

例えば、1兆個のパラメータをそれぞれ4ビットで保存した場合、必要な容量は500GBとなる。

さらに、NVIDIAのNVFP4形式で使用するブロック単位のスケール係数まで含めると、計算上の容量は562.5GBになる。

NVIDIAのNVFP4に関する技術解説によると、NVFP4では16個の4ビット値に対して、8ビットのスケール係数を一つ共有する。

このため、パラメータ1個あたりの平均的な保存量は次のようになる。

4ビット + 8ビット ÷ 16 = 4.5ビット

1兆パラメータに換算すると、必要な容量は以下のとおりだ。

1兆パラメータの保存形式 計算上の必要容量 含まれるデータ
4ビットの値のみ 500GB パラメータの値
NVFP4のブロックスケールを含む場合 562.5GB パラメータの値と、16個ごとの8ビットのスケール係数

これらは、NVIDIAが公表した最大モデル規模とNVFP4の仕様に基づき、すべてのパラメータを同じ形式で保存すると仮定した理論上の数値だ。

テンソルごとの追加のスケール係数や、低精度化しない層、実行時に必要となる作業領域などは含まれていない。

また、OSが使用するメモリや、AIモデルの推論時に必要なKVキャッシュも別途確保しなければならない。そのため、実際のモデルファイルのサイズや実行中のメモリ使用量が、この計算どおりになるわけではない。

注目すべきなのは、4ビット形式で保存した場合でも、1兆パラメータの重みはGPU側の252GBを大きく上回ることだ。

つまり、1兆パラメータのモデルをすべてメモリ上に保持するには、CPU側のメモリも利用する必要がある。

DGX Station for Windowsは、大容量のCPUメモリと低精度化技術を組み合わせることで、1兆パラメータ級のモデルを扱えるようにする設計だ。

1兆パラメータのモデル全体を、高速なHBM3eだけに収められるわけではない。

KVキャッシュが推論速度と同時利用数を左右する

大規模なAIモデルを実行する際には、パラメータの保存容量だけでなく、KVキャッシュに必要なメモリも考慮する必要がある。

KVキャッシュとは、過去に処理したトークンに関する中間計算結果を保存し、次のトークンを生成する際に再利用する仕組みだ。

これにより、同じ計算を繰り返す必要がなくなり、推論処理を効率化できる。

一方、KVキャッシュ自体もメモリを消費し、アクセス時にはメモリ帯域幅を使用する。

長い文書を読み込ませたり、複数の利用者からのリクエストを同時に処理したりすると、KVキャッシュに必要な容量も増えていく。

したがって、モデルの重みが748GBのメモリに収まったとしても、長いコンテキストや多数の同時リクエストを処理するための余裕が十分に残るとは限らない。

また、1兆パラメータのモデルを推論に利用できることと、同じ規模のモデルをゼロから学習できることも区別する必要がある。

AIモデルの学習では、パラメータに加えて、勾配やパラメータ更新に必要な状態なども保持しなければならない。

推論、追加学習、事前学習では、それぞれ必要なメモリ容量も計算量も異なる。

DGX Station for Windowsが掲げる「1兆パラメータ対応」を、同規模のモデルを最初から学習できる性能と解釈するのは適切ではない。

企業導入では、AIエージェントの管理とWindowsアプリの互換性も課題に

DGX Station for Windowsを企業で活用するには、AIの演算性能だけでなく、エージェントの実行環境やアクセス権限を安全に管理できるかも重要になる。

Microsoftは10月7日、AIエージェントを隔離された環境で実行するための「Microsoft Execution Containers(MXC)」の一般提供を発表した。

MXCは、エージェントごとに実行環境を分離し、どのエージェントがどの操作を行ったのかを識別することで、組織全体での管理を支援するOS側の仕組みだ。

MicrosoftはAgent 365やIntuneとの連携も打ち出している。ただし、大規模な環境で管理機能を利用する場合には、追加のサービスが必要になることもあると注記している。

一方、NVIDIAはDGX Station for Windowsについて、「OpenShell」への対応を計画している。

OpenShellもAIエージェントごとに隔離された実行環境を設ける仕組みだが、アプリケーションの操作と、インフラ側でのポリシー適用を分離する設計が特徴となっている。

これにより、AIモデルに与える指示だけに頼るのではなく、実行環境そのものでエージェントの操作を制限できるようにする。

ただし、Microsoftが発表したMXCの一般提供と、NVIDIAが計画しているDGX Station for WindowsでのOpenShell対応は、提供状況が異なる。

Grace CPUはArmベース、既存のWindowsアプリとの互換性に注意

もう一つ確認が必要なのが、Windowsアプリや周辺機器との互換性だ。

DGX Station for Windowsに搭載されるGrace CPUは、Armアーキテクチャを採用している。

そのため、Windowsが動作するといっても、従来のx86/x64プロセッサを搭載したワークステーションと、まったく同じ条件でソフトウェアを利用できるわけではない。

MicrosoftはWindows on Armで、x86/x64アプリを実行するためのエミュレーション機能を提供している。

ただし、エミュレーションには追加の処理負荷が伴うため、アプリによっては性能への影響が生じる可能性がある。

また、カーネルドライバーやユーザーモードのプリンタードライバーについては、Arm64に対応したネイティブ版が必要になる。

企業がDGX Station for Windowsを導入する場合は、利用している設計ソフトウェアや研究用アプリケーションに加え、周辺機器のドライバーなども含めて、Arm環境での動作を確認する必要がある。

最大1,600Wの電力、設置環境にも注意が必要

DGX Station for Windowsは、一般的なデスクトップPCと同じような感覚で設置できるとは限らない。

NVIDIAが公表した総システム電力は1,600Wで、20Aの電源回路が必要とされている。

ただし、これはすべての作業で常に1,600Wを消費するという測定結果ではない。

それでも、オフィスのデスク付近に設置する場合には、電源設備や放熱への配慮が必要になる。

また、追加のRTX PRO GPUを利用した可視化機能など、選択できる構成については、製品を提供するOEMメーカーごとに確認する必要がある。

AD

「32以上のAIエージェントを同時実行」は、どこまで実用的なのか

Microsoftは今回の発表で、DGX Stationを32以上のAIエージェントを同時に実行するための基盤として紹介している。

ただし、複数のAIエージェントを同時に動かせることと、それぞれが十分な速度で作業を完了できることは別問題だ。

例えば、32のエージェントが同時にモデルへリクエストを送った場合、モデルの規模やコンテキストの長さ、処理内容によって、応答までの待ち時間は変わる。

業務で利用できる性能かどうかを判断するには、少なくとも次のような指標を確認する必要がある。

  • 最初の応答までの時間: リクエストを送ってから、最初のトークンが生成されるまでの時間
  • 継続的な生成速度: モデルが単位時間あたりに生成できるトークン数
  • 同時実行時の性能: 複数のエージェントが稼働した場合、応答時間や処理速度がどの程度変化するか

Microsoftの発表では、32以上のエージェントを同時に動かす用途が示されているものの、DGX Stationでの具体的な性能試験条件や、これらの指標を組み合わせた測定結果は公表されていない。

実際の導入判断では、使用するAIモデルやコンテキストの長さをそろえ、同時実行数を増やした場合の性能を測定する必要がある。

単に多数のエージェントを起動できるだけでは、実用性を評価するには不十分だ。

重要なのは、複数のエージェントが同時に動いても、それぞれが許容できる待ち時間で仕事を完了できるかという点である。

クラウドAPIと比較した費用対効果も重要

企業が大規模AIをローカル環境で実行する場合、クラウドAPIとの費用比較も欠かせない。

DGX Stationを導入すれば、外部のクラウドAPIに依存せず、手元の計算資源でAIモデルを実行できるようになる。

ただし、端末を購入すればAI推論が無料になるわけではない。

クラウドAPIの従量課金が減る代わりに、ハードウェアの購入費用や電気代、保守・運用の費用が発生する。

そのため、費用対効果は、どれだけのクラウドAPI利用をローカル推論へ置き換えられるかによって変わってくる。

現在利用しているクラウドAPIの料金だけでなく、必要なモデルをDGX Stationで動かした場合の性能や、継続的な運用費用まで含めて比較する必要がある。

なお、今回のNVIDIAの発表や製品ページでは、Windows版の統一販売価格や、日本向けの確定した出荷日は明らかにされていない。

そのため、現時点で製品価格を仮定し、導入費用を何年で回収できるかを具体的に算出するのは難しい。

DGX Station for Windowsの真価は、実際のAI推論性能で決まる

DGX Station for Windowsは、最大748GBのメモリと高いAI演算性能を備え、大規模AIモデルをWindows環境で利用できるようにする製品だ。

Linux向けのAI開発ツールとWindowsの業務アプリを1台で扱えることは、研究開発や設計業務にAIを取り入れる企業にとって、大きな利点となる可能性がある。

また、複数のAIエージェントを常時稼働させるための共有基盤としても期待されている。

一方、最大1兆パラメータというモデル規模や、FP4で最大20PFLOPSという演算性能だけでは、実際の使い勝手を判断することはできない。

748GBのメモリはCPU側とGPU側に分かれており、アクセス速度にも大きな違いがある。モデルの規模が大きくなるほど、重みやKVキャッシュの配置が推論性能に影響する。

さらに、Windows on Armでのアプリケーション互換性や、電源・冷却設備、AIエージェントの管理機能など、企業導入に向けて確認すべき点も多い。

2026年第4四半期に予定されている実機の発売後は、企業が実際に使用するAIモデルや業務アプリを動かし、複数のエージェントを同時に実行した際の応答速度まで検証することが重要になる。

DGX Station for Windowsの価値は、1兆パラメータのモデルを動かせるという仕様だけでなく、その大規模なAIを日常業務で十分な速度と安定性を保ちながら利用できるかによって決まる。

大容量メモリと高い演算性能を、Windows上での実用的なAI処理につなげられるかが、今後の焦点となる。