
テクノロジー
NVIDIAがRubinの推論設計を詳説、GPUからラックまで「待たせない」仕組み
RubinはMoEの重み搬送や長文脈Attention、カーネル依存、NVLink同期の待ち時間を減らす。NVIDIAは推論設備の演算器を止めず、電力当たりの処理量を伸ばす設計を具体化した。
AIのTransformerモデルの処理を高速化するために設計された専用のハードウェアおよびソフトウェア層。Blackwellに搭載された第2世代では、新しいマイクロテンサースケーリングとFP4精度のサポートにより、推論性能とメモリ効率を劇的に向上させている。

RubinはMoEの重み搬送や長文脈Attention、カーネル依存、NVLink同期の待ち時間を減らす。NVIDIAは推論設備の演算器を止めず、電力当たりの処理量を伸ばす設計を具体化した。

NVIDIAは、現行世代であるHopperアーキテクチャGPU「H100」と比較して最大5倍の性能向上を誇るという、次世代「Blackwell」アーキテクチャGPUと、それに基づくAIアクセラレータ「B200」GPUを正 […]