Huaweiの輪番会長、徐直軍(Eric Xu)氏が、AIアクセラレーター「Ascend」の中国市場でのシェアがNVIDIAを上回ったとの見方を示した。同時に、AIチップの近くで電気信号を光信号へ変換する接続方式としてNPOを採用する理由について、製造コストと保守のしやすさを挙げた。

発言は9月17日のHUAWEI CONNECTで行われた質疑応答を、Huaweiが9月29日に公開したものである。中国市場でのAIチップ競争と光インターコネクトの設計は一見別の話題だが、どちらも、限られたAIチップを必要な数だけ確保し、大規模な計算システムとして長期間使い続けられるかという課題につながっている。

AD

「AscendがNVIDIAを上回った」という主張はどこまで確認できるか

徐氏は、NVIDIAの中国市場シェアを正確に把握するのは難しいとしたうえで、Huaweiが収集したデータではAscendがNVIDIAを上回っていると説明した。

ただし、公開された質疑応答には具体的なシェアの数値や集計期間が示されていない。売上高と出荷台数のどちらを基準にしたのか、学習向けと推論向けの製品をどのように集計したのかも分からない。

したがって、現時点で確認できるのは「HuaweiがAscendのシェアがNVIDIAを上回ったと主張している」という事実までであり、中国市場での順位が第三者の調査によって確定したわけではない。

新規販売に占める割合なのか、すでにデータセンターへ設置されているAIアクセラレーター全体に占める割合なのかによっても意味は変わる。市場シェアを、そのままチップの性能順位とみなすこともできない。

一方、NVIDIA自身の説明からも、中国向け事業を巡る不確実性は読み取れる。同社は8月26日の決算発表で、2027会計年度第3四半期の業績見通しに、中国向けデータセンター用コンピューティング製品の売上を織り込んでいないと明記した。

ただし、これは将来の業績見通しを作る際の前提であり、現在の中国売上や市場シェアがゼロだという意味ではない。

Huaweiの主張を評価するには、どの範囲の販売を集計した数字なのかに加え、顧客が実際にどれだけの計算能力を導入できるのかも見る必要がある。

特定のAIチップを購入できるかどうかが変動する市場では、単体性能の高さと、必要な数を継続的に調達できることは別の価値を持つ。

約5cmの銅配線を残すNPOを選ぶ理由

Huaweiが採用したNPO(Near-Packaged Optics)は、光エンジンをAIチップの近くに配置しながら、チップとは別の部品として実装する方式だ。

これに対してCPO(Co-Packaged Optics)は、光エンジンと計算チップを同じパッケージに組み込む。電気信号が通る距離をさらに短くできるため、高速信号の損失を抑えやすい一方、製造や修理の方法も変わってくる。

徐氏の説明によると、NPOでは銅配線の長さが約5cm、CPOでは約5mmになる。

Huaweiは、NPOではCPOより長い電気配線が残る代わりに、コストを約40%削減でき、光エンジンが故障してもAIチップまで一緒に廃棄せずに済むと主張している。

徐氏はさらに、製造した部品のうち正常に使えるものの割合を示す「歩留まり」も、NPOを選んだ理由として挙げた。

ただし、40%という数字について、どの構成を比較したのか、どこまでの費用を計算に含めたのかは公表されていない。データセンター全体の建設費や運用費が40%削減できるという意味にはならない。

部品の配置と修理性の関係については、光通信の標準化団体OIFの説明とも方向性が一致する。

OFC 2025の資料では、基板上に実装された部品を交換する場合にはカードを取り外す必要があり、計算チップと同じパッケージに組み込んだ構成では、ASICを含むパッケージそのものの修理が必要になると整理している。

また、NPOでは既存の高密度基板技術を活用できる一方、CPOでは大型のパッケージ基板や、より高度な実装技術が必要になり、コストや供給企業の選択肢にリスクが生じる可能性があると説明している。

光部品をAIチップから分離しておけば、故障した部品だけを交換できる可能性が高まり、修理範囲を限定しやすくなる。

ただし、NPOだからといって稼働を止めずに交換できるとは限らない。Hi-ONEの具体的な交換手順は今回の発言では明らかにされておらず、すべてのCPO製品で光部品の故障時にAIチップまで廃棄しなければならないと一般化することもできない。

実用上の判断材料となるのは、実機でどの部品を取り外す必要があり、交換にどの程度の停止時間が必要なのかだ。

競合各社も、光接続方式を一つに統一しているわけではない。

NVIDIAは5月31日、CPOを採用したSpectrum-X Ethernet Photonicsスイッチを生産中だと発表した。主な用途は、システム間を接続するscale-outや、データセンター間などを接続するscale-acrossであり、Huaweiが採用するNPU近傍の光接続とは実装される場所が異なる。

Broadcomも3月12日のOFC向け発表で、CPOと3.2TのVCSEL型NPOの双方を取り上げている。

そのため、HuaweiとNVIDIAなどの競争関係だけを見て、NPOとCPOのどちらが優れていると判断することはできない。

AD

光エンジンをどこに置くかと、光源をどこに置くかは別の問題

HuaweiのHi-ONEは、公称7.2Tbit/sの光エンジンに光源も内蔵している。

ただし、光エンジンをAIチップの近くに配置するかどうかと、光を発生させるレーザーをどこに置くかは別々の設計判断である。NPOだから必ず光源を内蔵し、CPOだから必ず外部光源を使うわけではない。

OIFは同じ資料で、CPOとNPOの双方に利用できる外付けの交換可能な光源「ELSFP」について説明している。

光源を外部へ分離すると、システム内部の熱密度を下げられるほか、レーザーや光源モジュールが故障した場合にホットスワップできる利点がある。

一方、光源を内蔵する構成にも配線や実装上の利点がある。どちらを選ぶ場合でも、冷却や故障時の交換方法まで含めて評価する必要がある。

Huaweiは9月17日の発表で、Ascend 960を搭載するAtlas 960E SuperPoDについて、従来構成で必要だった48,000個の800G光モジュールを5,500個のHi-ONEへ置き換え、550kWを超える消費電力を削減できると説明した。

これは従来型の光モジュールを使う構成との比較であり、前述した「CPOより40%低コスト」という主張とは比較対象が異なる。

また、異なる種類の光部品の個数を比較し、部品数が減った割合と同じだけ故障率も下がると推測することはできない。

Atlas 960向けのNPOシステムについては、同日付の別の公式発表で試験段階にあると説明されている。

一方、Atlas 950 SuperClusterについては、256,000枚の計算カードを使う構成を展開中としている。

光エンジンを製品として完成させることと、それを超大規模なAIシステムへ組み込み、長期間安定して稼働させることは別の段階として確認する必要がある。

DeepSeekの公開コードが示すソフトウェア面の前進

DeepSeekは9月30日、Ascend 950に対応する「DeepGEMM-Ascend」を公開した。

大規模言語モデルで多用される行列積を効率よく処理するためのカーネルライブラリで、既存のDeepGEMMと共通のAPIを採用している。

Ascend側ではCANN 9.20などの環境が必要になるが、アプリケーション側のコードや開発手順を大きく変えずに利用しやすくする狙いがある。

ただし、CUDA向けに書かれたあらゆるコードが、そのままAscendで動くようになるという意味ではない。

同日に公開されたTileLang v0.1.15も、Ascend 950向けのコード生成に正式対応した。

TileLangは、計算の実行順序や同期などを組み立て、ハードウェアの機能を効率よく利用するプログラムを生成する。

こうしたソフトウェアの整備は、AIチップを調達した後、その演算能力を実際のAIモデルで引き出すための具体的な前進といえる。

ただし、効率を示す数字は、何を測った値なのかを分けて読む必要がある。

DeepGEMM-Ascendの99.8%は特定の行列積カーネルの演算効率であり、Huaweiが示すシステム稼働率99.8%や、クラスタ全体のMFUとは別の指標である。

公開された指標 値 対象と評価条件
DeepGEMM-Ascendの行列積利用率 99.8% Ascend 950DTでのBF16行列積。READMEに記載された演算上限に対する開発者測定
Atlas 960Eのシステム稼働率 99.8% Huaweiが9月17日に示した、システムを利用可能な時間の割合
大規模クラスタのMFU改善 2.75倍 HuaweiのMarkov Labによる、同じ10万NPU規模での構成比較シミュレーション

表は10月7日に確認したDeepGEMM-AscendのPerformance節とHuaweiの9月17日発表をもとに、演算効率、システムの稼働時間、モデル全体の演算利用効率を分けて整理したものだ。

数値の大きさだけを比べて性能順位を示す表ではない。

DeepGEMM-Ascendの99.8%は、行列サイズM=4,096、N=7,168、K=16,384のBF16行列積で431TFLOPSを記録し、READMEに記載された上限432TFLOPSに対して99.8%に達したという意味である。

測定環境はAscend 950DTとCANN 9.20で、L2キャッシュを事前にウォームアップしない条件のbench_msprofが使われている。

分母となる432TFLOPSもREADMEに記載された値であり、AIモデルの学習全体を通じて99.8%の演算能力を使えるという意味ではない。

MFU(Model FLOPs Utilization)は、モデルの計算に理論上の演算能力をどの程度利用できているかを見る指標であり、チップ間通信による待ち時間なども影響する。

Huaweiが示した「2.75倍」は、4,000NPUの超ノードから構成する10万NPU規模のクラスタと、8NPUサーバーを多数接続した同規模のクラスタを比較したシミュレーションの結果である。

MFUの絶対値は示されておらず、NVIDIAのシステムと同じ条件で実測比較した結果でもない。

特定の行列積カーネルが演算性能の上限近くまで到達していても、大規模な分散学習で同程度の効率を得るには、通信やシステム運用を含めて検証する必要がある。

AD

チップを確保するだけでなく、長く使い続けられるか

Huaweiは、推論向けの950PRを限定的な数量で供給し、学習を主用途とする950DTの超ノードについては試験を経たうえで、2026年末から2027年初めに大規模供給を始めるとしている。

海外市場へ全面展開する計画はなく、中国の顧客を優先する方針だ。

徐氏は、世界のAIチップの需給が均衡する時期を2029年前後と予想し、中国ではさらに時間がかかる可能性があるとの見方も示した。

いずれも将来の計画や見通しであり、実際の供給実績を示したものではない。

中国市場でAscendのシェアを高めたとしても、必要な数のチップを継続的に納入できなければ、新しいAI学習基盤を拡張する速度には限界がある。

一方、光部品が故障した際に高価なAIチップまで交換せずに済み、短時間でシステムの計算能力を回復できるのであれば、供給が限られるチップを長期間活用するうえで意味がある。

HuaweiがNPOについて製造コストや保守性を強調する理由は、単に「何枚のAIチップを販売できるか」という競争だけではない。導入したチップを大規模なシステムとしてどれだけ安定して使い続けられるかにも関わっている。

今後の判断材料となるのは、950DTの供給が計画どおりに進むかだけではない。

光部品が故障した際に実際の交換作業へどの程度の時間がかかるのか、大規模モデルの学習でどの程度のMFUを維持できるのかも重要になる。

必要なチップを確保でき、故障しても短時間で復旧でき、チップ間通信による待ち時間を抑えながら計算を続けられる。

こうした条件がそろえば、中国の顧客は、限られたAIチップの演算能力をより長期間、効率よく学習や推論へ投入できるようになる。