AppleがM5 Ultra搭載Mac Studioを発売し、最大80コアGPUと1.2TB/sのメモリ帯域をデスクトップに載せた。発売日に量産機の測定結果が相次ぎ、M5 Ultraをデスクトップ向けGeForceと同じ表に置ける材料も増えている。だが、GeekbenchのOpenCLではRTX 4080に迫る一方、ゲームではRTX 5070搭載機に近く、ローカルLLMではNVIDIAの小型AIシステムを上回る場面があった。「RTX 5080級」という短い呼び方が、どの測定では成立し、どこから崩れるのかを数字から確かめる。
OpenCLではRTX 4080級、5080には届かない
Geekbench 7のOpenCL公開表は、Apple、NVIDIA、AMDのGPUを同じAPIと同じベンチマーク世代で並べられる。2026年9月22日時点の平均値を見ると、M5 Ultraは214,954点だった。GeForce RTX 4080の219,128点に迫り、Radeon RX 7900 XTXの212,264点は上回る。Apple製GPUがハイエンドのディスクリートGPUに食い込んだこと自体は明確だ。
Geekbench 7 OpenCLの公開平均では、M5 Ultraは214,954点でRTX 4080の219,128点に2%以内まで迫る一方、RTX 5080の250,711点を約14%下回る。
データを表で見る
| OpenCLスコア (score) | |
|---|---|
| GeForce RTX 5090 | 355,083 |
| GeForce RTX 4090 | 274,997 |
| GeForce RTX 5080 | 250,711 |
| GeForce RTX 4080 SUPER | 220,751 |
| GeForce RTX 4080 | 219,128 |
| Apple M5 Ultra | 214,954 |
| Radeon RX 7900 XTX | 212,264 |
| GeForce RTX 4070 Ti SUPER | 204,801 |
| Apple M3 Ultra | 131,445 |
したがって、OpenCLに限れば「RTX 4080級」は数字に沿うが、「RTX 5080級」は幅を持たせすぎている。RTX 4080との差は2%以内だが、RTX 5080とは約14%離れる。RTX 5090は355,083点で、差はさらに広がる。上位GeForceを一括して同じ性能帯と呼べるほど差は小さくない。
ただし、この表はメーカーが統制した試験機の順位表ではない。少なくとも5件のユーザー投稿を平均した値で、ドライバーや搭載機の状態も揺れる。GeekbenchはRTX 4060の100,000点を基準とし、2倍の点数を2倍のOpenCL性能と説明するが、この倍率をゲームのフレームレートやAIのトークン生成速度へ移すことはできない。ここで分かるのは、共通API上の計算処理でM5 Ultraがどの位置にいるかまでだ。
Metal首位とゲーム性能が両立しない理由
M5 UltraのGeekbench 7 Metalには354,301点という単一の公開結果がある。数字だけを見ればOpenCLのRTX 5090に近く、AppleInsiderが紹介した35万〜36万点という範囲にも入る。しかしMetalはApple向け、OpenCLは複数メーカー向けの別APIであり、サブテストの実装も集計方法も違う。Metalの35万点とRTX 5080のOpenCL 250,711点を引き算して、M5 Ultraの方が速いとは結論できない。
違いはゲームで表に出る。Tom's Hardwareが36コアCPU、80コアGPU、256GBメモリの試用機で測った「Cyberpunk 2077」は、1080pで66fpsだった。同媒体はRTX 5070搭載Acer機に近い結果と評価し、4Kではプレイ可能な水準に届かなかった。対してRTX 5090搭載機は4Kで59fpsを記録している。3DMark Steel NomadではM5 UltraがRTX 5070搭載機を上回ったものの、RTX 5090搭載機には大差を付けられた。
矛盾ではない。OpenCLは汎用計算、MetalはAppleのグラフィックス・計算基盤、ゲームは描画API、ドライバー、レイトレーシング、アップスケーリング、移植の出来までを含む。80コアという規模が同じでも、どの回路をどのソフトウェアが使えるかで順位が変わる。Mac向けゲームが増えたとしても、OpenCLの順位だけでGeForceと同じフレームレートを予測するのは危うい。
ローカルLLMで順位を変える1.2TB/sと大容量メモリ
ローカルLLMでは、GPU演算器の最大速度に加えて、モデルの重みをどれだけ速くメモリから読み出せるかが効く。M5 Ultraは1.2TB/sの帯域を持ち、CPUとGPUが同じユニファイドメモリを使う。トークンを一つずつ生成する処理では、重みを繰り返し読む比重が高く、この設計がゲームとは違う順位を生む。
Tom's HardwareはQwen 3.8-27B-Q4_K_Mを使い、M5 Ultraの生成速度がM4 Maxの約2倍、DGX Sparkの約4倍だったと報告した。プロンプト処理でもDGX Sparkを上回ったという。ただし、これは密なモデルでメモリ帯域への依存が強い一つのテストであり、画像生成や学習、別の量子化方式まで同じ倍率になるわけではない。CUDAとMetalの実装差も結果に入る。
ITmedia PC USERの世代比較でも伸びは大きい。LLaMA 7B Q4_0に512トークンを入力し、128トークンを生成した条件では、M5 Ultraが204.5 tokens/s、M5 Maxが119.9 tokens/s、M3 Ultraが92.1 tokens/sだった。同じ記事内の同条件に限れば、M5 UltraはM3 Ultraの2倍を超えた。
データを表で見る
| 生成速度 (tokens/s) | |
|---|---|
| M5 Ultra | 204.5 |
| M5 Max | 119.9 |
| M3 Ultra | 92.1 |
同じ測定ではプロンプト処理もM5 Ultraが6,298 tokens/s、M5 Maxが3,220、M3 Ultraが1,471だった。生成とプロンプト処理は別の段階だが、M5 Ultraは両方で世代差を広げている。AppleがM3 Ultra比で最大4.3倍のピークAI演算、最大1.8倍のグラフィックス性能を掲げても、その「最大」をアプリの待ち時間へ直結させてはいけない。実際の速度は、モデル、量子化、推論エンジン、処理段階で決まる。
512GBユニファイドメモリはVRAMではない
最大512GBという容量は、M5 UltraをGeForceと最も違う製品にする。NVIDIAの公式仕様では、RTX 5080は16GB GDDR7、RTX 5090は32GB GDDR7、業務用のRTX PRO 6000 Blackwell Workstation Editionでも96GB GDDR7 ECCだ。100GBを超えるモデルとKVキャッシュを単一GPUの専用メモリに置こうとすると、GeForceでは容量が先に壁になる。Mac StudioはCPU側へデータを逃がしてPCIe越しに読み戻す回数を減らし、一台で扱えるモデルの範囲を広げられる。
もっとも、512GBをそのまま「512GBのVRAM」と呼ぶのも正確ではない。macOS、CPU、GPU、各アプリが同じプールを共有し、全量をGPUだけが占有できるわけではない。専用VRAMと違って容量の用途が競合する。一方で、CPUとGPUがデータをコピーせず同じメモリを参照できるため、大きなモデルを載せる場面では共有であること自体が強みになる。
M5 Ultraの開始価格5,499ドルは、30コアCPU、64コアGPU、96GBメモリの構成だ。最大80コアGPUと512GBメモリを備えた価格ではない。Tom's Hardwareが試した36コアCPU、80コアGPU、256GBメモリ、4TB SSDの構成は12,299ドルだった。512GB構成は記事公開時点で10月下旬の出荷予定であり、GPUが実際に使える上限、長時間負荷時の速度、発熱はまだ独立測定で確かめられていない。
電力と価格は同じ物差しに載らない
AppleはMac Studioの最大連続電力を480Wとしている。NVIDIAはRTX 5080のTotal Graphics Powerを360W、RTX 5090を575W、RTX PRO 6000 Blackwell Workstation Editionの最大消費電力を600Wとする。だが480Wはコンピューター全体、NVIDIAの値はGPUボードを対象にした仕様値だ。Macの方がRTX 5090より省電力だという比較にも、M5 UltraのGPUが480Wを使うという説明にも使えない。壁コンセントで同じ処理を走らせた実測が必要になる。
購入時の比較対象も用途で変わる。価格当たりのゲーム性能を求めるなら、Cyberpunk 2077の結果はGeForce側に重い。CUDAを前提とする開発でも、メモリ容量だけでは既存コードやライブラリの移行費用を埋められない。逆に、100GBを超える量子化モデルを一台で動かし、ネットワーク越しの分散やCPUメモリへの退避を避けたいなら、最大512GBのMac StudioにはディスクリートGPUで作りにくい居場所がある。
M5 Ultraを「RTX 5080級」と呼べるのは、近接する結果が出た特定の計算テストを指す場合に限られる。判断を変える次の数字は、512GB量産機でGPUが実際に使えるメモリ量と消費電力、そして同じモデル、量子化、バッチ、推論エンジンで測ったMetalとCUDAの速度だ。そこまでそろえば、Mac Studioが速いかではなく、どの仕事を一台で終えられるかで選べるようになる。



