Apple、MediaTek、Qualcommの旗艦スマートフォン向けチップが、2026年9月にそろって2nm世代へ進んだ。AppleのA20 Pro、MediaTekのDimensity 9600 Pro、QualcommのSnapdragon 8 Elite Gen 6系列は、いずれも端末内で動くAIの強化を打ち出している。

ただし、各社の発表に並ぶ「2倍」「51%向上」「55%向上」という数字は、それぞれ測っている処理が異なる。

大規模なAIモデルをスマートフォン上で動かす競争を読み解くには、演算器そのものの性能だけでなく、モデルのどの部分を動かすのか、データをどこへ置くのか、発生した熱をどう逃がすのかまで見る必要がある。

「300億パラメーターに対応する」という説明も、300億すべてを毎回計算するという意味ではない。

Qualcommの技術解説とAppleのモデル研究を照らし合わせると、必要な部分だけを動かし、限られたメモリの中で大きなモデルを扱う工夫が見えてくる。

2nm化の先で競われているのは、スマートフォンに限られた電力とメモリを、AIのどの処理へどう配分するかという設計である。

AD

2nm世代の公称値を、何を測った数字なのかで分ける

Appleは9月9日、A20 Proを搭載するiPhone 18 Proを発表した。MediaTekは9月15日にDimensity 9600 Proを発表し、Qualcommは9月22日、上位モデルのSnapdragon 8 Elite Extreme Gen 6と、Snapdragon 8 Elite Gen 6の2製品を投入した。

Qualcommの2製品はいずれも2nm世代を採用するが、AI処理の性能まで同じではない。Qualcommの発表

各社が示した数字を、何を測っているのかで整理すると違いが分かりやすい。

製品・発表日 AIに関する主な公称値 測っている対象・比較範囲
Snapdragon 8 Elite Extreme Gen 6・9月22日 NPU性能35%向上、電力あたり性能は最大33%改善 前世代比のNPU性能と電力効率
Snapdragon 8 Elite Gen 6・9月22日 NPU性能14%向上、AI Engineの電力効率は最大20%改善 NPU性能とAI Engine全体の効率を別々に評価
Dimensity 9600 Pro・9月15日 LLM入力処理51%向上、生成時の電力効率55%向上、常時AIの消費電力40%削減 前世代比。入力処理、生成、低電力NPUによる常時動作を別々に評価
A20 Pro・9月9日 AI処理能力2倍、メモリ帯域幅50%増 A19 Pro比。モデルの実際の応答速度を直接比較した値ではない

表はQualcommの上位版と標準版、MediaTekの発表、Appleの発表を基に整理した。

MediaTekは、性能値を自社研究室のデモ端末で測定したと明記している。

3社で同じモデル、同じ入力長、同じ条件をそろえた比較ではないため、この表に並ぶ向上率だけから性能順位を決めることはできない。

言語モデルは、まず質問や会話履歴などの入力をまとめて処理し、その後、トークンと呼ばれる文字列の単位を順番に生成する。

つまり、長い文書を渡してから最初の返答が出るまでの時間と、返答が始まってからどれだけ速く文章が生成されるかは別の性能である。

AppleのCore ML技術解説でも、最初の出力までの時間と、その後の1秒あたりの生成トークン数を分けて評価している。

これは2024年のMacを使った説明であり、A20 Proそのものの実測値ではない。ただし、スマートフォン向けチップの発表に出てくる数字を読み分ける手掛かりにはなる。

製造技術の時系列も分けて考える必要がある。

TSMCのN2は2025年第4四半期に量産へ入り、同社として初めてナノシート型トランジスターを採用した。改良版のN2Pは、2026年後半に量産開始の予定と案内されている。

TSMCの技術紹介が示す工場側の量産開始時期と、今回のSoC製品の発表時期は別の話である。

同じ「2nm」という世代名であっても、製品ごとの回路設計やメモリ構成まで同じになるわけではない。

300億パラメーターでも、毎回動かすのは約30億

Qualcommは9月10日、次期上位プラットフォームの技術解説で、300億パラメーターのMoEモデルについて、1トークンを生成するたびに約30億の選択されたパラメーターを使う例を示した。

MoEは、複数の専門部分の中から、入力に応じて必要な部分だけを選んで使うモデル構造である。

モデル全体を毎回動かす方式と比べ、1回の処理で使う計算量を抑えられる。Hexagon NPUの解説

ただし、計算で使う部分が少なくても、残りの重みが不要になるわけではない。

パラメーターは、モデルが学習した関係を数値として保持するものであり、その瞬間に使わない部分も、次の入力で選ばれる可能性があるため保存しておく必要がある。

モデル全体を保存するための容量と、計算中に必要になるメモリ容量、そしてデータを移動する速度は、それぞれ別の制約である。

約30億という数字も、選ばれた専門部分の規模を示すものであり、スマートフォン全体で必要なメモリが10分の1になるという意味ではない。

Qualcommは、専門部分をフラッシュメモリから読み出す管理機構と、頻繁に使うデータをNPUの近くへ残すキャッシュを組み合わせる。

次期Hexagonでは共有メモリを50%増やし、モデルの状態や計算途中のデータをチップ上に保持できる余地を広げた。

外部のDRAMへデータを取りに行く回数を減らせれば、演算器がデータ待ちになる時間を減らし、転送に使う電力も抑えやすくなる。

ただし、「共有メモリ50%増」は、スマートフォンに搭載されるRAM容量が50%増えるという意味ではない。

演算器そのものにも改良が加えられている。

新しいElement Acceleratorは、言語モデルの基礎となるTransformerの処理を担い、INT4モデルの入力処理を最大50%高速化するとQualcommは説明している。

INT4は、数値を4ビットで表現する方式だ。

数値表現を小さくすれば扱うデータ量を減らせるが、回答品質をどこまで保てるかは、モデルや量子化方法によって変わる。

共有メモリ50%増や入力処理50%高速化という数字は、発表前に説明された次期上位設計の値であり、標準版を含むすべての製品へ一律に当てはめることはできない。

こうした工夫が重要になるのは、一度だけ短い質問に答える場面だけではない。

会話の途中で文書を読み、アプリから得た結果を受け取り、それをもとに次の処理を判断するAIでは、入力処理と生成処理が何度も繰り返される。

過去の計算結果を再利用するKVキャッシュもメモリを使うため、演算器だけを高速化しても、長い会話での待ち時間をすべて解消できるわけではない。

モデルをどのように使うかと、データをどこへ置くかの両方が重要になる。

AD

「55%効率向上」は「55%省電力」と同じではない

MediaTekはDimensity 9600 Proで、高負荷の推論を担うNPU 1090と、常時動作を担う第2世代Super Efficient NPUを組み合わせた。

前者では生成時の電力効率が55%向上し、後者では常時AIの消費電力を40%削減したとしている。

この2つは異なる処理についての数字だ。

必要なときに重い処理をすばやく終わらせる設計と、長時間動き続ける軽い処理を少ない電力で維持する設計を分けている。MediaTekの9月15日付発表

同じモデルと生成条件を使うと仮定した場合、トークン生成時の電力効率が55%向上すると、1トークンを生成するために必要なエネルギーは約35.5%減る計算になる。

電力あたりの生成速度が1.55倍になれば、同じ量を生成するためのエネルギーは逆数の1÷1.55になる。

したがって、削減率は「1−1÷1.55」で約35.5%となる。

これはMediaTekが公表した効率比を計算上で換算したものであり、スマートフォンのバッテリー持続時間が35.5%延びるという実測結果ではない。

発表では、具体的にどのモデルを使ったのか、生成条件は何か、どこまでの部品を電力測定に含めたのかまでは示されていない。

実機でどの程度改善するかは、別途測定する必要がある。

常時AIでは、処理を続ける時間の長さも重要になる。

大きなモデルを短時間だけ動かす場合と、小規模な認識処理を長時間動かし続ける場合では、バッテリーへの負荷の内訳が異なる。

低電力NPUによる40%削減は、後者を改善するための数字だ。

この40%を、画面や通信まで含めた端末全体の待機電力削減率として扱うことはできない。

それでも、AIがユーザーからの入力を待つだけの機能から、周囲の状況を継続的に把握する機能へ広がるのであれば、常時動作時の消費電力は独立して見るべき重要な指標になる。

Dimensity 9600 Proは、LPDDR6メモリとUFS 5.0ストレージにも対応し、CPUとNPUの連携や34.5MBのキャッシュを組み合わせる。

処理中のデータをメモリから渡す経路と、モデルそのものをストレージから読み込む経路の両方を更新した形だ。

ただし、対応する規格が増えても、実際のスマートフォンに搭載される容量や速度まで決まるわけではない。

モデルの起動時間と、起動後の生成速度を分けて測れば、どの部分の改良が実際の使い勝手に効いているのかを見分けやすい。

Appleは演算性能だけでなく、熱とモデルの読み込み方も変えた

AppleのA20 Proは、計32コアのNeural Engineを搭載し、AI処理能力をA19 Proの2倍にした。メモリ帯域幅も50%広げている。

さらに、シリコンダイとメモリを横に配置し、ダイから冷却部品へ熱を逃がす経路からメモリを外した。

A20 Proをベイパーチャンバーへ直接接合し、その表面積を前世代の3倍に広げた。Appleは、これによって持続性能が最大40%向上するとしている。Appleの発表

ベイパーチャンバーは、内部の液体が蒸発と凝縮を繰り返すことで、熱を広い範囲へ移動させる部品である。

チップが一時的に高い性能を出せても、発生した熱を十分に逃がせなければ、長時間その速度を維持することは難しい。

Appleは演算性能とデータ転送能力を高める一方で、熱を外へ運ぶ経路も変更した。

ただし、表面積が3倍という数字は冷却部品についての値であり、AI推論が3倍速くなるという意味ではない。

モデル側でも、限られたメモリを使う方法が変わっている。

2026年公開のApple Foundation Modelsの研究解説によると、端末内モデル「AFM 3 Core Advanced」は全体で200億パラメーターを持ち、要求に応じて10億〜40億パラメーターを動かす。

Appleは、このモデルを同社の最も高性能なAppleシリコンを搭載したシステム向けに最適化したと説明している。

ただし、この研究発表だけでは、A20 Pro搭載端末のどの機種で利用できるのか、どこまでの機能として提供されるのかは確定しない。

モデル全体はフラッシュメモリに保存し、入力を受けた際に必要な専門部分だけを選んでDRAMへ読み込む。

生成中も一定の間隔で使う部分を選び直し、常に使う共有部分と、入力に応じて変わる部分を組み合わせる設計だ。

Appleは、この方式を採る理由として、フラッシュからDRAMへの転送は、トークンごとに重みを入れ替えるには遅すぎると説明している。

そこで最初の入力処理の段階で使う部分を選び、重みを何度も読み直す頻度を減らす。

モデル全体を大きくしながら、実際の処理時にDRAMへ載せる量を調整する狙いがある。

ただし、この説明だけから、QualcommのMoE実装がどの頻度で重みを読み込み、どの程度高速に転送できるのかまでは判断できない。

Qualcommは、専門部分の管理とNPU近くの共有メモリを工夫する。

Appleは、モデル側でどの単位まで読み込むかを設計する。

MediaTekはLPDDR6やUFS 5.0など、データを運ぶ経路を強化する。

それぞれアプローチは異なるが、いずれも「大きなAIモデルを、スマートフォンの限られたメモリでどう動かすか」という同じ課題に取り組んでいる。

3社を単純に「大きなモデル」「放熱」「常時AI」と一つずつの特徴に分けるだけでは、この共通点を見落とす。

モデル側の工夫でDRAMの使用量を抑えても、最初の読み込みや、使う部分を切り替える際の転送には時間がかかる。

逆に、メモリ帯域を広げても、長時間の処理で熱がたまれば、チップは性能を落とす場合がある。

モデルを保存する場所、計算する場所、そして発生した熱を逃がす場所まで一つの流れとして設計して初めて、端末内AIを長時間快適に使えるようになる。

AD

実機では、待ち時間と消費電力を分けて測る必要がある

同じ言語モデルを動かせる端末同士を比較するなら、まず入力の長さと数値精度をそろえ、モデルの読み込みから最初の返答が出るまでの時間を測る。

次に、返答が始まってからの生成速度と、その間に使ったエネルギーを測定する。

異なるモデルを使う製品を比較する場合は、同じ課題を解かせ、待ち時間や消費電力だけでなく、回答品質も確認する必要がある。

パラメーター数だけでAIの品質を順位付けすることはできない。

常時動作するAIには、さらに別の評価が必要になる。

認識機能を有効にすると待機中の消費電力がどれだけ増えるのか、ゲームや撮影と同時に動かした場合でも応答速度を維持できるのかを確認する。

長時間のAI処理では、開始直後の速度と、端末が温まった後に維持できる速度を分けて見る必要もある。

画面や通信まで含めた端末全体の消費電力が示されれば、NPU単体の改善が、実際のバッテリー持続時間へどこまで影響するのかも判断しやすくなる。

2nm世代のスマートフォン向けチップは、重いAI処理へ使う演算能力と、常時動作へ使う電力を、より細かく配分する方向へ進んでいる。

端末メーカーやアプリ開発者がそれぞれに対応したモデルや機能を実装し、長い会話や継続的な処理でも待ち時間と電池消費を抑えられることを実機で示せれば、スマートフォンは短い質問に答えるだけのAI端末から、複数の作業を継続的に支える端末へと近づいていくだろう。