PrismMLは9月23日、QualcommのSnapdragon AR1 Gen 1を搭載したスマートグラス上で、約20億パラメータの視覚言語モデル「Bonsai」を端末内だけで動かす実演を発表した。言語処理部分は1ビット、画像処理部分は4ビットで構成する。

眼鏡が見ているものについて、その場で質問に答える用途を想定したものだ。ただし、今回示されたのは技術実演であり、Bonsaiを搭載した市販製品の発売や、一般向けの提供時期が発表されたわけではない。

限られたメモリと電力しか使えないスマートグラス上で動かすために、モデルをどのように小さくし、どこまで性能を確認したのか。この二つを分けて見ることが、今回の発表を理解するうえで重要になる。

AD

スマートグラス上で動いたのは、言語と画像を組み合わせたモデル

約20億というパラメータ数は、モデル全体が均一な「1ビットAI」になっていることを意味しない。

PrismMLの発表によると、17億パラメータの言語モデルを1ビットで表現し、約3億パラメータの画像エンコーダーは4ビットで表現する。この二つを組み合わせ、カメラが捉えた画像と言葉を同時に扱える視覚言語モデルにしている。

つまり、画像処理部分まで1ビットに圧縮したわけではない。

PrismMLとQualcomm Technologiesは、モデルの重みや構造をQualcommのHexagon NPUに合わせて最適化したとしている。

NPUはAI処理に特化した演算回路で、Snapdragon AR1 Gen 1にはカメラからの映像を処理するための機能も組み込まれている。

視覚情報を扱うAIでは、文章を生成する言語モデルだけを小さくすればよいわけではない。カメラから取り込んだ画像をモデルへ渡すまでの処理や、画像から特徴を抽出する部分も、スマートグラスの限られたメモリと電力の中に収める必要がある。

今回のBonsaiでは、そのために言語部分を1ビット、画像部分を4ビットとする構成を採った。

スマートグラス単体で生成AIを動かす実演自体は、今回が初めてではない。

Qualcommは2025年6月、Snapdragon AR1+を搭載したRayNeo X3 Pro上で、Llama 1Bを使ったAIアシスタントをスマートフォンやクラウドに頼らず動かしたと報告している。

今回の違いは、PrismMLがAR1 Gen 1向けに最適化したモデルを使い、言語と画像を組み合わせた約20億パラメータの視覚言語モデルを動かした点にある。

ただし、AR1+とAR1 Gen 1は異なるチップであるため、二つの実演結果から単純に世代間の速度差を比較することはできない。

「4倍」「2倍」がそれぞれ示しているもの

PrismMLは、同じメモリ容量であれば、従来より最大4倍のパラメータを持つモデルを搭載できる可能性があると説明している。

ただし、この「4倍」は一般的な条件で必ず得られる性能を示したものではない。同社の表現も「一部のスマートグラス設計」に限定した可能性としている。

発表資料の脚注に掲載された実測値を見ると、比較対象はさらに限定される。

公表された比較 1ビット言語モデル 対応する4ビット言語モデル 差
1.7B言語モデルの重みが占めるメモリ 0.43GB 1.66GB Qualcomm測定で3.83倍、約74%削減
トークン生成速度 15.36トークン/秒 7.44トークン/秒 Qualcomm測定で2.06倍

発表にある「4倍」は、同じメモリ容量に収められるモデル規模についての説明だ。一方、実測された3.83倍という差は言語モデルの重みが占めるメモリ容量、2.06倍は文章を生成する速度を比較した数字である。

測定はSnapdragon AR1 Gen 1、メモリ4GB、文脈長1024トークンという条件で行われ、1ビット演算に対応した社内版QNN SDKでコンパイルしたモデルが使われた。

なお、0.43GBと1.66GBは丸められた公表値である。そのため、この二つを単純に割って、PrismMLが示した3.83倍より細かな精度まで読み取るべきではない。

また、0.43GBという数字は、言語モデルの重みだけが占める容量だ。

実際のスマートグラスでは、画像エンコーダー、入力データ、推論中に使う作業領域、OSなどにもメモリが必要になる。4GBという数字は試験に使ったプラットフォーム全体のメモリ容量であり、「モデル全体が0.43GBで動いた」という意味ではない。

モデルの重みを保存できることと、視覚AIを含むシステム全体を快適に動かせることは分けて考える必要がある。

速度についても同じだ。

15.36トークン/秒という数字は、言語モデルが文章を順番に生成する部分の速度を示している。カメラ画像を取り込み、画像の特徴を抽出し、最初の回答が表示されるまでに何秒かかるのかは公表されていない。

つまり、この値だけでは、利用者が質問してから回答を受け取るまでの待ち時間は分からない。

Qualcomm側は15.36トークン/秒について控えめな値だと注記しているが、入力が長くなった場合や、別のスマートグラスでも同じ速度が得られるとは限らない。

日常的に長時間装着する製品であれば、処理速度だけでなく、バッテリー消費や発熱を継続的に測定する必要もある。

測定時に設定された1024トークンという文脈長も、あくまで今回の試験条件だ。製品版の最大文脈長を示す仕様ではない。

会話を長く続けたり、複数の画像を参照したりする場合に、必要なメモリ容量や処理時間がどう変化するのかは別途確認する必要がある。

PrismMLはまた、発表で挙げた言語ベンチマークでは、1ビット版が4ビット版に近い性能を示したと説明している。

ただし、その根拠として脚注に示されているのは、同社の1.7B・1ビット言語モデルと、Qwen 3 1.7Bの4ビット版を比較した評価だ。

BFCL v3やHumanEval+など、コード生成、知識、指示への追従などを見る8種類のベンチマーク名は掲載されているものの、それぞれの具体的な得点は示されていない。

また、この結果から、スマートグラスで撮影した画像について正しく答えられる割合や、約20億パラメータの視覚言語モデル全体としての性能まで確認できるわけではない。

AD

市販のスマートグラスに載るまでに残る条件

今回の測定では、1ビット演算に対応した社内版のQNN SDKが使われた。

モデルの重みを小さくできても、それを効率よく処理する演算機能が端末側で使えなければ、同じ速度は得られない。

一般の開発者がBonsaiと同様の構成を試すには、1ビット演算がどのQNN SDKで利用できるのか、どの端末が対応するのか、さらにカメラ入力を含めた実行環境がどのように提供されるのかが明らかになる必要がある。

PrismMLは今回、そこまでの提供計画を発表していない。

現在販売されているスマートグラスで、同じ構成をそのまま再現できることも確認されていない。

実際の使い勝手を比較するなら、同じスマートグラス上で、カメラが画像を取得してからAIが回答を返すまでの時間を測る必要がある。

言語モデル部分のトークン生成速度だけでは、実際の視覚質問応答でどれくらい待つことになるのかを判断できないためだ。

製品化に向けては、モデル性能以外にも確認すべき点がある。

カメラから画像を継続して取り込めば、画像処理とAI推論の両方で電力を消費し、スマートグラスの発熱にも影響する。

今回の資料には、バッテリー駆動時間、端末全体の消費電力、長時間動作させた場合の処理速度についてのデータは掲載されていない。

AI処理を端末内で完結できれば、カメラが捉えた画像を毎回クラウドへ送らずに済む可能性はある。

ただし、実際の製品で音声入力や会話履歴まで完全に端末内処理になるとは限らない。どの情報を端末内で処理し、何をクラウドへ送るかは、採用する製品ごとの設計で決まる。

Qualcommは2026年6月、スマートグラスメーカー向けの開発基盤「Snapdragon START」を発表している。

半導体モジュールに加え、スマートフォンアプリやクラウドサービスと連携するソフトウェア基盤も用意し、メーカーが製品を開発するまでの期間を短縮する狙いだ。

ただし、今回のBonsaiがSnapdragon STARTを使った製品へ採用されたという発表ではない。端末内AIとクラウドAIを組み合わせる構成も、引き続き選択肢の一つになる。

PrismMLの今回の実演は、画像と言語を組み合わせた約20億パラメータのAIを、既存のSnapdragon AR1 Gen 1上で動かせることを示した。

次に確認したいのは、1ビット演算に対応した開発環境が一般の開発者にも提供されるのか、画像を取得してから回答が返るまでに実際にどれだけ時間がかかるのか、長時間使った場合のバッテリー消費や発熱はどの程度なのか、そして実際にBonsaiを搭載する製品が登場するのかだ。

そこまで明らかになれば、「眼鏡が見ているものについて、その場でAIが答える」という機能が、技術デモから日常的に使える機能へどこまで近づいたのかを判断できるようになる。