南京大学などの研究チームは、光を受けたセンサー内部で画像認識AIに渡すデータを生成する試作チップ「LightTok」を、8月19日公開の査読付き論文で報告した。

従来は、画像センサーが画素データを読み出し、その後に別の回路でAIが処理しやすい形式へ変換する。LightTokは、この前処理の一部を撮像素子側へ移した。

研究チームによれば、従来方式と比べてトークン化に必要なエネルギーを約14分の1に抑えられるという。ただし、この数字はLightTokを搭載したドローンなどの実機で測定した消費電力ではない。実際に試作チップで確かめた内容と、より大規模な回路を想定した試算は分けて考える必要がある。

AD

光を受ける場所でAI向けデータを作る

画像認識に使われるVision Transformer(ViT)は、画像を小さな区画に分け、それぞれを数値の列へ変換してから処理する。この区画ごとの数値表現が、ここでいう「トークン」だ。文章生成AIが扱う単語や文字の断片とは対象が異なる。

一般的な構成では、まず画像センサーから各画素の信号をデジタルデータとして読み出し、その後、別の計算回路で画像を小さな区画に分け、「パッチ埋め込み」と呼ばれる変換を行う。

LightTokの中核となるのは、単層の二硫化モリブデン(MoS₂)を使った浮遊ゲート型の光トランジスタだ。

各素子が光に反応し、その情報を電気的な状態として保持する。周辺のアドレス回路で画素を選択し、学習済みの重みに対応する電圧を加えることで、各素子を流れる電流を合算し、区画ごとの埋め込み値を得る。

光そのものが直接デジタルの「トークン」へ変換されるわけではない。光から得た情報を素子内に保持し、それをアナログ回路で演算したうえで、最終的な出力をデジタル化する仕組みだ。

センサー内部で計算を行う発想そのものは、以前から研究されている。今回の論文でも、二次元半導体を使った画像処理チップや、単層MoS₂を利用した撮像素子などの先行研究が引用されている。

LightTokが狙ったのは、ViTへ渡すパッチ埋め込みを撮像側で直接生成することだ。すべての画素データをセンサー外へ送り出してから同じ処理を行う必要がなくなれば、データ転送に伴う消費電力を減らせる可能性がある。

32×32画素の試作機で確かめたこと

研究チームが作製した感光メモリーの配列は32×32画素、合計1,024素子である。

論文の補足資料では、このうち3×3画素を使って重み付き加算を行い、その結果をコンピューター上で計算した値と比較している。入力例には、画像分類データセットCIFAR-10に含まれる飛行機の画像を二値化したものが使われた。

この実験では、回路上でパッチ埋め込みに相当する演算が可能であることを示している。一方で、高解像度の動画をリアルタイム処理するところまで実証したわけではない。

入力の階調数も重要になる。

白黒の2値しか区別できなければ、物体の形や濃淡を表す情報が大きく失われる。研究チームは、光入力を41段階の状態として扱えることを実験で示した。

さらに補足資料では、256段階の入力を基準として、生成されるトークンがどの程度変化するかを比較している。代表的な画像を224×224画素に整え、16×16画素ずつ196個の区画へ分割する条件での検討だ。

41段階で処理した場合の結果は、2値の場合より256段階の基準に近かった。

ただし、この224×224画素という数字はシミュレーションや比較に用いた画像サイズであり、32×32画素の試作配列そのものを224×224画素まで大型化したわけではない。

論文要旨では、CIFAR-10を使った画像分類で、ソフトウェアによる処理に近い分類精度が得られたと報告されている。

しかし、実際のドローン映像には、移動する対象、急激な明るさの変化、機体の振動によるぶれ、遠距離にある小さな物体などが含まれる。今回公表された試験結果だけから、こうした条件でも同等の認識精度を維持できるとは言えない。

AD

「14.3倍」の差を生んだ比較条件

14.3倍という差は、16×16画素のパッチに対して1回の内積演算を行うトークン化工程を、41段階の入力精度と4マイクロ秒の処理時間という同じ条件で比較した結果である。

論文の補足資料では、LightTok型の物理トークナイザーについて、周辺回路や出力のデジタル変換まで含めてエネルギーを見積もっている。一方、従来方式にはCMOS画像センサーから別の計算回路へデータを転送する工程などが含まれる。

両方式に共通するViT本体の演算は、この比較には含まれていない。

16×16画素の1パッチで1回の内積 LightTok型 従来のデジタル方式
トークン化工程の推定エネルギー 1,743.9pJ 24,918.4pJ
うち撮像側から計算側へのデータ転送 対象外 19,225pJ
入力精度・処理時間 41段階・4µs 41段階・4µs

出典は論文補足資料のNote 5。24,918.4を1,743.9で割ると約14.3になる。

また、従来方式で見積もられた19,225pJのデータ転送は、同方式の総エネルギーの約77.2%を占める。

ただし、この19,225pJは、実際の画像センサーと計算チップを接続して測定した値ではない。出力回路のシミュレーション結果に、ビットの切り替わり率を50%とする条件を適用して算出した推定値である。

従来方式では、まず各画素の信号を読み出し、区画内にある256画素分のデータをデジタル化する必要がある。

補足資料の試算では、読み出し用アンプ、画像センサー側の電流源、画素信号を数値へ変換する回路などにも消費エネルギーを割り当てている。それらを合計しても、データ転送に必要なエネルギーより小さい。

これに対してLightTok型では、256画素分の信号を回路内部で加算してから、その結果だけをデジタル化する。

光そのものが電力を生み出しているわけではない。大きな差につながっているのは、各画素の読み出しやデータ転送、デジタル変換の回数を減らせる点だ。

また、単純にデータ転送分だけを取り除いて新方式の効果としているわけではなく、両方式とも周辺回路を含めた条件で比較している点にも注意が必要だ。

LightTok型の1,743.9pJについても、試作機で直接測定した値をすべて足し合わせたものではない。

研究チームは3×3画素の実験で測定した、電流が安定するまでの4マイクロ秒という時間を、16×16画素を集積した場合の処理時間にも適用している。周辺回路の消費エネルギーについては、部品仕様、回路シミュレーション、回路容量に応じた換算などを組み合わせて算出した。

従来方式についても、同じ4マイクロ秒の処理時間と41段階の入力精度を条件としている。

したがって、14.3倍という数字は、条件をそろえた設計上の比較としては意味があるものの、完成した2台の装置を並べて実測した結果ではない。

41段階の入力は、情報量に換算すると約5.36ビットに相当する。このため、従来方式の読み出し側にも同等の精度が設定されている。

補足資料では、256段階、つまり8ビット相当の入力を想定した条件についても別途試算している。この場合、従来方式ではデジタル変換とデータ転送の負担が増え、両方式の差は20.5倍になる。

倍率が変わるのは、入力精度や回路条件が変わるためだ。

したがって、14.3倍や20.5倍という数字は、あらゆる画像処理や実機にそのまま当てはめられる固定的な性能差ではない。

比較の単位についても確認しておく必要がある。

224×224画素の画像を16×16画素ずつに分割すると、196個のパッチができる。補足資料では、それぞれのパッチから768要素の埋め込みベクトルを生成する構成が例として示されている。

表に示したpJの値は、その768要素のうち1要素を求めるための1回の内積演算に必要なエネルギーである。画像1枚を撮影してから最終的な認識結果を出すまで、システム全体を通した消費エネルギーではない。

ドローンへ載せる前に必要な検証

32×32画素の試作配列と、16×16画素のパッチを使って224×224画素の画像を処理する想定システムの間には、まだ大きな隔たりがある。

まず、画素数を増やしたときにも二硫化モリブデンの各素子が均一に動作するかを確かめる必要がある。さらに、配線や周辺回路まで大規模に集積した状態で、想定どおりの処理速度と消費電力を実現できるかも検証しなければならない。

そのうえで、屋外で撮影した連続画像や動画を使い、既存の撮像システムと同じ画像認識課題を実行しながら、精度と消費電力を比較する必要がある。

ドローンの飛行時間を左右するのは、AIの推論処理だけではない。通信機器やセンサー、モーターなど、機体全体で電力を消費する。

そのため、トークン化工程で削減できたエネルギーが、実際の飛行時間をどの程度延ばすのかは、ドローン全体へ組み込んだ状態で測定しなければ分からない。

LightTokが今回示したのは、画像をAIへ渡す前の処理をセンサー側へ移す具体的な回路方式と、それによってデータ転送の負担を減らせる可能性だ。

次に求められるのは、より大規模な配列で同じ仕組みを動作させ、実際の画像認識精度とシステム全体の消費電力を同時に示すことである。