The Biological Computing Co.(TBC)とAmazon Web Services(AWS)は9月22日、培養した神経細胞の応答をもとに改良した動画生成AIを、AWSを通じて商用提供するための協業を発表した。TBCは、従来モデルと比べて生成速度を5倍にし、推論コストを80%削減できると主張している。

ただし、比較対象となるモデル名や測定条件は明らかにされていない。7月に公開されたMinecraft風動画の実証実験も、この「5倍」「80%減」をそのまま裏付ける試験だったとは限らない。

今回の発表を理解するには、培養神経の応答をもとに作られたソフトウェアと、生成速度を高めるための配信・推論技術を分けて見る必要がある。

AD

AWSで提供するのは細胞ではなく動画生成モデル

共同発表によると、TBCが提供を目指しているのは、既存のオープンソースモデルを改良したテキスト動画生成サービスだ。

培養神経から得た知見を独自のソフトウェア層へ取り込み、その追加パラメーターは元モデルの0.1%未満だという。利用者側が神経細胞を培養する設備を用意する必要はない。実際に動画を生成する際の計算は、通常のAI向けコンピューティング環境で行われる。

AWSとの協業には、独自AIチップ「Trainium」での実行、Amazon SageMaker AIを使った提供、AWS Marketplaceでの販売が含まれる。

ただし、発表文ではいずれも今後の計画として説明されており、現時点で案内されているのは早期アクセスへの申し込みだ。価格や一般提供の開始日、対応する解像度、生成できる動画の長さなどはまだ明らかになっていない。

したがって、「5倍速い」という主張を、利用者が実際に待つ時間や企業が支払う料金にそのまま置き換えるには、まだ情報が足りない。

今回変わったのは、技術そのものよりも事業化の段階だ。

TBCは7月30日、プレーヤーの操作に応じてMinecraft風の場面を1フレームずつ生成する世界モデル「Oasis」を使った公開デモを披露していた。今回はAWSの販売・提供基盤を使い、用途の異なるテキスト動画生成モデルとして商用展開しようとしている。

Oasisを使った公開デモと、今回商用化を目指すモデルは、同じ製品や同じ性能試験として扱うことはできない。

神経細胞の活動を、どうソフトウェアへ取り込むのか

TBCは、4096個の電極を備えたチップ上で神経細胞を培養し、電気刺激に対する反応を記録する。

刺激を与えた場所だけでなく、周囲へ神経活動がどこまで広がるのか、どの程度の時間で弱まっていくのかを測定する。そこから得た特徴を数値化し、動画生成モデルの中間表現へ作用する小さな追加モジュールの設計に反映する。

培養神経が使われるのは、こうした設計や学習の段階だ。完成したモデルが実際に動画を生成するときに、生きた神経細胞が接続されているわけではない。

最初に公開された「Neural Dynamics Adapter(神経ダイナミクス・アダプター)」は、Oasisで画像予測を担う拡散Transformerの初期層へ、局所的な空間情報を加える仕組みだ。

追加されるパラメーターは約15万6000個。元のモデル自体にも低い学習率で追加学習を行うため、神経細胞から測定した数値をそのままモデルへ入れれば性能が上がる、という単純な構成ではない。

神経細胞の応答から得た特徴を設計の手掛かりとして利用し、そのうえで動画データを使って調整したソフトウェアである。

その後公開された「Hypercolumn Neural Optimizer(Hypercolumn版)」では、近接する場所の情報を混ぜる畳み込み処理と、各位置で過去の情報を保持する仕組みを組み合わせている。

神経活動が空間的にどこまで広がるか、時間とともにどの程度減衰するかを測定し、その特徴をそれぞれの処理設計へ反映した。

こちらは約1400万パラメーターを追加し、元モデルの約3%に相当する。最初の小型アダプターとは、機能も規模も大きく異なる。

AD

商用モデルと公開デモは、同じ性能試験ではない

TBCがこれまで公表してきた数字は、それぞれ異なるモデルと試験から得られている。対象ごとに整理すると次のようになる。

対象 追加した仕組みと試験 公表された結果
AWS向け商用モデル ベースモデル名を公開していないテキスト動画生成モデル。追加層は元モデルの0.1%未満 基準モデル比で生成速度5倍、推論コスト80%減、品質向上とTBCが主張
Oasisの小型アダプター 15万6000パラメーター。異なる開始場面と操作を使った10本の評価動画 画像に残る情報量を測る代理指標で、元モデル比約19%改善とTBCが報告
OasisのHypercolumn版 1400万パラメーター。200種類の操作系列を各600フレーム評価 10秒時点の5指標で元モデルと比較し、単一ストリームの生成速度は4.4倍とTBCが報告

比較の根拠は、商用モデルの発表と、TBCが公開した小型版Hypercolumn版の技術説明である。

商用モデルのベースモデルや入力条件が、Oasisで行った実験と同じであることは確認できない。追加した層の規模も異なる。

そのため、公開デモで示された「4.4倍」という数字を、今回発表された商用モデルの「5倍」を直接裏付ける実測値として扱うことはできない。

小型版で報告された「約19%改善」も、動画全般の画質を直接表す点数ではない。

TBCは10本の連続生成動画を対象に、画像内の情報がどの程度失われるかを、情報量を表す統計指標で間接的に評価した。

同社は、同程度のパラメーター数を追加した通常の追加学習より約15%、LoRAを使った調整より約5%良かったとも報告している。ただし、いずれもこの特定の試験条件で得られた結果だ。

さらに、技術ブログの本文と図注では、その統計指標について値が上がる方が良いのか下がる方が良いのか、説明に食い違いがある。単一の改善率だけから、実際に人が見たときの画質向上を判断するのは難しい。

7月のOasis公開実証の発表では、AIインフラ企業Bluesky Computeと条件をそろえて外部試験を行い、選択した画質指標が2倍、推論コストが約4.4分の1、一貫した動画を生成できる時間が3倍超になったとしている。

ただし、試験に使ったGPU、解像度、コストの算出方法、動画の一貫性をどう判定したのかは公開されていない。

外部企業が関与した試験ではあるものの、第三者が同じ条件を用意して再現できる公開ベンチマークとは分けて考える必要がある。

4.4倍の高速化は、アダプターだけの効果ではない

Hypercolumn版で報告された約4.4倍という高速化は、神経細胞由来のアダプターを追加しただけで実現したものではない。

TBCの説明によると、元の配信構成では単一ストリームあたり毎秒約2フレームだったものを、改良後は毎秒約10フレーム近くまで高めた。

その際には、過去の計算結果を再利用するキャッシュ、より少ないステップで画像を生成するサンプラー、複数のGPUで複数ユーザーの処理を並行して行う仕組みなどを組み合わせている。

動画拡散モデルでは通常、1枚のフレームを生成するまでに、ノイズを段階的に取り除く処理を何度も繰り返す。ステップ数を減らせば高速化できる一方、映像が崩れやすくなる。

TBCは、神経細胞の応答をもとに設計したアダプターによって、長時間にわたって画像の構造を保ちやすくなり、通常は10ステップ必要な品質を6ステップでも維持できたと説明している。

つまり、生体由来の設計そのものが計算量を直接5分の1にしたというより、画質の崩れを抑えることで、より攻めた高速化設定を使えるようになったという説明だ。

ただし、公開されている結果だけでは、各技術が高速化にどの程度貢献したのかを切り分けることはできない。

アダプターだけを使った場合、キャッシュだけを使った場合、サンプラーだけを変更した場合を、同じハードウェアと同じ画質基準で比較しなければ、それぞれの効果は分からない。

また、「5倍高速」と「推論コスト80%削減」も独立した二つの改善とは限らない。処理時間に比例して費用が決まる環境なら、処理時間が5分の1になれば費用も約5分の1になるためだ。

したがって、この二つの数字を足し合わせて評価するものではない。

AD

商用価値を判断するには何を比べるべきか

TBCの公開実験は、培養した神経細胞の刺激応答から得た特徴を、動画生成モデルの設計へ取り込む具体的な方法を示した。

一方で、これまでの評価は主にMinecraft風の単一環境を対象としており、一般的なテキスト動画生成でも同様の効果が得られるかはまだ確認されていない。

TBC自身も、異なる環境や操作、推論条件で結果を再現できるかどうかや、必要なエネルギー量を定量化することを今後の課題に挙げている。

また、現時点で公開されている資料は査読済み論文ではなく、企業の技術ブログや発表資料である。

実際に導入を検討する企業が知りたいのは、同じ長さ、同じ解像度、同程度の画質で動画を生成したとき、どれだけ時間と費用を削減できるのかだろう。

ベースモデルの名称、使用したGPUまたはTrainium、サンプリングステップ数、失敗した生成をどう扱ったのかまで明らかになれば、「5倍高速」「80%削減」という数字を実際の運用に近い形で評価できる。

さらに、神経細胞から着想を得た設計そのものの価値を評価するには、同程度の規模を持つ通常のアダプターや、既存の高速化手法と比較する必要がある。モデルを学習するために必要な計算量や費用まで含めて比較できれば、より公平な評価になる。

生きた神経細胞が、データセンターの中で直接動画を生成しているわけではない。

それでも、神経細胞の応答から得た特徴をAIの設計へ取り込むことで、従来の手法では難しかった画質と速度の両立を繰り返し実現できるのであれば、培養神経をAI設計の手掛かりとして利用する意味は出てくる。

今後、AWS上で提供される商用モデルについて、具体的な利用条件と再現可能な比較結果が公開されれば、この技術が実際の動画生成でどこまで有用なのかを、より具体的に評価できるようになる。