
テクノロジー
AI動画生成は「ライブ配信」の時代へ。MetaとUCバークレーが「StreamDiT」を発表、単一GPUで16fpsのリアルタイム生成を実現
これまで我々が目にしてきた高品質なAI動画生成モデルは、いわば「映画」であった。テキストを入力し、数分から数十分待つと、息をのむような短編クリップが完成する。しかし、それは常に完成品を鑑賞する一方通行の体験だった。 これ […]
別名: StreamDiT: Real-Time Streaming Text-to-Video Generation
Metaとカリフォルニア大学バークレー校の研究チームが発表した、テキストから動画をリアルタイムで生成するAIモデル。従来の動画生成AIが動画全体を一度に計算するオフライン生成だったのに対し、StreamDiTはフレームを連続的に生成するストリーミング生成を採用している。NVIDIA H100 GPU上で512p解像度の動画を毎秒16フレームで生成でき、生成中にプロンプトを変更して内容をシームレスに変化させるインタラクティブな操作も可能。技術的にはBuffered Flow Matching、混合学習、ウィンドウアテンション、専用の蒸留技術を組み合わせることで、高い計算効率と動画の一貫性を両立している。ゲームエンジンやライブ配信など、ユーザーの入力に即座に反応する新しいデジタルコンテンツ制作への応用が期待されている。