
テクノロジー
Google、あらゆる入力を動画に変える「Gemini Omni」を発表:新モデルが挑む「不気味の谷」の克服
Googleは、あらゆる入力から動画などを生成・編集できるネイティブマルチモーダルモデルGemini Omniと、高速な推論でAIエージェント構築を支援するGemini 3.5 Flashを発表した。これにより、物理法則を理解した自然な動画生成や、開発タスクを高速化する自律エージェントの実現が可能となり、エンタープライズ利用を見据えた安全対策も導入された。
Gemini Omniは、Googleがany-to-anyと定義するネイティブなマルチモーダル基盤モデルです。テキスト、画像、音声、動画を統合的に処理し、単一のニューラルネットワークで一度に生成を行うことができます。従来の段階的なパイプライン処理とは異なり、データの劣化を抑えつつ、各モダリティ間の整合性が高い高品質なコンテンツを生成します。特に対話形式での動画編集や、物理法則を理解した自然な映像表現に強みを持ち、YouTube ShortsやGoogle Flowなどのサービスを通じて提供されます。

Googleは、あらゆる入力から動画などを生成・編集できるネイティブマルチモーダルモデルGemini Omniと、高速な推論でAIエージェント構築を支援するGemini 3.5 Flashを発表した。これにより、物理法則を理解した自然な動画生成や、開発タスクを高速化する自律エージェントの実現が可能となり、エンタープライズ利用を見据えた安全対策も導入された。

かつて多くのAndroidユーザーに愛されたアバター作成ツール「Androidify」。そのAndroidifyが、Googleの最新AI技術を身にまとい、全面的にリニューアルされることが明らかになった。Googleは、 […]

Google I/O 2025で、アプリ開発プラットフォームFirebaseに新機能「Firebase AI Logic」の導入が発表された。これは、開発者がAI機能をアプリに組み込む際の障壁を低減し、AI時代における新 […]