
Google、あらゆる入力を動画に変える「Gemini Omni」を発表:新モデルが挑む「不気味の谷」の克服
Googleは、あらゆる入力から動画などを生成・編集できるネイティブマルチモーダルモデルGemini Omniと、高速な推論でAIエージェント構築を支援するGemini 3.5 Flashを発表した。これにより、物理法則を理解した自然な動画生成や、開発タスクを高速化する自律エージェントの実現が可能となり、エンタープライズ利用を見据えた安全対策も導入された。
別名: Uncanny Valley
1970年に森政弘氏によって提唱された概念。ロボットやCGなどの人工物の外見や動作が人間に近づくにつれ、親近感が増すが、ある一定のレベルに達すると、わずかな不自然さが際立ち、強い拒絶感や不気味さを感じるようになる。本記事では、AI音声の過度な滑らかさが引き起こす聴覚的な違和感として言及されている。

Googleは、あらゆる入力から動画などを生成・編集できるネイティブマルチモーダルモデルGemini Omniと、高速な推論でAIエージェント構築を支援するGemini 3.5 Flashを発表した。これにより、物理法則を理解した自然な動画生成や、開発タスクを高速化する自律エージェントの実現が可能となり、エンタープライズ利用を見据えた安全対策も導入された。

最新のAIボイスクローン技術は、背景雑音のある環境下で人間の生声よりも圧倒的に高い明瞭度を持つことが、ユニバーシティ・カレッジ・ロンドンらの研究で実証された。わずか数秒の音声サンプルから個人の声を忠実に再現するこの技術は、騒音環境下で人間の声より13.4%も聞き取りやすく、機械が人間の身体的制約を超えた「より優れた言語伝達手段」を獲得しつつあることを示唆している。

ChatGPTがメールを作成したり、AIシステムがテレビ番組を推薦したり、病気の診断まで支援したりと、日常生活における機械知能の存在はもはやSFではなくなった。 しかし、スピード、正確性、最適化といったすべての約束にもか […]

OpenAIと、Appleの伝説的デザイナーであるJony Ive氏が率いるチームが共同で開発を進める次世代AIデバイス。その待望のプロジェクトが、「技術的な課題」という大きな壁に直面し、2026年と目されていた発売が遅 […]

Oculus VRの共同創業者らが立ち上げたSesame AIが、人間との区別が困難なほど自然な会話ができる新たなAI音声モデル「Conversational Speech Model(CSM)」を発表した。「Miles […]