
Google、あらゆる入力を動画に変える「Gemini Omni」を発表:新モデルが挑む「不気味の谷」の克服
Googleは、あらゆる入力から動画などを生成・編集できるネイティブマルチモーダルモデルGemini Omniと、高速な推論でAIエージェント構築を支援するGemini 3.5 Flashを発表した。これにより、物理法則を理解した自然な動画生成や、開発タスクを高速化する自律エージェントの実現が可能となり、エンタープライズ利用を見据えた安全対策も導入された。
Vertex AIは、Google Cloudが提供する統合機械学習プラットフォームである。機械学習モデルの学習、チューニング、デプロイ、監視といったライフサイクル全体を単一の環境で扱えるよう設計されており、企業が独自のカスタムモデルを構築する場合と、Googleが提供する基盤モデルを利用する場合の両方に対応する。近年はGeminiファミリーをはじめとする生成AIモデルの提供基盤としての役割が拡大している。
Vertex AIは、データの前処理からモデルの学習、評価、本番環境への展開、運用監視までを一貫して支援するマネージドサービス群で構成される。AutoMLによる自動モデル構築、カスタムコードによる学習ジョブの実行、MLOpsのためのパイプライン管理機能などを備え、開発者やデータサイエンティストの作業を効率化する。加えてModel Gardenと呼ばれる機能では、Gemini、Imagen、VeoなどGoogleの生成AIモデル群を検索・選択して自社アプリケーションに組み込むことができ、単なる学習基盤から生成AI活用の入り口としての性格も強めている。
Vertex AIは、Microsoft AzureのAzure Machine LearningやAmazon Web ServicesのSageMaker・Bedrockと並び、クラウド事業者が提供するエンタープライズ向けAI基盤の一つに位置づけられる。特徴は、Google独自の基盤モデルを同一プラットフォーム上でシームレスに利用できる点であり、企業は自社データを用いたファインチューニングと、Googleが開発した大規模モデルの活用を同じ管理画面から進められる。生成AIブームの中で、単発のモデル提供にとどまらず、モデルの選定からエージェント化、ガバナンスまでを包括する基盤としての重要性が増している。
2026年4月には、画像生成・編集モデル「Gemini 2.5 Flash Image」(開発コード名nano-banana)がGoogleから正式発表され、こうした生成AIモデルはVertex AIを通じて企業利用者に提供される仕組みの一部となっている。同年5月には音声合成モデル「Gemini 3.1 Flash TTS」、さらに入力を動画に変換する「Gemini Omni」が発表され、Vertex AIのModel Gardenを通じた新モデルの供給が続いている。
2026年6月には、数百から数千規模の自律型AIエージェントを企業が管理・運用するための新たな開発基盤「Gemini Enterprise Agent Platform」が発表された。これは開発環境や実行基盤、ガバナンス機能を統合したもので、Vertex AIが提供してきたMLOpsやモデル管理の仕組みを土台に、エージェント運用という新たな課題へ対応する動きと位置づけられる。
一方で2026年5月には、ゲーム業界向けの調査結果として、Google Cloudが自社ユーザーの9割がAIを利用していると発表したのに対し、GDC調査では個人利用が36%にとどまり、生成AI導入への警戒感が52%まで高まっているという結果も報じられた。これは、Vertex AIのようなクラウドAI基盤の普及率と、現場の受容度との間に存在する乖離を示す事例として言及されている。

Googleは、あらゆる入力から動画などを生成・編集できるネイティブマルチモーダルモデルGemini Omniと、高速な推論でAIエージェント構築を支援するGemini 3.5 Flashを発表した。これにより、物理法則を理解した自然な動画生成や、開発タスクを高速化する自律エージェントの実現が可能となり、エンタープライズ利用を見据えた安全対策も導入された。

ゲーム業界ではレイオフが続く中、AI導入が制作時間短縮ではなく雇用の脅威と認識され、生成AIへの警戒感が52%に上昇した。Google Cloudが9割の開発者がAIを使っていると主張する一方、GDC調査では個人利用が36%に留まり、効率化の利益と雇用リスクの分配が職種間で異なるため、AIの浸透度には大きな乖離がある。

Google Cloudは、企業が数百から数千の自律型AIエージェントを管理・運用する課題に対応するため、新たなエンタープライズ向け開発プラットフォーム「Gemini Enterprise Agent Platform」を発表した。本プラットフォームは、開発環境の刷新、長時間実行と永続的コンテキストを支える実行基盤の強化、そして厳格なガバナンスとインフラストラクチャの統合により、エージェントの急増という課題に包括的に対応する。

Googleは、音声合成技術の停滞を打破する「Gemini 3.1 Flash TTS」を展開し、オーディオタグにより音声の感情表現や抑揚を細かく制御可能にした。この技術は70以上の言語と多様な方言に対応し、高品質なAI音声の民主化とグローバル展開を加速させる。

AIスタートアップのAnthropicは10月15日(現地時間)、同社の言語モデルファミリーに最新の小型モデル「Claude Haiku 4.5」を追加したと発表した。わずか5カ月前に最先端とされた中位モデル「Claud […]

2025年8月26日、Googleはかねてより「nano-banana」のコードネームで知られ、AIコミュニティで大きな話題を呼んでいた次世代画像生成・編集モデルを、正式に「Gemini 2.5 Flash Image」 […]

一見すると何の変哲もない一枚の画像。しかし、AIシステムがその画像を読み込んだ瞬間、それはデータ窃取を命じる「トロイの木馬」へと変貌する。セキュリティ研究企業Trail of Bitsが白日の下に晒したこの新たな攻撃手法 […]

Googleは、開発者会議「Google I/O 2025」において、動画・画像生成AIモデルのアップデート、そしてそれらを統合する新たな制作ツール群を発表した。特に注目されるのは、音声生成まで可能になった動画モデル「V […]

Google I/O 2025の開幕を前に、Googleは同社のフラッグシップAIモデル「Gemini 2.5 Pro」の最新アップデート版、「Gemini 2.5 Pro Preview (I/Oエディション)」の早期 […]

Googleは、同社史上最も高性能とされるAIモデル「Gemini 2.5 Pro」のプレビュー版を開発者向けに公開した。これまで制限付きの無料実験版のみだったが、今回のリリースでより高いレート制限と明確な料金体系が導入 […]

Googleは、同社が「最もインテリジェント」と位置づける最新AIモデル「Gemini 2.5 Pro」を発表した。このモデルは、応答前に内部で「思考」する能力を備え、複雑なタスクにおける推論やコーディング性能を大幅に向 […]

Anthropicは、同社のAIモデル「Claude」に新たな機能として文書引用システム「Citations API」を発表した。この機能により、AIが生成する回答の信頼性と検証可能性が大幅に向上することが期待される。 […]

OpenAIのSam Altman CEOは、12月5日から20日まで12営業日連続で新機能やプロダクトを発表する「12 Days of OpenAI」の開催を発表した。毎日午前10時(太平洋時間)からのライブストリーム […]

GoogleがAI動画生成モデル「Veo」をクラウドプラットフォームVertex AIで提供開始したことを発表した。企業向けプライベートプレビューの形で、高品質な動画をテキストや画像から生成できる機能を提供する。大手クラ […]

OpenAIのライバル企業Anthropicは、最新かつ最も高度なAIモデル「Claude 3.5 Sonnet」をリリースした。これは、これから順次リリースされる「Claude 3.5」シリーズの最初のモデルであり、前 […]

生成AIは、出力の品質に重点が置かれて開発が進められていたが、最近はそれに加えて速度も改善が行われるようになって来ている。今回のGoogle I/Oの発表はそうした潮流を反映した物だった。 OpenAIが昨日発表した「G […]

Googleのオープンソース大規模言語モデル「Gemma」ファミリーに、コード補完とより効率的な推論のための新しいモデルが追加された。Gemmaへのこれらの変更は、今年2月に初めてリリースされて以来の大きな拡張となる。 […]

Google DeepMindは、AIによって生成された画像が精巧になり、その画像がディープフェイクであるかどうかを見分けることがますます難しくなっている現状で、AIによって生成された画像を(機械が)容易に見分けることが […]