
三菱電機とソニーが製造業向けAIで合弁、センサー内の画像認識をFA制御へつなぐ
三菱電機とソニーセミコンダクタソリューションズが、センサー内AIをFAの判断・制御へ結ぶ合弁事業を計画する。2026年10月の始動を目指す一方、製品仕様や発売時期は未公表だ。
別名: Multimodal
マルチモーダルとは、テキスト、画像、音声、動画などの複数の種類(モダリティ)のデータを同時に入力・処理し、それらを統合して理解・生成できるAIモデルやシステムの能力を指す用語である。従来のAIモデルは特定のデータ形式に特化して設計されてきたが、マルチモーダルモデルは異なる形式のデータ間の関連性を学習することで、より柔軟で人間の認知に近い応答を実現する。2020年代半ば以降、大規模言語モデルの発展とともに、主要なAI企業や半導体メーカーがマルチモーダル対応を競うように進めている。
マルチモーダルという概念自体は新しいものではないが、生成AIの急速な進化によって実用面での重要性が急速に高まった。テキストのみを扱う言語モデルに画像認識や音声認識、音声合成、動画生成の能力を組み合わせることで、単一の対話インターフェースで多様なタスクを処理できるようになる。これにより、チャットボットは画像を見て説明したり、音声で自然に会話したり、動画を生成したりすることが可能になっている。
マルチモーダル対応は、現在のAI開発における中心的な技術的課題の一つとなっている。テキスト、画像、音声、動画といった異なるデータ形式を単一のニューラルネットワークアーキテクチャで扱うためには、各モダリティの特徴を共通の表現空間に統合する仕組みが必要であり、これがモデルの性能や応答速度を左右する。またエッジデバイス上でマルチモーダル処理を軽量に実行する技術も、モバイル向けAIチップの重要な差別化要素になっている。
2026年4月には、OpenAIがChatGPTの高度な音声モードを大幅にアップデートし、より自然な発話とリアルタイム翻訳機能を実装した。同月、フランスのMistral AIも小型モデル「Mistral Small 3.1」を公開し、限られたパラメータ数でも高い性能を示した。2026年5月には、GoogleがリサーチツールNotebookLMをGemini 1.5 Proで強化し日本を含む200カ国で展開を開始するとともに、あらゆる入力を動画に変換する新モデル「Gemini Omni」を発表し、生成AIにおける表現力の課題である不気味の谷の克服を試みた。
2026年6月には動きがさらに加速した。OpenAIはChatGPTの画像生成機能をGPT-4oモデルに直接統合し、テキストやロゴの高精度な描画を実現する新システムを発表した。Googleは推論能力を強化した「Gemini 2.5 Pro」を発表し、ベンチマークで競合モデルを上回る性能を示すとともに、MediaTekの次世代チップセットDimensity 9400がGemini Nanoのマルチモーダル機能をサポートすることも明らかになり、エッジデバイスでの高度なAI活用が広がりつつある。さらに、AppleがSiriの抜本的な機能強化に向けてGoogleのGeminiモデルの搭載を検討しているとの報道もあり、長年ライバル関係にあった両社がAI領域で提携する可能性が浮上している。これらの動向は、マルチモーダル対応がクラウドからエッジまで幅広い層のAI製品において標準的な要件となりつつあることを示している。

三菱電機とソニーセミコンダクタソリューションズが、センサー内AIをFAの判断・制御へ結ぶ合弁事業を計画する。2026年10月の始動を目指す一方、製品仕様や発売時期は未公表だ。

Googleは、あらゆる入力から動画などを生成・編集できるネイティブマルチモーダルモデルGemini Omniと、高速な推論でAIエージェント構築を支援するGemini 3.5 Flashを発表した。これにより、物理法則を理解した自然な動画生成や、開発タスクを高速化する自律エージェントの実現が可能となり、エンタープライズ利用を見据えた安全対策も導入された。

長年のライバル関係にあったAppleとGoogleが、AIの領域で歴史的な提携に動く可能性が浮上した。Appleが次世代の音声アシスタント「Siri」の抜本的な機能強化のため、Googleの生成AIモデル「Gemini」 […]

最近のAIアシスタントの音声は、かなり自然な表現になってきているが、今回のChatGPTのアップデートでは更に改善が施されている。OpenAIは、ChatGPTの有料ユーザー向けに高度な音声モード(Advanced Vo […]

OpenAIはChatGPTの画像生成機能を大幅に刷新し、GPT-4oモデルに直接統合した新システムを発表した。テキストやロゴの正確な描画、会話を通じた画像の洗練、複雑な指示への対応など、従来のDALL-E 3を大きく上 […]

Googleは、同社が「最もインテリジェント」と位置づける最新AIモデル「Gemini 2.5 Pro」を発表した。このモデルは、応答前に内部で「思考」する能力を備え、複雑なタスクにおける推論やコーディング性能を大幅に向 […]

フランスのAIスタートアップMistral AIが、わずか24B(240億)パラメータながらGoogle GemmaやOpenAIのGPT-4o miniを上回る性能を持つ新モデル「Mistral Small 3.1」を […]

スマートフォン業界に革新的な進展がもたらされた。MediaTekは、次世代フラッグシップチップセットDimensity 9400が、GoogleのGemini Nanoをマルチモーダル機能とともにサポートすることを発表し […]

学生や研究者にとって強力なツールが日本でも利用可能になった。GoogleのAIを利用したリサーチツール「NotebookLM」がGemini 1.5 Proによりパワーアップを果たした上で、日本を含む200カ国で提供開始 […]

生成AIは、出力の品質に重点が置かれて開発が進められていたが、最近はそれに加えて速度も改善が行われるようになって来ている。今回のGoogle I/Oの発表はそうした潮流を反映した物だった。 OpenAIが昨日発表した「G […]

最近、OpenAIがSam Altman氏を解雇し、すぐに再雇用したことで、人工知能(AI)の開発と利用をめぐる議論が再び脚光を浴びている。さらに異例なのは、メディア報道で目立つテーマが、AIシステムの数学能力であること […]

Google DeepMindは、同社の有名なAIである「AlphaGo」の能力と、OpenAIのChatGPTを支える技術であるGPT-4のような大規模言語モデルを組み合わせた「Gemini」と呼ばれる画期的なAIシス […]