OpenAIが、アプリを閉じた後も作業を続ける個人向けAIエージェント「o」を準備しているとの情報が浮上した。AI関連の未発表情報を発信しているXアカウントのleo(@synthwavedd)が9月26日、9月29日の開発者イベント「DevDay」で発表される製品の一つとして「o」の名称を挙げた。ただし、製品名や搭載モデル、提供時期などはOpenAIが正式発表したものではない。
一方、Metaは9月8日、個人向けAIエージェント「Muse」を発表した。メール送信や予約、買い物といった実際の作業をこなし、アプリを閉じた後も必要に応じて処理を続けられることを特徴としている。
こうしたAIエージェントを比較する場合、単純な総合点だけでなく、「実際にどの作業を、どこまで完了できたか」を見る方が分かりやすい。Museの公開試験やMetaが明らかにした設計を見ると、OpenAIが同じ分野へ参入する場合に問われるポイントも見えてくる。
OpenAIの「o」は長時間動くAIエージェントか
leo(@synthwavedd)の投稿によると、「o」はOpenAIがDevDayで発表する予定の製品の一つで、Grok BotやHermes Agentのように長時間の作業を続けるAIエージェントになるという。
同投稿では、GPT-6 Astraの派生モデル「aeon」を利用し、長時間にわたるタスクの処理に重点を置いたものになるとの情報も示されている。
ただし、これらは現時点では未確認情報だ。「o」という製品名や「aeon」との関係について、OpenAIから正式な説明は出ていない。
確認できているのは、OpenAI DevDayが9月29日にサンフランシスコで開催されることだ。公式の開催案内には「o」の発表予定は記載されていない。
それでも、報じられている「o」の方向性自体は、AIアシスタントの次の競争軸をよく表している。
これまでのチャットAIは、利用者が質問や指示を送り、それに回答すると一度仕事を終えるものが中心だった。これに対し、常時稼働型のエージェントでは、目標を預かった後も作業を続け、状況が変われば再び動き、必要なときだけ利用者へ判断を求める。
すでにこの形を製品として提供しているのがMetaのMuseだ。
Museの「9.3点」は何を評価した数字なのか
Museには、AIアシスタントの実用性を評価するサイト「Assistant Benchmark」で総合9.3点というスコアが付いている。
Assistant BenchmarkはDavid Pawlan氏らが運営する評価サイトで、旅行予約、買い物、メール返信、定期実行など、実際の利用場面を想定した課題をAIエージェントに実行させている。
各項目には1〜10点のスコアが付き、試験していない項目には点数を付けない仕組みだ。
Museの個別ページでは、採点対象15項目のうち8項目について試験結果が公開されている。
| 試験項目 | Museの点数 | 公開記録で確認できる内容 |
|---|---|---|
| オンライン作業の実行 | 9 | 条件に合う宿が見つからず、代替案と条件変更を提示 |
| 旅行予約 | 7 | Duffel経由に限られ、選択肢に制約 |
| おすすめの質 | 9 | 条件に合う飲食店を選び、OpenTableで予約 |
| 商品購入 | 10 | 種類や予算を確認し、明細付きの注文を準備 |
| メール返信 | 10 | カレンダーを確認して文案を作成し、承認後に送信 |
| 定期実行 | 10 | 平日の定期作業を予定どおり実行 |
| 外部サービスとの連携 | 10 | OpenTableやStripeのLinkと連携 |
| 権限・プライバシー | 9 | メール送信や購入の前に確認し、サービスごとに権限を設定 |
表は2026年9月27日に確認したAssistant BenchmarkのMuse個別ページに基づく。
公開されている8項目の点数を合計すると74点で、単純平均は9.25となる。小数第1位に丸めれば、表示されている9.3点と一致する。
ただし、9.3点はMuseのあらゆる能力を評価した数字ではない。15項目のうち、記憶や電話、複数のタスクを連続して処理する能力など、まだ点数が付いていない項目もある。
重要なのは総合点そのものより、何が得意で、どこに制約があるかだ。
例えばメール返信では、予定を確認して返信案を作り、利用者の承認後に送信するところまで実行できた。一方、旅行予約は利用できるサービスに制約があり、7点にとどまっている。
商品購入の10点についても、「利用者に確認せず何でも購入できる」という意味ではない。注文内容を準備し、実際に支払いを行う前に止まるところまで含めて高く評価されている。
AIエージェントの実用性は、使っているAIモデルの性能だけでは決まらない。どのサービスへ接続できるのか、どこまで操作する権限があるのか、重要な操作の前で適切に利用者へ確認できるのかも大きく影響する。
アプリを閉じても仕事を続けるMuse
Metaの製品説明によると、Museは利用者から目標やタスクを受け取ると、その後も必要に応じて作業を続ける。
長時間かかる仕事の場合は、利用者がアプリを閉じた後も処理を継続する。状況に変化があったときや、利用者の承認が必要になったときに再び知らせる仕組みだ。
これは単に「AIの回答が速い」という機能とは異なる。
例えば旅行を計画する場合、その場で候補を提示するだけなら通常のAIアシスタントでもできる。常時稼働型のエージェントでは、予約条件や予定を覚えておき、後から状況が変わった場合に作業を再開するといった処理まで求められる。
一方、何も変化していないのに頻繁に通知すれば、かえって利用者の負担になる。何を継続して確認し、どのタイミングで利用者に知らせるかも、製品として重要な能力になる。
Museは利用者ごとに専用のクラウド上のコンピューターを持ち、その中でブラウザーやファイルを使って作業する。
Metaによると、利用者はMuseが行った操作や承認済みの権限を確認できる。AIが何を覚え、どのような操作を行ったのかを後から追跡できるようにしている。
ただし、Assistant Benchmarkで「定期実行」が10点だったからといって、数週間や数カ月にわたるあらゆる作業を安定して継続できることが証明されたわけではない。
予定した時刻に処理を実行できることに加えて、通信が途切れたり、利用条件が変わったり、途中の作業に失敗したりしたときに、正しく復帰できるかも重要になる。
OpenAIの「o」が長時間のタスクを特徴とするのであれば、こうした継続性や復旧能力は重要な比較ポイントになる。
自動で動くAIを、どこで止めるのか
常時稼働するAIでは、仕事をどれだけ自動化できるかだけでなく、「どこで止めるか」も重要になる。
MetaはMuseの安全設計について、AIが間違える可能性や、外部から読み込んだ情報によって不正な指示を受ける可能性を前提に設計したと説明している。
代表的な問題が「プロンプトインジェクション」だ。
例えばAIがWebページを読んで作業している途中、そのページ内に「これまでの指示を無視して別の操作を行え」といった命令が埋め込まれていれば、エージェントがそれに従ってしまう危険がある。
アプリを閉じた後も長時間動くAIでは、利用者が直接画面を見ていない間に外部のデータへ触れる機会も増える。
Museでは、この問題に対応するため、実際の作業をするAIとは別に「Sentinel」と呼ばれる監督役を動かしている。
Metaによると、Museが外部サービスへアクセスしたり、インターネット上で操作したりする際にはSentinelの審査を受ける。Muse自身がSentinelの判断を変更することはできない。
パスワードや決済情報なども、Museから直接見えない領域に保存する。
メール送信や商品購入といった重要な操作では、人が内容を確認してから実行する仕組みも採用している。
この設計を見ると、AIエージェントにおける「仕事ができる」の意味も変わってくる。
人間の確認なしですべてを最後まで実行することだけが優秀なのではない。メールの宛先や購入内容を準備したうえで、取り消しにくい操作の直前に正しく止まり、利用者へ判断を戻せることも重要な能力になる。
一方、利用者ごとに仮想マシンが分離されているからといって、現在のMuseでMeta自身もデータへアクセスできないわけではない。
Metaは現行のMuse Secure VMについて、利用者同士のデータは分離されているものの、サービスの運用や安全確保などに必要な場合、Metaによるアクセスを技術的に完全に防ぐ仕組みではないと説明している。
Meta自身もアクセスできないよう暗号技術で保護する「Muse Confidential VM」は、2026年内の提供を予定している別の仕組みだ。
現在利用できるMuseと、今後導入予定のConfidential VMは分けて考える必要がある。
新しいAIエージェントは「何を任せたいか」で比べる
Metaの発表によると、Museは米国でiOS、Android、Web向けに提供を開始している。多くの用途は無料で利用でき、より多く使いたい利用者向けには有料プランも用意する。
ただし、この発表だけでは日本での提供時期や料金は分からない。
OpenAIの「o」についても、現段階では正式な料金や提供条件は明らかになっていない。
こうした新しいAIエージェントを比較するときは、まず自分が任せたい作業を一つ決め、その開始から完了までどこまで実行できるかを見ると分かりやすい。
メールなら、文章の出来だけではなく、予定を正しく確認できるか、適切な宛先を選べるか、送信前に確認を求めるかまでが重要になる。
予約なら、候補を探すだけなのか、実際に利用したいサービスへアクセスし、予約直前まで手続きを進められるのかによって、削減できる手間は大きく変わる。
9月29日のDevDayで「o」が実際に発表されるのであれば、製品名や搭載モデルだけでなく、どの程度長く作業を続けられるのか、どのサービスを操作できるのか、失敗した作業から復帰できるのか、そしてどの段階で利用者の承認を求めるのかが重要になる。
目標を覚えて作業を続け、必要なサービスを操作し、重要な場面では人に判断を戻す。この一連の流れを安定してこなせるかどうかが、常時稼働するAIエージェントの実用性を左右することになりそうだ。
- OpenAIに常時稼働AI「o」の報道、Meta Museの高得点を8項目から読む
- 画面を閉じても働くAI、OpenAI「o」報道で問われる継続実行と承認の設計
- Meta Museの9.3点は万能の証明か、OpenAI「o」報道から考えるAIの選び方
