OpenAIは2026年9月23日、ChatGPTの音声機能を拡張し、リアルタイムの会話モード「Live」からプラグインを使えるようにした。対象はWeb、iOS、Androidだ。さらに、文書作成や調査を進める「ChatGPT Work」をWebとモバイルでも音声で操作できる。これまでデスクトップで始めていた音声による仕事の依頼が、スマートフォンにも広がった。ただし、声で指示できることと、接続先で実行できることは同じではない。利用できるアプリ、操作の権限、承認の方法を分けて見る必要がある。

AD

接続アプリを呼び出し、Workに仕事を頼む

 

今回の更新で、Liveの会話中にアカウントで利用可能なプラグインと接続済みアプリを呼び出せるようになった。OpenAIのリリースノートは、音声でやり取りしながら、返答をチャットの文字でも追えると説明する。話している最中に得た情報を、聞き返すだけでなく画面で確かめられる。

もう一つの変更は、ChatGPT Workの音声対応だ。Workは、単発の質問より長い仕事を引き受けるための機能で、接続済みアプリやファイルを使い、調査から成果物の作成まで進める。9月23日からはWebとモバイルでも音声で仕事を頼める。OpenAIが挙げる対象には文書、プレゼンテーション、表計算シートの作成があり、接続済みアプリやブラウザーを使う作業も含まれる。

たとえば移動中に資料作成を頼み、内容を話しながら調整する使い方が想定できる。通話を終えた時点で仕事が終わっていなければ、作業は文字の会話で続けられるとOpenAIは説明する。ただし、個別のプラグインを使った一連の作業を本記事で実機検証した結果ではない。

デスクトップで始まった音声操作が、Webとスマホへ

「声でWorkを動かす」機能そのものは初登場ではない。OpenAIは7月23日、デスクトップアプリのWorkとCodexに音声を導入し、話しかけてタスクを始めたり進捗を確かめたりできるようにした。Workも7月9日に、調査や資料作成を担う機能として発表済みだ。今回増えたのは、Workの音声操作をWebとモバイルへ広げ、通常のChatで使うLiveにもプラグインをつないだ点にある。

この経緯を押さえると、機能の位置づけが分かりやすい。プラグインは外部サービスへの接続や決まった手順をChatGPTで使う仕組みであり、Workは複数の手順を含む仕事を進める場だ。9月23日の更新は、その二つへ音声で入れる経路を増やした。接続していないメールや予定表へのアクセスを新たに与えたり、すべてのアプリの操作を一律に開放したりする発表ではない。

モデル名にも注意がいる。OpenAIのVoiceヘルプは、Liveの会話を支えるモデルをプランに応じてGPT-Live-1またはGPT-Live-1 miniと記す。一方、難しい検索や推論には別のモデルを使えると説明しており、9月22日にはGPT-6 SolとLunaをWorkとCodexに導入した。Workで選べるモデルの話と、リアルタイム音声を動かすモデルの話を一つにまとめて「音声がGPT-6で動く」と読むと、役割の違いを見落とす。

AD

声で頼めても、承認は画面に残る

Liveでプラグインを使うには、そのアプリを接続してログインする必要がある場合がある。使える情報と操作は、接続したアカウントの権限やワークスペースの制限を引き継ぐ。声で話しかけるだけで、その境界が広がるわけではない。メール、予定表、Slackといった接続先の具体的な読み取りや書き込みは、各アプリが提供する操作と設定によって変わる。

承認が必要な操作は、Webやモバイルの画面に確認が表示される。OpenAIは、音声での承認には対応せず、画面上で許可または拒否するよう案内している。つまり、話しかけて作業を始めることはできても、外部への送信や変更を含む仕事が常に画面を見ずに終わるとは限らない。接続先に何を許可したかと、実行前にどの操作を確認するかが、実用上の要点になる。

プランの違いも大きい。FreeとGoの利用者は、各プランで対応するプラグインをChat内のVoiceから使える。一方、Work内のVoiceにはVoiceとWorkの両方へのアクセスが必要だ。Workを音声で使った時間はプランのVoice利用枠や課金に従い、実行したWorkタスクも通常のWork使用量に算入される。声で依頼するとWorkの利用枠が不要になる、という扱いではない。提供される機能は地域、アプリの版、組織の設定などでも変わるため、自分の画面にWorkと対象プラグインがあるかを確認する必要がある。

使い始める前には、依頼したい仕事を「情報を探す」「成果物を作る」「接続先の状態を変える」に分けるとよい。最初の二つでも、必要な資料や接続先へのアクセスがなければ期待した内容にならない。最後の操作は、接続先が書き込みを提供しているか、アカウントに権限があるか、画面での承認を求められるかまで確かめる。音声で依頼できる機能の一覧だけでは、実際に完了できる仕事の範囲は決まらない。

音声で私的な予定やメールを扱う場合は、会話データの管理も見ておきたい。OpenAIのVoiceヘルプによれば、LiveとAdvancedの音声クリップは、チャット履歴に表示される書き起こしとともに保存され、30日間保持される。音声クリップは利用者が共有を選ばない限りモデルの訓練に使われない。一方、書き起こしや会話中のファイルは、プランやデータ設定によって訓練対象となる場合がある。接続アプリを増やす前に、アカウントと組織のデータ設定を確認したい。

音声モードを選ぶと、できることが変わる

ChatGPTの「音声」は一種類ではない。公式ヘルプにある各モードの説明を、利用する場面に沿って並べた。

音声モード 会話の進み方と接続アプリ 動画・画面共有
Live リアルタイムに会話し、利用可能なプラグインや接続済みアプリを使える 対応しない
Advanced 従来のリアルタイム音声。プラグインの対応は公式ヘルプに記載なし 対応するモバイル版で利用できる
Standard 発話を文字にしてから応答する交互型。プラグインの対応は公式ヘルプに記載なし 公式ヘルプに記載なし

Liveでは利用可能なプラグインを音声で使えるが動画/画面共有は非対応。Advancedは対応モバイルで動画/画面共有を使える。Workの音声は両機能へのアクセスと既存権限を必要とする。

ここでいう「両機能」は、OpenAIのリリースノートが利用条件に挙げるVoiceとWorkを指す。

この表はOpenAIが案内する機能を並べたもので、同じ条件で各モードの能力を測った比較ではない。「記載なし」は非対応を意味せず、全プランで各モードを選べるという意味でもない。声で接続アプリを使いたいのか、カメラや画面を見せたいのかによって、使うモードと利用条件を確かめる必要がある。

ChatGPTの音声が役立つ場面は、話せる時間の長さだけでは測れなくなった。今後確かめたいのは、利用者が実際に接続するアプリでどの操作まで許され、承認が必要なときにスマートフォンの画面へ無理なく移れるかだ。そこまで確認して初めて、声で始めた仕事をどこまで任せられるか判断できる。