AlibabaのQwenチームが9月23日、音声AI「Qwen-Audio-3.1」シリーズを発表した。音声認識、読み上げ、リアルタイム会話の各機能を更新し、音声や周囲の音を理解するASR-Nextと、声や効果音をまとめて生成するTTS-Nextを加えた5モデル構成だ。

音声APIの値下げも進み、開発者が用途や予算に応じて選べる幅は広がった。ただし、競合との比較を見ると、Qwenが強みを持つのは会話のどの部分なのか、安い料金がどのモデルに適用されるのかによって評価は変わる。

GPTやGeminiの代わりになるかを判断するには、音声認識の精度、会話中の振る舞い、生成される音声の品質を分けて見る必要がある。

AD

音声認識から音声生成まで、5モデルの役割

Qwen-Audio-3.1には、音声を文字に変換するモデル、音声で応答するモデル、さらに会話や効果音を含む音声コンテンツを生成するモデルがある。同じ「音声AI」でも、扱う入力と出力、想定される用途は大きく異なる。

モデル系統 主な役割 今回の主な機能 日本語利用時の注意点
ASR 音声を文字に変換する 方言認識、専門用語への対応、非ストリーミング版での話者分離 認識対象に日本語を含む
ASR-Next 発話や周囲の音を理解する 話者分離、環境音の説明、音が発生した時間の特定、音声に関する質問への回答 専用APIの提供条件は別途確認が必要
TTS テキストを音声にする 自然言語による感情・話し方の指定、言語をまたいだ声質の再現 公式デモに日本語を含む
TTS-Next 声、効果音、環境音をまとめて生成する 複数人の会話、ポッドキャスト、場面に合わせた音声生成 公開APIの対応言語は中国語と英語
Realtime 音声でリアルタイムにやり取りする 相手の発話中も聞き続ける全二重会話、ツール呼び出し、声の複製 利用ガイドに日本語を含む

ASR公式ページTTS公式デモTTS-Nextの仕様Realtime利用ガイドに基づく。シリーズ全体が掲げる機能と、個々のAPIで実際に利用できる機能・言語は同じではない。

たとえば会議の文字起こしでは、「誰がいつ話したか」を区別する話者分離が役立つ。動画やポッドキャストの制作では、台詞だけでなく足音や室内の反響音までまとめて生成できるTTS-Nextが候補になる。

通常のTTSに日本語デモが用意されていても、TTS-Nextで日本語の音声コンテンツまで生成できるとは限らない。

会話を理解する力と、割り込みへの反応は別に見る

Qwen-Audio-3.1-Realtimeは、Alibabaの評価ではGPT-Realtime-2を上回る項目が多い。ただし、音声入力に対してテキストで回答する試験と、音声入力に音声で応答する試験では結果が異なる。Qwenチームの技術報告でも、この2種類は分けて評価されている。

評価項目 GPT-Realtime-2 SeedDuplex 1.2.6.1 Qwen 3.0 Realtime Qwen 3.1 Realtime
音声による複数ターンの指示追従:Audio MultiChallenge 50.33% 41.91% 47.12% 52.21%
音声による推論問題:Big Bench Audio 93.30% 80.50% 98.80% 98.50%
タスク完遂:τ-Voiceを使った独自の半二重S2T評価 43.8% 40.3% 78.4% 82.0%
音声からの関数呼び出し:SpeechFCEval 70.74% 54.73% 83.28% 86.00%
音声で応答する評価:EVA-AのPass 50.40% 未掲載 43.10% 47.74%

いずれも高いほど良い。出典は同報告の表2・表6。Qwenの正式名称はそれぞれQwen-Audio-3.0-Realtime、Qwen-Audio-3.1-Realtimeで、表中では短縮している。GPT-Realtime-2は原則low-effort設定。上4行は音声入力・テキスト出力(S2T)、EVA-Aは音声入力・音声出力(S2S)の評価である。

Audio MultiChallengeの採点には公式のo4-miniではなくGPT-4o-miniを使用しているため、公式採点器によるスコアとは直接比較できない。τ-Voiceも、公式の全二重S2S方式とは異なる。

Qwen 3.1は、会話の途中で追加された指示に従う試験や、音声による依頼をツール操作につなげる試験で成績を伸ばした。一方、EVA-AのPassではGPT-Realtime-2が上回る。Big Bench Audioでも、旧Qwen 3.0をわずかに下回った。

したがって、この表だけから「音声会話のあらゆる能力でQwenが上回る」と結論づけることはできない。

学習方法からも、単に指示を理解するだけでなく、実際にタスクを完了させることを重視していることが分かる。

Alibabaは、ツールやデータベースを備えた環境でモデルを動かし、許可された変更が実際に完了したかどうかを確認したうえで、その結果を学習に利用する。正しい形式でツール呼び出しを生成できても、それだけでは仕事を完了したことにはならないためだ。

さらに、言語的な指示を理解する学習と、音声特有の感情表現や会話のタイミングを扱う学習を組み合わせている。

ただし、人と自然に会話するAIには、相手にされていない発話へ余計な返答をせず、利用者に割り込まれたらすぐに話すのをやめる能力も求められる。ここでは別の性能差が表れる。

全二重会話の評価項目 GPT-Realtime-2 SeedDuplex 1.2.6.1 Qwen 3.0 Qwen 3.1
周囲の発話に誤って反応してしまう割合 72.0% 61.0% 73.0% 13.0%
利用者が別の人に話しかけた際に誤って反応する割合 60.0% 81.0% 13.0% 3.0%
利用者の割り込み後に応答するまでの時間 1.872秒 2.108秒 1.9432秒 1.954秒

同報告の表10、Full-Duplex-Bench v1.5によるS2S評価。すべて低いほど良い。割合は原表の比率を100倍して示した。上2行は、本来応答すべきではない発話にAIが反応した頻度である。

利用者が割り込んでから、AIが発話を止めるまで横棒グラフ。カテゴリ 4 件、系列: 発話停止までの時間(単位: 秒・低いほど良い)GPT-Realtime-2GPT-Realtime-2GPT-Realtime-2 — 発話停止までの時間: 0.38秒・低いほど良い0.38SeedDuplex 1.2.6.1SeedDuplex 1.2.6.…SeedDuplex 1.2.6.1 — 発話停止までの時間: 1.42秒・低いほど良い1.42Qwen-Audio-3.0-RealtimeQwen-Audio-3.0-Re…Qwen-Audio-3.0-Realtime — 発話停止までの時間: 1.04秒・低いほど良い1.04Qwen-Audio-3.1-RealtimeQwen-Audio-3.1-Re…Qwen-Audio-3.1-Realtime — 発話停止までの時間: 1.12秒・低いほど良い1.12単位: 秒・低いほど良い
データを表で見る
発話停止までの時間 (秒・低いほど良い)
GPT-Realtime-20.38
SeedDuplex 1.2.6.11.42
Qwen-Audio-3.0-Realtime1.04
Qwen-Audio-3.1-Realtime1.12
利用者が割り込んでから、AIが発話を止めるまでAlibabaのFull-Duplex-Bench v1.5評価。音声入力・音声出力。GPT-Realtime-2はlow-effort設定。実サービス全体の遅延ではない。出典: Qwen-Audio-3.1-Realtime技術報告、表10

Qwen 3.1は、周囲の会話を自分への発話と誤認しない能力で大きく改善した。一方、利用者が割り込んでからAIが発話を止めるまでの時間はGPT-Realtime-2より長い。

Alibabaの同一評価では、Qwenの周囲の発話への誤反応率はGPT-Realtime-2より59ポイント低い一方、利用者が割り込んだ際に発話を止めるまでの時間は0.733秒長かった。 差はそれぞれ「72.0−13.0」と「1.116−0.383」である。

自分に向けられた発話かどうかを見分ける能力と、利用者の割り込みに素早く反応する能力は別々に評価する必要がある。

この比較はAlibabaのプレプリントに掲載された試験結果であり、第三者による再現試験や、統計的な有意差が確認された結果ではない。それでも、問い合わせ窓口で周囲の会話に誤って反応する回数を減らしたいのか、それとも利用者が遮った瞬間に素早く発話を止めてほしいのかによって、重視すべき指標が変わることは分かる。

AD

中国語の方言認識は改善、日本語の精度とは分けて見る

音声認識モデルのQwen-Audio-3.1-ASRは、公式説明で30言語と中国語の16方言に対応する。競合比較では、Alibabaが公開した中国語方言の結果が具体的に示されている。

公開データセットの比較図を表にすると、Tencentが上回る項目もある。

公開データセット・対象 Doubao-ASR Tencent Hy-ASR-3.0-preview Qwen-Audio-3.1-ASR
KeSpeech・北京 5.13% 4.25% 3.62%
KeSpeech・冀魯(Ji-Lu) 5.87% 4.11% 3.98%
KeSpeech・江淮(Jiang-Huai) 8.24% 6.39% 6.33%
KeSpeech・膠遼(Jiao-Liao) 6.37% 4.31% 4.20%
KeSpeech・蘭銀(Lan-Yin) 6.23% 4.44% 4.49%
KeSpeech・東北 7.84% 4.69% 4.79%
KeSpeech・西南 4.95% 3.50% 3.63%
KeSpeech・中原 4.90% 3.02% 3.03%
KeSpeech・普通話 2.90% 1.89% 1.78%
WSYue・長い音声 16.78% 8.90% 8.77%
WSYue・短い音声 9.47% 5.24% 5.42%

指標は文字誤り率(CER)で、低いほど良い。Alibabaが示した同一図の値を使用している。ただし、KeSpeechは方言音声を標準中国語へ変換するAST、WSYueは広東語音声を書き起こすASRの評価であり、同じ処理を測ったものではない。

Qwenは11項目中6項目、Tencentは5項目で最も低い誤り率を記録した。

ただし、単純に「勝った項目数」だけを数えると、差がごく小さい中原と、長い広東語音声で見られる差を同じ1項目として扱うことになる。また、翻訳と文字起こしの結果をまとめて、「どんな音声でもこの精度で認識できる」と解釈することもできない。

Alibabaの社内データを使った中国語16方言の評価では、さらに大きな差が示されている。

中国語16方言の文字起こし:社内評価の平均文字誤り率横棒グラフ。カテゴリ 3 件、系列: 16方言の単純平均CER(単位: %・低いほど良い)Doubao-ASRDoubao-ASRDoubao-ASR — 16方言の単純平均CER: 20.23%・低いほど良い20.23Tencent Hy-ASR-3.0-previewTencent Hy-ASR-3.…Tencent Hy-ASR-3.0-preview — 16方言の単純平均CER: 17.13%・低いほど良い17.13Qwen-Audio-3.1-ASRQwen-Audio-3.1-AS…Qwen-Audio-3.1-ASR — 16方言の単純平均CER: 10.38%・低いほど良い10.38単位: %・低いほど良い
データを表で見る
16方言の単純平均CER (%・低いほど良い)
Doubao-ASR20.23
Tencent Hy-ASR-3.0-preview17.13
Qwen-Audio-3.1-ASR10.38
中国語16方言の文字起こし:社内評価の平均文字誤り率Alibabaの社内テスト。各方言を等しい重みで平均。公開データセットの成績や日本語の認識精度とは別。出典: Qwen-Audio-3.1-ASR公式プロジェクトページ

Qwenの平均CERは10.38%で、比較された2モデルより低かった。もっとも、Alibabaの社内音声データを使った結果であるため、実際の利用環境でも同じ差が出るとは限らない。

日本語については、Realtimeの技術報告に、多言語版Big Bench Audioの日本語正答率としてQwen 3.1の89.3%、GPT-Realtime-2の79.8%が掲載されている。

ただし、これは音声で出題された推論問題に正しく回答できるかを測った値だ。日本語の固有名詞をどれだけ正確に文字起こしできるか、読み上げた日本語の発音がどれだけ自然かを示す数字ではない。

「日本語に対応している」という仕様と、日本語を実際に使った場合の精度は分けて確認する必要がある。

TTSの第三者評価は旧版、3.1の評価には使えない

QwenのTTS公式デモでは、自然言語による指示で感情や話し方を変えたり、言語を切り替えても声の特徴を維持したりする例が紹介されている。

技術面では、音声を1秒当たり12.5個のトークンに変換する仕組みと、言語モデル部分と音声生成部分を段階的に学習する方式が説明されている。生成する音声トークンの数を抑えながら、発話内容の正確さと声の表現力を両立させる狙いだ。

競合との音質比較では、独立評価機関Artificial AnalysisのProvider Voice Arenaが参考になる。ただし、9月24日時点で掲載されているQwenモデルはQwen-Audio-3.0-TTS-Plusであり、3.1ではない。

モデル Elo 95%信頼区間の幅 比較サンプル数 100万文字生成の掲載料金
Cartesia Sonic 3.6 1273 ±17 1,757 49.0ドル
Google Gemini 3.8 Flash TTS 1260 ±17 1,999 16.5ドル
Qwen-Audio-3.0-TTS-Plus(旧版) 1259 ±17 1,447 27.6ドル
Inworld Realtime TTS-2 1245 ±18 1,239 20.8ドル
SpeechifyAI Simba 3.2 1237 ±14 2,391 6.6ドル
ElevenLabs v3 Conversational 1196 ±15 1,844 50.0ドル
MiniMax Speech 2.8 HD 1168 ±11 4,414 100.0ドル
ElevenLabs Eleven v3 1167 ±11 4,345 100.0ドル

2026年9月24日参照。Accent、CategoryともにAll。各社の標準音声で同じ文章を読み上げ、聞き手がモデル名を知らない状態で、より自然だと感じる音声を選ぶ評価だ。

Eloは音声が選ばれやすい傾向を示す尺度であり、正答率ではない。料金は同機関が各社APIの標準設定で100万文字を生成した場合の費用として掲載したもので、後述する100万トークン当たりの料金とは単位が異なる。

旧Qwenは上位に位置しているものの、上位3モデルの信頼区間は重なっている。表示順位だけを見て明確な性能差があるとは言えない。

また、米国・英国のアクセントを対象とするこの評価から、日本語の自然さを判断することもできない。さらに、3.1のデモページからリンクされている論文の題名は3.0-TTSである。旧版の好成績をそのまま新版3.1の実測結果として扱うべきではない。

TTS-Nextは、通常の文章読み上げとは用途そのものが異なる。

台詞だけでなく、効果音や環境音までまとめて生成できるため、複数の音素材を後から編集して重ねる作業を減らせる可能性がある。

公開APIでは最大3本の参照音声を指定できるが、対応言語は中国語と英語で、完成した音声ファイルを受け取る非ストリーミング方式となる。生成できる音声の上限は、ポッドキャストが240秒、その他が120秒だ。

日本語をリアルタイムに読み上げる用途と、会話や効果音を含む音声コンテンツを制作する用途では、選ぶべきモデルが異なる。

AD

本当に安いのはどのモデルか、GPT・Geminiと料金を比較

Qwen-Audio-3.1-Realtime-Plusの音声料金は、GPT-Realtime-2.1より低い一方、Gemini 3.8 Liveより高い。値下げ率の大きさだけを見ると、この関係を見落としやすい。

会話API テキスト入力 音声入力 テキスト出力 音声出力
Qwen-Audio-3.1-Realtime-Plus 0.80ドル 6.40ドル 6.40ドル 24.00ドル
Qwen-Audio-3.0-Realtime-Flash(旧版) 0.23ドル 0.93ドル 0.70ドル 1.87ドル
OpenAI GPT-Realtime-2.1 4.00ドル 32.00ドル 24.00ドル 64.00ドル
OpenAI GPT-Realtime-2.1-mini 0.60ドル 10.00ドル 2.40ドル 20.00ドル
Google Gemini 3.8 Live 0.75ドル 3.00ドル 4.50ドル 12.00ドル
Google Gemini 3.1 Flash Live Preview 0.75ドル 3.00ドル 4.50ドル 12.00ドル

各欄とも100万トークン当たり。2026年9月24日時点のAlibaba CloudのPlus料金Flashの改定通知OpenAI料金表Google料金表に基づく。

Qwenは国際向けのシンガポール料金を使用し、各社ともキャッシュ割引や外部ツールの利用料金は含めていない。※Flashの1.87ドルは、改定通知で「テキスト+音声出力」と記載された区分。

  • 音声入力
  • 音声出力
リアルタイム会話APIの音声単価横棒グラフ。カテゴリ 5 件、系列: 音声入力, 音声出力(単位: ドル/100万トークン)Qwen 3.1 Realtime PlusQwen 3.1 Realtime…Qwen 3.1 Realtime Plus — 音声入力: 6.4ドル/100万トークン6.4Qwen 3.1 Realtime Plus — 音声出力: 24ドル/100万トークン24Qwen 3.0 Realtime Flash(旧版)Qwen 3.0 Realtime…Qwen 3.0 Realtime Flash(旧版) — 音声入力: 0.93ドル/100万トークン0.93Qwen 3.0 Realtime Flash(旧版) — 音声出力: 1.87ドル/100万トークン1.87GPT-Realtime-2.1GPT-Realtime-2.1GPT-Realtime-2.1 — 音声入力: 32ドル/100万トークン32GPT-Realtime-2.1 — 音声出力: 64ドル/100万トークン64GPT-Realtime-2.1-miniGPT-Realtime-2.1-…GPT-Realtime-2.1-mini — 音声入力: 10ドル/100万トークン10GPT-Realtime-2.1-mini — 音声出力: 20ドル/100万トークン20Gemini 3.8 LiveGemini 3.8 LiveGemini 3.8 Live — 音声入力: 3ドル/100万トークン3Gemini 3.8 Live — 音声出力: 12ドル/100万トークン12単位: ドル/100万トークン
データを表で見る
音声入力 (ドル/100万トークン)音声出力 (ドル/100万トークン)
Qwen 3.1 Realtime Plus6.424
Qwen 3.0 Realtime Flash(旧版)0.931.87
GPT-Realtime-2.13264
GPT-Realtime-2.1-mini1020
Gemini 3.8 Live312
リアルタイム会話APIの音声単価2026年9月24日。Qwenはシンガポール料金。Flash出力はテキスト+音声区分。各社の音声トークン数は同じ時間を意味せず、会話1分の費用比較ではない。出典: Alibaba Cloud、OpenAI、Googleの公式料金表・改定通知

Qwen 3.1 PlusはGPT-Realtime-2.1より音声の入出力単価が低いが、Googleよりは高い。OpenAIのminiと比べると、音声入力はQwenの方が安く、音声出力はminiの方が安い。

利用者が話す時間とAIが応答する時間の比率によって、実際の費用は変わる。

ここで注意したいのは、性能比較に使ったモデルと料金比較に使ったモデルを混同しないことだ。

前半のAlibabaによる評価対象はGPT-Realtime-2で、現在の料金表に掲載したOpenAIモデルはGPT-Realtime-2.1である。Qwen側でも、最も低価格な3.0 Flashと、前半で性能を比較した3.1は別のモデルだ。

旧版Flashの料金と新版3.1の性能結果を組み合わせると、実際には存在しない価格性能比を作ることになる。

文字起こしや音声生成に特化したAPIは、リアルタイム会話APIとは分けて見ると用途が分かりやすい。

専用API 地域 入力100万トークン 出力100万トークン
Qwen-Audio-3.1-ASR-Flash シンガポール 0.15ドル 0.47ドル
Qwen-Audio-3.1-TTS-Flash シンガポール 0.23ドル 1.87ドル
Qwen-Audio-3.1-TTS-Next 北京 0.848ドル 1.696ドル

ASRのモデル料金、TTS-Flashの改定通知、TTS-Nextの仕様に基づく。

ASRは音声から文字を生成し、TTS系は音声を生成するため、出力単価だけを比べて「どのAPIが安いか」を判断する表ではない。TTS-Nextは提供地域も異なる。

値下げの内容も具体的に確認できる。

9月22日発効の料金改定では、国際向けQwen-Audio-3.0-Realtime-Flashのテキスト+音声出力が、100万トークン当たり15ドルから1.87ドルへ引き下げられた。

「1−1.87÷15」で計算すると、値下げ率は約87.5%となる。ただし、これは旧版Flashの特定の出力区分についての数字であり、3.1 Plusの料金も同じ割合で下がったという意味ではない。

一方、TTS-Flashは、入力1万文字当たり0.15ドルという料金体系から、入力・出力それぞれのトークン数に応じた課金方式へ変わった。

文字数から完成音声の長さへの換算は、原稿の内容や話す速度によって異なる。料金の単位そのものが変わっているため、一律の値下げ率を計算するより、同じ原稿を生成した場合の実際の請求額を比較する方が実用的だ。

リアルタイム会話APIについても、各社で音声トークンの数え方や会話履歴の扱いが異なるため、100万トークン当たりの価格差が、そのまま会話1分当たりの料金差になるわけではない。

導入時には、料金表だけでは分からない制約も確認する必要がある。

QwenのRealtime利用ガイドによると、ツール呼び出しとウェブ検索は同時に有効化できない。

また、モデル自体のコンテキスト上限である262,144トークンとは別に、保持できる音声履歴には最大50ターン、累計300秒という制限があり、上限を超えた古い履歴は破棄される。

300秒は通話全体の時間制限ではないが、長時間の相談や会話で、過去の音声をどこまで参照できるかに影響する。

日本語対応のカスタマーサポートであれば、料金だけでなく、人名や固有名詞を聞き間違えた回数、周囲の人の会話へ誤って反応した回数、認識ミスの訂正によって会話の往復が増えた回数なども測る必要がある。

音声コンテンツの制作であれば、読み間違いや演技の修正によって再生成した回数と、その費用まで含めて考えたい。

実際の用途で必要な精度を満たし、最終的なタスクや成果物1件当たりの費用も下がるのであれば、今回増えた選択肢は、音声AIを実サービスへ導入するうえで有力な候補になる。