FlowTune Media

音声AIの料金が最大95%下がった — AlibabaのQwen-Audio 3.1がElevenLabsに仕掛けた価格戦争

音声AIの世界で、いちばん効くのは新機能ではなく値札だったりする。今回AlibabaのQwenチームがやってきたことは、まさにそれだった。ASRの料金を最大95%引き下げる、という一撃で、音声API市場の「相場」を書き換えにきた。

2026年9月のApsara Conferenceで公開された Qwen-Audio 3.1 は、音声認識(ASR)・音声合成(TTS)・リアルタイム対話の3系統を刷新し、さらに新モデル TTS-Next と ASR-Next を加えた計5モデルの構成だ。目玉は機能だが、話題をさらったのは価格のほうだった。

何が起きたのか — 値下げの幅がまず異常

まず数字を並べる。Alibabaの発表によれば、API料金は TTSで約70%、Realtimeで約85%、ASRで最大95% 下がった。「数%安くなりました」ではなく、桁が変わるレベルの引き下げだ。

音声AIの料金は、これまで「まあこんなもの」という相場があった。特に高品質TTSの代名詞であるElevenLabsは、最上位のEleven v3で 100万文字あたりおよそ$100 という水準だ。対してQwen-Audio-3.1-TTSは、前世代(3.0 Plusで100万文字あたり約$27.60)からさらに約70%下がった計算になる。単純にならすと、ElevenLabsの十分の一に近い価格帯に落ちてくる。

これは「安い代替が出た」という話にとどまらない。エンタープライズの音声API調達の基準線そのものを引き下げにきている と見るべきだ。DeepgramやElevenLabs、OpenAIの音声APIで年間契約を結んでいる企業は、次の更新前に時間あたりコストを計算し直す動機ができてしまった。価格が一社によってここまで動かされると、他社も追随せざるを得ない。音声AIの「価格の底」がまた一段下がった、というのが今回のいちばん大きい意味だと思う。

5モデルの中身 — 「Next」が面白い

値下げばかりが目立つが、モデルの中身も地味に進化している。

既存の3系統(ASR / TTS / Realtime)はそれぞれ強化された。ASRは多言語・方言の認識精度が上がり、「えーと」のようなフィラーや言い直しを自動で除去してくれる。Realtimeは、話しながら同時に聞き、割り込みにも即座に反応する「同時発話」に対応した。

面白いのは新規追加の2モデルだ。

ASR-Next は、単なる文字起こしを超えて「音声の理解」に踏み込む。複数話者をタイムスタンプ付きで識別し、感情や環境音、機械のノイズまで検出する。会議の議事録で「誰が」「どんなトーンで」話したかまで拾える、と考えるとイメージしやすい。

そして TTS-Next は、Alibabaが"Audiogen"と呼ぶモデルで、これがいちばんそそる。言語モデルと拡散(diffusion)方式を組み合わせ、音声・効果音・BGMを1パスでまとめて生成する。テキストとタイムスタンプ、参照音声を渡すと、複数話者の会話、ポッドキャストの組み立て、シーンごとの環境音までを48kHzで一気に出力できるという。

この「1パス生成」で何が変わるか

TTS-Nextの「音声もSFXもBGMもまとめて出す」という設計は、実は作業フローの話として大きい。

これまでポッドキャストや動画のナレーションを作ろうとすると、TTSで声を作り、別途フリー素材のBGMを探し、効果音を足し、タイミングを合わせて……という編集作業が必ず挟まっていた。声を生成する部分だけAIに任せても、その前後の「音の編集」は人間の手作業として残っていたわけだ。

もし1パス生成が実用水準で回るなら、「台本を渡すと、BGMと効果音まで乗った完成音源が返ってくる」という世界に近づく。個人のポッドキャスターや、動画に音を付けたい小規模チームにとっては、ここが効く。音声制作の面倒な後工程がまるごと圧縮される可能性がある。

もちろん、ここは期待込みの話でもある。1パスで出した音は「それっぽい」けれど細かい調整が効きにくい、という弱点は容易に想像できる。BGMの差し替えや効果音のタイミング微調整といった、人間がこだわりたい部分をどこまで許すのか。ここが甘いと「デモは映えるが実務では結局作り直し」になりかねない。実際に触ってみないと評価は保留、というのが正直なところだ。

正直な評価 — 価格で殴る戦略の光と影

良い点ははっきりしている。価格と多言語対応だ。日本語にも対応しており、この価格帯で日本語TTS・ASRがそこそこ使えるなら、コスト面のインパクトは無視できない。大量の音声を処理するバッチ用途(コールセンターのログ文字起こし、大量ナレーション生成など)では、料金差がそのまま事業の損益に効いてくる。

一方で、微妙な点も置いておきたい。

ひとつは 品質の実測がまだこれから だということ。「アリーナで首位」といった評価も出てはいるが、日本語の自然さ、固有名詞の読み、感情表現の細やかさは、実際の用途で試さないと分からない。ElevenLabsが評価されてきたのは、単なる価格ではなく声の表現力とエコシステムの完成度だ。そこを価格だけでひっくり返せるかは別問題である。

もうひとつは 中国系サービスへの依存 という論点。データの取り扱いやガバナンスを気にする企業にとって、Alibaba Cloud経由の音声APIをどこまで基幹に据えられるかは慎重な判断が要る。安さは強力な武器だが、それだけで乗り換えを決められない領域もある。

筆者自身、ナレーション用途ではElevenLabsを使ってきた。声の質と多言語の自然さは今でも頭ひとつ抜けていると感じる(無料枠から試せるので、品質の基準線を知る意味でも ElevenLabs を一度触っておくと、Qwen-Audioの安さが「どのくらいの品質とのトレードオフか」を判断しやすい)。逆に言えば、「多少品質が落ちても圧倒的に安いほうがいい」用途が自分の中にあるなら、Qwen-Audio 3.1は本命の乗り換え先になる。用途で使い分ける前提で見るのが現実的だ。

どう位置づけるか

Qwen-Audio 3.1は、「音声AIをコモディティ化しにきた」一手として理解するのが分かりやすい。高品質・高価格のElevenLabsと、低価格・多機能のQwen。この二極化は、動画生成や画像生成ですでに見てきた構図の音声版だ。

音声AIをこれから業務に組み込む人は、「品質最優先ならElevenLabs、コスト最優先ならQwen」という軸で一度比較してみるといい。特に大量処理・多言語・バッチ用途を抱えているなら、更新のタイミングでコストを計算し直す価値は十分にある。詳細は Qwenの公式サイト で確認できる。

値下げは派手だが、本当の勝負は「その安さで、日本語の音がどこまで使えるか」だ。ここは近いうちに実機で検証したい。

関連記事