FlowTune Media

ElevenLabsが音声AIの新モデル「v4」を出した — 日本語がはっきり良くなり、応答は人の相槌より速い

合成音声で日本語を喋らせると、長らく「なめらかだけど、どこか惜しい」の壁があった。抑揚が平坦だったり、感情を込めようとすると急に不自然になったり。英語ではもう人間と区別がつかないレベルなのに、日本語だと一歩届かない——そんな体感を持っていた人は多いはずだ。

ElevenLabsが9月28日に公開した Eleven v4 は、その"惜しさ"に効きそうなアップデートだ。同時に低遅延版の Eleven v4 Turbo も出ている。ElevenLabsは音声合成の代表格として知られるが、今回は完全に新しいアーキテクチャに載せ替えたという。

何が変わったのか

まず対応言語が従来の70から90以上に増えた。広東語・モンゴル語・オディア語などが加わっている。

ただ日本のユーザーにとって一番効くのは言語数ではない。品質の伸びが最も大きい言語として、日本語が名指しされている点だ。ブラジルポルトガル語・標準中国語・広東語と並んで、日本語が「最も良くなった」グループに入っている。冒頭の"惜しさ"の壁が、まさにここで崩れているかもしれない、ということになる。

機能面では、発音を細かく指定できるIPA(国際音声記号)対応が入った。v3で一度使えなくなっていた「プロフェッショナル・ボイスクローン」も復活している。感情タグを本文中に埋め込み、複数を重ねて順番どおりに演じさせることもできる。声の主を保ったまま、ドラマチックにも、優しくも、切迫した調子にも振れる、という設計だ。

音声クローンは「10秒の音声から」とうたっている。ここは正直、割り引いて見たほうがいい。おそらくベストケースの数字で、実運用で満足のいく品質を狙うなら、もう少し長めのサンプルを用意するつもりでいたほうが現実的だろう。

Turboが詰めてきた「会話の間」

もう一方のv4 Turboは、速度に振ったモデルだ。電話応対やリアルタイム会話のボットといった、音声エージェントを作る人向けの位置づけになる。

数字が具体的で、最初の音声が返るまでの時間が中央値で約150ミリ秒。ElevenLabsはこれを「人と人が話すときの平均的な"間"より短い」と表現している。しかも双方向ストリーミングで、相手の文が終わる前から音声を返し始める。

これが効くのは、会話の自然さだ。人間同士の会話は、相手が言い終わる前に次の反応が始まっている。従来の音声ボットが「機械っぽい」と感じられた大きな理由のひとつが、応答までの一拍の遅れだった。そこを人の相槌より速いところまで詰めてきた、というのが今回の勘所だと思う。

これで何が現実になるか

日本語の質が上がり、かつ遅延が人の会話並みまで縮むと、日本語で違和感のない音声エージェントが現実的な射程に入る。英語圏では実用段階だった「AIが電話に出て予約を取る」「問い合わせにリアルタイムで喋って答える」といった用途が、日本語でもそのまま組みやすくなる。

感情タグを重ねられる点と合わせると、用途はナレーションにも広がる。同じ声のまま、あるシーンは淡々と、あるシーンは切迫して——という演じ分けを、テキスト側の指定だけでコントロールできる。オーディオブックや動画のナレーションを一人の"声"で通しつつ、場面ごとに表情を変える、という作り方が現実的になる。動画を作っている人なら、ElevenLabs の音声を映像に合わせたナレーションに使う組み合わせは、一度試す価値がある。

正直に気になる点

派手なのはベンチマークの数字だ。ElevenLabsは第三者評価のArtificial AnalysisのTTSアリーナで首位、発音の頑健性でも91.7%で最高と主張している。ただしこれは提供側・評価元の発表であって、こちらで独立に再現したわけではない。話半分とは言わないが、鵜呑みにもしないくらいが健全だろう。

もう一点、90以上の言語すべてが同じ品質ではない。ElevenLabs自身が「最も伸びた言語」を挙げているということは、裏を返せばロングテールの言語はまだ発展途上ということでもある。日本語は幸い"当たり"の側だが、マイナー言語で使うなら期待値は調整したほうがいい。

そして音声クローンにつきまとう、なりすまし・詐欺のリスク。ElevenLabsは本人同意の録音を求めるなどの対策を課しているが、この種の仕組みが悪用を完全に防げた例はまだない。便利さと表裏だという前提は持っておきたい。

v4は無料枠でも触れる。まずは自分が使う言語で一度喋らせてみて、"惜しさ"が消えているかを自分の耳で確かめるのがいい。料金についてはv4固有の価格が今回明示されていないので、本格運用の前に最新のプラン表を確認しておくこと。

関連記事