Geminiの音声AIが「考えながら話す」ようになった — 返事しながら裏で作業を進めるGemini 3.8 Live
音声アシスタントに込み入ったお願いをすると、決まって訪れる「無言の間」がある。「ちょっと待ってください……」のあと、応答が返るまで会話が止まる、あの気まずい数秒だ。Googleが9月15日に公開した Gemini 3.8 Live は、その間を消しにきた。
正確には2つのモデルが出た。Gemini 3.8 Live と、その上位版 Gemini 3.8 Live Extended Thinking だ。どちらもリアルタイム音声対話向けで、Gemini API・Google AI Studio・Gemini Enterprise・Search Live・Gemini Live・Google Workspaceに順次展開される。音声AIの比較では Artificial Analysisの音声品質指標で首位 を記録したとも報じられている。
「話しながら裏で作業する」が今回の肝
数ある機能の中で、いちばん効くのは 非同期のツール実行 だと思う。
従来の音声AIは、ユーザーが「来週の東京行きの航空券を調べて予定に入れておいて」と頼むと、裏でAPIを叩いて結果が返るまで沈黙してしまうことが多かった。Gemini 3.8 Liveは、この処理をバックグラウンドで走らせながら、会話そのものは止めない。「承知しました、いま調べていますね」と受け答えをしつつ、裏でタスクが進む。終わったら結果を差し込む。
上位版のExtended Thinkingはさらに踏み込む。推論と発話を同時に行う。多段階の複雑なタスクを処理する間、「まず候補を絞っていて……」といった進捗を声で実況しながら、裏で考えを組み立てていく。人間が「えーっと、まず……」と言いながら考えるのに近い。会話のテンポを崩さずに、複雑な処理を挟み込めるわけだ。
地味だが実用的なのが、97言語を会話の途中で自動判別して切り替える点だ。日本語で話していて、固有名詞や引用で英語が混ざっても、モデル側が言語の切り替わりを検知して追従する。多言語が飛び交う場面や、日本語と英語をちゃんぽんで話す人には効く。
この設計で何が変わるか
「話しながら裏で作業する」が実用水準になると、音声AIの用途がひとつ上のレイヤーに移る。
これまでの音声アシスタントは、基本的に「一問一答」の道具だった。天気を聞く、タイマーをかける、短い返事をもらう。処理に時間がかかるタスクは、会話が止まるので体感が悪く、結局スマホの画面を操作したほうが早かった。
非同期実行が効くと、ここが変わる。たとえば運転中に「複数のホテルを比較して、一番条件のいいところを仮予約して」と頼み、AIが「調べていますね、他に希望はありますか?」と会話を続けながら裏で処理を回す——という使い方が現実味を帯びる。手も目も塞がっている状況でこそ、音声で複雑なタスクを丸投げできる価値は大きい。カスタマーサポートの音声ボットも、「確認いたします」の無言待ちが消えれば、体験がかなり自然になるはずだ。
もちろん、これは「うまく動けば」の話だ。裏の処理が失敗したとき、会話の流れの中でどう自然にリカバリーするのか。「調べていますね」と言ったきり結果が返らない、という最悪のパターンをどう防ぐのか。ここの作り込み次第で、体験は天と地ほど変わる。
2モデルの使い分けと正直な評価
Googleが2つに分けたのは合理的だ。無印の3.8 Liveはスケールとコスト効率を重視し、日常会話や視覚的な文脈把握(visual grounding)をこなす軽量寄りの選択肢。Extended Thinkingは高度な多段階タスク向けで、その分コストも重い。大量の音声対話をさばくならLive、込み入った業務エージェントを組むならExtended Thinking、という棲み分けになる。
正直な評価も置いておく。
「推論しながら話す」は、デモでは確実に映える。ただ、実際の会話で進捗実況が くどく感じないか は使ってみないと分からない。人間だって、考えている最中に逐一「いま候補を絞っていて……」と実況されたら、うるさいと感じる場面がある。この“おしゃべりさ”のさじ加減は、実運用での評価が割れそうなポイントだ。
もう一つ、音声AIはこの秋、競争が一気に激化している。GoogleのGemini 3.8 Liveだけでなく、Alibabaが音声APIの料金を最大95%引き下げてElevenLabsに価格戦争を仕掛けたばかりだ。品質で攻めるGoogle、価格で攻めるAlibaba、という構図が鮮明になってきた。音声AIを業務に組み込むなら、「品質最優先か、コスト最優先か」で選ぶ軸を先に決めておくといい。
Gemini 3.8 Liveの本当の価値は、ベンチマークの順位ではなく「あの気まずい沈黙が本当に消えるか」にある。そこが体感で確認できたとき、音声AIはようやく“使える相棒”になるのだと思う。
関連記事
Googleの音声AI、1時間のナレーションが約180円 — Gemini 3.1 Flash TTSの実力と死角
Gemini 3.1 Flash TTSは200以上のタグで声の感情やペースを制御できるGoogleの音声合成モデル。料金、ElevenLabsとの違い、日本語対応の実態を整理する。
Geminiが世代をひとつ上げた — 出力が16倍になったGemini 4 Argon、でも最初に触れるのは防御側
Googleが9月30日に発表したGemini 4世代初のフロンティアモデルArgon。出力上限が1Mトークンに拡大し法務・コーディングのベンチで首位。なぜ開発者より先に防御側へ提供されるのかを解説。
GoogleのAI秘書「CC」が家族版になった — 独自アカウントを持ち、世帯を丸ごと回す
Google Labsが2026年9月に発表したCCの家族向け拡張を解説。独自のGoogleアカウントで動き、最大6人で共有、献立作成や許可証サインまで担う仕組みと、個人版からの進化、日本での注意点を整理する。