声に合わせて、全身が動く — Metaの新アバターMuse Realtime Avatarが面白い
アバター系のAIは、ここ1年でずいぶん増えた。写真1枚から喋る動画を作る、という発想自体はもう珍しくない。
だからMetaがまた一つアバターを出した、と聞いても最初は「ふーん」くらいだった。でも中身を見ていくと、地味に一線を越えている部分があった。リアルタイムで、しかも口元だけじゃなく全身が動くという点だ。
Metaは2026年9月23日、Muse Realtime Avatarを公開した。既存のMuseシリーズ——パーソナルエージェントやMac版デスクトップエージェント——に、ついに「顔と体」が付いた格好だ。
口パクではなく、表情・手・全身
多くのトーキングアバターは、要は高度な口パクだ。顔の下半分を音声に合わせて動かし、あとは軽く首を振る程度。これはこれで用途があるが、見ているとどこか「喋る証明写真」感が抜けない。
Muse Realtime Avatarは、参照画像から表情・手・全身の動きを同期して生成する。しかもそれをリアルタイムでやる。駆動源は、同じMuseファミリーの「Muse Realtime Voice」が吐き出す音声トークンのストリームだ。つまり、AIが喋る声と、その声に合わせて動く体が、同じ流れの中で生成される。
技術的には因果的(causal)なDiffusion Transformerで、動画を短いチャンク単位で生成していく。各チャンクが完成すると、その最新の潜在表現が次のチャンクの「動きの文脈」になる。こうして見た目や仕草を会話の長さだけ一貫させながら、計算量が無限に膨らまないように抑えている。
地味だが、この「文脈を持ち越す」設計が効く。短い動画を切り貼りするのではなく、会話が続く限り同じ人格の同じ見た目が保たれる、ということだからだ。
870msという現実的な速さ
リアルタイム性を支えているのが蒸留(distillation)だ。1チャンクあたりの推論ステップを120から2まで削った結果、448×768・25fpsで、エンドツーエンドの遅延が約870ミリ秒に収まっている。
1秒弱の遅延を速いと見るか遅いと見るかは用途による。対面の自然な会話としてはまだ一拍ある。でも、配信やライブ接客のように「ほぼリアルタイムで反応が返ってくればいい」場面なら、実用圏にしっかり入っている数字だ。解像度の448×768は縦長で、スマホ画面やライブ配信のワイプにそのまま収まる比率なのも、狙いが透けて見える。
Metaの評価では、視覚的な品質・同期・一貫性のいずれでも、Runway CharactersやHeyGenのLiveAvatarを評価者が上回って好んだという。ただしこれはMeta自身が出した比較なので、額面通りには受け取らない。この手の自己申告ベンチは、だいたい自社が勝つように土俵が組まれているものだ。実際の使用感は、触れる人が増えてから判断したい。
VTuber・配信文脈での可能性
ここからは、この技術が何を可能にするかの話。
一番わかりやすいのは、VTuberやアバター配信だ。日本はこの領域の需要が世界でも突出している。参照画像1枚とAIの声から、全身が動くアバターがリアルタイムに生成できるなら、Live2Dのモデリングやモーションキャプチャ機材なしで「動く配信者」を立ち上げられる可能性がある。声の生成までMuse側が担うので、理屈の上では「中の人」すら要らない構成も描ける。
もう一つはライブ接客・カスタマーサポート。音声エージェントに顔と体が付くと、問い合わせ対応やオンライン受付の印象が変わる。無表情な音声より、表情と身振りがある相手のほうが、人は安心して話す。870msの遅延は、この用途なら十分に許容範囲だろう。
さらに踏み込むなら、Museのパーソナルエージェントと組み合わせたときだ。メールや予約を肩代わりするMuseエージェントに、このアバターが乗れば、「画面の中で喋って動く自分の代理人」が成立する。ビデオ会議に自分のアバターを出席させて要点を話させる——そんな使い方も、パーツとしてはすでに揃いつつある。もっとも、ここまで来ると「それ、本人が出なくていいの?」という別種の気持ち悪さも出てくる。可能性と不気味さは、たいてい背中合わせだ。
気になる点
正直に言えば、懸念もある。
まず、声から全身がリアルタイムで動くアバターは、そのままディープフェイクの道具にもなりうる。Metaは生成動画に「Meta Video Seal」という電子透かしを入れて追跡可能にしているが、透かしがどこまで悪用を抑止できるかは未知数だ。この手の対策は、たいてい抜け道とのいたちごっこになる。
もう一つは、提供形態がまだ見えないこと。研究ブログでの公開であって、誰でもすぐ使えるプロダクトとして降りてきているわけではない。一般ユーザーが手元で試せるようになるのか、APIとして開発者に開くのか、現時点では明確でない。期待先行で語るには、まだ距離がある。
それでも、「口パク」から「全身がリアルタイムに動く」への一歩は、素直に大きいと思う。アバターAIの基準点が一つ上がった、という意味で、追いかける価値のあるリリースだ。詳細はMeta Researchのブログにまとまっている。
関連記事: リアルタイムAIアバター比較【2026年最新】— Meta Muse・Runway Characters・HeyGen、配信と動画制作でどれを選ぶ
関連記事
ZoomもAsanaもCanvaも全部つなぐ — Metaが中小企業向けに出したAIエージェント「Muse for Small Business」
Metaが9月29日に発表したMuse for Small Business。Asana・Zoom・Canva・Slackや広告アカウントに接続し、中小企業の運用を担うAIエージェント。何ができて、どこが未知数かを整理する。
Metaのメガネ全部にAIが乗った — Connect 2026の新Ray-Banと「Muse」で何ができるのか
Meta Connect 2026で発表されたRay-Ban Meta Gen 3($449)、音声専用グラス、VRグラス、Muse Charmを整理。全製品に載る個人AIエージェントMuseで実際に何ができるのかを解説する。
Instagramが「撮らなくても投稿できる」時代に踏み出した — Editsアプリに文字→動画のAI生成が追加
InstagramのEditsアプリにテキストプロンプトからAI動画を生成する機能が追加。使い方、仕組み、Sora終了との関係、クリエイターへの影響を整理する。