← ブログ一覧へ戻る
リサーチレーダー顔交換トーキングフェイスarXiv2026年8月

月次 arXiv レーダー

2026年8月の顔交換論文:リアルタイム肖像、分単位アバター、感情制御

Augustの顔入れ替えとデジタルヒューマン研究は、単一のアイデンティティ転送トリックよりも持続的で制御可能な相互作用に焦点を当てています。選ばれたシステムは再利用可能な動きと外見を分離し、オフラインの音声・映像モデルをミニスケールのストリーマーに凝縮し、潜在的な感情の意味論と明示的なブレンドシェイプ幾何学を組み合わせています。

本月の重要シグナル

Proxy Avatar Meets Low-Rank Cachingは、再利用可能な感情パフォーマーとワンショットのアイデンティティリターゲティングやキャッシュの静的な外観を分離することで、RTX 4090で32FPSに達します。Omni-LiveAvatarはデータセンターの端に取り組み、自己回帰蒸留と有界長短メモリを用いて、共同音声と映像を1分間一貫性を保ちます。GemTalkはコントロールインターフェースに注力し、明示的なブレンドシェイプジオメトリが暗黙の感情機能の強さをスケールさせることを可能にします。これらは3つの異なる製品選択肢をマッピングします:パーソナライズされたモーション再利用、連続ストリーミングインフラ、そして細かい表現的方向性です。

論文 012026-08-03cs.CV

プロキシアバターと低ランクキャッシュ:リアルタイム・ワンショット感情制御ポートレートアニメーション

著者・所属

Haijie Yang

Nanjing University of Science and Technology, China

Jindi Bao

Nanjing University of Science and Technology, China

Yixuan Dong

Tsientang Institute for Advanced Study, China

Hongliang Zhang

Nanjing University of Science and Technology, China

Jian Bi

Nanjing University of Science and Technology, China

Hao Tang

Peking University, China

Zhenyu Zhang

Nanjing University, China

Jianjun Qian

Nanjing University of Science and Technology, China

Jian Yang

Nanjing University of Science and Technology, China

何を解決するか

この論文は、再利用可能な感情運動、クロスアイデンティティリターゲティング、外見レンダリングを分離し、単一の参照ポートレートを音声と感情ラベルからリアルタイムにアニメーション化できるようにしています。各ターゲットアイデンティティのキャッシュを再学習せずに、繰り返しの参照特徴計算を具体的に排除します。

主要結果

RTX 4090ではフルシステムが32FPSで動作します。自己再構築ではPSNR31.24、LPIPS0.018、SSIM0.883、リップシンクスコア6.314に達し、EmoTagの高い生フレームレートにもかかわらず、ほとんどの品質とモーション指標でトップに立ちました。クロスアイデンティティドライビングでは、FIDが29.64、アイデンティティ類似度が0.745、感情正確度75.4%、リップシンクが6.096を記録しました。参加者は感情表現の70%、リップシンクロが60%、視覚的リアリズムが65%で好まれました。拡張クリップでは明らかなアイデンティティや同期のドリフトはありませんでした。

要旨

音声駆動型ポートレートアニメーションは拡散ベースの生成モデルにより急速に進歩していますが、感情表現制御を用いたリアルタイムワンショット生成は依然として課題です。既存の手法は、感情認識の事前処理が不十分で、多段階ノイズ除去時の外観計算が高コストであることが多いです。これらの課題に対処するため、私たちはリアルタイムのワンショット感情制御ポートレートアニメーションのためのカスケードフレームワークである「Proxy Avatar Meets Low-Rank Caching」を提案します。音声から直接ターゲットポートレートを生成するのではなく、ガウスベースの感情プロキシアバターを再利用可能なモーションジェネレーターとして用い、単一のアイデンティティで一度訓練して、音声と感情ラベルから表現豊かなドライビング動画を生成する方法を採用しています。プロキシアバターはターゲットの外観やジオメトリではなく動きのみを提供するため、大規模なワンショットリターゲティングモデルはプロキシ性能からアイデンティティ非依存の動きをさらに抽出し、任意のターゲットポートレートに適応させます。推論効率を向上させるために、ゼロショット外観再利用を導入し、低ランクキャッシュで初期のノイズ除去ステップで参照表現特徴をキャッシュし、軽量な低ランクアダプターでその後の特徴変化をモデル化します。広範な実験により、本手法はより強い感情表現、より良いアイデンティティ保存アニメーション、そして推論コストを大幅に削減し、リアルタイムのワンショットポートレートアニメーションを実現できることが示されました。

研究の出発点

ワンショットのトーキングポートレートは、見えない人物の外見を保持し、会話を追い、要求された感情を表現し、利用可能なハードウェア上でインタラクティブに動作する必要があります。拡散システムはノイズ除去時にほぼ静的な外観の特徴を繰り返し再計算しますが、感情制御はしばしばアイデンティティと動きを絡め合わせたり、各スタイルごとに参照映像を必要としたりします。その結果、表現力は豊かだが生成が遅いか、感情の幅が弱い速いアニメーションになります。

手法

ガウスベースのプロキシアバターは1人のパフォーマーに一度だけ訓練され、音声および感情条件付けのモーションジェネレーターとしてのみ機能します。大規模なワンショットリターゲティングネットワークは、そのプロキシ映像からアイデンティティに依存しない動きを抽出し、任意のターゲットポートレートに適用します。少ステップ拡散中、ゼロショットの外観再利用は最初のステップで参照特徴をキャッシュし、軽量な低ランクアダプターは後のバリエーションのみをモデル化します。この連鎖的な分担は、自己再構築、クロスアイデンティティワンショットドライビング、長距離ビデオの安定性、アブレーション、そして20人の参加者を対象としたブラインド研究で評価されます。

論文要点

再利用可能なプロキシとリターゲティングの構成により、利用者ごとに拡散モデルを学習せず、感情表現付きアバターをリアルタイム生成できます。RTX 4090で32 FPSという結果は有望ですが、導入コストの算定には定常フレームレートだけでなく、一度限りのプロキシ学習と大規模リターゲティングモデルの品質・計算量も含める必要があります。

論文 022026-08-07cs.MM

Omni-LiveAvatar:分単位のリアルタイム・ストリーミング音声映像アバター生成

著者・所属

Lunjie Zhu

iComAI Lab, Hong Kong University of Science and Technology, Hong Kong

Vivix Group Limited, Hong Kong

Xingtong Ge

iComAI Lab, Hong Kong University of Science and Technology, Hong Kong

Vivix Group Limited, Hong Kong

Fangyu Lin

iComAI Lab, Hong Kong University of Science and Technology, Hong Kong

Vivix Group Limited, Hong Kong

Yi Zhang

Vivix Group Limited, Hong Kong

Zhening Liu

iComAI Lab, Hong Kong University of Science and Technology, Hong Kong

Mengfei Li

iComAI Lab, Hong Kong University of Science and Technology, Hong Kong

Vivix Group Limited, Hong Kong

Yumeng Zhang

iComAI Lab, Hong Kong University of Science and Technology, Hong Kong

Guanglu Song

Vivix Group Limited, Hong Kong

Yu Liu

Vivix Group Limited, Hong Kong

Jun Zhang

iComAI Lab, Hong Kong University of Science and Technology, Hong Kong

何を解決するか

Omni-LiveAvatarは、大規模なオフラインの共同音声・映像教師を因果ストリーミングジェネレーターに変換し、長いコンテキストと変化するプロンプトという個別の安定性問題に対処します。その目標は、独立して生成された短いクリップの連続ではなく、連続的なミニッツスケール生成です。

主要結果

5秒間のクリップでは19.57 FPSで生成され、0.60 FPSの教師の約33倍の速度を出します。また、テストされたシステムの中で最高の総合品質スコア(81.72)を記録し、人間の身元と衣装の忠実度も完璧に評価しています。62世代では21.99 FPSに達し、次に速い基準は16.18fpsです。分単位の人間アイデンティティスコアは98.61、67.60と50.19、Sync-Cは6.76、0.72、0.28、テキストと映像のアライメントは9.82、6.68、5.46で、アバターや背景のドリフトが目に見えて減少しています。

要旨

共同音声・映像生成モデルは、没入型でインタラクティブなデジタル・ヒューマン生成の基盤となります。それにもかかわらず、既存の多くのモデルは双方向注意と多段階ノイズ除去に依存しており、短いクリップしか生成できず、長時間にわたるリアルタイムの相互作用には適していません。私たちは、分単位のリアルタイムストリーミングによる共同音声・映像アバター生成のための初のフレームワークであるOmni-LiveAvatarを提案します。具体的には、(1) 大規模な双方向共同音声・映像拡散モデルを補助安定化機構を持たない数ステップの自己回帰生成器に転送する段階的自己回帰的蒸留パイプラインを提案します。(2) 制限されたメモリ予算内でグローバルな一貫性を保つ同期音声・ビデオ・長期短期記憶;および (3) 一貫した意味進化とシームレスなプロンプト遷移を可能にする階層的なローリングプロンプト計画戦略。広範な実験により、Omni-LiveAvatarはリアルタイムで高品質で同期された分単位のアバターを生成することが示されています。速度面では、1枚のNVIDIA H200 GPUで教師版LTX-2に比べて33$××1倍の世代向上を実現しています。生成品質の面では、視覚品質、音声品質、クロスモーダル同期、人間の忠実度において加速ベースラインを上回っています。当社のコードは https://github.com/Aoko955/Omni-LiveAvatar で利用可能です。

研究の出発点

共同音声・映像生成装置は説得力のある短いクリップを合成できますが、双方向の注意や多段階の拡散によりライブインタラクションは妨げられ、加速された自己回帰型は長時間のセッションでアイデンティティ、背景、音質、口型同期が漂い続けます。有用なデジタル人間は、両モダリティを数分間にわたり限定記憶に保存し、急激な意味論的・音響的移行なしに進化するプロンプトを受け入れなければなりません。

手法

3段階のプログレッシブ自己回帰蒸留パイプラインにより、LTX-2は外部報酬モデルやモダリティ特有の安定化なしに4段階のノイズ除去因果発生器に転送されます。同期音声・映像・長期・短期記憶は、定期的に再アンカーされる最初のマクロブロックとローリングキー・バリューキャッシュを組み合わせ、グローバルアイデンティティと最近のコンテキストを固定予算内に保持します。階層的なローリングプロンプト計画は、持続的な出現やバックグラウンド命令をブロックレベルのローカルアクションから分離し、プロンプトはローリングウィンドウで進行します。評価はNVIDIA H200の5秒および60秒の出力(512×768)の両方をカバーします。

論文要点

本研究は、長時間の音声・映像安定性を後処理ではなく中核的なシステム課題として扱っています。ライブデジタルヒューマン向けの有力な参照設計ですが、リアルタイム性能はH200上の512×768出力で測定されています。購入側は自社の配信ハードウェアで遅延、メモリ、同時実行数を再検証すべきです。

論文 032026-08-01cs.CV

制御可能で写実的な感情的トーキングフェイス生成のための幾何学誘導型感情変調

著者・所属

Chenggong Hu

School of Software Technology, Zhejiang University, Ningbo, China

Shaoyin Ma

School of Software Technology, Zhejiang University, Ningbo, China

Yi Wang

College of Computer Science and Technology, Zhejiang University, Hangzhou, China

Li Sun

Ningbo Global Innovation Center, Zhejiang University, Ningbo, China

Mingli Song

College of Computer Science and Technology, Zhejiang University, Hangzhou, China

Jie Song

School of Software Technology, Zhejiang University, Ningbo, China

何を解決するか

GemTalkは音声由来の感情意味をアイデンティティ認識型顔幾何学に結びつけ、その幾何学を使って潜在的表現特徴の強さを制御します。これにより、感情のカテゴリや強度を継続的に編集可能にしつつ、フォトリアリズムとリップシンクロを保つことができます。

主要結果

MEAD-frontとRAVDESSの音声感情テストを組み合わせた結果、GemTalkはFVD334.937、FID31.625、Sync-Cが7.027、Sync-Dが8.283、表現FIDが2.392、感情正確率が59.258%に達しました。次に優れた方法より感情の正確さを3.33ポイント向上させ、FVDを20.84%低下させています。中立HDTFでは強い同期を維持し、報告された表現FIDは1.386で、係数編集は明らかなアイデンティティ喪失なく滑らかな弱い感情への強い感情への移行を生み出します。

要旨

音声駆動の感情的なトーキングフェイス生成は、リアルな動画と表情的な顔の動態を合成することを目指しています。しかし、既存の手法は制御性と視覚的な忠実度のバランスを取るのに苦労しています。暗黙的表現は豊かな意味論を捉えますが、構造的なガイダンスが不足しているため、しばしば平均的な感情表現を生み出します。これに対し、明示的幾何学的手法は表情の制御をより良くしますが、高周波のテクスチャの詳細を犠牲にする傾向があります。これに対処するため、暗黙的表現の意味的豊かさと明示的幾何学的事前指標の構造的精度を組み合わせた拡散ベースのフレームワークGemTalkを提案します。暗黙の感情的口唇や表現の特徴を抽出する視覚誘導音声感情投影(V-AEP)モジュールを導入します。同時に、拡散ベースの幾何学的プライアーズジェネレーター(D-GPG)は、明示的な構造的事前比としてアイデンティティ認識型のブレンドシェイプ係数を生成します。特に重要なのは、私たちの幾何学的誘導感情調節(GEM)モジュールがこれらの幾何学的事前処理を活用し、暗黙的特徴の大きさを再調整することで、特に感情の強度を視覚的な品質を損なうことなく、感情表現を正確かつ連続的に制御できることです。広範な実験により、GemTalkはフォトリアリズムや顔の感情ダイナミクスで優れた性能を達成していることが示されています。

研究の出発点

暗黙の拡散機能は豊かな顔のテクスチャーを提供しますが、感情表現は平均的で強度のコントロールが不十分です。明示的なランドマークやブレンドシェイプは解釈可能な構造を提供しますが、幾何学のみで駆動されるシステムは高周波の外観を失い、音声と矛盾する口や上半身の顔を生み出すことがあります。感情アニメーションは、意味の豊かさと制御可能な身体的動きを必要とし、参照ポートレートにすでに存在する表情を漏らさないようにする必要があります。

手法

トレーニングは、感情に依存しないリップシンクバックボーンを、非感情的な広範なビデオ上で行います。視覚誘導オーディオ感情投影は、視覚的感情表現を用いて音声特徴を監督し、唇と顔の上半分の感情空間を分離しつつ調整された空間を学習します。拡散ベースの幾何学的事前ジェネレーターは、アイデンティティ認識型Apple ARKitブレンドシェイプ係数を予測します。ジオメトリ誘導感情変調は、感情カテゴリーを表す潜在的特徴方向を保持しつつ、ブレンドシェイプからその大きさを再調整します。コンフリクト認識サンプリングペアは異なる感情を持つ画像と音声を参照するため、モデルが元の表現をコピーできないようにします。

論文要点

潜在空間の感情意味と明示的なブレンドシェイプ強度を組み合わせることで、制作ツールやデジタルヒューマンAPIに扱いやすい制御面を提供します。GemTalkは感情強度を連続的に調整したい用途に適していますが、感情ラベルとARKit係数の前提が対象言語、話し方、リグを十分に覆うかは別途検証が必要です。