著者・所属
Haijie Yang
Nanjing University of Science and Technology, China
Jindi Bao
Nanjing University of Science and Technology, China
Yixuan Dong
Tsientang Institute for Advanced Study, China
Hongliang Zhang
Nanjing University of Science and Technology, China
Jian Bi
Nanjing University of Science and Technology, China
Hao Tang
Peking University, China
Zhenyu Zhang
Nanjing University, China
Jianjun Qian
Nanjing University of Science and Technology, China
Jian Yang
Nanjing University of Science and Technology, China
何を解決するか
この論文は、再利用可能な感情運動、クロスアイデンティティリターゲティング、外見レンダリングを分離し、単一の参照ポートレートを音声と感情ラベルからリアルタイムにアニメーション化できるようにしています。各ターゲットアイデンティティのキャッシュを再学習せずに、繰り返しの参照特徴計算を具体的に排除します。
主要結果
RTX 4090ではフルシステムが32FPSで動作します。自己再構築ではPSNR31.24、LPIPS0.018、SSIM0.883、リップシンクスコア6.314に達し、EmoTagの高い生フレームレートにもかかわらず、ほとんどの品質とモーション指標でトップに立ちました。クロスアイデンティティドライビングでは、FIDが29.64、アイデンティティ類似度が0.745、感情正確度75.4%、リップシンクが6.096を記録しました。参加者は感情表現の70%、リップシンクロが60%、視覚的リアリズムが65%で好まれました。拡張クリップでは明らかなアイデンティティや同期のドリフトはありませんでした。
要旨
音声駆動型ポートレートアニメーションは拡散ベースの生成モデルにより急速に進歩していますが、感情表現制御を用いたリアルタイムワンショット生成は依然として課題です。既存の手法は、感情認識の事前処理が不十分で、多段階ノイズ除去時の外観計算が高コストであることが多いです。これらの課題に対処するため、私たちはリアルタイムのワンショット感情制御ポートレートアニメーションのためのカスケードフレームワークである「Proxy Avatar Meets Low-Rank Caching」を提案します。音声から直接ターゲットポートレートを生成するのではなく、ガウスベースの感情プロキシアバターを再利用可能なモーションジェネレーターとして用い、単一のアイデンティティで一度訓練して、音声と感情ラベルから表現豊かなドライビング動画を生成する方法を採用しています。プロキシアバターはターゲットの外観やジオメトリではなく動きのみを提供するため、大規模なワンショットリターゲティングモデルはプロキシ性能からアイデンティティ非依存の動きをさらに抽出し、任意のターゲットポートレートに適応させます。推論効率を向上させるために、ゼロショット外観再利用を導入し、低ランクキャッシュで初期のノイズ除去ステップで参照表現特徴をキャッシュし、軽量な低ランクアダプターでその後の特徴変化をモデル化します。広範な実験により、本手法はより強い感情表現、より良いアイデンティティ保存アニメーション、そして推論コストを大幅に削減し、リアルタイムのワンショットポートレートアニメーションを実現できることが示されました。
研究の出発点
ワンショットのトーキングポートレートは、見えない人物の外見を保持し、会話を追い、要求された感情を表現し、利用可能なハードウェア上でインタラクティブに動作する必要があります。拡散システムはノイズ除去時にほぼ静的な外観の特徴を繰り返し再計算しますが、感情制御はしばしばアイデンティティと動きを絡め合わせたり、各スタイルごとに参照映像を必要としたりします。その結果、表現力は豊かだが生成が遅いか、感情の幅が弱い速いアニメーションになります。
手法
ガウスベースのプロキシアバターは1人のパフォーマーに一度だけ訓練され、音声および感情条件付けのモーションジェネレーターとしてのみ機能します。大規模なワンショットリターゲティングネットワークは、そのプロキシ映像からアイデンティティに依存しない動きを抽出し、任意のターゲットポートレートに適用します。少ステップ拡散中、ゼロショットの外観再利用は最初のステップで参照特徴をキャッシュし、軽量な低ランクアダプターは後のバリエーションのみをモデル化します。この連鎖的な分担は、自己再構築、クロスアイデンティティワンショットドライビング、長距離ビデオの安定性、アブレーション、そして20人の参加者を対象としたブラインド研究で評価されます。
論文要点
再利用可能なプロキシとリターゲティングの構成により、利用者ごとに拡散モデルを学習せず、感情表現付きアバターをリアルタイム生成できます。RTX 4090で32 FPSという結果は有望ですが、導入コストの算定には定常フレームレートだけでなく、一度限りのプロキシ学習と大規模リターゲティングモデルの品質・計算量も含める必要があります。