Avatar proxy rencontre le cache de bas rang : animation de portrait en temps réel contrôlable par émotion
Auteurs & institutions
Haijie Yang
Nanjing University of Science and Technology, China
Jindi Bao
Nanjing University of Science and Technology, China
Yixuan Dong
Tsientang Institute for Advanced Study, China
Hongliang Zhang
Nanjing University of Science and Technology, China
Jian Bi
Nanjing University of Science and Technology, China
Hao Tang
Peking University, China
Zhenyu Zhang
Nanjing University, China
Jianjun Qian
Nanjing University of Science and Technology, China
Jian Yang
Nanjing University of Science and Technology, China
Problème traité
Le papier sépare le mouvement émotionnel réutilisable, le reciblage croisé et le rendu d’apparence afin qu’un seul portrait de référence puisse être animé en temps réel à partir de l’audio et d’une étiquette émotionnelle. Il supprime spécifiquement le calcul répété des caractéristiques de référence sans réentraîner un cache pour chaque identité cible.
Résultat clé
Sur une RTX 4090, le système complet tourne à 32 FPS. En auto-reconstruction, il atteint 31,24 PSNR, 0,018 LPIPS, 0,883 SSIM et un score de synchronisation labiale de 6,314, menant le plus grand nombre de métriques de qualité et de mouvement malgré le taux d’images brut plus élevé d’EmoTag. En conduite croisée, il enregistre 29,64 FID, 0,745 similarité d’identité, 75,4 % de précision émotionnelle et 6,096 de synchronisation labiale. Les participants le préféraient pour son expressivité émotionnelle dans 70 % des comparaisons, la synchronisation labiale dans 60 % et le réalisme visuel dans 65 % ; les extraits étendus ne montraient aucune identité ou dérive évidente de synchronisation.
Résumé
L’animation de portraits pilotée par l’audio a progressé rapidement avec des modèles génératifs basés sur la diffusion, mais la génération one-shot en temps réel avec contrôle expressif des émotions reste un défi. Les méthodes existantes souffrent souvent d’un manque de priors de mouvement conscients des émotions et d’un calcul d’apparence coûteux lors du débruit en plusieurs étapes. Pour résoudre ces problèmes, nous proposons Proxy Avatar Meets Low-Rank Caching, un cadre en cascade pour une animation de portrait contrôlable en temps réel. Au lieu de générer directement le portrait cible à partir de l’audio, notre méthode utilise un avatar proxy émotionnel basé sur gaussienne comme générateur de mouvement réutilisable, entraîné une fois sur une identité unique pour produire des vidéos de conduite expressives à partir d’audio et d’étiquettes émotionnelles. Puisque l’avatar proxy ne fournit que le mouvement plutôt que l’apparence ou la géométrie de la cible, un modèle de reciblage à grande échelle extrait davantage le mouvement indépendant de l’identité de la performance du proxy et l’adapte à des portraits cibles arbitraires. Pour améliorer l’efficacité de l’inférence, nous introduisons la réutilisation de l’apparence zéro avec la mise en cache de bas rang, qui met en cache les caractéristiques d’apparence de référence à l’étape initiale de débruissement et modélise les variations suivantes à l’aide d’adaptateurs légers de bas rang. Des expériences approfondies démontrent que notre méthode permet d’obtenir une plus grande expressivité émotionnelle, une meilleure animation préservant l’identité et un coût d’inférence considérablement réduit, permettant une animation portrait en temps réel en un seul plan.
Point de départ de la recherche
Les portraits parlants en un seul plan doivent préserver l’apparence d’une personne invisible, suivre la parole, exprimer une émotion demandée et fonctionner de manière interactive sur le matériel disponible. Les systèmes de diffusion recalculent à plusieurs reprises des caractéristiques d’apparence presque statiques lors du débruit, tandis que les contrôles émotionnels entremêlent souvent identité et mouvement ou nécessitent une vidéo de référence pour chaque style. Le résultat est soit une génération expressive mais lente, soit une animation rapide avec une faible gamme émotionnelle.
Méthode
Un avatar proxy basé sur Gausss est entraîné une fois sur un interprète et sert uniquement de générateur de mouvement conditionné audio et émotionnel. Un réseau de reciblage one-shot à grande échelle extrait le mouvement indépendant de l’identité de cette vidéo proxy et l’applique à des portraits de cibles arbitraires. Lors de la diffusion en quelques étapes, la réutilisation de l’apparence zéro fait référence aux caches à la première étape, tandis que les adaptateurs légers de rang bas modélisent uniquement leur variation ultérieure. Cette division en cascade du travail est évaluée lors de l’auto-reconstruction, de la conduite à coup unique croisé, de la stabilité en longue vidéo, des ablations et d’une étude aveugle avec vingt participants.
À retenir
Le design proxy réutilisable plus reciblage rend les avatars émotionnels en temps réel pratiques sans entraînement à diffusion par utilisateur. Les 32 FPS annoncés sur une RTX 4090 grand public sont prometteurs, mais la taille du déploiement devrait inclure l’entraînement proxy unique et le compromis qualité/coût du modèle de reciblage à grande fin, pas seulement un taux d’images en état stable.