Avatar Proxy se encuentra con caché de bajo rango: animación de retrato controlable por emociones en tiempo real de un solo disparo
Autores e instituciones
Haijie Yang
Nanjing University of Science and Technology, China
Jindi Bao
Nanjing University of Science and Technology, China
Yixuan Dong
Tsientang Institute for Advanced Study, China
Hongliang Zhang
Nanjing University of Science and Technology, China
Jian Bi
Nanjing University of Science and Technology, China
Hao Tang
Peking University, China
Zhenyu Zhang
Nanjing University, China
Jianjun Qian
Nanjing University of Science and Technology, China
Jian Yang
Nanjing University of Science and Technology, China
Qué problema resuelve
El artículo separa el movimiento emocional reutilizable, el retargeting entre identidades y la representación de apariencia para que un único retrato de referencia pueda animarse en tiempo real desde audio y una etiqueta emocional. Elimina específicamente el cálculo repetido de referencia-características sin reentrenar una caché para cada identidad objetivo.
Resultado clave
En una RTX 4090, el sistema completo funciona a 32 FPS. En auto-reconstrucción alcanza 31,24 PSNR, 0,018 LPIPS, 0,883 SSIM y una puntuación de sincronización labial de 6,314, liderando la mayoría de métricas de calidad y movimiento a pesar de la mayor tasa de frames en bruto de EmoTag. En conducción cruzada de identidades registra 29,64 FID, 0,745 de similitud de identidad, 75,4% de precisión emocional y 6,096 de sincronización labial. Los participantes la preferían por su expresividad emocional en el 70% de las comparaciones, sincronización labial en el 60% y realismo visual en el 65%; los clips extendidos no mostraron un drift evidente de identidad ni sincronización.
Resumen
La animación de retratos basada en audio ha avanzado rápidamente con modelos generativos basados en difusión, pero la generación de one-shot en tiempo real con control expresivo de emociones sigue siendo un reto. Los métodos existentes a menudo sufren de previos de movimiento conscientes de las emociones insuficientes y costosos cálculos de apariencia durante la reducción de ruido en varios pasos. Para abordar estos problemas, proponemos Proxy Avatar Meets Low-Rank Caching, un marco en cascada para animación de retrato controlable por emoción en tiempo real de un solo disparo. En lugar de generar directamente el retrato objetivo a partir de audio, nuestro método utiliza un avatar proxy emocional basado en Gauss como generador de movimiento reutilizable, que se entrena una vez en una sola identidad para producir vídeos de conducción expresiva a partir de etiquetas de audio y emoción. Dado que el avatar proxy solo proporciona movimiento y no apariencia o geometría objetivo, un modelo de retargeting a gran escala extrae aún más movimiento independiente de la identidad del rendimiento del proxy y lo adapta a retratos objetivo arbitrarios. Para mejorar la eficiencia de la inferencia, introducimos la reutilización de apariencia sin disparo con caché de bajo rango, que almacena en caché características de apariencia de referencia en el primer paso de eliminación de ruido y modela las variaciones posteriores usando adaptadores ligeros de bajo rango. Experimentos extensos demuestran que nuestro método logra una mayor expresividad emocional, mejor animación que preserva la identidad y coste de inferencia sustancialmente reducido, permitiendo animación de retrato en tiempo real de un solo disparo.
Punto de partida
Los retratos hablados de un solo disparo necesitan preservar la apariencia de una persona invisible, seguir el habla, expresar una emoción solicitada y ejecutarse de forma interactiva en el hardware disponible. Los sistemas de difusión recalculan repetidamente características casi estáticas de la apariencia durante la reducción de ruido, mientras que los controles de emociones suelen entrelazar identidad y movimiento o requieren un vídeo de referencia para cada estilo. El resultado es o bien una generación expresiva pero lenta o una animación rápida con un rango emocional débil.
Método
Un avatar proxy basado en Gaus se entrena una vez en un intérprete y sirve únicamente como generador de movimiento condicionado por audio y emoción. Una red de retargeting a gran escala de un solo disparo extrae movimiento independiente de identidad de ese vídeo proxy y lo aplica a retratos de objetivos arbitrarios. Durante la difusión en pocos pasos, la reutilización de apariencia cero referencia a las características en el primer paso, mientras que los adaptadores ligeros de rango bajo solo modelan su variación posterior. Esta división en cascada del trabajo se evalúa en auto-reconstrucción, conducción de un solo plano de identidad cruzada, estabilidad en vídeo largo, ablaciones y un estudio ciego con veinte participantes.
Conclusión del artículo
El diseño de proxy reutilizable más retargeting hace que los avatares emocionales en tiempo real sean prácticos sin entrenamiento de difusión por usuario. Los 32 FPS reportados en una RTX 4090 de consumo son prometedores, pero el tamaño del despliegue debería incluir el entrenamiento proxy único y el equilibrio calidad/coste del modelo de retargeting grande, no solo la tasa de frames en estado estable.