Proxy Avatar com cache de baixo posto: animação de retrato em tempo real, a partir de uma única imagem e controlável por emoção
Autores e instituições
Haijie Yang
Nanjing University of Science and Technology, China
Jindi Bao
Nanjing University of Science and Technology, China
Yixuan Dong
Tsientang Institute for Advanced Study, China
Hongliang Zhang
Nanjing University of Science and Technology, China
Jian Bi
Nanjing University of Science and Technology, China
Hao Tang
Peking University, China
Zhenyu Zhang
Nanjing University, China
Jianjun Qian
Nanjing University of Science and Technology, China
Jian Yang
Nanjing University of Science and Technology, China
Que problema resolve
O artigo separa movimento emocional reutilizável, redirecionamento de identidades cruzadas e renderização de aparência para que um único retrato de referência possa ser animado em tempo real a partir de áudio e de um rótulo de emoção. Ele remove especificamente o cálculo repetido de características de referência sem reprogramar um cache para cada identidade alvo.
Resultado-chave
Em uma RTX 4090, o sistema completo roda a 32 FPS. Na auto-reconstrução, atinge 31,24 PSNR, 0,018 LPIPS, 0,883 SSIM e uma pontuação de sincronização labial de 6,314, liderando a maioria das métricas de qualidade e movimento apesar da maior taxa de quadros bruta do EmoTag. Na condução entre identidades, registra 29,64 FID, 0,745 de similaridade de identidade, 75,4% de precisão emocional e 6,096 de sincronização labial. Os participantes preferiram por expressividade emocional em 70% das comparações, sincronização labial em 60% e realismo visual em 65%; clipes estendidos não mostraram identidade ou desvio óbvio de sincronização.
Resumo
A animação de retratos baseada em áudio avançou rapidamente com modelos generativos baseados em difusão, mas a geração one-shot em tempo real com controle expressivo de emoções continua desafiadora. Métodos existentes frequentemente sofrem com priors de movimento conscientes de emoções insuficientes e cálculos caros de aparência durante a redução de ruído em múltiplas etapas. Para resolver essas questões, propomos Proxy Avatar Meets Low-Rank Caching, uma estrutura em cascata para animação de retrato controlável por emoção one-shot em tempo real. Em vez de gerar diretamente o retrato alvo a partir do áudio, nosso método usa um avatar proxy de emoção baseado em Gauss como gerador de movimento reutilizável, que é treinado uma vez em uma única identidade para produzir vídeos expressivos de direção a partir de rótulos de áudio e emoção. Como o avatar proxy fornece apenas movimento, e não aparência ou geometria do alvo, um modelo de retargeting em grande escala extrai ainda mais movimento independente da identidade do desempenho do proxy e o adapta a retratos alvo arbitrários. Para melhorar a eficiência da inferência, introduzimos reutilização de aparência zero-shot com cache de baixo rank, que armazena em cache características de aparência de referência na etapa inicial de redução de ruído e modela variações subsequentes usando adaptadores leves de baixo rango. Experimentos extensos demonstram que nosso método alcança maior expressividade emocional, melhor animação preservadora de identidade e custo de inferência substancialmente reduzido, permitindo animação de retrato one-shot em tempo real.
Ponto de partida da pesquisa
Retratos falantes one-shot precisam preservar a aparência de uma pessoa invisível, seguir a fala, expressar uma emoção solicitada e rodar de forma interativa no hardware disponível. Sistemas de difusão recomputam repetidamente características quase estáticas da aparência durante a redução de ruído, enquanto controles de emoção frequentemente entrelaçam identidade e movimento ou exigem um vídeo de referência para cada estilo. O resultado é ou expressiva, porém de geração lenta, ou animação rápida com fraca gama emocional.
Método
Um avatar proxy baseado em Gaus é treinado uma vez em um performer e serve apenas como gerador de movimento condicionado a áudio e emoções. Uma rede de retargeting em grande escala extrai movimento independente da identidade desse vídeo proxy e o aplica a retratos arbitrários. Durante a difusão em poucos passos, a reutilização de aparência zero faz referência a características na primeira etapa, enquanto adaptadores leves de baixo nível modelam apenas sua variação posterior. Essa divisão em cascata do trabalho é avaliada em auto-reconstrução, direção one-shot cruzada, estabilidade em vídeo longo, ablações e um estudo cego com vinte participantes.
Síntese do artigo
O design de proxy reutilizável mais retargeting torna avatares emocionais em tempo real práticos sem treinamento de difusão por usuário. Os 32 FPS relatados em uma RTX 4090 para consumidores são promissores, mas o dimensionamento de implantação deve incluir o treinamento proxy único e o equilíbrio qualidade/custo do modelo de retargeting grande, não apenas taxa de quadros em estado estável.