← Voltar ao Blog
Radar de pesquisaTroca de rostosRosto falantearXivAgosto de 2026

Radar mensal do arXiv

Artigos sobre troca de rostos de agosto de 2026: retratos em tempo real, avatares de um minuto e controle emocional

A troca de rostos e a pesquisa digital de August são menos sobre um único truque de transferência de identidade e mais sobre interação sustentada e controlável. Os sistemas selecionados separam o movimento reutilizável da aparência, destilam um modelo de áudio-vídeo offline em um streamer em escala minúscula e combinam semântica de emoção latente com geometria explícita de blendshape.

O que este mês sinaliza

Proxy Avatar Encontra Cache de Baixo Rank alcança 32 FPS em uma RTX 4090 separando um performer emocional reutilizável do retargeting de identidade e cache de aparência estática one-shot. Omni-LiveAvatar aborda a extremidade do espectro de data center, usando destilação autorregressiva e memória longa-curta limitada para manter áudio e vídeo conjuntos coerentes por um minuto inteiro. O GemTalk foca na interface de controle, permitindo que a geometria explícita de blendshape escale a força dos recursos emocionais implícitos. Juntos, eles mapeiam três escolhas de produtos diferentes: reutilização personalizada de movimento, infraestrutura de streaming contínuo e direção expressiva detalhada.

Artigo 012026-08-03cs.CV

Proxy Avatar com cache de baixo posto: animação de retrato em tempo real, a partir de uma única imagem e controlável por emoção

Autores e instituições

Haijie Yang

Nanjing University of Science and Technology, China

Jindi Bao

Nanjing University of Science and Technology, China

Yixuan Dong

Tsientang Institute for Advanced Study, China

Hongliang Zhang

Nanjing University of Science and Technology, China

Jian Bi

Nanjing University of Science and Technology, China

Hao Tang

Peking University, China

Zhenyu Zhang

Nanjing University, China

Jianjun Qian

Nanjing University of Science and Technology, China

Jian Yang

Nanjing University of Science and Technology, China

Que problema resolve

O artigo separa movimento emocional reutilizável, redirecionamento de identidades cruzadas e renderização de aparência para que um único retrato de referência possa ser animado em tempo real a partir de áudio e de um rótulo de emoção. Ele remove especificamente o cálculo repetido de características de referência sem reprogramar um cache para cada identidade alvo.

Resultado-chave

Em uma RTX 4090, o sistema completo roda a 32 FPS. Na auto-reconstrução, atinge 31,24 PSNR, 0,018 LPIPS, 0,883 SSIM e uma pontuação de sincronização labial de 6,314, liderando a maioria das métricas de qualidade e movimento apesar da maior taxa de quadros bruta do EmoTag. Na condução entre identidades, registra 29,64 FID, 0,745 de similaridade de identidade, 75,4% de precisão emocional e 6,096 de sincronização labial. Os participantes preferiram por expressividade emocional em 70% das comparações, sincronização labial em 60% e realismo visual em 65%; clipes estendidos não mostraram identidade ou desvio óbvio de sincronização.

Resumo

A animação de retratos baseada em áudio avançou rapidamente com modelos generativos baseados em difusão, mas a geração one-shot em tempo real com controle expressivo de emoções continua desafiadora. Métodos existentes frequentemente sofrem com priors de movimento conscientes de emoções insuficientes e cálculos caros de aparência durante a redução de ruído em múltiplas etapas. Para resolver essas questões, propomos Proxy Avatar Meets Low-Rank Caching, uma estrutura em cascata para animação de retrato controlável por emoção one-shot em tempo real. Em vez de gerar diretamente o retrato alvo a partir do áudio, nosso método usa um avatar proxy de emoção baseado em Gauss como gerador de movimento reutilizável, que é treinado uma vez em uma única identidade para produzir vídeos expressivos de direção a partir de rótulos de áudio e emoção. Como o avatar proxy fornece apenas movimento, e não aparência ou geometria do alvo, um modelo de retargeting em grande escala extrai ainda mais movimento independente da identidade do desempenho do proxy e o adapta a retratos alvo arbitrários. Para melhorar a eficiência da inferência, introduzimos reutilização de aparência zero-shot com cache de baixo rank, que armazena em cache características de aparência de referência na etapa inicial de redução de ruído e modela variações subsequentes usando adaptadores leves de baixo rango. Experimentos extensos demonstram que nosso método alcança maior expressividade emocional, melhor animação preservadora de identidade e custo de inferência substancialmente reduzido, permitindo animação de retrato one-shot em tempo real.

Ponto de partida da pesquisa

Retratos falantes one-shot precisam preservar a aparência de uma pessoa invisível, seguir a fala, expressar uma emoção solicitada e rodar de forma interativa no hardware disponível. Sistemas de difusão recomputam repetidamente características quase estáticas da aparência durante a redução de ruído, enquanto controles de emoção frequentemente entrelaçam identidade e movimento ou exigem um vídeo de referência para cada estilo. O resultado é ou expressiva, porém de geração lenta, ou animação rápida com fraca gama emocional.

Método

Um avatar proxy baseado em Gaus é treinado uma vez em um performer e serve apenas como gerador de movimento condicionado a áudio e emoções. Uma rede de retargeting em grande escala extrai movimento independente da identidade desse vídeo proxy e o aplica a retratos arbitrários. Durante a difusão em poucos passos, a reutilização de aparência zero faz referência a características na primeira etapa, enquanto adaptadores leves de baixo nível modelam apenas sua variação posterior. Essa divisão em cascata do trabalho é avaliada em auto-reconstrução, direção one-shot cruzada, estabilidade em vídeo longo, ablações e um estudo cego com vinte participantes.

Síntese do artigo

O design de proxy reutilizável mais retargeting torna avatares emocionais em tempo real práticos sem treinamento de difusão por usuário. Os 32 FPS relatados em uma RTX 4090 para consumidores são promissores, mas o dimensionamento de implantação deve incluir o treinamento proxy único e o equilíbrio qualidade/custo do modelo de retargeting grande, não apenas taxa de quadros em estado estável.

Artigo 022026-08-07cs.MM

Omni-LiveAvatar: Geração conjunta de avatares áudio-vídeo em streaming em tempo real em nível de minuto

Autores e instituições

Lunjie Zhu

iComAI Lab, Hong Kong University of Science and Technology, Hong Kong

Vivix Group Limited, Hong Kong

Xingtong Ge

iComAI Lab, Hong Kong University of Science and Technology, Hong Kong

Vivix Group Limited, Hong Kong

Fangyu Lin

iComAI Lab, Hong Kong University of Science and Technology, Hong Kong

Vivix Group Limited, Hong Kong

Yi Zhang

Vivix Group Limited, Hong Kong

Zhening Liu

iComAI Lab, Hong Kong University of Science and Technology, Hong Kong

Mengfei Li

iComAI Lab, Hong Kong University of Science and Technology, Hong Kong

Vivix Group Limited, Hong Kong

Yumeng Zhang

iComAI Lab, Hong Kong University of Science and Technology, Hong Kong

Guanglu Song

Vivix Group Limited, Hong Kong

Yu Liu

Vivix Group Limited, Hong Kong

Jun Zhang

iComAI Lab, Hong Kong University of Science and Technology, Hong Kong

Que problema resolve

Omni-LiveAvatar converte um grande modelo professor offline conjunto de áudio e vídeo em um gerador causal de streaming e resolve os problemas separados de estabilidade de contexto longo e prompts em mudança. Seu objetivo é a geração contínua em escala de minutos, em vez de uma sequência de clipes curtos gerados independentemente.

Resultado-chave

Para clipes de cinco segundos, o modelo gera a 19,57 FPS, aproximadamente 33 vezes mais rápido que seu professor de 0,60 FPS, enquanto apresenta a maior pontuação geral de qualidade entre os sistemas testados (81,72) e pontuações perfeitas de identidade humana e fidelidade de vestuário. Na geração de sessenta segundos, alcança 21,99 FPS contra 16,18 para a linha de base seguinte mais rápida. Sua pontuação de identidade humana em nível de minuto é 98,61 contra 67,60 e 50,19, Sync-C é 6,76 contra 0,72 e 0,28, e o alinhamento texto-vídeo é 9,82 contra 6,68 e 5,46, com visível redução de deriva de avatar e fundo.

Resumo

Modelos geradores conjuntos de áudio e vídeo servem como base para a geração imersiva e interativa de humanos digitais. No entanto, a maioria dos modelos existentes depende de atenção bidirecional e de redução de ruído em múltiplas etapas, podendo gerar apenas clipes curtos, tornando-os inadequados para interação em tempo real por períodos prolongados. Apresentamos o Omni-LiveAvatar, o primeiro framework para geração de avatares de áudio e vídeo em tempo real por minutos. Especificamente, propomos (1) um pipeline progressivo de destilação autorregressiva que transfere um grande modelo de difusão conjunto de áudio e vídeo bidirecional para um gerador autorregressivo de poucas etapas sem mecanismos auxiliares de estabilização; (2) uma memória de longo e curto prazo de áudio-vídeo sincronizada que preserva consistência global com um orçamento de memória limitado; e (3) uma estratégia hierárquica de planejamento de prompts contínuos que permite evolução semântica coerente e transições de prompt suaves. Experimentos extensivos mostram que o Omni-LiveAvatar gera avatares sincronizados e de alta qualidade em tempo real por minutos. Em termos de velocidade, alcança uma aceleração de 33$ imes$ na geração em comparação ao seu professor, LTX-2, em uma única GPU NVIDIA H200; em termos de qualidade de geração, supera as linhas de base aceleradas em qualidade visual, qualidade de áudio, sincronização entre modalidades e fidelidade humana. Nosso código está disponível em https://github.com/Aoko955/Omni-LiveAvatar.

Ponto de partida da pesquisa

Geradores conjuntos de áudio e vídeo podem sintetizar clipes curtos convincentes, mas a atenção bidirecional e a difusão em múltiplas etapas impedem a interação ao vivo, enquanto variantes autorregressivas aceleradas apresentam desvios na identidade, fundo, qualidade do áudio ou sincronização labial em sessões longas. Um humano digital útil deve preservar ambas as modalidades por minutos sob memória limitada e aceitar prompts em evolução sem transições semânticas ou acústicas abruptas.

Método

Um pipeline de destilação autoregressiva progressiva de três estágios transfere LTX-2 para um gerador causal de quatro etapas de denoising sem modelos de recompensa externos ou estabilização específica de modalidade. Memória de longo-curto prazo de áudio e vídeo sincronizada combina um primeiro macrobloco periodicamente reancorado com caches de chave-valor em movimento, mantendo a identidade global e o contexto recente dentro de um orçamento fixo. Planejamento hierárquico de prompt em movimento separa instruções persistentes de aparência/fundo de ações locais em nível de bloco, para que os prompts avancem junto com a janela deslizante. A avaliação cobre tanto saídas de cinco segundos quanto de sessenta segundos em 512 por 768 em uma NVIDIA H200.

Síntese do artigo

O artigo trata a estabilidade de longo prazo de áudio e vídeo como um problema de sistema de primeira classe em vez de uma reflexão posterior. É uma forte arquitetura de referência para humanos digitais ao vivo, mas a alegação de tempo real é medida em uma H200 a 512 por 768, portanto os compradores devem reproduzir latência, memória e concorrência em seu próprio hardware de serviço.

Artigo 032026-08-01cs.CV

Modulação de Emoção Guiada por Geometria para Geração de Rosto Falante Emocional Controlável e Fotorrealista

Autores e instituições

Chenggong Hu

School of Software Technology, Zhejiang University, Ningbo, China

Shaoyin Ma

School of Software Technology, Zhejiang University, Ningbo, China

Yi Wang

College of Computer Science and Technology, Zhejiang University, Hangzhou, China

Li Sun

Ningbo Global Innovation Center, Zhejiang University, Ningbo, China

Mingli Song

College of Computer Science and Technology, Zhejiang University, Hangzhou, China

Jie Song

School of Software Technology, Zhejiang University, Ningbo, China

Que problema resolve

O GemTalk conecta semântica emocional derivada do áudio à geometria facial consciente da identidade e usa a geometria para controlar a força das características de expressão latente. Isso torna a categoria e intensidade da emoção continuamente editáveis, mantendo o fotorrealismo e a sincronização labial.

Resultado-chave

No teste emocional combinado MEAD-front e RAVDESS-speech, o GemTalk atinge 334,937 FVD, 31,625 FID, 7,027 Sync-C, 8,283 Sync-D, 2,392 FID de expressão e 59,258% de precisão emocional. Ele melhora a precisão emocional em 3,33 pontos percentuais em relação ao próximo melhor método e reduz o FVD em 20,84. Em HDTF neutro, mantém forte sincronização e o melhor FID de expressão relatado de 1,386, enquanto edições de coeficientes produzem transições suaves de emoção fraca para forte, sem perda óbvia de identidade.

Resumo

A geração de rostos emocionais orientados por áudio busca sintetizar vídeos realistas com dinâmicas faciais expressivas. No entanto, os métodos existentes têm dificuldade em equilibrar controlabilidade e fidelidade visual. Embora representações implícitas capturem semântica rica, elas carecem de orientação estrutural, frequentemente resultando em expressões emocionais médias. Em contraste, métodos geométricos explícitos oferecem melhor controle sobre expressões faciais, mas tendem a sacrificar detalhes de textura de alta frequência. Para resolver isso, propomos o GemTalk, uma estrutura baseada em difusão que combina a riqueza semântica das representações implícitas com a precisão estrutural de priors geométricos explícitos. Introduzimos um módulo de Projeção de Emoções de Áudio Guiada por Visão (V-AEP) para extrair características implícitas de lábios e expressão emocionais. Ao mesmo tempo, um Gerador de Priors Geométricos baseado em Difusão (D-GPG) gera coeficientes de blendshape conscientes de identidade como priors estruturais explícitos. Crucialmente, nosso módulo de Modulação Emocional Guiada pela Geometria (GEM) utiliza esses priors geométricos para recalibrar a magnitude das características implícitas, permitindo controle preciso e contínuo sobre expressões emocionais, especialmente a intensidade emocional, sem sacrificar a qualidade visual. Experimentos extensos mostram que o GemTalk alcança desempenho superior em fotorrealismo e dinâmicas emocionais faciais.

Ponto de partida da pesquisa

Características de difusão implícitas fornecem textura facial rica, mas tendem a medir expressões emocionais e oferecem baixo controle de intensidade. Marcos explícitos ou blendshapes fornecem estrutura interpretável, mas sistemas movidos apenas pela geometria frequentemente perdem a aparência de alta frequência e podem produzir uma boca ou face superior que conflita com o áudio. A animação emocional precisa tanto de riqueza semântica quanto de movimento físico controlável sem vazar a expressão já presente no retrato de referência.

Método

O treinamento começa com uma espinha dorsal de sincronização labial agnóstica à emoção em vídeos amplos e não emocionais. A Projeção de Emoção de Áudio guiada por visão aprende espaços emocionais separados, mas coordenados, dos lábios e da face superior, usando representações visuais de emoções para supervisionar características de áudio. Um gerador geométrico-prior baseado em difusão prevê coeficientes de blendshape Apple ARKit conscientes de identidade. A Modulação de Emoção guiada por geometria então preserva a direção latente das características que representam a categoria de emoção enquanto recalibra sua magnitude a partir das blendshapes; pares de amostragem conscientes de conflito referenciam imagens e áudio com emoções diferentes para que o modelo não possa copiar a expressão de origem.

Síntese do artigo

Combinar semântica de emoção latente com magnitude de blendshape explícita oferece uma superfície de controle útil para ferramentas criativas e APIs digitais-humanas. O GemTalk é mais forte quando a intensidade emocional contínua importa, embora as equipes devam testar se seus rótulos emocionais e suposições de coeficientes ARKit cobrem seus idiomas, estilos de fala e rigs-alvo.