← Voltar ao Blog
Radar de PesquisaTroca de rostosEdição VisualarXivSetembro de 2026

Radar Mensal do arXiv

Artigos de Troca de Rostos de setembro de 2026: Harmonia da Iluminação, Atenção à Referência e Dobragem em Tempo Real

Setembro oferece um método direto de composição de faces e dois sistemas adjacentes de edição de identidade. O pipeline de harmonização de sombras limita deliberadamente o que pode mudar, para que uma estimativa ruim não possa recolorir ou clarear um rosto aprovado. Os instrumentos RefGAP referenciam a atenção através de sete editores de difusão e a corrigem no momento da inferência. TBDub adapta um modelo de dublagem visual para imagens de produção, depois destila trinta passos de redução de ruído para dois enquanto mede identidade, dublagem labial, qualidade visual e throughput de ponta a ponta.

O que este mês sinaliza

O harmonizador movido pela geometria aplica apenas um campo de escurecimento limitado e uniforme em canal; em seu proxy analítico, 56,5% dos pixels de face mudam, ganho médio é 0,938 e nenhum pixel é iluminado, embora o artigo não afirme uma vitória perceptiva em imagem real. O RefGAP calibra dois coeficientes uma vez, depois melhora a similaridade de identidade entre sete editores de imagem/vídeo em 1.040 clipes de troca de cabeça e 1.000 pares de troca de rosto; o sucesso na substituição atinge pelo menos 86% e 82%, respectivamente, com trade-offs mensuráveis entre pose e preservação. O aluno de dois passos do TBDub alcança 7,13 FPS a 512 por 512 em um H20, uma aceleração de ponta a ponta 13,93 vezes em relação ao professor, enquanto as avaliações humanas mantêm a qualidade da identidade do professor e melhoram ligeiramente a sincronização labial e a qualidade visual. Para os compradores, a distinção importante é o risco: limites determinísticos, controles de tempo de inferência e geração destilada possuem diferentes modos de falha e necessidades de validação.

Artigo 012026-09-15cs.CV

Harmonização de sombras guiada pela geometria para faces compostas: um pipeline multiplicativo de reiluminação que preserva o albedo

Autores e instituições

Vijesh KP

Independent researcher (no institutional affiliation stated in the paper)

Que problema resolve

O artigo mira o caso restrito em que cor e identidade do doador são aceitáveis, mas sombras de forma estão ausentes. Pergunta como injetar sombras de nariz, alvéolo, lábio e cavidade a partir de geometria facial aproximada sem clarear pixels, alterar a cromaticidade ou sintetizar um novo rosto.

Resultado-chave

No campo analítico de altura da face com luz conhecida, a configuração padrão modifica 56,5% dos pixels da face, dá ganho médio de 0,938 no geral e 0,890 em pixels modificados, e envia 3,4% dos pixels para o piso de 0,82. Ela garante zero pixels iluminados e nenhuma mudança matemática do ângulo de matiz além do ruído de ponto flutuante. Esses valores caracterizam o operador limitado em vez da qualidade perceptiva: o artigo não fornece referência pareada com compósitos reais ou comparação de linha base. Não pode adicionar destacamentos, corrigir um doador já escuro, remover luz fonte oposta ou evitar sombreamento residual doador com duplo sombreamento.

Resumo

Pipelines de troca de rostos e composição facial produzem rotineiramente um rosto geometricamente bem alinhado, mas fotometricamente implausível: o rosto doador carrega iluminação plana e quase frontal do estúdio, enquanto o corpo hospedeiro e o fundo carregam luz direcional da cena. A maioria dos remédios existentes ressintetiza o rosto por meio de transferência de cor, reiluminação neural ou renderização inversa, correndo o risco de alterar identidade, tom de pele e textura. Apresentamos uma alternativa conservadora: injeção de sombra de forma orientada pela geometria. O pipeline nunca repinta o rosto. Ele estima um campo de ganho por pixel $g\in[g_{\min},1]$ de um proxy facial 3D rasterizado e o multiplica uniformemente para RGB linear, de modo que o operador só pode escurecer e não pode deslocar a cromaticidade. Uma malha densa de marcos é rasterizada em um buffer de profundidade, do qual derivamos normais de superfície, termo cavidade e sombras projetadas no espaço da tela. A direção da luz principal é estimada a partir de pistas do lado do hospedeiro (corpo, fundo, halo capilar); as pistas no rosto são reduzidas porque recuperam a iluminação do doador. A magnitude da sombra não é correspondida ao hospedeiro: ela é definida por uma transferência de três parâmetros $(τ,σ,g_{\min})$. O campo de sombreamento é dividido pelo percentil 75 sobre a pele, depois bloqueado, escalado, fixado, suavizado e reclipado dentro de uma máscara facial com controle de pele e com feathering. Em um campo de altura facial analítico, o padrão $(τ,σ,g_{\min})=(0,90,0,45,0,82)$ modifica 56,5% dos pixels faciais com ganho médio 0,938 (0,890 em pixels modificados) e conduz 3,4% dos pixels para o chão. A invariância de matiz é um corolário do operador. Analisamos a transferência em forma fechada, ablacionamos seus parâmetros e discutimos modos de falha de uma formulação monótona e apenas escurecendo, incluindo o duplo sombreamento de doadores não planos.

Ponto de partida da pesquisa

Um rosto trocado pode ser geometricamente alinhado e correto à identidade, mas ainda assim parecer colado porque o doador carrega luz plana do estúdio enquanto a cena anfitriã tem uma chave direcional. A reiluminação generativa pode reparar mais efeitos, mas também pode alterar tom de pele, poros, textura ou identidade após o rosto já ter sido aprovado. Equipes de produção às vezes precisam de um operador deliberadamente limitado cuja alteração fotométrica no pior caso seja conhecida.

Método

Um detector de rosto e uma malha de 468 pontos produzem um buffer de profundidade rasterizado, normais de superfície, proxy de cavidade e espaço de tela projetam sombras em um corte de 512 pixels. Os sinais do lado do hospedeiro do corpo, fundo, pescoço e halo de cabelo votam na direção da luz principal enquanto os sinais do rosto doador são reduzidos. O mapa de sombreamento normalizado passa por um limiar de três parâmetros, transferência de força e ganho mínimo, depois suavização guiada e uma máscara de pele com feathering. O mesmo ganho escalar é multiplicado em todos os canais linear-RGB e recortado em uma faixa de 0,82 a 1,0.

Síntese do artigo

Este é um controle conservador pós-composição com um limite de dano compreensível, não um sistema completo de reiluminação. É atraente quando a preservação de identidade supera o realismo dramático, desde que as cenas reais sejam revisadas quanto à direção errada da luz e sombras duplas.

Artigo 022026-09-28cs.CV

Cuidado com o RefGAP: Corrigindo a Atenção à Referência em Edição Visual Baseada em Difusão

Autores e instituições

Yanan Wang

Mohamed bin Zayed University of Artificial Intelligence

Institute of Foundation Models

Shengcai Liao

United Arab Emirates University

Guangyi Liu

Mohamed bin Zayed University of Artificial Intelligence

Institute of Foundation Models

Xiaodan Liang

Mohamed bin Zayed University of Artificial Intelligence

Que problema resolve

O RefGAP visa melhorar a fidelidade da identidade da referência em diferentes editores de imagem e vídeo, sem re-treinamento e sem aplicar uma força separada de correção para cada modelo. Ele equilibra explicitamente o uso mais intenso da referência dentro da máscara de edição com a supressão em regiões que devem ser preservadas.

Resultado-chave

Em 1.040 clipes do HeadSwapBench, a similaridade de identidade melhora para todos os sete editores de uso geral e o sucesso na substituição atinge pelo menos 86% onde definido; a similaridade da cabeça inteira também aumenta para todos os sete. Em 1.000 pares de troca de rosto do FaceForensics, a similaridade de identidade melhora em todos os editores, com substituição e recuperação correta de pelo menos 82% e 75%, respectivamente. Aplicado ao modelo especializado DirectSwap, a similaridade de identidade aumenta de 0,7019 para 0,7450 enquanto o LPIPS do quadro inteiro permanece praticamente inalterado. Os ganhos vêm acompanhados de maior erro de pontos-chave para vários sistemas e preservação não editada mista; a substituição de fundo não transfere de forma confiável. A implementação de atenção não fundida também pode adicionar memória ou latência substancial, portanto a qualidade da integração é importante.

Resumo

Editores de difusão guiada por referência têm dificuldade em reproduzir fielmente referências fornecidas pelo usuário. Identificamos um possível gargalo em editores de difusão: muitos métodos fornecem alocação limitada de atenção à referência. Por exemplo, no LoomVideo, consultas por região de edição atribuem menos de 1% de sua massa de atenção à referência. Introduzimos o RefGAP, uma correção sem treinamento que determina as magnitudes do deslocamento logit online em cada camada a partir da massa de atenção de referência medida durante a passagem direta. Deslocamentos positivos para logits de referência fortalecem o uso de referências por meio de consultas de região de edição, enquanto deslocamentos negativos para consultas keep-region limitam as alterações induzidas por referência fora da edição. Dois coeficientes globais controlam a correção; eles são selecionados uma vez em dados de validação de quatro editores de difusão de desenvolvimento e mantidos fixos. Em sete editores baseados em difusão, o RefGAP melhora a fidelidade de identidade em troca de cabeças e troca de faces. O RefGAP alcança um equilíbrio entre fidelidade e preservação comparável a vieses constantes ajustados separadamente no lado da edição, sem varreduras de força por abordagem. Experimentos adicionais em teste virtual e substituição de fundo avaliam a transferência além da edição de identidade.

Ponto de partida da pesquisa

Editores de difusão guiados por referência podem receber o rosto de origem correto e ainda assim dedicar quase nenhuma atenção a ele; consultas da região de edição do LoomVideo alocam menos de 1% da massa de atenção à referência, de acordo com a medição dos autores. Aumento fixo de atenção pode fortalecer a identidade, mas exige ajuste por modelo e pode vazar a aparência da referência para cabelo, roupa, fundo, pose ou expressão que deveriam permanecer inalterados.

Método

Durante cada camada de atenção, o RefGAP mede a parcela da atenção atribuída aos tokens de referência separadamente para consultas de edição e de preservação. Ele deriva um deslocamento de logit online a partir da massa observada: deslocamentos positivos fortalecem as chaves de referência na região de edição, enquanto deslocamentos negativos as restringem na região de preservação. Dois coeficientes globais e uma regra de seleção de camada são calibrados uma vez em 40 clipes de troca de cabeça usando quatro editores de desenvolvimento, e depois mantidos fixos em sete editores, três sistemas retidos, troca de rosto, prova virtual de roupa e substituição de plano de fundo.

Síntese do artigo

Medir a atenção real à referência é um sinal de controle útil e agnóstico ao modelo para edições de identidade, mas uma transferência mais forte da identidade pode alterar geometria e regiões preservadas. Equipes precisam de uma barreira de qualidade específica para a tarefa, não apenas similaridade de identidade.

Artigo 032026-09-05cs.CV

TBDub: Dublagem Visual Orientada para Produção

Autores e instituições

Bihan Li

TaoLive AIGC, Taobao & Tmall Group, Alibaba

Xinyang Li

TaoLive AIGC, Taobao & Tmall Group, Alibaba

Zeran Xu

TaoLive AIGC, Taobao & Tmall Group, Alibaba

Meiguang Jin

TaoLive AIGC, Taobao & Tmall Group, Alibaba

Junfeng Ma

TaoLive AIGC, Taobao & Tmall Group, Alibaba

Que problema resolve

O TBDub adapta uma pilha de dublagem de difusão de vídeo existente para imagens de produção e pergunta se um aluno em dois passos pode manter a identidade percebida do professor, sincronização e qualidade visual. Ele avalia a reconstrução, resposta de áudio, avaliações humanas e o caminho completo de geração VAE-para-VAE, em vez de citar apenas a velocidade do denoiser.

Resultado-chave

Em 38 clipes do TalkVid, o professor melhora todas as oito métricas de reconstrução, percepção, identidade e sincronização relatadas em relação ao X-Dub. Em 114 avaliações por método, os valores de sincronização labial, identidade e qualidade visual do MOS do X-Dub de 3,57, 2,83 e 2,88 sobem para 3,71, 3,78 e 3,78 para o professor. O aluno nota 3,85, 3,72 e 3,80, mantendo a identidade próxima enquanto lidera a sincronização labial e a qualidade visual. Com 512 por 512 em um H20, o aluno atinge 7,13 FPS efetivo contra 0,51 para o professor, um aumento de velocidade de ponta a ponta de 13,93 vezes; o estágio DiT sozinho é 42,49 vezes mais rápido. O benchmark é pequeno, exclui vários estágios de pré-processamento e codificação, e entradas de resolução muito baixa continuam sendo um caso de falha.

Resumo

A dublagem visual deve sincronizar o movimento da boca com a fala substituta, preservando identidade, aparência e consistência temporal. Embora o X-Dub forneça uma base sólida de edição de vídeo sem máscara, sua aplicação para transmissões ao vivo e conteúdo gerado revela limitações na robustez do domínio da produção, estabilidade temporal e de movimento, preservação de identidade e detalhes orais e eficiência de inferência. Apresentamos \textbf{TBDub}, uma extensão orientada à produção do X-Dub que combina treinamento pós-adaptativo à tarefa com destilação consciente da tarefa em poucos passos. O pós-treinamento adapta o DiT do vídeo usando dados do domínio da produção, condicionamento e filtragem específicos da produção, e recursos de áudio aprimorados para obter um Professor em 30 etapas. A destilação adapta DMD/DMD2 para edição condicional de vídeo e comprime o Professor em um Aluno em dois passos. Em 38 clipes do TalkVid, o Professor melhora todas as oito métricas de reconstrução, percepção, identidade e sincronização relatadas sobre o X-Dub. Na avaliação MOS, melhora a consistência de sincronização labial, a consistência de identidade e a qualidade visual em relação ao X-Dub em 0,14, 0,95 e 0,90 pontos, enquanto o Aluno alcança as maiores pontuações de sincronização labial e qualidade visual e permanece próximo do Professor em consistência de identidade. No tempo de geração emparelhado de ponta a ponta desde a primeira codificação VAE até a decodificação final em uma única GPU NVIDIA H20 a $512\512$, o Aluno atinge 7,13 FPS efetivos e reduz a latência total em $13,93\vezes$; a etapa DiT sozinha é acelerada em $42,49\times$. O Aluno mantém em grande parte a qualidade de geração do Professor e a sincronização audiovisual. O código está disponível no GitHub em \https://github.com/TaoLiveAIGC/TBDub, e os pesos Teacher de 30 passos e Student de dois passos estão disponíveis no Hugging Face em https://huggingface.co/TaoLiveAIGC/TBDub.

Ponto de partida da pesquisa

A dublagem visual deve alterar o movimento da boca o suficiente para expressar a fala substituta, mantendo identidade, dentes, textura dos lábios, pose, iluminação, oclusão e todas as regiões não relacionadas à fala estáveis ao longo do tempo. O X-Dub oferece um editor de vídeo capaz sem máscara, mas transmissões ao vivo de produção e entradas de vídeo gerado expõem deslocamento de domínio, cintilação, deriva de detalhes orais e a latência de trinta etapas de redução de ruído.

Método

O pós-treinamento adaptativo à tarefa mistura dados do domínio de produção com a distribuição de treinamento herdada, fortalece as características sonoras com camadas HuBERT-large, degrada condições assimetricamente e utiliza desistência de movimento mais correspondência de fluxo ponderado espacial e temporal para criar um professor de 30 passos. Um procedimento condicional DMD/DMD2 destila esse professor em um aluno diferenciável de dois passos, com treinamento dinâmico de pontuação falsa, supervisão seletiva por região em etapas, tratamento causal de primeiro latente, amostragem em passo de tempo integral, aritmética de orientação FP32 e pesos EMA FP32.

Síntese do artigo

Dublagem visual em dois passos pode oferecer um ponto de throughput de qualidade muito melhor, mas os 7,13 FPS relatados estão limitados ao núcleo de geração. O tamanho da produção deve incluir áudio, rastreamento facial, composição, codificação e estabilidade em vídeo longo.