← Volver al Blog
Radar de InvestigaciónIntercambio de rostrosEdición visualarXivSeptiembre 2026

Radar arXiv Mensual

Artículos de intercambio de rostros de septiembre 2026: Armonía de iluminación, atención a las referencias y doblaje en tiempo real

Septiembre ofrece un método directo de composición de rostros y dos sistemas adyacentes de edición de identidad. La cadena de armonización de sombras limita deliberadamente lo que puede cambiar para que una mala estimación no pueda recolorear ni aclarar una cara aprobada. Los instrumentos RefGAP referencian la atención a través de siete editores de difusión y la corrigen en el momento de la inferencia. TBDub adapta un modelo de doblaje visual a metraje de producción, luego destila treinta pasos de eliminación de ruido a dos mientras mide identidad, sincronización labial, calidad visual y rendimiento de extremo a extremo.

Lo que señala este mes

El armonizador impulsado por geometría aplica solo un campo de oscurecimiento acotado y uniforme al canal; en su proxy analítico, el 56,5% de los píxeles de la cara cambian, la ganancia media es 0,938 y ningún píxel se ilumina, aunque el artículo no reclama una victoria perceptiva en imagen real. RefGAP calibra dos coeficientes una vez, luego mejora la similitud de identidad entre siete editores de imagen/vídeo con 1.040 clips de intercambio de cabezas y 1.000 pares de intercambio de rostros; el éxito de reemplazo alcanza al menos el 86% y el 82%, respectivamente, con compensaciones medibles entre pose y preservación. El estudiante de dos pasos de TBDub alcanza 7,13 FPS a 512 por 512 en un H20, una aceleración de extremo a extremo 13,93 veces respecto a su profesor, mientras que las valoraciones humanas mantienen la calidad de identidad del profesor y mejoran ligeramente la sincronización labial y la calidad visual. Para los compradores, la distinción importante es el riesgo: los límites deterministas, los controles de tiempo de inferencia y la generación destilada tienen diferentes modos de fallo y necesidades de validación.

Artículo 012026-09-15cs.CV

Armonización de sombras impulsada por geometría para caras compuestas: una tubería de reiluminación multiplicativa que preserva el albedo

Autores e instituciones

Vijesh KP

Independent researcher (no institutional affiliation stated in the paper)

Qué problema resuelve

El artículo se dirige al caso limitado en el que el color y la identidad del donante son aceptables pero faltan sombras de forma. Pregunta cómo inyectar sombras de nariz, alveolo, labio y cavidad a partir de geometría facial aproximada sin aclarar píxeles, cambiar la cromaticidad ni sintetizar un rostro nuevo.

Resultado clave

En el campo de altura analítica de la cara con luz conocida, la configuración predeterminada modifica el 56,5% de los píxeles de la cara, da una ganancia media de 0,938 en general y 0,890 en píxeles modificados, y envía el 3,4% de los píxeles al suelo de 0,82. Garantiza cero píxeles iluminados ni desplazamiento matemático del ángulo de tono más allá del ruido de punto flotante. Estas cifras caracterizan el operador acotado más que la calidad perceptiva: el papel no proporciona un punto de referencia real compuesto emparejado ni una comparación de línea base. No puede añadir resaltos, corregir un donante ya oscuro, eliminar luz fuente opuesta ni evitar sombras dobles del sombreado residual del donante.

Resumen

El intercambio de rostros y las canaletas de composición de rostros producen rutinariamente un rostro geométricamente bien alineado pero fotométricamente poco plausible: el rostro donante lleva iluminación plana y casi frontal del estudio, mientras que el cuerpo anfitrión y el fondo llevan luz direccional de la escena. La mayoría de los remedios existentes resintetizan el rostro mediante transferencia de color, reiluminación neuronal o renderizado inverso, y por tanto corren el riesgo de alterar identidad, tono de piel y textura. Presentamos una alternativa conservadora: la inyección de sombra de forma impulsada por geometría. La tubería nunca repinta la cara. Estima un campo de ganancia por píxel $g\in[g_{\min},1]$ de un proxy facial 3D rasterizado y lo multiplica de manera uniforme en RGB lineal, de modo que el operador solo puede oscurecer y no puede desplazar la cromaticidad. Una malla densa de hitmark se rasteriza en un buffer de profundidad, del que derivamos normales superficiales, un término cavidad y sombras proyectadas en el espacio de pantalla. La dirección de la luz clave se estima a partir de señales del lado del anfitrión (cuerpo, fondo, halo de cabello); las señales en la cara se reducen porque recuperan la iluminación del donante. La magnitud de la sombra no se ajusta a la del huésped: se establece mediante una transferencia de tres parámetros $(τ,σ,g_{\min})$. El campo de sombreado se divide por su percentil 75 sobre la piel, luego se encapsula, escala, sujeta, suaviza y re-recorta dentro de una máscara facial con difuminados y controlados por la piel. En un campo de altura facial analítico, el valor predeterminado $(τ,σ,g_{\min})=(0,90,0,45,0,82)$ modifica el 56,5% de los píxeles de la cara con una ganancia media de 0,938 (0,890 en píxeles modificados) y lleva el 3,4% de los píxeles al suelo. La invariancia de tono es una consecuencia del operador. Analizamos la transferencia en forma cerrada, ablacionamos sus parámetros y discutimos los modos de fallo de una formulación monótona y solo oscurecida, incluyendo doble sombra de donantes no planos.

Punto de partida

Una cara intercambiada puede estar alineada geométricamente y correcta por identidad, pero aún así parecer pegada porque el donante lleva luz plana de estudio mientras que la escena anfitriona tiene una clave direccional. La reiluminación generativa puede reparar más efectos, pero también puede cambiar el tono de piel, los poros, la textura o la identidad después de que la cara ya haya sido aprobada. Los equipos de producción a veces necesitan un operador deliberadamente limitado cuyo peor caso de cambio fotométrico sea conocido.

Método

Un detector facial y una malla de 468 puntos producen un buffer de profundidad rasterizado, normales superficiales, proxy de cavidad y espacio de pantalla proyectan sombras en un recorte de 512 píxeles. Las señales del cuerpo del lado del anfitrión, el fondo, el cuello y el halo capilar votan por la dirección de la luz principal mientras que las señales de rostro donante se reducen. El mapa de sombreado normalizado pasa por un umbral de tres parámetros, transferencia de fuerza y ganancia mínima, luego suavizado guiado y una máscara de piel difuminada. La misma ganancia escalar se multiplica en todos los canales RGB lineales y se recorta en un rango de 0,82 a 1,0.

Conclusión del artículo

Este es un control conservador post-composición con un límite de daño comprensible, no un sistema completo de reiluminación. Resulta atractivo cuando la preservación de la identidad supera el realismo dramático, siempre que se revisen planos reales para detectar dirección de luz incorrecta y sombras dobles.

Artículo 022026-09-28cs.CV

Cuidado con el RefGAP: Corrección de la atención de referencia en la edición visual basada en difusión

Autores e instituciones

Yanan Wang

Mohamed bin Zayed University of Artificial Intelligence

Institute of Foundation Models

Shengcai Liao

United Arab Emirates University

Guangyi Liu

Mohamed bin Zayed University of Artificial Intelligence

Institute of Foundation Models

Xiaodan Liang

Mohamed bin Zayed University of Artificial Intelligence

Qué problema resuelve

RefGAP tiene como objetivo mejorar la fidelidad de la identidad de la referencia en diferentes editores de imágenes y video sin reentrenamiento y sin aplicar una fuerza de corrección separada para cada modelo. Equilibra explícitamente un uso más fuerte de la referencia dentro de la máscara de edición con la supresión en las regiones que se deben preservar.

Resultado clave

En 1,040 clips de HeadSwapBench, la similitud de identidad mejora para los siete editores de propósito general y el éxito de reemplazo alcanza al menos el 86% donde esté definido; la similitud de toda la cabeza también aumenta para los siete. En 1,000 pares de intercambio de caras de FaceForensics, la similitud de identidad mejora en cada editor, con reemplazo y recuperación correcta de al menos 82% y 75%. Aplicado al modelo especializado DirectSwap, la similitud de identidad pasa de 0.7019 a 0.7450 mientras que el LPIPS de todo el cuadro casi no cambia. Las ganancias vienen con un mayor error de puntos clave para varios sistemas y preservación no editada mixta; el reemplazo de fondo no se transfiere de manera confiable. La implementación de atención no fusionada también puede añadir memoria o latencia sustancial, por lo que la calidad de integración importa.

Resumen

Los editores de difusión guiada por referencias tienen dificultades para reproducir fielmente las referencias proporcionadas por el usuario. Identificamos un posible cuello de botella en los editores de difusión: muchos métodos proporcionan una asignación limitada de atención a la referencia. Por ejemplo, en LoomVideo, las consultas por región de edición asignan menos del 1% de su masa de atención a la referencia. Introducimos RefGAP, una corrección sin entrenamiento que determina las magnitudes del desplazamiento logit en línea en cada capa a partir de la masa de atención de referencia medida durante el pase hacia adelante. Los desplazamientos positivos para los logits de referencia refuerzan el uso de referencias mediante consultas de región de edición, mientras que los desplazamientos negativos para consultas de región de mantenimiento limitan los cambios inducidos por referencias fuera de la edición. Dos coeficientes globales controlan la corrección; se seleccionan una vez en datos de validación de cuatro editores de difusión de desarrollo y se mantienen fijos. En siete editores de imagen/vídeo basados en difusión, RefGAP mejora la fidelidad de identidad en el intercambio de cabezas y el intercambio de caras. RefGAP logra un equilibrio entre fidelidad y preservación comparable a sesgos constantes ajustados por separado en el lado de la edición, sin barridos de fuerza por aproximación. Experimentos adicionales sobre prueba virtual y reemplazo de fondo evalúan la transferencia más allá de la edición de identidad.

Punto de partida

Los editores de difusión guiados por referencia pueden recibir la cara fuente correcta pero dedicarle casi nada de atención; las consultas de la región de edición de LoomVideo asignan menos del 1% de la masa de atención a la referencia según la medición de los autores. Los aumentos de atención fijos pueden fortalecer la identidad pero requieren ajuste por modelo y pueden filtrar la apariencia de la referencia en el cabello, la ropa, el fondo, la pose o la expresión que deberían permanecer sin cambios.

Método

Durante cada capa de atención, RefGAP mide la proporción de atención asignada a los tokens de referencia por separado para las consultas de edición y de preservación. Deriva un desplazamiento logit en línea a partir de la masa observada: los desplazamientos positivos fortalecen las claves de referencia en la región de edición, mientras que los negativos las restringen en la región de preservación. Dos coeficientes globales y una regla de selección de capas se calibran una vez en 40 clips de intercambio de cabeza usando cuatro editores de desarrollo, y luego se mantienen fijos en siete editores, tres sistemas no utilizados, intercambio de caras, prueba virtual de ropa y reemplazo de fondo.

Conclusión del artículo

Medir la atención real de la referencia es una señal de control útil independiente del modelo para ediciones de identidad, pero una transferencia de identidad más fuerte puede alterar la geometría y las regiones preservadas. Los equipos necesitan una puerta de calidad específica de la tarea, no solo la similitud de identidad.

Artículo 032026-09-05cs.CV

TBDub: Doblaje visual orientado a la producción

Autores e instituciones

Bihan Li

TaoLive AIGC, Taobao & Tmall Group, Alibaba

Xinyang Li

TaoLive AIGC, Taobao & Tmall Group, Alibaba

Zeran Xu

TaoLive AIGC, Taobao & Tmall Group, Alibaba

Meiguang Jin

TaoLive AIGC, Taobao & Tmall Group, Alibaba

Junfeng Ma

TaoLive AIGC, Taobao & Tmall Group, Alibaba

Qué problema resuelve

TBDub adapta un stack existente de doblaje por difusión de video al metraje de producción y plantea si un estudiante de dos pasos puede retener la identidad percibida, la sincronización y la calidad visual del maestro. Evalúa la reconstrucción, la respuesta de audio, las valoraciones humanas y la ruta completa de generación de VAE a VAE en lugar de citar solo la velocidad del denoiser.

Resultado clave

En 38 clips de TalkVid, el profesor mejora las ocho métricas de reconstrucción, percepción, identidad y sincronización reportadas sobre X-Dub. En 114 valoraciones por método, los valores de sincronización labial, identidad y calidad visual de MOS de X-Dub de 3,57, 2,83 y 2,88 suben a 3,71, 3,78 y 3,78 para el profesor. El estudiante obtiene 3,85, 3,72 y 3,80, manteniendo la identidad cerca mientras lidera la sincronización labial y la calidad visual. Con 512 por 512 en un H20, el estudiante alcanza 7,13 FPS efectivos frente a 0,51 para el profesor, una aceleración de extremo a extremo 13,93 veces; solo la etapa DiT es 42,49 veces más rápida. El benchmark es pequeño, excluye varias etapas de preprocesamiento y codificación, y las entradas de muy baja resolución siguen siendo un caso de fallo.

Resumen

El doblaje visual debe sincronizar el movimiento de la boca con el habla de reemplazo mientras se preservan la identidad, la apariencia y la consistencia temporal. Aunque X-Dub proporciona una sólida referencia de edición de video sin máscaras, su aplicación a contenido de transmisión en vivo y videos generados revela limitaciones en la robustez para el dominio de producción, estabilidad temporal y del movimiento, preservación de identidad y detalles orales, y eficiencia de inferencia. Presentamos \textbf{TBDub}, una extensión orientada a la producción de X-Dub que combina el posentrenamiento adaptado a la tarea con la destilación de pocos pasos consciente de la tarea. El posentrenamiento adapta el DiT de video utilizando datos del dominio de producción, condicionamiento y filtrado específicos de producción, y características de audio mejoradas para obtener un Maestro de 30 pasos. La destilación adapta DMD/DMD2 a la edición condicional de video y comprime el Maestro en un Estudiante de dos pasos. En 38 clips de TalkVid, el Maestro mejora las ocho métricas reportadas de reconstrucción, percepción, identidad y sincronización sobre X-Dub. En la evaluación MOS, mejora la consistencia del sincronismo labial, la consistencia de identidad y la calidad visual sobre X-Dub en 0,14, 0,95 y 0,90 puntos, mientras que el Estudiante alcanza las puntuaciones más altas en sincronismo labial y calidad visual, manteniéndose cercano al Maestro en consistencia de identidad. En la generación de extremo a extremo en pares, desde la primera codificación VAE hasta la decodificación final VAE en una sola GPU NVIDIA H20 a $512\times512$, el Estudiante alcanza 7,13 FPS efectivos y reduce la latencia total en $13,93\times$; la etapa DiT por sí sola se acelera en $42,49\times$. El Estudiante conserva en gran medida la calidad de generación y la sincronización audiovisual del Maestro. El código está disponible en GitHub en https://github.com/TaoLiveAIGC/TBDub, y los pesos del Maestro de 30 pasos y del Estudiante de dos pasos están disponibles en Hugging Face en https://huggingface.co/TaoLiveAIGC/TBDub.

Punto de partida

El doblaje visual debe cambiar el movimiento de la boca lo suficiente para expresar el habla de reemplazo mientras se mantiene estable la identidad, los dientes, la textura de los labios, la pose, la iluminación, la oclusión y todas las regiones no relacionadas con el habla a lo largo del tiempo. X-Dub proporciona un editor de video capaz sin máscara, pero las entradas de transmisiones en vivo de producción y videos generados exponen cambios de dominio, parpadeo, deriva de detalles orales y la latencia de treinta pasos de denoising.

Método

El posentrenamiento adaptado a la tarea mezcla datos del dominio de producción con la distribución de entrenamiento heredada, refuerza las características de audio con capas HuBERT-large, degrada las condiciones de manera asimétrica y utiliza abandono de movimiento más un flujo ponderado espacial y temporal para crear un maestro de 30 pasos. Un procedimiento condicional DMD/DMD2 destila ese maestro en un estudiante diferenciable de dos pasos, con entrenamiento dinámico de puntuación falsa, supervisión selectiva por regiones por etapas, manejo causal del primer latente, muestreo de todos los pasos, aritmética de guía FP32 y pesos EMA FP32.

Conclusión del artículo

El doblaje visual en dos pasos puede ofrecer un rendimiento de calidad mucho mejor, pero los 7,13 FPS reportados están limitados al núcleo generacional. El tamaño de producción debe incluir audio, seguimiento facial, composición, codificación y estabilidad en vídeo largo.