← Volver al Blog
Radar de investigaciónIntercambio facialRostro parlantearXivAgosto de 2026

Radar mensual de arXiv

Artículos sobre intercambio de rostros de agosto de 2026: retratos en tiempo real, avatares de un minuto y control emocional

El intercambio de rostros y la investigación digital humana de August se centran menos en un solo truco de transferencia de identidad y más en una interacción sostenida y controlable. Los sistemas seleccionados separan el movimiento reutilizable de la apariencia, destilan un modelo de audio-vídeo offline en un streamer a escala minúscula y combinan semántica emocional latente con geometría explícita de blendshape.

Lo que señala este mes

Proxy Avatar se encuentra con el caché de bajo rango alcanza 32 FPS en una RTX 4090 separando un performer emocional reutilizable de la retargeting de identidad de un solo episodio y la caché de la apariencia estática. Omni-LiveAvatar aborda el extremo del espectro de centros de datos, utilizando destilación autorregresiva y memoria acotada de largo y corto plazo para mantener el audio y el vídeo conjuntos coherentes durante un minuto completo. GemTalk se centra en la interfaz de control, permitiendo que la geometría explícita de la mezcla escale la fuerza de las características emocionales implícitas. Juntos mapean tres opciones de productos diferentes: reutilización personalizada de movimiento, infraestructura de streaming continuo y dirección expresiva detallada.

Artículo 012026-08-03cs.CV

Avatar Proxy se encuentra con caché de bajo rango: animación de retrato controlable por emociones en tiempo real de un solo disparo

Autores e instituciones

Haijie Yang

Nanjing University of Science and Technology, China

Jindi Bao

Nanjing University of Science and Technology, China

Yixuan Dong

Tsientang Institute for Advanced Study, China

Hongliang Zhang

Nanjing University of Science and Technology, China

Jian Bi

Nanjing University of Science and Technology, China

Hao Tang

Peking University, China

Zhenyu Zhang

Nanjing University, China

Jianjun Qian

Nanjing University of Science and Technology, China

Jian Yang

Nanjing University of Science and Technology, China

Qué problema resuelve

El artículo separa el movimiento emocional reutilizable, el retargeting entre identidades y la representación de apariencia para que un único retrato de referencia pueda animarse en tiempo real desde audio y una etiqueta emocional. Elimina específicamente el cálculo repetido de referencia-características sin reentrenar una caché para cada identidad objetivo.

Resultado clave

En una RTX 4090, el sistema completo funciona a 32 FPS. En auto-reconstrucción alcanza 31,24 PSNR, 0,018 LPIPS, 0,883 SSIM y una puntuación de sincronización labial de 6,314, liderando la mayoría de métricas de calidad y movimiento a pesar de la mayor tasa de frames en bruto de EmoTag. En conducción cruzada de identidades registra 29,64 FID, 0,745 de similitud de identidad, 75,4% de precisión emocional y 6,096 de sincronización labial. Los participantes la preferían por su expresividad emocional en el 70% de las comparaciones, sincronización labial en el 60% y realismo visual en el 65%; los clips extendidos no mostraron un drift evidente de identidad ni sincronización.

Resumen

La animación de retratos basada en audio ha avanzado rápidamente con modelos generativos basados en difusión, pero la generación de one-shot en tiempo real con control expresivo de emociones sigue siendo un reto. Los métodos existentes a menudo sufren de previos de movimiento conscientes de las emociones insuficientes y costosos cálculos de apariencia durante la reducción de ruido en varios pasos. Para abordar estos problemas, proponemos Proxy Avatar Meets Low-Rank Caching, un marco en cascada para animación de retrato controlable por emoción en tiempo real de un solo disparo. En lugar de generar directamente el retrato objetivo a partir de audio, nuestro método utiliza un avatar proxy emocional basado en Gauss como generador de movimiento reutilizable, que se entrena una vez en una sola identidad para producir vídeos de conducción expresiva a partir de etiquetas de audio y emoción. Dado que el avatar proxy solo proporciona movimiento y no apariencia o geometría objetivo, un modelo de retargeting a gran escala extrae aún más movimiento independiente de la identidad del rendimiento del proxy y lo adapta a retratos objetivo arbitrarios. Para mejorar la eficiencia de la inferencia, introducimos la reutilización de apariencia sin disparo con caché de bajo rango, que almacena en caché características de apariencia de referencia en el primer paso de eliminación de ruido y modela las variaciones posteriores usando adaptadores ligeros de bajo rango. Experimentos extensos demuestran que nuestro método logra una mayor expresividad emocional, mejor animación que preserva la identidad y coste de inferencia sustancialmente reducido, permitiendo animación de retrato en tiempo real de un solo disparo.

Punto de partida

Los retratos hablados de un solo disparo necesitan preservar la apariencia de una persona invisible, seguir el habla, expresar una emoción solicitada y ejecutarse de forma interactiva en el hardware disponible. Los sistemas de difusión recalculan repetidamente características casi estáticas de la apariencia durante la reducción de ruido, mientras que los controles de emociones suelen entrelazar identidad y movimiento o requieren un vídeo de referencia para cada estilo. El resultado es o bien una generación expresiva pero lenta o una animación rápida con un rango emocional débil.

Método

Un avatar proxy basado en Gaus se entrena una vez en un intérprete y sirve únicamente como generador de movimiento condicionado por audio y emoción. Una red de retargeting a gran escala de un solo disparo extrae movimiento independiente de identidad de ese vídeo proxy y lo aplica a retratos de objetivos arbitrarios. Durante la difusión en pocos pasos, la reutilización de apariencia cero referencia a las características en el primer paso, mientras que los adaptadores ligeros de rango bajo solo modelan su variación posterior. Esta división en cascada del trabajo se evalúa en auto-reconstrucción, conducción de un solo plano de identidad cruzada, estabilidad en vídeo largo, ablaciones y un estudio ciego con veinte participantes.

Conclusión del artículo

El diseño de proxy reutilizable más retargeting hace que los avatares emocionales en tiempo real sean prácticos sin entrenamiento de difusión por usuario. Los 32 FPS reportados en una RTX 4090 de consumo son prometedores, pero el tamaño del despliegue debería incluir el entrenamiento proxy único y el equilibrio calidad/coste del modelo de retargeting grande, no solo la tasa de frames en estado estable.

Artículo 022026-08-07cs.MM

Omni-LiveAvatar: Generación conjunta de avatares audio-vídeo en streaming en tiempo real a nivel de minuto

Autores e instituciones

Lunjie Zhu

iComAI Lab, Hong Kong University of Science and Technology, Hong Kong

Vivix Group Limited, Hong Kong

Xingtong Ge

iComAI Lab, Hong Kong University of Science and Technology, Hong Kong

Vivix Group Limited, Hong Kong

Fangyu Lin

iComAI Lab, Hong Kong University of Science and Technology, Hong Kong

Vivix Group Limited, Hong Kong

Yi Zhang

Vivix Group Limited, Hong Kong

Zhening Liu

iComAI Lab, Hong Kong University of Science and Technology, Hong Kong

Mengfei Li

iComAI Lab, Hong Kong University of Science and Technology, Hong Kong

Vivix Group Limited, Hong Kong

Yumeng Zhang

iComAI Lab, Hong Kong University of Science and Technology, Hong Kong

Guanglu Song

Vivix Group Limited, Hong Kong

Yu Liu

Vivix Group Limited, Hong Kong

Jun Zhang

iComAI Lab, Hong Kong University of Science and Technology, Hong Kong

Qué problema resuelve

Omni-LiveAvatar convierte un gran maestro conjunto de audio-vídeo offline en un generador de streaming causal y aborda los problemas de estabilidad separados de contexto largo y prompts cambiantes. Su objetivo es la generación continua a escala de minutos en lugar de una secuencia de clips cortos generados de forma independiente.

Resultado clave

Para clips de cinco segundos, el modelo genera 19,57 FPS, aproximadamente 33 veces más rápido que su profesor de 0,60 FPS, mientras que obtiene la puntuación de calidad global más alta entre los sistemas probados (81,72) y puntuaciones perfectas de identidad humana y fidelidad de la ropa. En la generación sesenta y dos alcanza 21,99 FPS frente a 16,18 en la siguiente línea base más rápida. Su puntuación de identidad humana a nivel de minuto es 98,61 frente a 67,60 y 50,19, Sync-C es 6,76 frente a 0,72 y 0,28, y la alineación texto-vídeo es 9,82 frente a 6,68 y 5,46, con un desvio visible reducido de avatar y fondo.

Resumen

Los modelos generativos conjuntos de audio-vídeo sirven como base para la generación digital humana inmersiva e interactiva. No obstante, la mayoría de los modelos existentes dependen de la atención bidireccional y la reducción de ruido en varios pasos, y solo pueden generar clips cortos, lo que los hace inadecuados para la interacción en tiempo real durante largos periodos. Presentamos Omni-LiveAvatar, el primer marco para la generación conjunta de avatares audio-video en streaming a nivel minuto y en tiempo real. Específicamente, proponemos (1) una cadena progresiva de destilación autoregresiva que transfiere un gran modelo bidireccional conjunto de difusión audio-video a un generador autorregresivo de unos pocos pasos sin mecanismos auxiliares de estabilización; (2) una memoria sincronizada audio-vídeo a largo plazo que preserve la consistencia global bajo un presupuesto de memoria limitado; y (3) una estrategia jerárquica de planificación de prompts que permite una evolución semántica coherente y transiciones fluidas de prompts. Experimentos extensos muestran que Omni-LiveAvatar genera avatares sincronizados de alta calidad a nivel minuto en tiempo real. En cuanto a velocidad, logra una aceleración de generación de 33$ y multiplicaciones por su profesor, LTX-2, en una única GPU NVIDIA H200; en cuanto a calidad de generación, supera las líneas de base aceleradas en calidad visual, calidad de audio, sincronización multimodal y fidelidad humana. Nuestro código está disponible en https://github.com/Aoko955/Omni-LiveAvatar.

Punto de partida

Los generadores conjuntos de audio-vídeo pueden sintetizar clips cortos convincentes, pero la atención bidireccional y la difusión en varios pasos impiden la interacción en vivo, mientras que las variantes autoregresivas aceleradas derivan en identidad, fondo, calidad de audio o sincronización labial durante sesiones largas. Un humano digital útil debe preservar ambas modalidades durante minutos bajo memoria limitada y aceptar prompts en evolución sin transiciones semánticas o acústicas abruptas.

Método

Una tubería de destilación progresiva autorregresiva de tres etapas transfiere LTX-2 a un generador causal de cuatro pasos de reducción de ruido, sin modelos de recompensa externos ni estabilización específica por modalidad. La memoria sincronizada audio-vídeo a largo plazo combina un primer macro-bloque reanclado periódicamente con cachés de clave-valor móviles, manteniendo la identidad global y el contexto reciente dentro de un presupuesto fijo. La planificación jerárquica de prompts rolling separa instrucciones persistentes de apariencia/fondo de las acciones locales a nivel de bloque, de modo que los prompts avanzan con la ventana rotativa. La evaluación cubre tanto la salida de cinco segundos como de sesenta segundos a 512 por 768 en un NVIDIA H200.

Conclusión del artículo

El artículo convierte la estabilidad audiovisual a largo plazo en un problema de sistemas de primera clase en lugar de una ocurrencia secundaria. Es una arquitectura de referencia sólida para humanos digitales en vivo, pero la afirmación en tiempo real se mide en un H200 de 512 por 768, por lo que los compradores deberían reproducir latencia, memoria y concurrencia en su propio hardware de servicio.

Artículo 032026-08-01cs.CV

Modulación de emociones guiada por geometría para la generación de rostros emocionales controlables y fotorrealistas

Autores e instituciones

Chenggong Hu

School of Software Technology, Zhejiang University, Ningbo, China

Shaoyin Ma

School of Software Technology, Zhejiang University, Ningbo, China

Yi Wang

College of Computer Science and Technology, Zhejiang University, Hangzhou, China

Li Sun

Ningbo Global Innovation Center, Zhejiang University, Ningbo, China

Mingli Song

College of Computer Science and Technology, Zhejiang University, Hangzhou, China

Jie Song

School of Software Technology, Zhejiang University, Ningbo, China

Qué problema resuelve

GemTalk conecta la semántica emocional derivada del audio con la geometría facial consciente de la identidad y utiliza la geometría para controlar la intensidad de las características de expresión latente. Esto hace que la categoría e intensidad emocional sean editables de forma continua, manteniendo el fotorrealismo y la sincronización labial.

Resultado clave

En la prueba combinada de MEAD-frente y RAVDESS-voz emocional, GemTalk alcanza 334,937 FVD, 31,625 FID, 7,027 Sync-C, 8,283 Sync-D, 2,392 FID de expresión y 59,258% de precisión emocional. Mejora la precisión emocional en 3,33 puntos porcentuales respecto al siguiente mejor método y reduce la FVD en 20,84. En HDTF neutral mantiene una fuerte sincronización y el mejor FID de expresión reportado es de 1,386, mientras que las ediciones de coeficientes producen transiciones suaves de emoción débil a fuerte sin pérdida de identidad evidente.

Resumen

La generación de rostros emocionales hablados impulsada por audio busca sintetizar vídeos realistas con dinámicas faciales expresivas. Sin embargo, los métodos existentes luchan por equilibrar la controlabilidad y la fidelidad visual. Aunque las representaciones implícitas capturan semánticas profundas, carecen de orientación estructural, lo que a menudo resulta en expresiones emocionales promediadas. En cambio, los métodos geométricos explícitos ofrecen un mejor control sobre las expresiones faciales pero tienden a sacrificar detalles de texturas de alta frecuencia. Para abordarlo, proponemos GemTalk, un marco basado en difusión que combina la riqueza semántica de representaciones implícitas con la precisión estructural de los priors geométricos explícitos. Introducimos un módulo de Proyección de Audio Emocional Guiada por Visión (V-AEP) para extraer características implícitas de labios y expresiones emocionales. Al mismo tiempo, un Generador de Priors Geométricos basado en Difusión (D-GPG) genera coeficientes de blendshape conscientes de identidad como priors estructurales explícitos. De manera crucial, nuestro módulo de Modulación Emocional Guiada por Geometría (GEM) aprovecha estos priores geométricos para recalibrar la magnitud de las características implícitas, permitiendo un control preciso y continuo sobre las expresiones emocionales, especialmente la intensidad emocional, sin sacrificar la calidad visual. Experimentos extensos demuestran que GemTalk logra un rendimiento superior en fotorrealismo y dinámicas emocionales faciales.

Punto de partida

Las características implícitas de difusión proporcionan una textura facial rica, pero tienden a promediar las expresiones emocionales y ofrecen un control de intensidad pobre. Los hitos o blendshapes explícitos proporcionan una estructura interpretable, pero los sistemas impulsados solo por la geometría a menudo pierden la apariencia de alta frecuencia y pueden producir una boca o parte superior de la cara que entra en conflicto con el audio. La animación emocional necesita tanto riqueza semántica como movimiento físico controlable sin filtrar la expresión ya presente en el retrato de referencia.

Método

El entrenamiento comienza con una columna vertebral de sincronización labial agnóstica a emoción en vídeo amplio y no emocional. La Proyección de Emociones de Audio guiada por visión aprende espacios emocionales separados pero coordinados de los labios y la cara superior utilizando representaciones visuales de emociones para supervisar características de audio. Un generador geométrico basado en difusión predice coeficientes de blendshape Apple ARKit conscientes de identidad. La Modulación de Emoción guiada por geometría preserva la dirección latente de rasgos que representa la categoría emocional mientras recalibra su magnitud a partir de las blendshapes; las parejas de muestreo conscientes del conflicto referencian imágenes y audio con diferentes emociones para que el modelo no pueda copiar la expresión original.

Conclusión del artículo

Combinar la semántica de emoción latente con la magnitud explícita de la forma de mezcla ofrece una superficie de control útil para herramientas creativas y APIs digitales para humanos. GemTalk es más fuerte cuando la intensidad emocional continua importa, aunque los equipos deberían comprobar si sus etiquetas emocionales y supuestos de coeficientes ARKit cubren sus idiomas, estilos de habla y rigs objetivo.