← Volver al Blog
Radar de investigaciónIntercambio de carasCaras parlantesarXivJulio de 2026

Radar mensual de arXiv

Documentos sobre intercambio de rostros de julio de 2026: Anclajes de identidad, privacidad de los peatones y rostros parlantes interactivos

El trabajo de síntesis facial de julio abarca tres usos distintos de la transferencia de identidad. Un artículo propone la colocación adaptativa de anclajes para mantener estable una identidad intercambiada a lo largo de vídeos extensos; otro utiliza el intercambio como método de desidentificación, preservando al mismo tiempo las señales de comportamiento; y un tercero va más allá de una sola persona hablando para abarcar conversaciones sintéticas con respuesta mutua.

Lo que señala este mes

El método Adaptive Identity Anchoring trata la colocación de fotogramas clave como un problema de retroalimentación y destaca por plantear pruebas falsables, aunque aún no informa sobre esos experimentos. El método de privacidad para peatones proporciona un estudio empírico más pequeño sobre qué se conserva al intercambiar elementos y dónde falla la transferencia de cabeza completa, especialmente en casos de oclusión y velo. CHAT muestra la escala y complejidad de generar dos identidades receptivas con habla, reacciones del oyente y estructura de turnos, al tiempo que reconoce que su evaluación aún no mide la semántica a nivel de diálogo. Los tres artículos en conjunto demuestran por qué la similitud de identidad por sí sola no es una métrica de calidad adecuada para la síntesis facial.

Artículo 012026-07-23cs.CV

Anclaje de identidad adaptativo: Colocación de fotogramas clave en bucle cerrado para la supervisión sintética por pares en el intercambio de rostros en vídeo.

Autores e instituciones

Logan Robbins

Independent researcher

Qué problema resuelve

El artículo se centra en la fábrica de datos que sustenta un modelo de intercambio, en lugar de añadir otra arquitectura para estudiantes. Se pregunta cuántas anclas de identidad necesita un par sintético, dónde deberían ubicarse y cómo deberían filtrarse los fragmentos que no pueden mantener la identidad antes de que pasen a la fase de supervisión.

Resultado clave

Se trata de una propuesta de investigación, no de un resultado empírico finalizado. Especifica curvas de deriva frente a brecha de anclaje, colocación uniforme frente a adaptativa con presupuestos iguales, formación posterior de estudiantes, ablaciones de textura y un estudio de filtro de belleza humana como pruebas falsables, pero aún no informa de ganancias medidas en cuanto a identidad, temporalidad, espectro o estudios de usuarios.

Resumen

El intercambio de caras en video no tiene supervisión de pares natural: no existe metraje real de la cara de una persona realizando el video de otra persona. La respuesta actual más fuerte, SyncID-Pipe de DreamID-V, crea pares reemplazando la identidad en exactamente dos fotogramas de un clip real (el primero y el último) y regenerando el resto a partir de una secuencia de poses solamente. La pose no lleva evidencia de apariencia de la identidad intercambiada, por lo que en clips largos, oclusiones y excursiones de pose extremas la identidad sintetizada tiene un largo lapso sin anclaje en el que deriva; ninguna ablación publicada examina el recuento de anclajes o la ubicación. Proponemos Anclaje de Identidad Adaptativo (AIA): (i) generalizamos el sintetizador a conjuntos de anclajes arbitrarios, arquitectónicamente natural para transformadores de estilo de forzamiento de difusión donde el condicionamiento en un fotograma es limitar sus tokens a ruido cero; (ii) colocamos anclajes por un bucle de retroalimentación cerrado que califica cada fotograma generado contra la identidad de referencia real e inserta un anclaje de imagen-cara intercambiada en el fotograma de peor puntuación hasta que el par pasa un umbral o agota un presupuesto; (iii) reutilizar el veredicto del bucle como un filtro de datos automático. Una segunda patología, el aspecto de filtro de belleza de la piel excesivamente suavizada, tiene la misma causa raíz: la microtextura, al igual que la identidad, no se valora en ninguno de los objetivos del flujo de trabajo. Por lo tanto, combinamos AIA con la restauración de textura referenciada a la realidad: regranado coincidente de las regiones no faciales de cada fotograma real, transferencia de banda dividida de la microtextura de subidentidad del metraje real y un segundo canal de aceptación espectral referenciado por el propio espectro del metraje. La densidad del anclaje de identidad, argumentamos, es un control de calidad controlable, y especificamos experimentos refutables (curvas de deriva versus brecha, colocación uniforme versus adaptativa en presupuestos coincidentes, entrenamiento de estudiantes en datos generados por AIA y ablaciones de textura con un estudio de filtro de belleza humano) que validarían o refutarían la propuesta.

Punto de partida

El intercambio de rostros en vídeo carece de una referencia natural: la identidad objetivo nunca protagonizó el vídeo original. La supervisión sintética actual solo puede fijar los fotogramas límite, dejando intervalos largos, movimiento de perfil y oclusión sin evidencia directa de la apariencia, lo que permite que la identidad o la textura de la piel varíen.

Método

El anclaje de identidad adaptativo generaliza un sintetizador de vídeo de difusión forzada a fotogramas condicionados arbitrarios. Un bucle cerrado evalúa cada fotograma generado comparándolo con la identidad objetivo real, inserta un ancla con la imagen intercambiada en el peor fotograma y repite el proceso hasta alcanzar un umbral o presupuesto de anclas. La restauración de texturas con referencia a la realidad transfiere por separado la microtextura y el grano que no corresponden a la identidad a partir de imágenes reales y añade una prueba de aceptación espectral para reducir el suavizado excesivo de la piel.

Conclusión del artículo

AIA resulta útil como lista de verificación de diseño para equipos que generan datos de vídeo sintéticos emparejados: monitorizar la identidad de cada fotograma, asignar anclas donde la deriva sea mayor, rechazar clips no convergentes y evaluar la textura por separado. Su valor reside actualmente en su metodología; aún se requieren pruebas de implementación y comparativas antes de elegirlo en lugar de un flujo de trabajo existente.

Artículo 022026-07-09cs.CV

Intercambio de rostros, conservación de funcionalidades: una solución de doble propósito para la privacidad de los peatones en los sistemas de transporte inteligentes.

Autores e instituciones

Roba H. Farouk

C-DRiVeS Lab: Cognitive Driving Research in Vehicular Systems, Cairo, Egypt

Computer Science and Engineering Department, Faculty of Media Engineering and Technology, German University in Cairo, Egypt

Catherine M. Elias

C-DRiVeS Lab: Cognitive Driving Research in Vehicular Systems, Cairo, Egypt

Computer Science and Engineering Department, Faculty of Media Engineering and Technology, German University in Cairo, Egypt

Qué problema resuelve

Este trabajo busca un método práctico de anonimización para el conjunto de datos Egy-DRiVeS que reemplace la identidad conservando la postura, la expresión, la mirada y una calidad de imagen suficiente para el entrenamiento posterior. Asimismo, analiza casos de fallo específicos de peatones distantes, ocluidos o velados, en lugar de depender únicamente de primeros planos de retratos.

Resultado clave

En imágenes de primer plano, Roop tiene una menor diferencia de blendshape (1,898 frente a 2,0478) y diferencia de puntos de referencia (0,00596 frente a 0,00710), mientras que Ghost-v2 produce una menor similitud de identidad (0,1393 frente a 0,1997), lo que indica una mayor ocultación según esa métrica. Ambos preservan bien la mirada con una similitud de coseno de aproximadamente 0,94. Roop gana en tres de las cuatro métricas cuantitativas y es más robusto en rostros callejeros de baja calidad u ocluidos, mientras que Ghost-v2 puede reemplazar incorrectamente los velos con cabello de origen.

Resumen

Se necesitan conjuntos de datos amplios y diversos para entrenar modelos de IA que tomen decisiones en tiempo real para vehículos autónomos (VA), una aplicación de sistemas de transporte inteligentes (STI). La predicción de la intención y la trayectoria de los peatones son modelos críticos utilizados en los VA, que requieren conjuntos de datos con diversas imágenes de peatones. El acceso sin restricciones a estos conjuntos de datos impone graves riesgos de seguridad, como el robo de identidad y el seguimiento de peatones. El desafío consiste en aplicar procedimientos de preservación de la privacidad manteniendo los atributos de imagen necesarios para entrenar los modelos. Los métodos de privacidad existentes pueden preservar la privacidad del peatón, pero degradan la usabilidad de la imagen, lo que dificulta la eficacia de los modelos. Este trabajo se centra en implementar un proceso de cinco etapas para proteger la privacidad de los peatones mediante el intercambio de rostros, manteniendo intactos los atributos faciales esenciales. Debe adaptarse para satisfacer las necesidades de privacidad del conjunto de datos Egy-DRiVeS. Además, se evalúan los modelos de intercambio de rostros Roop y Ghost-v2. Se ha demostrado que Roop supera a Ghost-v2 en varios aspectos, como se analizará más adelante. En consecuencia, Roop es el modelo de intercambio de rostros que se utilizará en el proceso para lograr el equilibrio entre la privacidad de los peatones mediante la ocultación de la identidad y la usabilidad de los datos mediante la preservación de los atributos faciales.

Punto de partida

Los conjuntos de datos urbanos requieren información sobre rostros y comportamiento corporal para los modelos de intención o trayectoria de los peatones; sin embargo, las imágenes sin restricciones permiten la identificación y el seguimiento. El desenfoque protege la identidad a costa de la mirada, la expresión y otras señales que podrían ser necesarias para futuras investigaciones sobre conducción autónoma.

Método

Un proceso de cinco etapas detecta peatones con YOLOv11, localiza rostros con SCRFD, mejora opcionalmente recortes de baja resolución con CodeFormer, intercambia identidades y fusiona el resultado con la imagen de la calle. Roop y Ghost-v2 se comparan visualmente y mediante la diferencia de blendshape, la diferencia de puntos de referencia, la similitud de identidad original frente a la intercambiada y la similitud del vector de mirada.

Conclusión del artículo

El intercambio de rostros puede preservar mejor la utilidad conductual que el desenfoque, pero la privacidad y la utilidad varían según las métricas. Para una implementación, se deben seleccionar cuidadosamente las identidades de origen, probar casos extremos demográficos y de vestimenta, y medir si los modelos de peatones posteriores siguen funcionando; este artículo aún no proporciona esa evaluación de utilidad o reidentificación posterior.

Artículo 032026-07-02cs.CV

Generación de diálogos conversacionales audiovisuales humanos

Autores e instituciones

Junhao Song

Department of Computing, Imperial College London, United Kingdom

Lluis Guasch

Department of Earth Science and Engineering, Imperial College London, United Kingdom

Xilin He

Mohamed bin Zayed University of Artificial Intelligence, United Arab Emirates

Zhongyu Yang

Department of Computer Science, Heriot-Watt University, United Kingdom

Yingfang Yuan

School of Computer Science, Northumbria University, United Kingdom

Weicheng Xie

College of Computer Science and Software Engineering, Shenzhen University, China

Linlin Shen

School of Artificial Intelligence, Shenzhen University, China

Guangdong Provincial Key Laboratory of Intelligent Information Processing, Shenzhen University, China

Haijun Lin

School of Engineering and Design, Hunan Normal University, China

Shizhe Liu

Department of Computer Science, University of Oxford, United Kingdom

Wei Pang

Department of Computer Science, Heriot-Watt University, United Kingdom

Siyang Song

Department of Computer Science, University of Exeter, United Kingdom

Qué problema resuelve

CHAT define la generación de diálogos audiovisuales interactivos diádicos como una tarea unificada: crear dos clips con identidad coherente, que respondan verbal y no verbalmente, a partir de una indicación de texto, sin necesidad de audio ni vídeo pregrabados. También evalúa si los datos generados pueden preentrenar modelos de generación de reacciones independientes.

Resultado clave

CHAT registra el mejor FID (17,33), confianza de sincronización labial (6,89), correlación de reacción (50,02 x 1e-2) y similitud de identidad (0,85) entre los sistemas comparados, mientras que ocupa el segundo lugar en FVD y LPIPS. Los usuarios lo califican con 4,6/5 en calidad visual y sincronización, y 4,8/5 en audio e interactividad. El preentrenamiento de CHAT-AVD-50k aumenta la correlación de reacción PerFRDiff de 37,21 a 40,11 y ReactDiff de 24,19 a 26,12 en REACT 2024.

Resumen

Los conjuntos de datos de diálogo audiovisual interactivo diádico (DIAD) a gran escala proporcionan recursos fundamentales para el desarrollo de agentes virtuales interactivos humanoides y humanos digitales. Sin embargo, la recopilación de estos datos es laboriosa, costosa y plantea dilemas éticos. Para abordar este problema, proponemos CHAT, un nuevo marco de generación de diálogo audiovisual interactivo diádico (DIADG) que genera clips de diálogo de voz y rostro diversos, emparejados y con respuesta mutua a partir de una única indicación textual. CHAT unifica grandes modelos de lenguaje y modelos de rostros parlantes con módulos interactivos de audio y refinamiento del comportamiento facial, lo que permite la generación de clips de diálogo diádico alineados con diversos contenidos e identidades faciales. Los experimentos demuestran que CHAT supera a los métodos relacionados existentes diseñados para tareas similares, tanto en evaluaciones objetivas como subjetivas. Además, nuestro conjunto de datos sintetizado CHAT-AVD-50k sirve como datos de preentrenamiento eficaces para la generación posterior de cabezas interactivas, mejorando consistentemente PerFRDiff y ReactDiff en REACT 2024. CHAT ofrece una alternativa escalable a la costosa y éticamente delicada recopilación de datos reales de interacción diádica.

Punto de partida

El entrenamiento de humanos digitales interactivos requiere la interacción mediante habla, expresiones faciales, reacciones auditivas y la alternancia de turnos entre dos personas. Grabar conjuntos de datos diádicos amplios y diversos es costoso y plantea dilemas éticos, mientras que la mayoría de los sistemas de cabezas parlantes animan a un hablante de forma aislada y no modelan cómo responde el otro rostro.

Método

El marco combina modelos de lenguaje para la planificación de diálogos y audio con síntesis de rostros parlantes, generación de comportamiento de silencio, refinamiento de reacciones y consistencia temporal. Produce el conjunto de datos CHAT-AVD-50k de 50 000 muestras. La evaluación abarca 1000 conversaciones generadas con FID/FVD, sincronización labial, correlación y diversidad de reacciones, similitud de identidad ArcFace, LPIPS, un estudio con 60 personas y preentrenamiento posterior para PerFRDiff y ReactDiff.

Conclusión del artículo

CHAT es relevante para datos escalables de humanos digitales y síntesis de interacciones emparejadas, no para el intercambio convencional de una sola cara. Sus métricas admiten calidad visual, de identidad y de reacción, pero la sincronización a nivel de diálogo y la adecuación semántica siguen siendo aspectos abiertos, y la prueba posterior no es completamente independiente porque un componente de CHAT fue preentrenado en REACT 2024.