← Retour au Blog
Radar de rechercheÉchange de visagesVisages parlantsarXivJuillet 2026

Radar arXiv mensuel

Juillet 2026 Articles sur l'échange de visages : Ancrages identitaires, vie privée des piétons et visages parlants réactifs

Les travaux de juillet sur la synthèse faciale portent sur trois applications distinctes du transfert d'identité. Un article propose un placement adaptatif des points d'ancrage pour maintenir la stabilité d'une identité échangée sur de longues vidéos ; un autre utilise l'échange comme méthode de dé-identification tout en préservant les indices comportementaux ; et un troisième étend le concept au-delà d'une simple tête parlante pour aboutir à des conversations synthétiques interactives.

Ce que révèle ce mois-ci

L'ancrage adaptatif d'identité considère le placement des images clés comme un problème de rétroaction et se distingue par la mise en place de tests falsifiables, bien que les résultats de ces expériences ne soient pas encore publiés. Le pipeline de protection de la vie privée des piétons propose une étude empirique plus restreinte des avantages et des limites du transfert complet de la tête, notamment en cas d'occlusion ou de voile. CHAT illustre l'ampleur et la complexité de la génération de deux identités réactives avec la parole, les réactions de l'interlocuteur et la structure des tours de parole, tout en reconnaissant que son évaluation ne mesure pas encore la sémantique au niveau du dialogue. Ces trois articles démontrent ensemble pourquoi la similarité d'identité à elle seule ne constitue pas un critère de qualité adéquat pour la synthèse faciale.

Article 012026-07-23cs.CV

Ancrage adaptatif de l'identité : placement en boucle fermée d'images clés pour la supervision synthétique par paires dans l'échange de visages vidéo

Auteurs & institutions

Logan Robbins

Independent researcher

Problème traité

Cet article se concentre sur l'infrastructure de données sous-jacente à un modèle d'échange plutôt que sur l'ajout d'une nouvelle architecture étudiante. Il s'interroge sur le nombre d'ancres d'identité nécessaires à une paire synthétique, leur emplacement optimal et la manière dont les séquences ne pouvant maintenir leur identité doivent être filtrées avant d'être utilisées comme supervision.

Résultat clé

Il s'agit d'une proposition de recherche, et non d'un résultat empirique définitif. Elle spécifie des courbes de dérive par rapport à l'écart d'ancrage, un placement uniforme par rapport à un placement adaptatif à budget égal, une formation ultérieure des étudiants, des ablations de texture et une étude sur un filtre de beauté humain comme tests falsifiables, mais ne rapporte à ce jour aucun gain mesuré en termes d'identité, de temps, de spectre ou d'études auprès des utilisateurs.

Résumé

L'échange de visages dans les vidéos ne bénéficie d'aucune supervision par paires naturelle : il n'existe aucune vidéo réelle du visage d'une personne interprétant la vidéo d'une autre. La solution la plus performante actuellement disponible, SyncID-Pipe de DreamID-V, crée des paires en remplaçant l'identité dans exactement deux images d'un clip réel (la première et la dernière) et en régénérant le reste à partir d'une simple séquence de poses. La pose ne fournissant aucune indication visuelle de l'identité insérée, l'identité synthétisée présente une large marge de dérive lors de longs clips, d'occlusions et de variations extrêmes de pose. Aucune étude publiée n'examine le nombre ou l'emplacement des ancres. Nous proposons l'Ancrage d'Identité Adaptatif (AIA) : (i) généraliser le synthétiseur à des ensembles d'ancres arbitraires, une approche architecturale naturelle pour les transformateurs de type diffusion-forcing où le conditionnement sur une image consiste à limiter ses jetons à un bruit nul ; (ii) Placer des ancres grâce à une boucle de rétroaction fermée qui évalue chaque image générée par rapport à l'identité de référence réelle et insère une ancre avec un visage inversé sur l'image ayant le score le plus faible, jusqu'à ce que la paire atteigne un seuil ou que le budget soit épuisé ; (iii) Réutiliser le résultat de la boucle comme filtre de données automatique. Une seconde pathologie, l'aspect « filtre beauté » d'une peau excessivement lissée, a la même cause : la micro-texture, comme l'identité, n'est prise en compte par aucun des objectifs du pipeline. Nous associons donc l'AIA à la restauration de texture référencée à la réalité : un regranulage adapté aux régions non faciales de chaque image réelle, un transfert par séparation de bandes de la micro-texture sous-identité à partir du métrage réel et un second canal d'acceptation spectrale référencé par le spectre propre du métrage. Nous soutenons que la densité d'ancrage d'identité est un paramètre de qualité contrôlable, et nous spécifions des expériences falsifiables — courbes de dérive par rapport à l'écart, placement uniforme par rapport au placement adaptatif à budgets équivalents, formation des étudiants sur des données créées par l'AIA et ablations de texture avec une étude de filtre de beauté humain — qui permettraient de valider ou de réfuter la proposition.

Point de départ de la recherche

L'échange de visages dans les vidéos manque de données de référence naturelles : la personne ciblée n'a jamais participé à la vidéo source. La supervision synthétique actuelle ne peut ancrer que les images de transition, laissant de longs intervalles, les mouvements de profil et les occlusions sans preuve d'apparence directe et permettant ainsi à l'identité ou à la texture de la peau de varier.

Méthode

L'ancrage d'identité adaptatif généralise un synthétiseur vidéo à diffusion forcée à des images conditionnées arbitraires. Une boucle fermée évalue chaque image générée par rapport à l'identité cible réelle, insère une ancre inversée sur l'image la plus défavorable et répète l'opération jusqu'à ce qu'un seuil ou un budget d'ancres soit atteint. La restauration de texture référencée à la réalité transfère séparément les microtextures et le grain non liés à l'identité à partir de séquences réelles et ajoute un test d'acceptation spectrale pour réduire le lissage excessif de la peau.

À retenir

L'AIA constitue une liste de contrôle utile pour les équipes de conception de données vidéo synthétiques appariées : elle permet de contrôler l'identité de chaque image, d'optimiser l'utilisation des ancres là où la dérive est la plus importante, de rejeter les clips non convergents et d'évaluer la texture séparément. Son intérêt réside actuellement dans sa méthodologie ; des preuves de sa mise en œuvre et des tests de performance sont encore nécessaires avant de la privilégier par rapport à un pipeline existant.

Article 022026-07-09cs.CV

Échange de visages, préservation des fonctionnalités : un pipeline à double usage pour la protection de la vie privée des piétons dans les STI

Auteurs & institutions

Roba H. Farouk

C-DRiVeS Lab: Cognitive Driving Research in Vehicular Systems, Cairo, Egypt

Computer Science and Engineering Department, Faculty of Media Engineering and Technology, German University in Cairo, Egypt

Catherine M. Elias

C-DRiVeS Lab: Cognitive Driving Research in Vehicular Systems, Cairo, Egypt

Computer Science and Engineering Department, Faculty of Media Engineering and Technology, German University in Cairo, Egypt

Problème traité

Ce travail vise à développer une méthode pratique d'anonymisation pour le jeu de données Egy-DRiVeS, permettant de remplacer l'identité tout en préservant la pose, l'expression, le regard et une qualité d'image suffisante pour l'entraînement ultérieur. Il examine également les cas d'échec spécifiques aux piétons éloignés, partiellement masqués ou voilés, au lieu de se baser uniquement sur des gros plans de portraits.

Résultat clé

Sur les images en gros plan, Roop présente une différence de blendshape plus faible (1,898 contre 2,0478) et une différence de points de repère plus faible (0,00596 contre 0,00710), tandis que Ghost-v2 affiche une similarité d'identité plus faible (0,1393 contre 0,1997), ce qui indique une meilleure dissimulation selon ce critère. Les deux logiciels préservent bien le regard, avec une similarité cosinus d'environ 0,94. Roop surpasse trois des quatre critères quantitatifs et se montre plus performant sur les visages de rue de faible qualité ou partiellement masqués, tandis que Ghost-v2 peut confondre incorrectement les voiles avec les cheveux.

Résumé

Des ensembles de données vastes et diversifiés sont nécessaires pour entraîner les modèles d'IA à prendre des décisions en temps réel pour les véhicules autonomes (VA), une application des systèmes de transport intelligents (STI). La prédiction des intentions et des trajectoires des piétons est essentielle pour les VA et requiert des ensembles de données comprenant diverses images de piétons. L'accès libre à ces données présente des risques de sécurité importants, tels que l'usurpation d'identité et le suivi des piétons. Le défi consiste à appliquer des procédures de protection de la vie privée tout en préservant les attributs d'image nécessaires à l'entraînement des modèles. Les méthodes de protection de la vie privée existantes peuvent préserver l'anonymat des piétons, mais dégradent la qualité des images, ce qui nuit à l'efficacité des modèles. Ce travail vise à implémenter un pipeline en cinq étapes pour protéger la vie privée des piétons grâce à l'échange de visages, tout en conservant les attributs faciaux essentiels. Ce pipeline doit être adapté aux exigences de confidentialité de l'ensemble de données Egy-DRiVeS. De plus, les modèles d'échange de visages Roop et Ghost-v2 sont évalués. Il est démontré que Roop surpasse Ghost-v2 sur plusieurs points, comme nous le verrons. Par conséquent, Roop est le modèle de remplacement facial qui sera utilisé dans le processus afin de trouver un équilibre entre la protection de la vie privée des piétons grâce à la dissimulation de leur identité et l'utilisabilité des données grâce à la préservation des attributs faciaux.

Point de départ de la recherche

Les données routières nécessitent la prise en compte des visages et du comportement corporel pour l'élaboration de modèles d'intention ou de trajectoire des piétons ; or, des images non censurées permettent l'identification et le suivi. Le floutage protège l'identité au détriment du regard, de l'expression et d'autres indices qui pourraient s'avérer nécessaires pour les recherches ultérieures sur la conduite autonome.

Méthode

Un pipeline en cinq étapes détecte les piétons avec YOLOv11, localise les visages avec SCRFD, améliore éventuellement les recadrages basse résolution avec CodeFormer, inverse les identités et réintègre le résultat à l'image de la rue. Roop et Ghost-v2 sont comparés visuellement et selon les critères suivants : différence de blendshape, différence de points de repère, similarité entre l'identité originale et l'identité inversée, et similarité des vecteurs de regard.

À retenir

L'échange de visages préserve davantage l'utilité comportementale que le floutage, mais confidentialité et utilité évoluent différemment selon les critères. Lors du déploiement, il convient de choisir soigneusement les identités sources, de tester les cas limites liés aux caractéristiques démographiques et vestimentaires, et de vérifier si les modèles piétonniers en aval restent performants ; cet article ne fournit pas encore d'évaluation de l'utilité en aval ni de la réidentification.

Article 032026-07-02cs.CV

Génération de dialogues conversationnels audio-visuels humains

Auteurs & institutions

Junhao Song

Department of Computing, Imperial College London, United Kingdom

Lluis Guasch

Department of Earth Science and Engineering, Imperial College London, United Kingdom

Xilin He

Mohamed bin Zayed University of Artificial Intelligence, United Arab Emirates

Zhongyu Yang

Department of Computer Science, Heriot-Watt University, United Kingdom

Yingfang Yuan

School of Computer Science, Northumbria University, United Kingdom

Weicheng Xie

College of Computer Science and Software Engineering, Shenzhen University, China

Linlin Shen

School of Artificial Intelligence, Shenzhen University, China

Guangdong Provincial Key Laboratory of Intelligent Information Processing, Shenzhen University, China

Haijun Lin

School of Engineering and Design, Hunan Normal University, China

Shizhe Liu

Department of Computer Science, University of Oxford, United Kingdom

Wei Pang

Department of Computer Science, Heriot-Watt University, United Kingdom

Siyang Song

Department of Computer Science, University of Exeter, United Kingdom

Problème traité

CHAT définit la génération de dialogues interactifs audio-visuels dyadiques comme une tâche unifiée : créer deux clips vidéo cohérents en termes d’identité, avec des réponses verbales et non verbales, à partir d’une invite textuelle, sans nécessiter d’enregistrement vidéo ou audio préalable. L’étude teste également si les données générées permettent de pré-entraîner des modèles de génération de réactions distincts.

Résultat clé

Parmi les systèmes comparés, CHAT obtient les meilleurs scores FID (17,33), de confiance en synchronisation labiale (6,89), de corrélation de réaction (50,02 x 10⁻²) et de similarité d'identité (0,85), tout en se classant deuxième pour FVD et LPIPS. Les utilisateurs lui attribuent une note de 4,6/5 pour la qualité visuelle et la synchronisation, et de 4,8/5 pour l'audio et l'interactivité. Le pré-entraînement CHAT-AVD-50k améliore la corrélation de réaction PerFRDiff de 37,21 à 40,11 et ReactDiff de 24,19 à 26,12 sur REACT 2024.

Résumé

Les ensembles de données à grande échelle de dialogues audio-visuels interactifs dyadiques (DIAD) constituent des ressources fondamentales pour le développement d'agents virtuels humanoïdes interactifs et d'humains numériques. Cependant, la collecte de telles données est longue, coûteuse et soulève des questions éthiques. Pour pallier ces difficultés, nous proposons CHAT, un nouveau cadre de génération de dialogues audio-visuels interactifs dyadiques (DIADG) qui génère des clips de dialogue parole-visage diversifiés, appariés et interactifs à partir d'une simple invite textuelle. CHAT unifie de grands modèles de langage et de visages parlants avec des modules d'amélioration de l'audio interactif et du comportement facial, permettant ainsi la génération de clips de dialogue dyadiques alignés, aux contenus et identités faciales variés. Les expériences montrent que CHAT surpasse les méthodes existantes conçues pour des tâches similaires, tant sur le plan objectif que subjectif. De plus, notre ensemble de données synthétisé CHAT-AVD-50k sert de données de pré-entraînement efficaces pour la génération de têtes interactives, améliorant constamment les scores PerFRDiff et ReactDiff sur REACT 2024. CHAT offre une alternative évolutive à la collecte coûteuse et éthique de données réelles d'interaction dyadique.

Point de départ de la recherche

L'entraînement d'humains numériques interactifs nécessite la prise de parole en binôme, la visualisation des expressions faciales, des réactions d'écoute et l'alternance des tours de parole entre deux personnes. L'enregistrement de vastes ensembles de données dyadiques diversifiées est coûteux et soulève des questions éthiques, tandis que la plupart des systèmes de têtes parlantes animent un seul locuteur indépendamment et ne modélisent pas les réactions de l'autre visage.

Méthode

Ce cadre combine des modèles de langage pour la planification des dialogues et de l'audio avec la synthèse faciale, la génération de silences, l'amélioration des réactions et la cohérence temporelle. Il produit le jeu de données CHAT-AVD-50k, composé de 50 000 échantillons. L'évaluation porte sur 1 000 conversations générées avec FID/FVD, la synchronisation labiale, la corrélation et la diversité des réactions, la similarité d'identité ArcFace, LPIPS, une étude menée auprès de 60 participants, ainsi que le pré-entraînement en aval pour PerFRDiff et ReactDiff.

À retenir

CHAT est pertinent pour les données numériques humaines à grande échelle et la synthèse d'interactions par paires, et non pour le simple remplacement d'un visage. Ses métriques évaluent la qualité visuelle, l'identité et la réactivité, mais la pertinence temporelle et sémantique du dialogue restent à déterminer, et le test en aval n'est pas totalement indépendant car un composant de CHAT a été pré-entraîné sur REACT 2024.