← Retour au Blog
Radar de rechercheÉchange de visagesÉdition visuellearXivSeptembre 2026

Radar arXiv mensuel

Articles sur l'échange de visages de septembre 2026 : Harmonisation de l'éclairage, Attention aux références et Doublage en temps réel

Septembre propose une méthode directe de composition de visages et deux systèmes adjacents de modification d'identité. Le pipeline d'harmonisation des ombres limite délibérément ce qu'il peut changer afin qu'une mauvaise estimation ne puisse pas recolorer ou éclaircir un visage approuvé. RefGAP gère l'attention aux références à travers sept éditeurs de diffusion et la corrige au moment de l'inférence. TBDub adapte un modèle de doublage visuel aux séquences de production, puis distille trente étapes de débruitage en deux tout en mesurant l'identité, la synchronisation labiale, la qualité visuelle et le débit de bout en bout.

Ce que révèle ce mois-ci

L’harmonisateur géométrique applique uniquement un champ d’assombrissement borné et uniforme au canal ; sur son proxy analytique, 56,5 % des pixels faciaux changent, le gain moyen est de 0,938, et aucun pixel n’est éclairci, bien que l’article ne revendique pas de victoire perceptuelle en image réelle. RefGAP calibre deux coefficients une fois, puis améliore la similarité d’identité sur sept monteurs image/vidéo sur 1 040 clips de changement de tête et 1 000 paires d’échange de visages ; le succès du remplacement atteint au moins 86 % et 82 %, avec des compromis mesurables entre pose et préservation. L’élève en deux étapes de TBDub atteint 7,13 FPS à 512 par 512 sur un H20, soit une accélération de 13,93 fois de bout en bout par rapport à son enseignant, tandis que les évaluations humaines conservent la qualité d’identité de l’enseignant et améliorent légèrement la synchronisation labiale et la qualité visuelle. Pour les acheteurs, la distinction importante réside dans le risque : les bornes déterministes, les contrôles en temps d’inférence et la génération distillée ont des modes de défaillance et des besoins de validation différents.

Article 012026-09-15cs.CV

Harmonisation géométrique des ombres pour les visages composites : un pipeline de rééclairage multiplicatif préservant l’albédo

Auteurs & institutions

Vijesh KP

Independent researcher (no institutional affiliation stated in the paper)

Problème traité

L’article cible le cas restreint où la couleur et l’identité du donneur sont acceptables mais où il manque des ombres de forme. Il demande comment injecter des ombres de nez, d’alvéole, de lèvres et de cavités à partir d’une géométrie du visage approximative, sans éclaircir les pixels, modifier la chromaticité ou synthétiser un nouveau visage.

Résultat clé

Sur le champ de hauteur analytique du visage avec une lumière connue, le réglage par défaut modifie 56,5 % des pixels de face, donne un gain moyen de 0,938 global et 0,890 sur des pixels modifiés, et envoie 3,4 % des pixels au sol de 0,82. Il garantit zéro pixel éclairci et aucun décalage mathématique de l’angle de teinte au-delà du bruit en virgule flottante. Ces chiffres caractérisent l’opérateur borné plutôt que la qualité perceptuelle : l’article ne fournit aucun benchmark réel composite apparié ni comparaison de base. Il ne peut pas ajouter de surlignes, corriger un donneur déjà sombre, supprimer la lumière source opposée, ni éviter l’ombrage résiduel du donneur à double ombre.

Résumé

Les pipelines d’échange de visages et de composition de visages produisent régulièrement un visage géométriquement bien aligné mais photométriquement peu plausible : le visage donneur porte une lumière plate et proche du frontal tandis que le corps hôte et l’arrière-plan transportent la lumière directionnelle de la scène. La plupart des remèdes existants resynthétisent le visage par transfert de couleur, relighting neuronal ou rendu inverse, risquant ainsi de modifier l’identité, le ton de peau et la texture. Nous présentons une alternative conservatrice : l’injection d’ombre de forme géométrique. Le pipeline ne repeint jamais le visage. Il estime un champ de gain par pixel $g\in[g_{\min},1]$ d’un proxy facial 3D rasterisé et le multiplie uniformément sur RGB linéaire, de sorte que l’opérateur ne peut que s’assombrir et ne peut pas déplacer la chromaticité. Un maillage dense de repère est rastérisé en un tampon de profondeur, d’où l’on dérive des normales de surface, un terme cavité et des ombres projetées en espace écran. La direction de la lumière principale est estimée à partir des indices côté hôte (corps, arrière-plan, halo capillaire) ; les indices sur le visage sont réduits car ils récupèrent l’éclairage du donneur. La magnitude de l’ombre n’est pas adaptée à l’hôte : elle est fixée par un transfert à trois paramètres $(τ,σ,g_{\min})$. Le champ d’ombrage est divisé par son 75e percentile sur la peau, puis grillé, échelle, clampé, lissé et re-cliqué à l’intérieur d’un masque facial à plumes et à contrôle de peau. Sur un champ de hauteur facial analytique, le taux par défaut $(τ,σ,g_{\min})=(0,90,45,82)$ modifie 56,5 % des pixels faciaux avec un gain moyen de 0,938 (0,890 sur les pixels modifiés) et pousse 3,4 % des pixels vers le plancher. L’invariance de teinte est un corollaire de l’opérateur. Nous analysons le transfert sous forme fermée, ablâchons ses paramètres et discutons des modes de défaillance d’une formulation monotone à foncement uniquement, incluant le double-shadowing des donneurs non plats.

Point de départ de la recherche

Un visage échangé peut être aligné géométriquement et identité, tout en restant collé car le donneur porte une lumière plate de studio tandis que la scène hôte a une clé directionnelle. La réillumination générative peut réparer davantage d’effets, mais elle peut aussi modifier le teint de peau, les pores, la texture ou l’identité après que le visage ait déjà été approuvé. Les équipes de production ont parfois besoin d’un opérateur délibérément limité dont le pire changement photométrique est connu.

Méthode

Un détecteur de visages et un maillage à 468 points produisent un tampon de profondeur rastérisé, des normales de surface, un proxy de cavité et un espace d’écran projettent des ombres dans un recadrage de 512 pixels. Les indices côté hôte du corps, de l’arrière-plan, du cou et du halo de cheveux votent pour la direction de la lumière principale tandis que les indices du visage donneur sont réduits. La carte d’ombrage normalisée passe par un seuil de trois paramètres, un transfert de force et de gain minimum, puis un lissage guidé et un masque de peau en plume. Le même gain scalaire est multiplié en tous les canaux RVB linéaires et découpé dans une plage de 0,82 à 1,0.

À retenir

C’est un contrôle post-compositing conservateur avec une limite de dégâts compréhensible, et non un système complet de réillumination. Il est attrayant lorsque la préservation de l’identité prime sur le réalisme dramatique, à condition que les plans réels soient examinés pour détecter une mauvaise direction de la lumière et des doubles ombres.

Article 022026-09-28cs.CV

Mind the RefGAP : correction de l’attention portée à la référence dans l’édition visuelle fondée sur la diffusion

Auteurs & institutions

Yanan Wang

Mohamed bin Zayed University of Artificial Intelligence

Institute of Foundation Models

Shengcai Liao

United Arab Emirates University

Guangyi Liu

Mohamed bin Zayed University of Artificial Intelligence

Institute of Foundation Models

Xiaodan Liang

Mohamed bin Zayed University of Artificial Intelligence

Problème traité

RefGAP vise à améliorer la fidélité de l'identité de référence à travers différents éditeurs d'images et de vidéos sans réentraînement et sans appliquer une force de correction séparée pour chaque modèle. Il équilibre explicitement une utilisation plus forte de la référence à l'intérieur du masque d'édition avec une suppression dans les régions qui doivent être conservées.

Résultat clé

Sur 1 040 clips HeadSwapBench, la similarité d'identité s'améliore pour les sept éditeurs généralistes et le succès du remplacement atteint au moins 86 % là où il est défini ; la similarité de tête entière augmente également pour les sept. Sur 1 000 paires d'échange de visages FaceForensics, la similarité d'identité s'améliore pour chaque éditeur, avec un remplacement et une récupération correcte d'au moins 82 % et 75 %. Appliqué au modèle spécialisé DirectSwap, la similarité d'identité passe de 0,7019 à 0,7450 tandis que le LPIPS sur l'ensemble de l'image reste pratiquement inchangé. Les gains s'accompagnent d'une erreur de points clés plus élevée pour plusieurs systèmes et d'une préservation non modifiée mixte ; le remplacement d'arrière-plan ne se transfère pas de manière fiable. L'implémentation de l'attention non fusionnée peut également ajouter une mémoire ou une latence importante, donc la qualité de l'intégration est importante.

Résumé

Les éditeurs de diffusion guidés par référence peinent à reproduire fidèlement les références fournies par les utilisateurs. Nous identifions un goulot d’étranglement potentiel dans les éditeurs de diffusion : de nombreuses méthodes offrent une allocation limitée de l’attention référence. Par exemple, dans LoomVideo, les requêtes par région d’édition attribuent moins de 1 % de leur masse d’attention à la référence. Nous introduisons RefGAP, une correction sans entraînement qui détermine en ligne les grandeurs logit-offset à chaque couche à partir de la masse d’attention de référence mesurée lors du passage avant. Les décalages positifs des logits de référence renforcent l’utilisation des références par les requêtes par région d’édition, tandis que les décalages négatifs pour les requêtes de région de maintien limitent les changements induits par la référence en dehors du montage. Deux coefficients globaux contrôlent la correction ; ils sont sélectionnés une fois sur des données de validation de quatre éditeurs de diffusion de développement et maintenus fixes. Sur sept éditeurs image/vidéo basés sur la diffusion, RefGAP améliore la fidélité d’identité dans l’échange de têtes et l’échange de faces. RefGAP atteint un compromis fidélité-préservation comparable aux biais constants du côté montage réglés séparément, sans balayages de force par approche. Des expériences supplémentaires sur l’essai virtuel et le remplacement de fond évaluent le transfert au-delà de l’édition identité.

Point de départ de la recherche

Les éditeurs de diffusion guidée par référence peuvent recevoir le visage source correct mais y accorder presque aucune attention ; les requêtes de région d'édition LoomVideo allouent moins de 1 % de la masse d'attention à la référence selon la mesure des auteurs. Les renforts d'attention fixes peuvent renforcer l'identité mais nécessitent un réglage par modèle et peuvent faire fuir l'apparence de la référence dans les cheveux, les vêtements, l'arrière-plan, la pose ou l'expression qui devraient rester inchangés.

Méthode

Lors de chaque couche d'attention, RefGAP mesure la part d'attention assignée aux jetons de référence séparément pour les requêtes d'édition et de maintien. Il déduit un décalage logit en ligne à partir de la masse observée : les décalages positifs renforcent les clés de référence dans la région d'édition, tandis que les décalages négatifs les contraignent dans la région à conserver. Deux coefficients globaux et une règle de sélection de couche sont calibrés une fois sur 40 clips de permutation de tête utilisant quatre éditeurs de développement, puis restent fixes à travers sept éditeurs, trois systèmes exclus, l'échange de visage, l'essai virtuel et le remplacement d'arrière-plan.

À retenir

Mesurer l'attention réelle portée à la référence est un signal de contrôle utile indépendant du modèle pour les modifications d'identité, mais un transfert d'identité plus fort peut altérer la géométrie et les régions conservées. Les équipes ont besoin d'une barrière de qualité spécifique à la tâche, et pas seulement de la similarité d'identité.

Article 032026-09-05cs.CV

TBDub : doublage visuel orienté production

Auteurs & institutions

Bihan Li

TaoLive AIGC, Taobao & Tmall Group, Alibaba

Xinyang Li

TaoLive AIGC, Taobao & Tmall Group, Alibaba

Zeran Xu

TaoLive AIGC, Taobao & Tmall Group, Alibaba

Meiguang Jin

TaoLive AIGC, Taobao & Tmall Group, Alibaba

Junfeng Ma

TaoLive AIGC, Taobao & Tmall Group, Alibaba

Problème traité

TBDub adapte une pile existante de doublage de diffusion vidéo aux séquences de production et demande si un élève en deux étapes peut conserver l’identité perçue de l’enseignant, sa synchronisation et sa qualité visuelle. Il évalue la reconstruction, la réponse audio, les évaluations humaines et le parcours complet de génération VAE-à-VAE plutôt que de citer uniquement la vitesse de dénoixeur.

Résultat clé

Sur 38 extraits TalkVid, l’enseignant améliore les huit métriques de reconstruction, perception, identité et synchronisation rapportées par rapport à X-Dub. Sur 114 évaluations par méthode, les valeurs de MOS de synchronisation, d’identité et de qualité visuelle de X-Dub de 3,57, 2,83 et 2,88 montent à 3,71, 3,78 et 3,78 pour l’enseignant. L’élève obtient 3,85, 3,72 et 3,80, gardant l’identité proche tout en menant la synchronisation labiale et la qualité visuelle. À 512 par 512 sur un H20, l’élève atteint 7,13 FPS effectifs contre 0,51 pour l’enseignant, soit une accélération de bout en bout de 13,93 fois ; l’étape DiT seule est 42,49 fois plus rapide. La référence est petite, exclut plusieurs étapes de prétraitement et d’encodage, et les entrées très basse résolution restent un cas d’échec.

Résumé

Le doublage visuel doit synchroniser le mouvement de la bouche avec la parole de remplacement tout en préservant l’identité, l’apparence et la cohérence temporelle. Bien que X-Dub offre une base solide pour le montage vidéo sans masque, son application au livestream et au contenu vidéo générée révèle des limites en robustesse du domaine de production, de stabilité temporelle et du mouvement, de préservation des détails oraux, et d’efficacité d’inférence. Nous présentons \textbf{TBDub}, une extension orientée production de X-Dub qui combine post-entraînement adaptatif à la tâche avec une distillation en quelques étapes consciente de la tâche. Le post-entraînement adapte le DiT vidéo en utilisant des données du domaine production, un conditionnement et filtrage spécifiques à la production, ainsi que des fonctionnalités audio améliorées pour obtenir un Enseignant en 30 étapes. La distillation adapte DMD/DMD2 au montage vidéo conditionnel et compresse l’Enseignant en un Élève en deux étapes. Sur 38 clips TalkVid, le Professeur améliore les huit métriques de reconstruction, perception, identité et synchronisation rapportées par rapport à X-Dub. Dans l’évaluation MOS, il améliore la cohérence de la synchronisation labiale, la cohérence de l’identité et la qualité visuelle par rapport à X-Dub de 0,14, 0,95 et 0,90 points, tandis que l’Élève obtient les meilleurs scores de synchronisation labiale et de qualité visuelle et reste proche de l’Enseignant en termes de cohérence d’identité. Lors du timing jumelé de génération de bout en bout depuis le premier encodage VAE jusqu’au décodage final VAE sur un seul GPU NVIDIA H20 à 512 $ / 512 $ multipliés par 512 $, l’Étudiant atteint 7,13 FPS effectifs et réduit la latence totale de 13,93 $ / fois $ ; l’étape DiT seule est accélérée de 42,49 $ $. L’Étudiant conserve en grande partie la qualité de génération et la synchronisation audiovisuelle du Professeur. Le code est disponible sur GitHub à \https://github.com/TaoLiveAIGC/TBDub, et les poids 30 étapes Teacher et Double Step Student sont disponibles sur Hugging Face à https://huggingface.co/TaoLiveAIGC/TBDub.

Point de départ de la recherche

Le doublage visuel doit modifier suffisamment le mouvement de la bouche pour exprimer la parole de remplacement tout en maintenant l’identité, les dents, la texture des lèvres, la pose, l’illumination, l’occlusion et chaque région non liée à la parole stables dans le temps. X-Dub propose un éditeur vidéo capable sans masque, mais les entrées en direct de production et vidéo générée exposent le décalage de domaine, le scintillement, la dérive des détails oraux et la latence de trente étapes de débruit.

Méthode

Le post-entraînement adaptatif à la tâche mélange les données du domaine de production avec la distribution d’entraînement héritée, renforce les fonctionnalités audio avec des couches HuBERT-large, dégrade les conditions de manière asymétrique, et utilise la perte de mouvement ainsi que l’appariement spatial et temporel pondéré des flux pour créer un enseignant en 30 étapes. Une procédure conditionnelle DMD/DMD2 distille cet enseignant en un élève différentiable en deux étapes, avec une formation dynamique à fake-score, une supervision régionale sélective en phases, une gestion causale en premier latent latenti, un échantillonnage à temps plein, une arithmétique de guidage FP32 et des poids EMA FP32.

À retenir

Le doublage visuel en deux étapes peut offrir un bien meilleur débit de qualité, mais les 7,13 FPS annoncés sont limités au cœur de la génération. La taille de la production doit inclure l’audio, le suivi des visages, le compositing, l’encodage et la stabilité sur la longue vidéo.