← Retour au Blog
Radar de rechercheÉchange de visagesVisage parlantarXivAoût 2026

Radar arXiv mensuel

Articles sur l’échange de visages d’août 2026 : portraits en temps réel, avatars d’une minute et contrôle émotionnel

L’échange de visages d’August et la recherche numérique-humain ne reposent pas tant sur un simple tour de transfert d’identité que sur une interaction soutenue et contrôlable. Les systèmes sélectionnés séparent le mouvement réutilisable de l’apparence, distillent un modèle audio-vidéo hors ligne en un streamer à l’échelle minuscule, et combinent la sémantique des émotions latentes avec une géométrie explicite de la forme du mélange.

Ce que révèle ce mois-ci

Proxy Avatar rencontre le cache low-rank atteint 32 FPS sur une RTX 4090 en séparant un interprète émotionnel réutilisable du reciblage d’identité en one-shot et de la mise en cache de l’apparence statique. Omni-LiveAvatar s’attaque à l’extrémité du data-center, utilisant la distillation autorégressive et la mémoire long-court bornée pour maintenir l’audio et la vidéo joints cohérents pendant une minute entière. GemTalk se concentre sur l’interface de contrôle, permettant à la géométrie explicite de la forme de blendshape d’étendre la puissance des fonctionnalités émotionnelles implicites. Ensemble, ils cartographient trois choix de produits différents : réutilisation personnalisée du mouvement, infrastructure de streaming continu et direction expressive fine.

Article 012026-08-03cs.CV

Avatar proxy rencontre le cache de bas rang : animation de portrait en temps réel contrôlable par émotion

Auteurs & institutions

Haijie Yang

Nanjing University of Science and Technology, China

Jindi Bao

Nanjing University of Science and Technology, China

Yixuan Dong

Tsientang Institute for Advanced Study, China

Hongliang Zhang

Nanjing University of Science and Technology, China

Jian Bi

Nanjing University of Science and Technology, China

Hao Tang

Peking University, China

Zhenyu Zhang

Nanjing University, China

Jianjun Qian

Nanjing University of Science and Technology, China

Jian Yang

Nanjing University of Science and Technology, China

Problème traité

Le papier sépare le mouvement émotionnel réutilisable, le reciblage croisé et le rendu d’apparence afin qu’un seul portrait de référence puisse être animé en temps réel à partir de l’audio et d’une étiquette émotionnelle. Il supprime spécifiquement le calcul répété des caractéristiques de référence sans réentraîner un cache pour chaque identité cible.

Résultat clé

Sur une RTX 4090, le système complet tourne à 32 FPS. En auto-reconstruction, il atteint 31,24 PSNR, 0,018 LPIPS, 0,883 SSIM et un score de synchronisation labiale de 6,314, menant le plus grand nombre de métriques de qualité et de mouvement malgré le taux d’images brut plus élevé d’EmoTag. En conduite croisée, il enregistre 29,64 FID, 0,745 similarité d’identité, 75,4 % de précision émotionnelle et 6,096 de synchronisation labiale. Les participants le préféraient pour son expressivité émotionnelle dans 70 % des comparaisons, la synchronisation labiale dans 60 % et le réalisme visuel dans 65 % ; les extraits étendus ne montraient aucune identité ou dérive évidente de synchronisation.

Résumé

L’animation de portraits pilotée par l’audio a progressé rapidement avec des modèles génératifs basés sur la diffusion, mais la génération one-shot en temps réel avec contrôle expressif des émotions reste un défi. Les méthodes existantes souffrent souvent d’un manque de priors de mouvement conscients des émotions et d’un calcul d’apparence coûteux lors du débruit en plusieurs étapes. Pour résoudre ces problèmes, nous proposons Proxy Avatar Meets Low-Rank Caching, un cadre en cascade pour une animation de portrait contrôlable en temps réel. Au lieu de générer directement le portrait cible à partir de l’audio, notre méthode utilise un avatar proxy émotionnel basé sur gaussienne comme générateur de mouvement réutilisable, entraîné une fois sur une identité unique pour produire des vidéos de conduite expressives à partir d’audio et d’étiquettes émotionnelles. Puisque l’avatar proxy ne fournit que le mouvement plutôt que l’apparence ou la géométrie de la cible, un modèle de reciblage à grande échelle extrait davantage le mouvement indépendant de l’identité de la performance du proxy et l’adapte à des portraits cibles arbitraires. Pour améliorer l’efficacité de l’inférence, nous introduisons la réutilisation de l’apparence zéro avec la mise en cache de bas rang, qui met en cache les caractéristiques d’apparence de référence à l’étape initiale de débruissement et modélise les variations suivantes à l’aide d’adaptateurs légers de bas rang. Des expériences approfondies démontrent que notre méthode permet d’obtenir une plus grande expressivité émotionnelle, une meilleure animation préservant l’identité et un coût d’inférence considérablement réduit, permettant une animation portrait en temps réel en un seul plan.

Point de départ de la recherche

Les portraits parlants en un seul plan doivent préserver l’apparence d’une personne invisible, suivre la parole, exprimer une émotion demandée et fonctionner de manière interactive sur le matériel disponible. Les systèmes de diffusion recalculent à plusieurs reprises des caractéristiques d’apparence presque statiques lors du débruit, tandis que les contrôles émotionnels entremêlent souvent identité et mouvement ou nécessitent une vidéo de référence pour chaque style. Le résultat est soit une génération expressive mais lente, soit une animation rapide avec une faible gamme émotionnelle.

Méthode

Un avatar proxy basé sur Gausss est entraîné une fois sur un interprète et sert uniquement de générateur de mouvement conditionné audio et émotionnel. Un réseau de reciblage one-shot à grande échelle extrait le mouvement indépendant de l’identité de cette vidéo proxy et l’applique à des portraits de cibles arbitraires. Lors de la diffusion en quelques étapes, la réutilisation de l’apparence zéro fait référence aux caches à la première étape, tandis que les adaptateurs légers de rang bas modélisent uniquement leur variation ultérieure. Cette division en cascade du travail est évaluée lors de l’auto-reconstruction, de la conduite à coup unique croisé, de la stabilité en longue vidéo, des ablations et d’une étude aveugle avec vingt participants.

À retenir

Le design proxy réutilisable plus reciblage rend les avatars émotionnels en temps réel pratiques sans entraînement à diffusion par utilisateur. Les 32 FPS annoncés sur une RTX 4090 grand public sont prometteurs, mais la taille du déploiement devrait inclure l’entraînement proxy unique et le compromis qualité/coût du modèle de reciblage à grande fin, pas seulement un taux d’images en état stable.

Article 022026-08-07cs.MM

Omni-LiveAvatar : Génération conjointe d’avatars audio-vidéo en streaming en temps réel au niveau de la minute

Auteurs & institutions

Lunjie Zhu

iComAI Lab, Hong Kong University of Science and Technology, Hong Kong

Vivix Group Limited, Hong Kong

Xingtong Ge

iComAI Lab, Hong Kong University of Science and Technology, Hong Kong

Vivix Group Limited, Hong Kong

Fangyu Lin

iComAI Lab, Hong Kong University of Science and Technology, Hong Kong

Vivix Group Limited, Hong Kong

Yi Zhang

Vivix Group Limited, Hong Kong

Zhening Liu

iComAI Lab, Hong Kong University of Science and Technology, Hong Kong

Mengfei Li

iComAI Lab, Hong Kong University of Science and Technology, Hong Kong

Vivix Group Limited, Hong Kong

Yumeng Zhang

iComAI Lab, Hong Kong University of Science and Technology, Hong Kong

Guanglu Song

Vivix Group Limited, Hong Kong

Yu Liu

Vivix Group Limited, Hong Kong

Jun Zhang

iComAI Lab, Hong Kong University of Science and Technology, Hong Kong

Problème traité

Omni-LiveAvatar transforme un grand professeur audio-vidéo hors ligne en générateur de streaming causal et répond aux problèmes de stabilité distincts liés au contexte long et aux consignes changeantes. Son objectif est la génération continue à l’échelle des minutes plutôt qu’une séquence de courts extraits générés indépendamment.

Résultat clé

Pour les clips de cinq secondes, le modèle génère à 19,57 FPS, soit environ 33 fois plus vite que son enseignant à 0,60 FPS, tout en affichant le score global de qualité le plus élevé parmi les systèmes testés (81,72) et des scores parfaits en identité humaine et fidélité vestimentaire. Sur la génération de soixante-deuxième, il atteint 21,99 FPS contre 16,18 pour la ligne de base suivante la plus rapide. Son score d’identité humaine au niveau de la minute est de 98,61 contre 67,60 et 50,19, Sync-C est de 6,76 contre 0,72 et 0,28, et l’alignement texte-vidéo est de 9,82 contre 6,68 et 5,46, avec une différence d’avatar et de fond visiblement réduite.

Résumé

Les modèles génératifs audio-vidéo conjoints servent de base à la génération numérique humaine immersive et interactive. Néanmoins, la plupart des modèles existants reposent sur une attention bidirectionnelle et un débruit en plusieurs étapes et ne peuvent générer que de courts extraits, ce qui les rend inadaptés à l’interaction en temps réel sur de longues durées. Nous présentons Omni-LiveAvatar, le premier cadre pour la génération conjointe d’avatars audio-vidéo en streaming au niveau minute et en temps réel. Plus précisément, nous proposons (1) un pipeline de distillation autorégressive progressive qui transfère un grand modèle bidirectionnel de diffusion audio-vidéo dans un générateur autorégressif en quelques étapes sans mécanismes auxiliaires de stabilisation ; (2) une mémoire audio-vidéo synchronisée à long terme qui préserve la cohérence globale sous un budget mémoire limité ; et (3) une stratégie hiérarchique de planification des prompts roulants permettant une évolution sémantique cohérente et des transitions fluides des invites. Des expériences approfondies montrent qu’Omni-LiveAvatar génère en temps réel des avatars synchronisés au niveau minute de haute qualité. En termes de vitesse, il atteint une accélération de génération de 33$\fois plus que son enseignant, LTX-2, sur un seul GPU NVIDIA H200 ; en termes de qualité de génération, il surpasse les lignes de base accélérées en qualité visuelle, audio, synchronisation intermodale et fidélité humaine. Notre code est disponible en https://github.com/Aoko955/Omni-LiveAvatar.

Point de départ de la recherche

Les générateurs audio-vidéo conjoints peuvent synthétiser des extraits courts convaincants, mais l’attention bidirectionnelle et la diffusion en plusieurs étapes empêchent toute interaction en direct, tandis que les variantes autorégressives accélérées dérivent en identité, en arrière-plan, en qualité audio ou en synchronisation labiale sur de longues sessions. Un humain numérique utile doit préserver les deux modalités pendant quelques minutes en mémoire limitée et accepter des prompts évolutifs sans transitions sémantiques ou acoustiques abruptes.

Méthode

Un pipeline de distillation auto-régressive progressive à trois étapes transfère LTX-2 dans un générateur causal en quatre étapes de réduction du bruit sans modèles de récompense externes ni stabilisation spécifique à chaque modalité. La mémoire audio-vidéo synchronisée à long terme, à court terme, combine un premier macro-bloc périodiquement réancré avec des caches clé-valeur roulantes, conservant l’identité globale et le contexte récent dans un budget fixe. La planification hiérarchique par prompt roulant sépare les instructions persistantes apparence/arrière-plan des actions locales au niveau du bloc, de sorte que les invites avancent avec la fenêtre roulante. L’évaluation couvre à la fois la sortie de cinq secondes et de soixante secondes à 512 par 768 sur un NVIDIA H200.

À retenir

L’article fait de la stabilité audio-vidéo à long horizon un problème système de première classe plutôt qu’une simple réflexion secondaire. C’est une architecture de référence solide pour les humains numériques en direct, mais la revendication en temps réel est mesurée sur un H200 à 512 par 768, donc les acheteurs devraient reproduire la latence, la mémoire et la concurrence sur leur propre matériel de service.

Article 032026-08-01cs.CV

Modulation émotionnelle guidée par géométrie pour une génération contrôlable et photoréaliste de visages émotionnels parlants

Auteurs & institutions

Chenggong Hu

School of Software Technology, Zhejiang University, Ningbo, China

Shaoyin Ma

School of Software Technology, Zhejiang University, Ningbo, China

Yi Wang

College of Computer Science and Technology, Zhejiang University, Hangzhou, China

Li Sun

Ningbo Global Innovation Center, Zhejiang University, Ningbo, China

Mingli Song

College of Computer Science and Technology, Zhejiang University, Hangzhou, China

Jie Song

School of Software Technology, Zhejiang University, Ningbo, China

Problème traité

GemTalk relie la sémantique émotionnelle dérivée de l’audio à la géométrie faciale consciente de l’identité et utilise cette géométrie pour contrôler la force des traits d’expression latents. Cela rend la catégorie et l’intensité émotionnelles en continu modifiables tout en conservant le photoréalisme et la synchronisation labiale.

Résultat clé

Sur le test émotionnel combiné MEAD-front et RAVDESS-speech, GemTalk atteint 334,937 FVD, 31,625 FID, 7,027 Sync-C, 8,283 Sync-D, 2,392 FID d’expression et 59,258 % de précision émotionnelle. Il améliore la précision émotionnelle de 3,33 points de pourcentage par rapport à la méthode suivante et réduit la FVD de 20,84. Sur HDTF neutre, il conserve une forte synchronisation et le meilleur FID d’expression rapporté de 1,386, tandis que les corrections de coefficients produisent des transitions émotionnelles douces de faible à forte sans perte d’identité évidente.

Résumé

La génération de visages émotionnels parlants pilotée par l’audio vise à synthétiser des vidéos réalistes avec des dynamiques faciales expressives. Cependant, les méthodes existantes peinent à équilibrer contrôlabilité et fidélité visuelle. Bien que les représentations implicites capturent une sémantique riche, elles manquent de guidage structurel, ce qui entraîne souvent une moyenne des expressions émotionnelles. En revanche, les méthodes géométriques explicites offrent un meilleur contrôle des expressions faciales mais ont tendance à sacrifier les détails de textures à haute fréquence. Pour y remédier, nous proposons GemTalk, un cadre basé sur la diffusion qui combine la richesse sémantique des représentations implicites avec la précision structurelle des priors géométriques. Nous introduisons un module de projection audio émotionnelle guidée par vision (V-AEP) pour extraire les traits émotionnels implicites des lèvres et expressions. Parallèlement, un générateur de priors géométriques basé sur la diffusion (D-GPG) génère des coefficients de blendshape conscients de l’identité comme priors structurels explicites. De manière cruciale, notre module de modulation émotionnelle guidée par la géométrie (GEM) exploite ces priors géométriques pour recalibrer l’ampleur des traits implicites, permettant un contrôle précis et continu des expressions émotionnelles, en particulier de l’intensité émotionnelle, sans sacrifier la qualité visuelle. Des expériences approfondies montrent que GemTalk atteint des performances supérieures en photoréalisme et en dynamique émotionnelle faciale.

Point de départ de la recherche

Les traits de diffusion implicites offrent une texture faciale riche mais tendent à moyenner les expressions émotionnelles et offrent un contrôle de l’intensité faible. Les repères explicites ou les blendshapes fournissent une structure interprétable, mais les systèmes guidés uniquement par la géométrie perdent souvent l’apparence haute fréquence et peuvent produire une bouche ou un visage supérieur qui entrait en conflit avec l’audio. L’animation émotionnelle nécessite à la fois richesse sémantique et mouvement physique contrôlable sans perdre l’expression déjà présente dans le portrait de référence.

Méthode

L’entraînement commence par une dorsale de synchronisation labiale indépendante de l’émotion sur des vidéos larges non émotionnelles. La projection émotionnelle audio guidée par vision apprend des espaces émotionnels séparés mais coordonnés des lèvres et du haut du visage en utilisant des représentations visuelles des émotions pour superviser les caractéristiques audio. Un générateur géométrique basé sur la diffusion prédit les coefficients de blendshape Apple ARKit conscients de l’identité. La modulation émotionnelle guidée par la géométrie préserve alors la direction latente des caractéristiques qui représente la catégorie émotionnelle tout en recalibrant sa magnitude à partir des blendshapes ; l’échantillonnage sensible au conflit fait référence à des images et à l’audio avec différentes émotions afin que le modèle ne puisse pas copier l’expression source.

À retenir

Combiner la sémantique émotionnelle latente avec la magnitude explicite de la forme de mélange offre une surface de contrôle utile pour les outils créatifs et les API numériques humains. GemTalk est le plus puissant lorsque l’intensité émotionnelle continue est importante, bien que les équipes doivent tester si ses étiquettes émotionnelles et ses hypothèses de coefficients ARKit couvrent leurs langues, styles de parole et rigs cibles.