← Zurück zum Blog
ForschungsradarGesichtstauschVisuelle BearbeitungarXivSeptember 2026

Monatlicher arXiv Radar

Face-Swapping-Studien im September 2026: Lichtanpassung, Referenzaufmerksamkeit und Echtzeit-Synchronisation

Der September bietet eine direkte Gesichtskompositionsmethode und zwei benachbarte Identity-Editing-Systeme. Die Schattenharmonisierungspipeline begrenzt bewusst, was sie ändern kann, sodass eine schlechte Schätzung ein genehmigtes Gesicht nicht umfärben oder aufhellen kann. RefGAP-Instrumente beziehen sich auf die Aufmerksamkeit über sieben Diffusionseditoren hinweg und korrigieren sie zur Schlussfolgerzeit. TBDub passt ein visuelles Synchronisationsmodell an Produktionsmaterial an, destilliert dann dreißig Denoising-Schritte auf zwei, während Identität, Lippensynchronisation, visuelle Qualität und End-to-End-Durchsatz gemessen werden.

Was dieser Monat zeigt

Der geometriegesteuerte Harmonizer verwendet nur ein begrenztes, kanalgleichmäßiges Abdunkelungsfeld; auf seinem analytischen Proxy ändern sich 56,5 % der Gesichtspixel, der mittlere Gewinn beträgt 0,938 und kein Pixel wird aufgehellt, obwohl das Paper keinen echten Bild-Wahrnehmungsgewinn beansprucht. RefGAP kalibriert zwei Koeffizienten einmal und verbessert dann die Identitätsähnlichkeit über sieben Bild-/Videoeditoren bei 1.040 Kopftausch-Clips und 1.000 Gesichtstausch-Paaren; der Ersetzungserfolg erreicht mindestens 86 % bzw. 82 %, mit messbaren Positions- und Erhaltungskompromissen. TBDubs Zwei-Schritt-Schüler erreicht 7,13 FPS bei 512 mal 512 auf einem H20, eine 13,93-fache End-to-End-Geschwindigkeit gegenüber seinem Lehrer, während menschliche Bewertungen die Identitätsqualität des Lehrers erhalten und Lip-Sync sowie visuelle Qualität leicht verbessern. Für Käufer ist der wichtige Unterschied das Risiko: Deterministische Grenzen, Inferenzzeitkontrollen und destillierte Erzeugung haben unterschiedliche Fehlerarten und Validierungsbedürfnisse.

Paper 012026-09-15cs.CV

Geometriegesteuerte Schattenharmonisierung für zusammengesetzte Gesichter: Eine multiplikative, albedo-erhaltende Relighting-Pipeline

Autoren & Institutionen

Vijesh KP

Independent researcher (no institutional affiliation stated in the paper)

Welches Problem es löst

Das Paper richtet sich an den engen Fall, in dem Spenderfarben und -identität akzeptabel sind, aber Formschatten fehlen. Es fragt, wie man Nasen-, Socken-, Lippen- und Hohlraum-Schatten aus ungefährer Gesichtsgeometrie injizieren kann, ohne Pixel aufzuhellen, die Chromatizität zu verändern oder ein neues Gesicht zu synthetisieren.

Zentrales Ergebnis

Im analytischen Flächenhöhenfeld des Papiers mit bekanntem Licht verändert die Standardeinstellung 56,5 % der Flächenpixel, gibt insgesamt 0,938 durchschnittliche Verstärkung und 0,890 bei modifizierten Pixeln und sendet 3,4 % der Pixel auf den 0,82er Boden. Sie garantiert null aufgehellte Pixel und keine mathematische Farbwinkelverschiebung über Gleitkommarauschen hinaus. Diese Figuren charakterisieren den beschränkten Operator statt die Wahrnehmungsqualität: Das Paper bietet keinen gepaarten realen Composite-Benchmark oder Baseline-Vergleich. Es kann keine Lichter hinzufügen, einen bereits dunklen Spender korrigieren, gegenüberliegende Lichtquelle entfernen oder das Doppelschatten von Residual-Donor-Schattierungen vermeiden.

Abstract

Gesichtstausch und Gesichtskompositionspipelines erzeugen routinemäßig ein Gesicht, das geometrisch gut ausgerichtet, aber photometrisch unwahrscheinlich ist: Das Donor-Gesicht trägt flache, nahezu frontale Studiobeleuchtung, während Wirtkörper und Hintergrund das gerichtete Szenenlicht tragen. Die meisten bestehenden Lösungen synthetisieren das Gesicht durch Farbübertragung, neuronale Neubeleuchtung oder inverses Rendering und riskieren somit die Veränderung von Identität, Hautton und Textur. Wir präsentieren eine konservative Alternative: geometriegesteuerte Form-Schatten-Injektion. Die Pipeline lackiert das Gesicht nie. Sie schätzt ein Pixel-Gain-Feld $g\in[g_{\min},1]$ aus einem gerasterten 3D-Flächenproxy und multipliziert es kanalgleichmäßig auf lineare RGB, sodass der Operator nur verdunkeln und die Chromatizität nicht verschieben kann. Ein dichtes Landmark-Netz wird zu einem Tiefenpuffer gerastert, aus dem wir Oberflächennormalen, einen Hohlraumterm und Schatten im Bildschirmraum ableiten. Die Richtung des Schlüssellichts wird anhand von Host-seitigen Hinweisen (Körper, Hintergrund, Haarhalo) geschätzt; On-Face-Hinweise werden heruntergewichtet, da sie die Beleuchtung des Spenders wiederherstellen. Die Schattenstärke wird nicht dem Host zugeordnet: Sie wird durch einen drei-Parameter-Transfer $(τ,σ,g_{\min})$ festgelegt. Das Shading-Feld wird durch das 75. Perzentil über der Haut geteilt, dann in einer gefiederten, hautgeschützten Gesichtsmaske gesperrt, skaliert, geklemmt, geglättet und neu abgeschnitten. Auf einem analytischen Flächenhöhenfeld modifiziert das Standard-Format $(τ,σ,g_{\min})=(0,90,0.45,0.82)$ 56,5 % der Flächenpixel mit einem mittleren Gewinn von 0,938 (0,890 bei modifizierten Pixeln) und treibt 3,4 % der Pixel auf den Boden. Farbtoninvarianz ist eine Korollare des Operators. Wir analysieren den Transfer in geschlossener Form, ablassen seine Parameter und diskutieren Versagensarten einer monotonen, nur verdunkelnden Formulierung, einschließlich Doppelschatten von nicht-flachen Spendern.

Ausgangspunkt der Forschung

Ein vertauschtes Gesicht kann geometrisch ausgerichtet und identitätskorrekt sein, aber dennoch angeklebt, da der Spender flaches Studiolicht trägt, während die Host-Szene eine Richtungstaste hat. Generative Nachbeleuchtung kann weitere Effekte reparieren, kann aber auch Hautton, Poren, Textur oder Identität verändern, nachdem das Gesicht bereits genehmigt wurde. Produktionsteams benötigen manchmal einen bewusst begrenzten Operator, dessen schlimmste photometrische Änderung bekannt ist.

Methode

Ein Gesichtsdetektor und ein 468-Punkte-Mesh erzeugen einen rasterisierten Tiefenpuffer, Oberflächennormalen, Hohlraumproxy und Bildschirmraum werfen Schatten in einem 512-Pixel-Ausschnitt. Hostseitige Körper-, Hintergrund-, Hals- und Haar-Halo-Hinweise stimmen für die Richtung des Key-Lights, während Donor-Face-Cues heruntergewichtet werden. Die normalisierte Shading-Map durchläuft eine drei-Parameter-Übertragung von Schwellenwert, Stärke und Minimum-Gain, dann geführtes Glätten und eine gefiederte Hautmaske. Der gleiche skalare Gewinn wird auf alle linearen RGB-Kanäle multipliziert und auf einen Bereich von 0,82 bis 1,0 geclippt.

Einordnung

Dies ist eine konservative Post-Compositing-Steuerung mit einer verständlichen Schadensgrenze, kein vollständiges Neubeleuchtungssystem. Es ist attraktiv, wenn Identitätserhaltung dramatischer Realismus übertrifft, vorausgesetzt, echte Aufnahmen werden auf falsche Lichtrichtung und doppelte Schatten überprüft.

Paper 022026-09-28cs.CV

Mind the RefGAP: Korrektur der Referenzaufmerksamkeit bei diffusionsbasierter visueller Bearbeitung

Autoren & Institutionen

Yanan Wang

Mohamed bin Zayed University of Artificial Intelligence

Institute of Foundation Models

Shengcai Liao

United Arab Emirates University

Guangyi Liu

Mohamed bin Zayed University of Artificial Intelligence

Institute of Foundation Models

Xiaodan Liang

Mohamed bin Zayed University of Artificial Intelligence

Welches Problem es löst

RefGAP zielt darauf ab, die Referenzidentitätsgenauigkeit über verschiedene Bild- und Videoeditoren hinweg zu verbessern, ohne ein erneutes Training und ohne eine separate Korrekturstärke für jedes Modell festzulegen. Es balanciert ausdrücklich die stärkere Nutzung der Referenz innerhalb der Editiermaske mit Unterdrückung in Bereichen, die erhalten bleiben sollen.

Zentrales Ergebnis

Bei 1.040 HeadSwapBench-Clips verbessert sich die Identitätsähnlichkeit für alle sieben Allzweckeditoren, und der Erfolg der Ersatzanwendung erreicht mindestens 86 %, wo definiert; die Vollkopf-Ähnlichkeit steigt ebenfalls für alle sieben. Bei 1.000 FaceForensics-Gesichtsaustausch-Paaren verbessert sich die Identitätsähnlichkeit bei jedem Editor, mit Ersatz- und korrekt abgerufener Übereinstimmung von mindestens 82 % bzw. 75 %. Auf das spezialisierte DirectSwap-Modell angewendet, steigt die Identitätsähnlichkeit von 0,7019 auf 0,7450, während das LPIPS des gesamten Frames nahezu unverändert bleibt. Gewinne gehen einher mit höherem Keypoint-Fehler für mehrere Systeme und gemischter Nicht-Edit-Erhaltung; der Hintergrundersatz wird nicht zuverlässig übertragen. Die nicht verschmolzene Aufmerksamkeitsimplementierung kann auch erheblichen Speicher- oder Latenzbedarf hinzufügen, daher ist die Integrationsqualität wichtig.

Abstract

Referenzgesteuerte Diffusionseditoren haben Schwierigkeiten, von den Nutzern bereitgestellte Referenzen originalgetreu wiederzugeben. Wir identifizieren einen potenziellen Engpass bei Diffusionseditoren: Viele Methoden bieten eine begrenzte Referenz-Aufmerksamkeitszuteilung. Beispielsweise weisen Edit-Region-Abfragen in LoomVideo weniger als 1 % ihrer Aufmerksamkeitsmasse der Referenz zu. Wir führen RefGAP ein, eine trainingsfreie Korrektur, die online Logit-Offset-Größen auf jeder Ebene aus der während des Vorwärtsdurchlaufs gemessenen Referenz-Aufmerksamkeitsmasse bestimmt. Positive Offsets für Referenzlogits stärken die Referenznutzung durch Edit-Region-Abfragen, während negative Offsets für Keep-Region-Abfragen referenzinduzierte Änderungen außerhalb des Schnitts begrenzen. Zwei globale Koeffizienten steuern die Korrektur; sie werden einmal auf Validierungsdaten von vier Entwicklungs-Diffusionseditoren ausgewählt und festgehalten. Über sieben diffusionsbasierte Bild-/Videoeditoren hinweg verbessert RefGAP die Genauigkeit der Identität beim Kopf- und Face-Swapping. RefGAP erreicht einen Kompromiss zwischen Fidelität und Erhaltung, vergleichbar mit separat abgestimmten konstanten Bearbeitungsseiten-Verzerrungen, ohne Stärke-Sweeps pro Annäherung. Weitere Experimente zu virtuellem Probieren und Hintergrundersatz bewerten die Übertragung über die Identitätsbearbeitung hinaus.

Ausgangspunkt der Forschung

Referenzgeführte Diffusionseditoren können das richtige Quellgesicht erhalten, ihm jedoch fast keine Aufmerksamkeit schenken; LoomVideo-Edit-Region-Abfragen weisen in der Messung der Autoren weniger als 1 % der Aufmerksamkeitsmasse der Referenz zu. Feste Aufmerksamkeitsverstärkungen können die Identität stärken, erfordern jedoch eine modellabhängige Feinabstimmung und können das Aussehen der Referenz in Haaren, Kleidung, Hintergrund, Pose oder Ausdruck, die unverändert bleiben sollten, übertragen.

Methode

In jeder Aufmerksamkeitslage misst RefGAP den Anteil der Aufmerksamkeit, der den Referenz-Token separat für Edit- und Behalte-Abfragen zugewiesen wird. Es leitet einen Online-Logit-Offset aus der beobachteten Masse ab: positive Offsets verstärken Referenzschlüssel in der Editierregion, während negative Offsets sie in der Behalte-Region einschränken. Zwei globale Koeffizienten und eine Schichtauswahlregel werden einmal an 40 Head-Swap-Clips unter Verwendung von vier Entwicklungseditors kalibriert und dann für sieben Editoren, drei nicht getestete Systeme, Gesichts­tausch, virtuelle Anprobe und Hintergrundersetzung unverändert beibehalten.

Einordnung

Die Messung der tatsächlichen Referenzaufmerksamkeit ist ein nützliches modellagnostisches Kontrollsignal für Identitätsbearbeitungen, aber stärkere Identitätsübertragung kann Geometrie und erhaltene Bereiche verändern. Teams benötigen eine aufgabenspezifische Qualitätskontrolle, nicht nur die Identitätsähnlichkeit.

Paper 032026-09-05cs.CV

TBDub: Produktionsorientiertes Visuelles Dubbing

Autoren & Institutionen

Bihan Li

TaoLive AIGC, Taobao & Tmall Group, Alibaba

Xinyang Li

TaoLive AIGC, Taobao & Tmall Group, Alibaba

Zeran Xu

TaoLive AIGC, Taobao & Tmall Group, Alibaba

Meiguang Jin

TaoLive AIGC, Taobao & Tmall Group, Alibaba

Junfeng Ma

TaoLive AIGC, Taobao & Tmall Group, Alibaba

Welches Problem es löst

TBDub passt einen vorhandenen Video-Diffusions-Dubbing-Stack an Produktionsaufnahmen an und untersucht, ob ein Zwei-Schritte-Schüler die vom Lehrer wahrgenommene Identität, Synchronisation und visuelle Qualität beibehalten kann. Es bewertet Rekonstruktion, Audioantwort, menschliche Bewertungen und den vollständigen VAE-zu-VAE-Generierungsweg, anstatt nur die Geschwindigkeit des Denoisers anzugeben.

Zentrales Ergebnis

Bei 38 TalkVid Clips verbessert der Lehrer alle acht berichteten Rekonstruktions-, Wahrnehmungs-, Identitäts- und Synchronisationsmetriken gegenüber X-Dub. In 114 Bewertungen pro Methode steigen X-Dubs Lippensynchronisations-, Identitäts- und visuelle MOS-Werte von 3,57, 2,83 und 2,88 für den Lehrer auf 3,71, 3,78 und 3,78. Der Schüler erzielt 3,85, 3,72 und 3,80, hält die Identität nah und führt gleichzeitig Lippensynchronisation und visuelle Qualität an. Bei 512 mal 512 auf einem H20 erreicht der Schüler 7,13 effektive FPS gegenüber 0,51 für den Lehrer, eine 13,93-fache End-to-End-Beschleunigung; die DiT-Stufe allein ist 42,49-mal schneller. Der Benchmark ist klein, schließt mehrere Vorverarbeitungs- und Codierungsstufen aus, und sehr niedrig aufgelöste Eingaben bleiben ein Fehlerfall.

Abstract

Visuelles Dubbing muss die Mundbewegungen mit der Ersatzsprache synchronisieren und gleichzeitig Identität, Aussehen und zeitliche Konsistenz bewahren. Obwohl X-Dub eine leistungsstarke, maskenfreie Video-Editing-Basis bietet, zeigen seine Anwendungen auf Livestream- und generierten Videoinhalten Einschränkungen in Produktionsdomänen-Robustheit, zeitlicher und Bewegungsstabilität, Identitäts- und Detailtreue im Mundbereich sowie Effizienz bei der Inferenz. Wir stellen \\textbf{TBDub} vor, eine produktionsorientierte Erweiterung von X-Dub, die aufgabenadaptives Nachtraining mit aufgabenbewusster wenige-Schritte-Distillation kombiniert. Das Nachtraining passt das Video-DiT mithilfe von Produktionsdomänen-Daten, produktion-spezifischer Konditionierung und Filterung sowie erweiterten Audiofunktionen an, um einen 30-Schritte-Lehrer zu erhalten. Die Distillation passt DMD/DMD2 an bedingtes Video-Editing an und komprimiert den Lehrer in einen Zwei-Schritte-Schüler. Bei 38 TalkVid-Clips verbessert der Lehrer alle acht berichteten Rekonstruktions-, Wahrnehmungs-, Identitäts- und Synchronisationsmetriken im Vergleich zu X-Dub. In der MOS-Bewertung verbessert er die Lippen-Synchronisationskonsistenz, Identitätskonsistenz und visuelle Qualität gegenüber X-Dub um 0,14, 0,95 und 0,90 Punkte, während der Schüler die höchsten Werte für Lippen-Synchronisation und visuelle Qualität erreicht und in der Identitätskonsistenz nah am Lehrer bleibt. Bei paarweiser End-to-End-Generierung vom ersten VAE-Encode bis zum finalen VAE-Decode auf einer einzelnen NVIDIA H20 GPU bei $512\times512$ erreicht der Schüler 7,13 effektive FPS und reduziert die Gesamtlatenz um $13,93\times$; die DiT-Stufe allein wird um $42,49\times$ beschleunigt. Der Schüler bewahrt größtenteils die Generierungsqualität und audiovisuelle Synchronisation des Lehrers. Der Code ist auf GitHub verfügbar unter \https://github.com/TaoLiveAIGC/TBDub, und die 30-Schritte-Lehrer- und Zwei-Schritte-Schüler-Gewichte sind auf Hugging Face unter https://huggingface.co/TaoLiveAIGC/TBDub verfügbar.

Ausgangspunkt der Forschung

Visuelles Dubbing muss die Mundbewegung so ändern, dass die Ersatzsprache ausgedrückt wird, während Identität, Zähne, Lippenstruktur, Pose, Beleuchtung, Okklusion und alle nichtsprachlichen Bereiche über die Zeit stabil bleiben. X-Dub bietet einen leistungsfähigen, maskenfreien Video-Editor, aber Produktions-Livestream- und generierte Videoeingaben zeigen Domänenverschiebung, Flimmern, Drift in Munddetails und die Latenz von dreißig Entrauschungsschritten.

Methode

Aufgabenadaptives Nachtraining mischt Produktionsdomänen-Daten mit der übernommenen Trainingsverteilung, verstärkt Audiofunktionen mit HuBERT-Large-Schichten, verschlechtert Bedingungen asymmetrisch und verwendet Bewegungs-Dropout sowie räumliches und zeitliches gewichtetes Fluss-Matching, um einen 30-Schritte-Lehrer zu erzeugen. Ein bedingtes DMD/DMD2-Verfahren destilliert diesen Lehrer in einen differenzierbaren Zwei-Schritte-Schüler mit dynamischem Fake-Score-Training, gestaffelter regionsselektiver Supervision, kausaler Handhabung des ersten Latents, vollständigem Schritt-für-Schritt-Sampling, FP32-Guidance-Arithmetik und FP32-EMA-Gewichten.

Einordnung

Zweistufige visuelle Synchronisation kann einen deutlich besseren Durchsatzpunkt bieten, aber die gemeldeten 7,13 FPS sind auf den Generationskern beschränkt. Produktionsgrößen sollten Audio, Face Tracking, Compositing, Codierung und Langvideostabilität umfassen.