Geometriegesteuerte Schattenharmonisierung für zusammengesetzte Gesichter: Eine multiplikative, albedo-erhaltende Relighting-Pipeline
Autoren & Institutionen
Vijesh KP
Independent researcher (no institutional affiliation stated in the paper)
Welches Problem es löst
Das Paper richtet sich an den engen Fall, in dem Spenderfarben und -identität akzeptabel sind, aber Formschatten fehlen. Es fragt, wie man Nasen-, Socken-, Lippen- und Hohlraum-Schatten aus ungefährer Gesichtsgeometrie injizieren kann, ohne Pixel aufzuhellen, die Chromatizität zu verändern oder ein neues Gesicht zu synthetisieren.
Zentrales Ergebnis
Im analytischen Flächenhöhenfeld des Papiers mit bekanntem Licht verändert die Standardeinstellung 56,5 % der Flächenpixel, gibt insgesamt 0,938 durchschnittliche Verstärkung und 0,890 bei modifizierten Pixeln und sendet 3,4 % der Pixel auf den 0,82er Boden. Sie garantiert null aufgehellte Pixel und keine mathematische Farbwinkelverschiebung über Gleitkommarauschen hinaus. Diese Figuren charakterisieren den beschränkten Operator statt die Wahrnehmungsqualität: Das Paper bietet keinen gepaarten realen Composite-Benchmark oder Baseline-Vergleich. Es kann keine Lichter hinzufügen, einen bereits dunklen Spender korrigieren, gegenüberliegende Lichtquelle entfernen oder das Doppelschatten von Residual-Donor-Schattierungen vermeiden.
Abstract
Gesichtstausch und Gesichtskompositionspipelines erzeugen routinemäßig ein Gesicht, das geometrisch gut ausgerichtet, aber photometrisch unwahrscheinlich ist: Das Donor-Gesicht trägt flache, nahezu frontale Studiobeleuchtung, während Wirtkörper und Hintergrund das gerichtete Szenenlicht tragen. Die meisten bestehenden Lösungen synthetisieren das Gesicht durch Farbübertragung, neuronale Neubeleuchtung oder inverses Rendering und riskieren somit die Veränderung von Identität, Hautton und Textur. Wir präsentieren eine konservative Alternative: geometriegesteuerte Form-Schatten-Injektion. Die Pipeline lackiert das Gesicht nie. Sie schätzt ein Pixel-Gain-Feld $g\in[g_{\min},1]$ aus einem gerasterten 3D-Flächenproxy und multipliziert es kanalgleichmäßig auf lineare RGB, sodass der Operator nur verdunkeln und die Chromatizität nicht verschieben kann. Ein dichtes Landmark-Netz wird zu einem Tiefenpuffer gerastert, aus dem wir Oberflächennormalen, einen Hohlraumterm und Schatten im Bildschirmraum ableiten. Die Richtung des Schlüssellichts wird anhand von Host-seitigen Hinweisen (Körper, Hintergrund, Haarhalo) geschätzt; On-Face-Hinweise werden heruntergewichtet, da sie die Beleuchtung des Spenders wiederherstellen. Die Schattenstärke wird nicht dem Host zugeordnet: Sie wird durch einen drei-Parameter-Transfer $(τ,σ,g_{\min})$ festgelegt. Das Shading-Feld wird durch das 75. Perzentil über der Haut geteilt, dann in einer gefiederten, hautgeschützten Gesichtsmaske gesperrt, skaliert, geklemmt, geglättet und neu abgeschnitten. Auf einem analytischen Flächenhöhenfeld modifiziert das Standard-Format $(τ,σ,g_{\min})=(0,90,0.45,0.82)$ 56,5 % der Flächenpixel mit einem mittleren Gewinn von 0,938 (0,890 bei modifizierten Pixeln) und treibt 3,4 % der Pixel auf den Boden. Farbtoninvarianz ist eine Korollare des Operators. Wir analysieren den Transfer in geschlossener Form, ablassen seine Parameter und diskutieren Versagensarten einer monotonen, nur verdunkelnden Formulierung, einschließlich Doppelschatten von nicht-flachen Spendern.
Ausgangspunkt der Forschung
Ein vertauschtes Gesicht kann geometrisch ausgerichtet und identitätskorrekt sein, aber dennoch angeklebt, da der Spender flaches Studiolicht trägt, während die Host-Szene eine Richtungstaste hat. Generative Nachbeleuchtung kann weitere Effekte reparieren, kann aber auch Hautton, Poren, Textur oder Identität verändern, nachdem das Gesicht bereits genehmigt wurde. Produktionsteams benötigen manchmal einen bewusst begrenzten Operator, dessen schlimmste photometrische Änderung bekannt ist.
Methode
Ein Gesichtsdetektor und ein 468-Punkte-Mesh erzeugen einen rasterisierten Tiefenpuffer, Oberflächennormalen, Hohlraumproxy und Bildschirmraum werfen Schatten in einem 512-Pixel-Ausschnitt. Hostseitige Körper-, Hintergrund-, Hals- und Haar-Halo-Hinweise stimmen für die Richtung des Key-Lights, während Donor-Face-Cues heruntergewichtet werden. Die normalisierte Shading-Map durchläuft eine drei-Parameter-Übertragung von Schwellenwert, Stärke und Minimum-Gain, dann geführtes Glätten und eine gefiederte Hautmaske. Der gleiche skalare Gewinn wird auf alle linearen RGB-Kanäle multipliziert und auf einen Bereich von 0,82 bis 1,0 geclippt.
Einordnung
Dies ist eine konservative Post-Compositing-Steuerung mit einer verständlichen Schadensgrenze, kein vollständiges Neubeleuchtungssystem. Es ist attraktiv, wenn Identitätserhaltung dramatischer Realismus übertrifft, vorausgesetzt, echte Aufnahmen werden auf falsche Lichtrichtung und doppelte Schatten überprüft.