FreqFLD: Auf dem Weg zu einer universellen Erkennung von Gesichtslandmarken durch Frequenzmodulation
Autoren & Institutionen
Shun Ren
College of Computer and Information Technology, China Three Gorges University
Kaijie Jin
College of Computer and Information Technology, China Three Gorges University
Shengkai Hu
School of Information Engineering, Zhongnan University of Economics and Law
Beihang Song
National Institute of Natural Hazards, Ministry of Emergency Management of China
Hang Sun
College of Computer and Information Technology, China Three Gorges University
Wenwen Min
School of Information Science and Engineering, Yunnan University
Youfa Liu
School of Computer Science, Wuhan University
Jun Wan
School of Information Engineering, Zhongnan University of Economics and Law
School of Computer Science and Engineering, Nanyang Technological University
Welches Problem es löst
FreqFLD zielt auf einen All-in-One-Landmark-Detektor ab, der gemeinsam auf 300W, AFLW, COFW und WFLW trainiert werden kann, während er bei jedem Benchmark wettbewerbsfähig bleibt und in ihren schwierigen Teilmengen robust ist. Das Paper fragt, ob explizite Frequenz-Priors die Spezialisierung von Experten zuverlässiger steuern können als uneingeschränkte Mischung von Experten-Routing.
Zentrales Ergebnis
Das einheitliche Modell erreicht 2,72 NME auf 300W Common, 4,52 auf 300W Challenge und 4,50 auf dem WFLW-Testsatz; WFLW-Pose-, Beleuchtungs-, Okklusions- und Unschärfe-Teilmengen erzielen 7,54, 4,55, 5,53 und 5,15. Bei stark verdecktem COFW meldet es 4,80 NME und eine Ausfallrate von 0,39%. Die Vollfrequenzmodule und der Routing-Verlust verbessern die 300W-Schwierigkeits-Basislinie von 4,71 auf 4,52, während das Hinzufügen aller vier Trainingsdatensätze ein Ergebnis von 4,97 auf 4,52 verbessert. Die Leistung ist wettbewerbsfähig und nicht gleichmäßig best, darunter 1,69 NME bei AFLW, wo ältere spezialisierte Methoden geringere Fehler melden.
Abstract
Jüngste Fortschritte im Deep Learning haben die Gesichtsmarkenerkennung erheblich vorangebracht. Die meisten bestehenden Methoden verarbeiten Features jedoch räumlich im Rahmen eines datensatzspezifischen Trainingsparadigmas, das übersieht, dass die Gesichtsmarkenerkennung von Natur aus geometriegetrieben und empfindlich auf Frequenzschwankungen reagiert, wodurch die Verallgemeinerung von Datensätzen unter komplexen Szenarien begrenzt und die Entwicklung eines Gesichtsmarken-Erkennungsmodells behindert wird. Um dieses Problem anzugehen, schlagen wir \textbf{FreqFLD} vor, ein \textbf{freq}uency-moduliertes Framework für All-in-One \textbf{f}acial \textbf{l}andmark \textbf{d}etection. Konkret führt FreqFLD ein Frequency Modulation Module (FreqMoM) ein, das die vorherige Frequenz explizit induziert, indem sie Nieder- und Hochfrequenzkomponenten entkoppelt und moduliert, was dann in die nachfolgende Merkmalsmodellierung einfließt, um eine ausgewogene Modellierung globaler Gesichtsstrukturen und lokaler Landmarken-Details zu ermöglichen. Darüber hinaus verwendet FreqFLD eine frequenzmodulierte Mischung von Experten (FreqMoE), bei der Expertenauswahl adaptiv auf frequenzmodulierten Priors konditioniert ist und so eine flexible Modellierung heterogener Gesichtsmarkenmuster unter unterschiedlichen und herausfordernden Szenarien ermöglicht. Um frequenzkonsistente Modellierung im All-in-One-Paradigma zu regularisieren, führen wir zudem einen Frequency-Consistent Routing (FreqCR)-Verlust ein, der das Routing und die Zuweisung frequenzbewusster Experten einschränkt, um eine ausgewogene Expertennutzung über verschiedene Gesichtsszenarien hinweg zu fördern, wodurch eine stabile Expertenspezialisierung und eine robuste Gesichtsmarkenerkennung möglich ist. Umfangreiche Experimente zeigen, dass das vorgeschlagene FreqFLD auf gängigen Datensätzen vergleichbare Leistung erzielt. Der Code ist verfügbar unter: https://github.com/jkj1059657014/FreqFLD.
Ausgangspunkt der Forschung
Gesichtsmarkierungsmodelle werden üblicherweise pro Datensatz trainiert, obwohl Produktionseingaben Orientierungskonventionen, Posen, Okklusionen, Unschärfe und Beleuchtung mischen. Reine räumliche Merkmale können ein Annotationsregime überdimensionieren und die Unterscheidung zwischen niedrigfrequenter Flächenstruktur und hochfrequenten Landmark-Details übersehen. Ein einheitliches Modell erzeugt auch Routing-Konflikte, wenn von einem Experten erwartet wird, jede Geometrie und Bildqualität zu behandeln.
Methode
Das Frequency Modulation Module zerlegt Features in Nieder- und Hochfrequenzkomponenten, modelliert sie separat und injiziert das resultierende Prior in nachgelagerte Schichten. Eine frequenzmodulierte Mischung von Experten nutzt dies vor der Routeung heterogener Gesichtsmuster, während Frequency-Consistent Routing die Auslastung ausgleicht und stabile Spezialisierung fördert. Gemeinsames Training gleicht die vier Quelldatensätze auf jeweils 20.000 Proben aus, was einen 80.000-Bild-Trainingspool ergibt, der nach dem nativen Landmark- und Normalisierungsprotokoll jedes Datensatzes ausgewertet wird.
Einordnung
Frequenzbewusstes Routing liefert ein glaubwürdiges Argument dafür, mehrere Meilenmark-Modelle zu einem zusammenzufassen, aber Teams sollten Fehler pro Kamera und pro Orientierungsschema vergleichen, da einheitliches Training nicht jeden einzelnen Benchmark erreicht.