← Zurück zum Blog
ForschungsradarGesichtserkennungGesichtsmarkierungenarXivSeptember 2026

Monatlicher arXiv Radar

Face-Detection-Studien im September 2026: Einheitliche Landmarken, Diffusionsausrichtung und Einsatz im Klassenzimmer

Direkte Face-Box-Papiere waren im September spärlich, daher folgt diese Zusammenfassung dem angrenzenden Lokalisierungsstack, den Produktionssysteme nach dem Fund einer Box benötigen. FreqFLD trainiert ein frequenzbewusstes Landmark-Modell über vier Datensätze. FAHCD-Net behandelt Landmark-Heatmaps als bedingtes Denoising-Problem unter Änderungen von Pose, Okklusion, Unschärfe und Beleuchtung. Die Visage-Studie bringt Erkennung und Erkennung in überfüllten Klassenzimmerbildern wieder zusammen, wo Durchsatz und übersehene Gesichter genauso wichtig sind wie die Genauigkeit der wichtigsten Identität.

Was dieser Monat zeigt

FreqFLD balanciert globale Struktur und lokale Details aus, indem Frequenzkomponenten aufgeteilt und Proben über frequenzkonditionierte Experten geleitet werden; ein gemeinsam trainiertes Modell erreicht 4,50 NME auf WFLW und 4,80 NME bei einer Fehlerrate von 0,39 % auf verdecktem COFW. FAHCD-Net kaskadeiert stattdessen bedingte Diffusionsstufen und unterdrückt redundantes Hochfrequenz-Heatmap-Rauschen, wodurch die 300W-NME mit herausforderndem Set-Format von 4,48 in Stufe eins auf 4,29 in Stufe drei reduziert wird. Die Visage-Studie berichtet, dass ein YOLOv8n mit 3,2 Millionen Parametern 0,935 mAP@0,5 erreicht, während deutlich größere Detektoren bei erheblichen Parameterkosten Genauigkeit erreichen; mehrere Erkenner erreichen 99,75 % Top-1 auf seinem 100-Klassen-Erkennungsset. Diese Ergebnisse sind vielversprechend, aber die beiden wegweisenden Arbeiten bleiben Benchmark-Studien und die Klassendaten stammen aus einer begrenzten institutionellen Umgebung, sodass eine Querschnittsvalidierung weiterhin erforderlich ist.

Paper 012026-09-09cs.CV

FreqFLD: Auf dem Weg zu einer universellen Erkennung von Gesichtslandmarken durch Frequenzmodulation

Autoren & Institutionen

Shun Ren

College of Computer and Information Technology, China Three Gorges University

Kaijie Jin

College of Computer and Information Technology, China Three Gorges University

Shengkai Hu

School of Information Engineering, Zhongnan University of Economics and Law

Beihang Song

National Institute of Natural Hazards, Ministry of Emergency Management of China

Hang Sun

College of Computer and Information Technology, China Three Gorges University

Wenwen Min

School of Information Science and Engineering, Yunnan University

Youfa Liu

School of Computer Science, Wuhan University

Jun Wan

School of Information Engineering, Zhongnan University of Economics and Law

School of Computer Science and Engineering, Nanyang Technological University

Welches Problem es löst

FreqFLD zielt auf einen All-in-One-Landmark-Detektor ab, der gemeinsam auf 300W, AFLW, COFW und WFLW trainiert werden kann, während er bei jedem Benchmark wettbewerbsfähig bleibt und in ihren schwierigen Teilmengen robust ist. Das Paper fragt, ob explizite Frequenz-Priors die Spezialisierung von Experten zuverlässiger steuern können als uneingeschränkte Mischung von Experten-Routing.

Zentrales Ergebnis

Das einheitliche Modell erreicht 2,72 NME auf 300W Common, 4,52 auf 300W Challenge und 4,50 auf dem WFLW-Testsatz; WFLW-Pose-, Beleuchtungs-, Okklusions- und Unschärfe-Teilmengen erzielen 7,54, 4,55, 5,53 und 5,15. Bei stark verdecktem COFW meldet es 4,80 NME und eine Ausfallrate von 0,39%. Die Vollfrequenzmodule und der Routing-Verlust verbessern die 300W-Schwierigkeits-Basislinie von 4,71 auf 4,52, während das Hinzufügen aller vier Trainingsdatensätze ein Ergebnis von 4,97 auf 4,52 verbessert. Die Leistung ist wettbewerbsfähig und nicht gleichmäßig best, darunter 1,69 NME bei AFLW, wo ältere spezialisierte Methoden geringere Fehler melden.

Abstract

Jüngste Fortschritte im Deep Learning haben die Gesichtsmarkenerkennung erheblich vorangebracht. Die meisten bestehenden Methoden verarbeiten Features jedoch räumlich im Rahmen eines datensatzspezifischen Trainingsparadigmas, das übersieht, dass die Gesichtsmarkenerkennung von Natur aus geometriegetrieben und empfindlich auf Frequenzschwankungen reagiert, wodurch die Verallgemeinerung von Datensätzen unter komplexen Szenarien begrenzt und die Entwicklung eines Gesichtsmarken-Erkennungsmodells behindert wird. Um dieses Problem anzugehen, schlagen wir \textbf{FreqFLD} vor, ein \textbf{freq}uency-moduliertes Framework für All-in-One \textbf{f}acial \textbf{l}andmark \textbf{d}etection. Konkret führt FreqFLD ein Frequency Modulation Module (FreqMoM) ein, das die vorherige Frequenz explizit induziert, indem sie Nieder- und Hochfrequenzkomponenten entkoppelt und moduliert, was dann in die nachfolgende Merkmalsmodellierung einfließt, um eine ausgewogene Modellierung globaler Gesichtsstrukturen und lokaler Landmarken-Details zu ermöglichen. Darüber hinaus verwendet FreqFLD eine frequenzmodulierte Mischung von Experten (FreqMoE), bei der Expertenauswahl adaptiv auf frequenzmodulierten Priors konditioniert ist und so eine flexible Modellierung heterogener Gesichtsmarkenmuster unter unterschiedlichen und herausfordernden Szenarien ermöglicht. Um frequenzkonsistente Modellierung im All-in-One-Paradigma zu regularisieren, führen wir zudem einen Frequency-Consistent Routing (FreqCR)-Verlust ein, der das Routing und die Zuweisung frequenzbewusster Experten einschränkt, um eine ausgewogene Expertennutzung über verschiedene Gesichtsszenarien hinweg zu fördern, wodurch eine stabile Expertenspezialisierung und eine robuste Gesichtsmarkenerkennung möglich ist. Umfangreiche Experimente zeigen, dass das vorgeschlagene FreqFLD auf gängigen Datensätzen vergleichbare Leistung erzielt. Der Code ist verfügbar unter: https://github.com/jkj1059657014/FreqFLD.

Ausgangspunkt der Forschung

Gesichtsmarkierungsmodelle werden üblicherweise pro Datensatz trainiert, obwohl Produktionseingaben Orientierungskonventionen, Posen, Okklusionen, Unschärfe und Beleuchtung mischen. Reine räumliche Merkmale können ein Annotationsregime überdimensionieren und die Unterscheidung zwischen niedrigfrequenter Flächenstruktur und hochfrequenten Landmark-Details übersehen. Ein einheitliches Modell erzeugt auch Routing-Konflikte, wenn von einem Experten erwartet wird, jede Geometrie und Bildqualität zu behandeln.

Methode

Das Frequency Modulation Module zerlegt Features in Nieder- und Hochfrequenzkomponenten, modelliert sie separat und injiziert das resultierende Prior in nachgelagerte Schichten. Eine frequenzmodulierte Mischung von Experten nutzt dies vor der Routeung heterogener Gesichtsmuster, während Frequency-Consistent Routing die Auslastung ausgleicht und stabile Spezialisierung fördert. Gemeinsames Training gleicht die vier Quelldatensätze auf jeweils 20.000 Proben aus, was einen 80.000-Bild-Trainingspool ergibt, der nach dem nativen Landmark- und Normalisierungsprotokoll jedes Datensatzes ausgewertet wird.

Einordnung

Frequenzbewusstes Routing liefert ein glaubwürdiges Argument dafür, mehrere Meilenmark-Modelle zu einem zusammenzufassen, aber Teams sollten Fehler pro Kamera und pro Orientierungsschema vergleichen, da einheitliches Training nicht jeden einzelnen Benchmark erreicht.

Paper 022026-09-15cs.CV

FAHCD-Net: Frequenzadaptive, Heatmap-konditionierte Diffusionsnetze zur robusten Erkennung von Gesichtslandmarken

Autoren & Institutionen

Jun Wan

School of Information Engineering, Zhongnan University of Economics and Law

Jiwei Hu

School of Information Engineering, Zhongnan University of Economics and Law

Shengkai Hu

School of Information Engineering, Zhongnan University of Economics and Law

Qilu Zhu

School of Information Engineering, Zhongnan University of Economics and Law

Welches Problem es löst

FAHCD-Net strebt eine robuste, bahnbrechende Lokalisierung unter Pose, Occlusion, Illumination und Blur an, indem ein heatmap-bedingter Diffusionsprozess explizit frequenzbewusst gestaltet wird. Es prüft außerdem, ob eine Kaskade eine anfängliche Mittelwert-Form schrittweise verbessern kann, anstatt sich auf eine hochwertige, vom Detektor erzeugte Start-Heatmap zu verlassen.

Zentrales Ergebnis

FAHCD-Net meldet 2,51 NME auf 300W Common, 2,99 auf dem gesamten Set, 1,17 auf AFLW-Frontal und 2,08 auf AFLW-Voll. Bei 300W Challenging reduzieren aufeinanderfolgende Diffusionsstufen die NME von 4,48 auf 4,33 und dann 4,29, verglichen mit 4,81, 4,73 und 4,69 bei Konditionierung auf einer Mittelform. Das Hinzufügen von COFW-, WFLW- und AFLW-Trainingsdaten verbessert das berichtete 300W-Challenge-Ergebnis von 4,76 auf 4,49 in der Multi-Dataset-Ablation. Das Paper demonstriert die Benchmark-Robustheit, meldet aber keine Detektor-plus-Landmark-Latenz, sodass die Kosten der iterativen Diffusion weiterhin eine Frage des Einsatzes bleiben.

Abstract

Die Facial Landmark Detection (FLD) ist eine entscheidende Aufgabe in verschiedenen Anwendungen und hat in den letzten Jahren bedeutende Fortschritte erzielt. Dennoch haben die aktuellen FLD-Methoden unter schwierigen Bedingungen weiterhin Schwierigkeiten, da strukturelle Variationen, Informationsverlust und Rauschstörungen die Integrität und Genauigkeit erlernter Gesichtszüge stark beeinträchtigen. Um diese Probleme anzugehen, schlagen wir das Frequency-Adaptive Heatmap-Conditional Diffusion Network (FAHCD-Net) vor, das ein Frequency-Adaptive Heatmap-Conditional Diffusion (FAHCD)-Modell mit einem Smoothness Regularization (SR)-Verlust in einem kaskadetbasierten Rahmen integriert. Konkret enthält das FAHCD-Modell ein Hierarchical Frequency Adaptation (HFA)-Modul, das redundantes Hochfrequenzrauschen durch mehrschichtige Frequenzzerlegung und adaptive Rekonstruktion unterdrückt und so wesentliche Gesichtsstrukturen erhalten soll. Zusätzlich wird der SR-Verlust vorgeschlagen, um die Störung von hochfrequentem Rauschen weiter zu mindern und die Glattheit der erzeugten Landmark-Heatmaps zu verbessern. Indem das FAHCD-Modell mit dem SR-Verlust kaskadeiert wird, nutzt FAHCD-Net effektiv sowohl statistische als auch frequenzbasierte Verteilungsmerkmale der Daten, um schrittweise genauere Landmark-Heatmaps aus verrauschten Eingaben zu erzeugen. Umfangreiche Experimente mit populären Benchmarks zeigen die Wirksamkeit und Robustheit der vorgeschlagenen Methode und erzielen unter herausfordernden Szenarien Spitzenleistungen bei FLD-Aufgaben. Der Quellcode ist unter https://github.com/HJWKryptonite/FAHCD-Net verfügbar.

Ausgangspunkt der Forschung

Bahnbrechende Heatmaps verschlechtern sich, wenn Pose oder Ausdruck die Gesichtsstruktur verändert, wenn Okklusion Beweise entfernt und wenn Unschärfe oder Blitze hochfrequentes Rauschen erzeugen. Die Standardregression behandelt diese Effekte als direkte Vorhersagefehler. Diffusion bietet iterative Erholung von verrauschten oder unvollständigen Beweisen, aber uneingeschränktes Denoising kann selbst unscheinbare hochfrequente Heatmap-Energie und instabile Spitzen erzeugen.

Methode

Jede Kaskadenstufe verwendet ein Frequency-Adaptive Heatmap-Conditional Diffusion-Modell, um Orientierungsverteilungen zu verfeinern. Hierarchische Frequenzanpassung zerlegt und rekonstruiert wiederholt Merkmale, sodass die flachfrequente Gesichtsstruktur erhalten bleibt, während redundantes hochfrequentes Rauschen unterdrückt wird. Ein Glattheitsregularisierungsterm richtet das erzeugte Heatmap-Frequenzverhalten mit der Ground Truth aus. Multi-Dataset-Training fügt COFW, WFLW und AFLW auf 300W hinzu, und drei Stufen geben ihre vorhergesagten Heatmaps als nächste Bedingung weiter.

Einordnung

Bedingte Diffusion kann sauberere Landmark-Heatmaps in schwierigen Bildern wiederherstellen, aber ihre iterativen Kosten sollten gegen das Latenzbudget der Kamera und eine starke Nicht-Diffusions-Ausrichtungsbasis gemessen werden.

Paper 032026-09-19cs.CV

Auf dem Weg zu robuster Anwesenheitserfassung im Klassenzimmer: Eine umfassende Bewertung von Gesichtsdetektions- und Gesichtserkennungsmodellen

Autoren & Institutionen

Himani Trivedi

Computer Engineering Department, LDRP Institute of Technology and Research, Kadi Sarva Vishwavidyalaya

Hiren Patel

Vidush Somany Institute of Technology and Research, Kadi Sarva Vishwavidyalaya

Ridham Patel

Information Technology Department, LDRP Institute of Technology and Research, Kadi Sarva Vishwavidyalaya

Krutika Patel

Information Technology Department, LDRP Institute of Technology and Research, Kadi Sarva Vishwavidyalaya

Nancy Patel

Information Technology Department, LDRP Institute of Technology and Research, Kadi Sarva Vishwavidyalaya

Welches Problem es löst

Die Studie führt gepaarte Erkennungs- und Erkennungsdatensätze für Unterrichtsbedingungen ein und vergleicht eine Familie von Detektorgrößen mit sieben aktuellen Gesichtserkennungsarchitekturen. Ziel ist es, einen praktischen Genauigkeits- und Effizienz-Betriebspunkt zu identifizieren, anstatt anzunehmen, dass der größte Detektor oder Erkenner die beste Anwesenheitskomponente ist.

Zentrales Ergebnis

YOLOv8n verwendet 3,2 Millionen Parameter und erreicht eine Genauigkeit von 0,932, 0,886 Rückruf, 0,91 F1 und 0,935 mAP@0,5; größere Varianten erreichen etwa 0,97 mAP@0,5, verwenden aber 43,7 bis 68,2 Millionen Parameter. Bei der Erkennung erreichen FaceLiVTv2-L, EdgeFace Base, LVFace ViT-B und TransFace ViT-B jeweils 99,75 % Top-1 in der berichteten Tabelle. EdgeFace Base erreicht dies in 4,029 ms, schneller als FaceLiVTv2-L mit 6,081 ms, während die Modellgrößen stark variieren. Dies sind geschlossene Ergebnisse aus einer begrenzten Menge von Bildungseinrichtungen, sodass sie keine Spoof-Resistenz, schulübergreifende Generalisierung oder politische Eignung für automatisierte Anwesenheit nachweisen.

Abstract

Manuelle Anwesenheitsmethoden wie papierbasierte oder registerbasierte Systeme benötigen viel Zeit, können zu Fehlern führen und lassen sich leicht fälsifizieren. Gesichtserkennung ist zuverlässiger, hat aber häufig Schwierigkeiten im Klassenzimmer, da Beleuchtung und andere Bedingungen variieren können. Gesichtserkennungsdatensätze sind für regulierte Umgebungen konzipiert und decken die tatsächlichen Herausforderungen im Klassenzimmer nicht ab. Um dem entgegenzuwirken, wird ein neuer Datensatz zur Gesichtserkennung und -erkennung, der Visage Face-Datensatz mit 16.234 Gesichtsproben, für die Aufgabe der Gesichtserkennung und -erkennung vorgeschlagen. Die Fotos werden aus verschiedenen Blickwinkeln und unter unterschiedlichen Lichtverhältnissen aufgenommen, wobei die Schüler unterschiedliche Gesichtsausdrücke zeigen und einige Gesichter teilweise abgedeckt sind, um reale Situationen widerzuspiegeln. Ein YOLO-basiertes System wird verwendet, um Gesichter zu erkennen und sieben fortschrittliche Gesichtserkennungsmodelle mit dreizehn Konfigurationen zu testen: LVFace, QCFace, FaceLiVTv2, TopoFR, EdgeFace, TransFace und GhostFaceNets. Davon schnitt FaceLiVTv2-M am besten ab, mit 99,75 % Top-1/Top-5-Genauigkeit und einer Schlusszeit von 6,459 ms. Diese Ergebnisse zeigen, dass der Visage Face Dataset ein realistischer und herausfordernder Maßstab für Gesichtserkennung bei der Anwesenheit im Unterricht darstellt.

Ausgangspunkt der Forschung

Die Anwesenheit im Klassenzimmer vereint viele kleine Gesichter, unterschiedliche Posen und Beleuchtung, teilweise Okklusion und die Notwendigkeit, wiederholte Videobilder auf erschwinglicher Hardware zu verarbeiten. Allgemeine Gesichtsdatensätze reproduzieren diese Betriebsumgebung nicht, während die Erfassung der Erkennungsgenauigkeit allein übersehene Erkennungen und Rechenkosten verbirgt. Institutionen benötigen außerdem Daten, die mit Zustimmung gesammelt werden, anstatt wiederverwendete Identitätsbilder.

Methode

Die Autoren sammeln 801 Unterrichtsbilder, annotieren Gesichter manuell und nutzen Rotation, Skalierung, Translation, Rauschen und Flipping, um das Detektionsset zu erstellen; die Arbeit berichtet 3.635 Detektionsbilder und 96.409 Gesichtsannotationen nach der Erweiterung. Das Erkennungsset enthält 3.500 Bilder aus 100 Klassen, ausgerichtet von fünf RetinaFace-Orientierungspunkten und normalisiert auf 112 mal 112. YOLOv8 n/s/m/l/x-Varianten werden zur Erkennung evaluiert, und dreizehn Konfigurationen von LVFace, QCFace, FaceLiVTv2, TopoFR, EdgeFace, TransFace und GhostFaceNets werden zur Erkennung verglichen.

Einordnung

Das nützliche Ergebnis ist der gemessene Detektor-Erkennungs-Kompromiss, nicht der nahezu perfekte geschlossene Wertzahl. Ein Pilot sollte Rückruf, Latenz, Einwilligung, Spoofing und das Verhalten unbekannter Personen auf den eigenen Kameras der Institution reproduzieren.