← Zurück zum Blog
ForschungsradarGesichtserkennungarXivSeptember 2026

Monatlicher arXiv Radar

Face-Recognition-Studien im September 2026: Faireres Matching, thermische Anpassung und der Zwillings-Härtetest

Die Gesichtserkennungsforschung im September beschäftigt sich weniger mit einem weiteren Backbone-Rennen, sondern mehr mit schwierigen Einsatzbedingungen. DenseFace ändert die Matching-Regel eines bestehenden Modells, um rassische Falsch-Übereinstimmungs-Unterschiede zu verringern. SynThermFace verwandelt knapp vorhandene sichtbare-thermale Paare in einen größeren Anpassungssatz, ohne während der Inferenz Bildübersetzung hinzuzufügen. Das Celeb Twins Test Set fragt dann, ob heutige Embeddings die kleinen lokalen Hinweise verwenden, auf die Menschen angewiesen sind, um eineiige Zwillinge zu unterscheiden.

Was dieser Monat zeigt

DenseFace zeigt, dass die lokale Embedding-Dichte als post-hoc probabilistisches Matching-Signal genutzt werden kann, wodurch mehrere Falsch-Übereinstimmungsraten von Nicht-Kaukasiern erheblich näher an einen kaukasischen Referenzwert gebracht werden, während die Verifizierungsgenauigkeit erhalten bleibt. SynThermFace verwendet ein Diffusionsmodell nur während des Trainings und setzt dann einen einzelnen adaptierten EdgeFace-Forward-Pass ein; sein Modell synthetischer Paare erreicht 0,99% EER auf MCXFace, aber 14,70% auf nicht gesehenen Tufts-Daten, sodass Sensorübertragung weiterhin relevant bleibt. CTTS liefert 21.120 auf Zwillinge fokussierte Paare und stellt fest, dass zwölf moderne Matcher-Varianten etwa 73-77% Genauigkeit erreichen, obwohl ihr üblicher Benchmark-Durchschnitt etwa 97% beträgt. Die gemeinsame Lektion besteht darin, die Matching-Regel, das Capturing-Spektrum und die schwierige Identitätspopulation separat zu validieren, anstatt einen aggregierten Score als Produktionsbereitschaft zu betrachten.

Paper 012026-09-14cs.CV

DenseFace: Bias-Reduktion in der Gesichtserkennung durch dichtebewusstes probabilistisches Matching

Autoren & Institutionen

Mansur Bultygov

VisionLabs

Vadim Seliutin

Amazon Web Services

VisionLabs (work performed there)

Dmitry Nekhaev

VisionLabs

Ivan Laptev

Mohamed bin Zayed University of Artificial Intelligence

Welches Problem es löst

DenseFace fragt, ob rassische Falsch-Abgleich-Ungleichheiten zur Vergleichszeit reduziert werden können, ohne den zugrunde liegenden Gesichtscodierer zu ändern oder neu zu trainieren. Es ersetzt auch die Standardabweichung der Untergruppen-Genauigkeit durch ein einsatzorientiertes Protokoll: Setze einen Schwellenwert bei einer falschen-Positiv-Rate von 0,001 für Kaukasier und messe, wie weit jede andere Kohorte von der Parität abweicht.

Zentrales Ergebnis

Über die CosFace- und AdaFace-Modelle, die mit Glint360K, MS1MV2, WebFace4M, WebFace12M und BUPT-BalancedFace trainiert wurden, wird derselbe globale Schwellenwert deutlich ausgeglichener. Beim BUPT-Modell fällt das Vielfache der falsch-positiven Ergebnisse der afrikanischen Kohorte von 6,15 auf 1,43 und bei der indischen Kohorte von 4,01 auf 1,03 im Vergleich zur kaukasischen Referenz. Die konventionelle Verifikationsgenauigkeit bleibt erhalten: Für ein CosFace Glint360K-Modell steigt die durchschnittliche RFW-Genauigkeit von 98,61 % auf 98,68 %, während die Standardabweichung der Untergruppen von 0,53 auf 0,44 fällt. Der Regressor benötigt in den GPU-Tests der Autoren etwa 0,2 % Speicher und 1,75 % End-to-End-Latenz; seine optimierte Berechnung auf der CPU kostet etwa 1,5-mal so viel wie die reine Kosinusberechnung. Die Ergebnisse hängen weiterhin von einer repräsentativen Anker- oder Trainingspopulation des Regressors ab.

Abstract

Trotz kontinuierlicher Fortschritte in der Gesichtserkennung leiden aktuelle Gesichtserkennungsmodelle weiterhin unter erheblichen demografischen Verzerrungen. Während Ansätze zur Minderung von Verzerrungen vorgeschlagen wurden, erzwingen bestehende Methoden oft Einschränkungen im Trainingsverfahren und führen zu einer Verschlechterung der Erkennungsgenauigkeit. Um dieses Problem zu lösen, stellen wir hier eine Methode vor, die rassistische Verzerrungen in vortrainierten Gesichtserkennungsmodellen reduziert, ohne deren Genauigkeit zu beeinträchtigen. Zu diesem Zweck modellieren wir Gesichtseinbettungen jeder Person durch die von-Mises-Fisher (MF)-Verteilung. Anschließend beobachten wir die Abhängigkeit zwischen demografischen Merkmalen und der Dichte der MF-Verteilungen und schlagen DenseFace vor, ein probabilistisches Verfahren zur Gesichtserkennung, das Unterschiede in MF-Verteilungen berücksichtigt. Unsere umfangreichen Experimente zeigen, dass DenseFace rassistische Verzerrungen in starken Gesichtserkennungsmodellen, die in Netzwerkarchitekturen, Trainingsdatensätzen und Verlustfunktionen variieren, konsequent reduziert. Bemerkenswerterweise bewahrt DenseFace die Erkennungsgenauigkeit und erfordert kein erneutes Training des zugrunde liegenden Gesichtserkennungsmodells. Unsere Arbeit untersucht auch zuvor verwendete Verzerrungsmaße und gibt Vorschläge.

Ausgangspunkt der Forschung

Gesichtserkennungssysteme verwenden oft eine globale Entscheidungsschwelle, doch unterscheiden sich die Verteilungen der Betrüger-Scores zwischen den demografischen Gruppen. Ein Modell kann daher auf RFW genau aussehen, wenn jede Gruppe ihre eigene kreuzvalidierte Schwelle erhält, während es in einem realen Dienst sehr unterschiedliche Falsch-Treffer-Raten erzeugt. Die meisten Minderungsmethoden erfordern außerdem ausgeglichene Trainingsdaten, Architekturänderungen oder Fairness-Verluste, die die Erkennungsleistung verringern können und schwer in ein genehmigtes Modell nachträglich einzufügen sind.

Methode

Für jede Gesichtseinbettung findet die Methode die nächstgelegenen Identitäten in einem demografisch ausgewogenen Anker-Set und schätzt die lokale Interklassen-Dichte. Sie stellt die Einbettung durch eine von Mises-Fisher-Verteilung dar, deren Konzentration diese Dichte widerspiegelt, und bewertet ein Paar anhand der gegenseitigen Wahrscheinlichkeit anstelle der rohen Kosinusähnlichkeit. Ein Abstand trennt nahestehende Identitäten, und eine leichte Regressor-Variante sagt die Dichte direkt voraus, sodass für die Produktionsabgleichung kein großer Anker-Lookup erforderlich ist. Der Encoder, die Einbettungsdimension und die Einschreibedaten bleiben unverändert.

Einordnung

Eine Fairness-Kontrolle auf Vergleichsebene kann die Kohortenparität verbessern, ohne das Modelltraining wieder zu öffnen, aber sie beseitigt nicht die Notwendigkeit repräsentativer Kalibrierungsdaten und Untergruppenüberwachung am tatsächlichen Betriebsschwellenwert.

Paper 022026-09-09cs.CV

SynThermFace: Verstärkung begrenzter gepaarter Daten für sichtbar-thermische Gesichtserkennung mittels synthetischer Datengenerierung

Autoren & Institutionen

Anjith George

Idiap Research Institute, Switzerland

Adam Unal

Idiap Research Institute, Switzerland

Sebastien Marcel

Idiap Research Institute, Switzerland

University of Lausanne, Switzerland

Welches Problem es löst

SynThermFace verstärkt begrenzte gepaarte Überwachung für sichtbar-zu-thermische Erkennung und testet, ob synthetische thermische Paare sowohl die Genauigkeit in der Datenbank als auch die Übertragung auf einen Sensor/Datenbank verbessern, der nie für das Training verwendet wurde. Es trennt den Vorteil seines Anpassungsziels vom Vorteil der Skalierung synthetischer Identitäten.

Zentrales Ergebnis

Bei der disjunkten MCXFace-Entwicklungsaufteilung erreicht der reale Paar-PACT 3,04 % EER und 96,49 % Rang-1 und schlägt damit die vergleichbaren Realpaar-Adaptionsbasislinien. Mit 1.000 von CASIA abgeleiteten synthetischen Identitäten fällt EER auf 0,99 %, Rang 1 auf 99,75 % und die Verifikation bei 0,1 % FAR auf 93,48 %; die unadaptierte EdgeFace-Basislinie hat 23,06 % EER und 40,10 % Rang-1. Bei nicht gesehenen Tufts-Daten verbessert Digi2Real-abgeleitetes Training EdgeFace von 43,41 % auf 13,91 % EER und von 12,03 % auf 56,37 % Rang 1. Die verbleibende Lücke zwischen MCXFace und Tufts ist groß, und der Generator hängt weiterhin von echten MCXFace-Paaren ab, sodass die Methode die echte Cross-Spectral-Sammlung verringert statt eliminiert.

Abstract

Gesichtserkennung (FR) ist eine weit verbreitete Methode für biometrische Authentifizierung, aber konventionelle Modelle basieren auf sichtbaren Spektrumbildern und verschlechtern sich, wenn hochwertige RGB-Bilder nicht erfasst werden können. Crossspektrale Gesichtserkennung behebt diese Einschränkung, indem sichtbare Bilder mit anderen Modalitäten wie thermischen Bildern abgeglichen werden, was eine zuverlässigere Leistung bei wenig Licht, Nacht und uneingeschränkten Bedingungen ermöglicht. Der Fortschritt wird jedoch durch die Knappheit gepaarter sichtbar-thermischer Daten begrenzt, die schwer und kostspielig in großem Maßstab zu sammeln sind. Wir schlagen SynThermFace vor, ein Framework, das begrenzte reale sichtbar-thermische Überwachung in größere gepaarte Anpassungsdatensätze für crossspektrale Gesichtserkennung verstärkt. Ein Diffusionsmodell wird zunächst mit einem begrenzten Satz gepaarter sichtbarer Bilder adaptiert und anschließend zur Erstellung groß angelegter, gepaarter sichtbarer synthetischer Daten aus bestehenden realen oder synthetischen sichtbaren Gesichtsdatensätzen verwendet. Die erzeugten Paare werden verwendet, um ein vortrainiertes sichtbares Spektrum-Gesichtserkennungsmodell in ein CFR-Modell umzuwandeln. Im Gegensatz zu synthesebasierten Ansätzen, die Bildübersetzung zur Testzeit erfordern, verlagert die vorgeschlagene Methode die Erzeugung in die Trainingsphase und führt Inferenz mit einem einzigen Vorwärtsdurchgang durch das adaptierte Erkennungsmodell durch. Unter demselben MCXFace-Realpaarprotokoll verbessert sich PACT gegenüber den bewerteten CFR-Anpassungsbaselines und isoliert den Effekt des vorgeschlagenen Anpassungsziels. Das Training von PACT auf größeren, generierten gepaarten Datensätzen bringt zusätzliche Verbesserungen sowohl gegenüber dem unadaptierten Modell als auch gegenüber der realen PACT-Konfiguration. Die Datenbankübergreifende Bewertung des Tufts-Datensatzes liefert einen Nachweis dafür, dass die erlernte Darstellung in eine unsichtbare Datenbank übertragen wird. Der Quellcode und die trainierten Modelle werden öffentlich zugänglich gemacht.

Ausgangspunkt der Forschung

Wärmebildkameras können Authentifizierung und Überwachung unterstützen, wenn sichtbares Licht fehlschlägt, aber die meisten Identitätsgalerien sind RGB und gepaarte sichtbar-thermische Flächen sind teuer zu sammeln. Die direkte Übersetzung jeder thermischen Sonde zur Laufzeit fügt dem kritischen Pfad einen Generator hinzu und kann die Identität verändern. Die praktische Frage ist, ob ein kleines, reales gepaartes Set ein viel größeres Trainingsset überwachen kann, während die Bereitstellung als normale Einbettungssuche bleibt.

Methode

Ein Diffusionsgenerator wird zunächst auf dem gepaarten MCXFace-Trainingssplit angepasst und wandelt dann entweder echte CASIA-WebFace-Bilder oder synthetische Digi2Real-Identitäten in passende thermische Ansichten um. Preservation-Aware Cross-Spectral Tuning beginnt mit einem vortrainierten EdgeFace-Modell und kombiniert symmetrisches thermisch-sichtbares und sichtbar-zu-thermisches kontrastives Lernen mit einem Verlust, der sichtbare Einbettungen in der Nähe einer eingefrorenen Kopie des Originalmodells hält. Die Erzeugung erfolgt nur beim Aufbau des Anpassungssets; Inferenz ist ein Vorwärtsdurchgang durch den abgestimmten Erkenner.

Einordnung

Offline kann die synthetische thermische Erzeugung aus einer kleinen gepaarten Sammlung eine nützliche Erkennungsüberwachung ohne Laufzeitübersetzung verwandeln, aber neue Sensoren und Populationen benötigen weiterhin eigene Übertragungs- und Fairnesstests.

Paper 032026-09-01cs.CV

Gesichtserkennung für monozygotische Zwillinge neu betrachten: Das Celeb Twins Testset

Autoren & Institutionen

Michael Zang

Department of Computer Science and Engineering, University of Notre Dame

Haiyu Wu

Department of Computer Science and Engineering, University of Notre Dame

Mrinal Sharma

Department of Computer Science and Engineering, University of Notre Dame

Kevin W. Bowyer

Department of Computer Science and Engineering, University of Notre Dame

Welches Problem es löst

Das Paper erstellt einen verifikationsähnlichen Benchmark, der groß genug für die Kreuzvalidierung von Zwillingsdisjunkten ist und für lokale Unterscheidungsmerkmale und mögliche Spiegelasymmetrie annotiert ist. Anschließend wird getestet, ob moderne Deep-Face-Matcher diese Hinweise nutzen und ob das Entfernen von horizontalen Flip-Annahmen oder die Erzeugung synthetischer Zwillinge einen plausiblen Weg nach vorne bietet.

Zentrales Ergebnis

Die zwölf Matcher-Konfigurationen erreichen nur 73,14–76,50 % mittlere CTTS-Genauigkeit, gegenüber etwa 97,00–97,69 % im Durchschnitt über fünf konventionelle Verifikationssätze. Das Löschen sichtbarer Markierungen lässt Einbettungen und Paardistanzverteilungen im Wesentlichen unverändert, was darauf hindeutet, dass aktuelle Modelle Hinweise ignorieren, die Menschen verwenden können. Das asymmetriebewusste Retraining erreicht 78,58 % plus/minus 3,7 und unterscheidet sich statistisch nicht vom ursprünglichen Modell; es hilft einigen Spiegel-Zwilling-Sätzen und schadet anderen. Generierte Zwillinge bewahren keine realistische Struktur zwischen der Person und zwischen den Zwillingen, sodass sie noch kein validierter Trainingsersatz sind.

Abstract

Frühere Literatur zur Gesichtserkennung bei monozygotischen (("identische") Zwillingen weist auf Gesichtsmarkierungen und Spiegelasymmetrie als mögliche Hinweise auf eine verbesserte Genauigkeit der Zwillingserkennung hin. Das Celeb Twins Test Set (CTTS) enthält Web-Scraped-Bildpaare für 80 Paar von Promi-Zwillingen. Es ist das einzige Zwillingstestset mit Metadaten für Zwillinge mit unterscheidenden Hautspuren und möglicher Spiegelasymmetrie. CTTS ist nach Gesichtsverifikationstestsets wie LFW, CALFW, CPLFW, CFP-FP und AgeDB-30 organisiert. Aktuelle Deep CNN-Matcher können über 76 % Genauigkeit bei der Klassifizierung von CTTS-Bilderpaaren für dieselbe Person / andere Person erreichen. Wir zeigen, dass aktuelle Matcher keine Hautmarkierungen oder Asymmetrie verwenden, und diskutieren die Gründe dafür. Abschließend besprechen wir die Machbarkeit der Nutzung generativer KI-Tools wie Grok, ChatGPT und Gemini, um Bilder von imaginierten monozygotischen Zwillingen zu erstellen, um die Repräsentation von Zwillingen in Gesichtserkennungstrainings zu erhöhen.

Ausgangspunkt der Forschung

Monozygotische Zwillinge legen eine Identitätsgrenze offen, die gewöhnliche Gesichts-Benchmarks kaum repräsentieren. NIST berichtete zuvor, dass bei einer Schwelle für eine False-Match-Rate von 0,0001 viele Algorithmen 98–99 % der Zeit einen Zwilling als den anderen akzeptierten. Bestehende Zwillingsdatensätze sind klein, alt oder fehlen Metadaten zu Sommersprossen, Muttermalen, Narben und dem Spiegel-Zwilling-Status, was es schwierig macht zu erkennen, welche Hinweise moderne Einbettungen tatsächlich verwenden.

Methode

CTTS-80 sammelt Webbilder für 80 Promi-Zwillingssets und konstruiert 21.120 ausgewogene gleiche-Person- und Zwillings-Impostor-Paare über zehn Falten, wobei jedes Zwillingsset vollständig innerhalb einer Falte bleibt. Die Autoren bewerten ArcFace-, AdaFace-, UniFace und MagFace ResNet-100-Modelle, die auf drei gemeinsamen Datensätzen trainiert sind. Sie löschen sichtbare Hautmarkierungen in ausgewählten Identitäten, vergleichen originale und bearbeitete Einbettungsverteilungen, trainieren ArcFace ohne horizontale Flip-Augmentation neu und inspizieren synthetische Zwillingssätze, die von drei generativen Systemen angefordert werden.

Einordnung

Zwillingsverifikation bleibt eine eigenständige Risikoklasse: Standardgenauigkeit sagt wenig darüber aus, und heutige Einbettungen scheinen keine offensichtlichen lokalen Markierungen zu verwenden. Hochsichere Einsätze sollten Zwillings-Betrüger explizit testen, anstatt die Leistung aus allgemeinen Benchmarks abzuleiten.