DenseFace: Bias-Reduktion in der Gesichtserkennung durch dichtebewusstes probabilistisches Matching
Autoren & Institutionen
Mansur Bultygov
VisionLabs
Vadim Seliutin
Amazon Web Services
VisionLabs (work performed there)
Dmitry Nekhaev
VisionLabs
Ivan Laptev
Mohamed bin Zayed University of Artificial Intelligence
Welches Problem es löst
DenseFace fragt, ob rassische Falsch-Abgleich-Ungleichheiten zur Vergleichszeit reduziert werden können, ohne den zugrunde liegenden Gesichtscodierer zu ändern oder neu zu trainieren. Es ersetzt auch die Standardabweichung der Untergruppen-Genauigkeit durch ein einsatzorientiertes Protokoll: Setze einen Schwellenwert bei einer falschen-Positiv-Rate von 0,001 für Kaukasier und messe, wie weit jede andere Kohorte von der Parität abweicht.
Zentrales Ergebnis
Über die CosFace- und AdaFace-Modelle, die mit Glint360K, MS1MV2, WebFace4M, WebFace12M und BUPT-BalancedFace trainiert wurden, wird derselbe globale Schwellenwert deutlich ausgeglichener. Beim BUPT-Modell fällt das Vielfache der falsch-positiven Ergebnisse der afrikanischen Kohorte von 6,15 auf 1,43 und bei der indischen Kohorte von 4,01 auf 1,03 im Vergleich zur kaukasischen Referenz. Die konventionelle Verifikationsgenauigkeit bleibt erhalten: Für ein CosFace Glint360K-Modell steigt die durchschnittliche RFW-Genauigkeit von 98,61 % auf 98,68 %, während die Standardabweichung der Untergruppen von 0,53 auf 0,44 fällt. Der Regressor benötigt in den GPU-Tests der Autoren etwa 0,2 % Speicher und 1,75 % End-to-End-Latenz; seine optimierte Berechnung auf der CPU kostet etwa 1,5-mal so viel wie die reine Kosinusberechnung. Die Ergebnisse hängen weiterhin von einer repräsentativen Anker- oder Trainingspopulation des Regressors ab.
Abstract
Trotz kontinuierlicher Fortschritte in der Gesichtserkennung leiden aktuelle Gesichtserkennungsmodelle weiterhin unter erheblichen demografischen Verzerrungen. Während Ansätze zur Minderung von Verzerrungen vorgeschlagen wurden, erzwingen bestehende Methoden oft Einschränkungen im Trainingsverfahren und führen zu einer Verschlechterung der Erkennungsgenauigkeit. Um dieses Problem zu lösen, stellen wir hier eine Methode vor, die rassistische Verzerrungen in vortrainierten Gesichtserkennungsmodellen reduziert, ohne deren Genauigkeit zu beeinträchtigen. Zu diesem Zweck modellieren wir Gesichtseinbettungen jeder Person durch die von-Mises-Fisher (MF)-Verteilung. Anschließend beobachten wir die Abhängigkeit zwischen demografischen Merkmalen und der Dichte der MF-Verteilungen und schlagen DenseFace vor, ein probabilistisches Verfahren zur Gesichtserkennung, das Unterschiede in MF-Verteilungen berücksichtigt. Unsere umfangreichen Experimente zeigen, dass DenseFace rassistische Verzerrungen in starken Gesichtserkennungsmodellen, die in Netzwerkarchitekturen, Trainingsdatensätzen und Verlustfunktionen variieren, konsequent reduziert. Bemerkenswerterweise bewahrt DenseFace die Erkennungsgenauigkeit und erfordert kein erneutes Training des zugrunde liegenden Gesichtserkennungsmodells. Unsere Arbeit untersucht auch zuvor verwendete Verzerrungsmaße und gibt Vorschläge.
Ausgangspunkt der Forschung
Gesichtserkennungssysteme verwenden oft eine globale Entscheidungsschwelle, doch unterscheiden sich die Verteilungen der Betrüger-Scores zwischen den demografischen Gruppen. Ein Modell kann daher auf RFW genau aussehen, wenn jede Gruppe ihre eigene kreuzvalidierte Schwelle erhält, während es in einem realen Dienst sehr unterschiedliche Falsch-Treffer-Raten erzeugt. Die meisten Minderungsmethoden erfordern außerdem ausgeglichene Trainingsdaten, Architekturänderungen oder Fairness-Verluste, die die Erkennungsleistung verringern können und schwer in ein genehmigtes Modell nachträglich einzufügen sind.
Methode
Für jede Gesichtseinbettung findet die Methode die nächstgelegenen Identitäten in einem demografisch ausgewogenen Anker-Set und schätzt die lokale Interklassen-Dichte. Sie stellt die Einbettung durch eine von Mises-Fisher-Verteilung dar, deren Konzentration diese Dichte widerspiegelt, und bewertet ein Paar anhand der gegenseitigen Wahrscheinlichkeit anstelle der rohen Kosinusähnlichkeit. Ein Abstand trennt nahestehende Identitäten, und eine leichte Regressor-Variante sagt die Dichte direkt voraus, sodass für die Produktionsabgleichung kein großer Anker-Lookup erforderlich ist. Der Encoder, die Einbettungsdimension und die Einschreibedaten bleiben unverändert.
Einordnung
Eine Fairness-Kontrolle auf Vergleichsebene kann die Kohortenparität verbessern, ohne das Modelltraining wieder zu öffnen, aber sie beseitigt nicht die Notwendigkeit repräsentativer Kalibrierungsdaten und Untergruppenüberwachung am tatsächlichen Betriebsschwellenwert.