DenseFace : atténuation des biais en reconnaissance faciale par appariement probabiliste sensible à la densité
Auteurs & institutions
Mansur Bultygov
VisionLabs
Vadim Seliutin
Amazon Web Services
VisionLabs (work performed there)
Dmitry Nekhaev
VisionLabs
Ivan Laptev
Mohamed bin Zayed University of Artificial Intelligence
Problème traité
DenseFace demande si les disparités raciales de fausse correspondance peuvent être réduites au moment de la comparaison, sans changer ni réentraîner l’encodeur facial sous-jacent. Il remplace également l’écart-type de précision des sous-groupes par un protocole orienté déploiement : fixer un seuil à un taux caucasien de faux positifs de 0,001 et mesurer la distance que chaque autre cohorte s’éloigne de la parité.
Résultat clé
Sur les modèles CosFace et AdaFace entraînés avec Glint360K, MS1MV2, WebFace4M, WebFace12M et BUPT-BalancedFace, le même seuil global devient nettement plus équilibré. Sur le modèle BUPT, le multiple faux positif de la cohorte africaine passe de 6,15 à 1,43 et celui de la cohorte indienne de 4,01 à 1,03 par rapport à la référence caucasienne. La précision de la vérification conventionnelle est préservée : pour un modèle CosFace Glint360K, la précision moyenne RFW passe de 98,61 % à 98,68 % tandis que l’écart-type du sous-groupe passe de 0,53 à 0,44. Le régresseur ajoute environ 0,2 % de mémoire et 1,75 % de latence de bout en bout dans le test GPU des auteurs ; son calcul optimisé du score CPU est environ 1,5 fois le coût brut du cosinus. Les résultats dépendent encore d’une population d’entraînement représentative d’ancrage ou de régresseur.
Résumé
Malgré des progrès constants dans la reconnaissance faciale, les modèles actuels souffrent encore de biais démographiques importants. Bien que des approches de mitigation des biais aient été proposées, les méthodes existantes imposent souvent des contraintes à la procédure d’entraînement et entraînent une dégradation de la précision de la reconnaissance. Pour répondre à ce problème, nous introduisons ici une méthode qui réduit les biais raciaux dans les modèles pré-entraînés sans compromettre leur précision. À cette fin, nous modélisons les embeddings faciaux de chaque personne selon la distribution von Mises-Fisher (MF). Nous observons ensuite la dépendance entre les attributs démographiques et la densité des distributions MF, et proposons DenseFace, une procédure probabiliste de correspondance faciale qui prend en compte les différences dans les distributions MF. Nos expériences approfondies démontrent que DenseFace réduit systématiquement les biais raciaux dans des modèles forts de reconnaissance faciale variant en architectures réseau, ensembles de données d’entraînement et fonctions de perte. Notamment, DenseFace préserve la précision de la reconnaissance et ne nécessite aucun réentraînement du modèle sous-jacent. Notre travail étudie également les mesures de biais précédemment adoptées et fait des suggestions.
Point de départ de la recherche
Les systèmes de reconnaissance faciale utilisent souvent un seuil global de décision, mais les distributions des scores imposteurs diffèrent selon les groupes démographiques. Un modèle peut donc paraître exact sur RFW lorsque chaque groupe reçoit son propre seuil validé croisément, tout en produisant des taux de fausse correspondance très différents dans un service réel. La plupart des méthodes d’atténuation nécessitent également des données de réentraînement équilibrées, des modifications d’architecture ou des pertes d’équité qui peuvent réduire la performance de reconnaissance et sont difficiles à adapter dans un modèle approuvé.
Méthode
Pour chaque plongement de face, la méthode trouve les identités les plus proches dans un ensemble d’ancrage démographiquement équilibré et estime la densité locale inter-classes. Elle représente l’inclusion avec une distribution de von Mises-Fisher dont la concentration reflète cette densité, puis évalue une paire selon la vraisemblance mutuelle plutôt que la similarité cosinus brute. Une marge sépare les identités des proches voisins, et une variante régresseur légère prédit directement la densité, de sorte que l’appariement de production n’a pas besoin d’une grande recherche d’ancre. L’encodeur, la dimension d’inclusion et les données d’inscription restent inchangées.
À retenir
Un contrôle de l'équité au niveau de la couche de comparaison peut améliorer la parité des cohortes sans rouvrir l'entraînement du modèle, mais il ne supprime pas le besoin de données de calibration représentatives et de suivi des sous-groupes au seuil opérationnel réel.