DenseFace: Mitigación de Sesgos en el Reconocimiento Facial a través de Emparejamiento Probabilístico Consciente de la Densidad
Autores e instituciones
Mansur Bultygov
VisionLabs
Vadim Seliutin
Amazon Web Services
VisionLabs (work performed there)
Dmitry Nekhaev
VisionLabs
Ivan Laptev
Mohamed bin Zayed University of Artificial Intelligence
Qué problema resuelve
DenseFace pregunta si las disparidades raciales de falsas coincidencias pueden reducirse en el momento de la comparación, sin cambiar ni reentrenar el codificador facial subyacente. También reemplaza la desviación estándar de precisión de subgrupos por un protocolo orientado al despliegue: establecer un umbral a una tasa caucásica de falsos positivos de 0,001 y medir hasta qué punto se alejan todas las demás cohortes de la paridad.
Resultado clave
En los modelos CosFace y AdaFace entrenados con Glint360K, MS1MV2, WebFace4M, WebFace12M y BUPT-BalancedFace, el mismo umbral global se vuelve sustancialmente más uniforme. En el modelo BUPT, el múltiplo de falsos positivos de la cohorte africana cae de 6,15 a 1,43 y la cohorte india de 4,01 a 1,03 en relación con la referencia caucásica. Se mantiene la precisión convencional de verificación: para un modelo CosFace Glint360K, la precisión media de RFW sube del 98,61% al 98,68%, mientras que la desviación estándar del subgrupo cae de 0,53 a 0,44. El regresor añade aproximadamente un 0,2% de memoria y un 1,75% de latencia de extremo a extremo en la prueba GPU de los autores; su cálculo optimizado de puntuación de CPU es aproximadamente 1,5 veces el coste bruto del coseno. Los resultados siguen dependiendo de una población ancla o regresora representativa en formación.
Resumen
A pesar del progreso constante en el reconocimiento facial, los modelos actuales siguen sufriendo sesgos demográficos significativos. Aunque se han propuesto enfoques para mitigar el sesgo, los métodos existentes a menudo imponen restricciones al procedimiento de entrenamiento y resultan en la degradación de la precisión del reconocimiento. Para abordar este problema, aquí introducimos un método que reduce el sesgo racial en modelos preentrenados sin comprometer su precisión. Para ello, modelamos incrustaciones faciales de cada persona mediante la distribución von Mises-Fisher (MF). A continuación observamos la dependencia entre atributos demográficos y la densidad de distribuciones MF, y proponemos DenseFace, un procedimiento probabilístico de emparejamiento facial que tiene en cuenta las diferencias en las distribuciones MF. Nuestros extensos experimentos demuestran que DenseFace reduce consistentemente el sesgo racial en modelos fuertes de reconocimiento facial que varían en arquitecturas de red, conjuntos de datos de entrenamiento y funciones de pérdida. Cabe destacar que DenseFace preserva la precisión del reconocimiento facial y no requiere reentrenamiento del modelo subyacente. Nuestro trabajo también investiga medidas de sesgo previamente adoptadas y hace sugerencias.
Punto de partida
Los sistemas de reconocimiento facial suelen usar un umbral global de decisión, pero las distribuciones de puntuación del impostor varían entre grupos demográficos. Por tanto, un modelo puede parecer preciso en RFW cuando cada grupo recibe su propio umbral de validación cruzada, produciendo tasas de coincidencia falsa muy diferentes en un servicio real. La mayoría de los métodos de mitigación también requieren datos de reentrenamiento balanceados, cambios en la arquitectura o pérdidas de equidad que pueden reducir el rendimiento del reconocimiento y son difíciles de adaptar a un modelo aprobado.
Método
Para cada incrustación de caras, el método encuentra las identidades más cercanas en un conjunto de anclajes demográficamente equilibrado y estima la densidad local entre clases. Representa la incrustación con una distribución de von Mises-Fisher cuya concentración refleja esa densidad, y luego puntua un par por probabilidad mutua en lugar de similitud coseno pura. Un margen separa las identidades de vecinos cercanos, y una variante regresora ligera predice la densidad directamente, por lo que la emparejamiento de producción no necesita una búsqueda de ancla grande. El codificador, la dimensión de incrustación y los datos de inscripción permanecen sin cambios.
Conclusión del artículo
Un control de equidad a nivel de capa de comparación puede mejorar la paridad del grupo sin reabrir el entrenamiento del modelo, pero no elimina la necesidad de datos de calibración representativos y de supervisión de subgrupos en el umbral operativo real.