← Volver al Blog
Radar de InvestigaciónReconocimiento FacialarXivSeptiembre 2026

Radar arXiv Mensual

Artículos sobre Reconocimiento Facial de Septiembre 2026: Emparejamiento más Justo, Adaptación Térmica y la Prueba de Gemelos

La investigación de reconocimiento facial de septiembre se centra menos en otra carrera de arquitecturas y más en regímenes operativos difíciles. DenseFace cambia la regla de emparejamiento de un modelo existente para reducir las disparidades raciales de falsos positivos. SynThermFace convierte pares visibles-térmicos escasos en un conjunto de adaptación más grande sin añadir traducción de imágenes durante la inferencia. El Conjunto de Pruebas de Gemelos Celeb (CTTS) luego pregunta si las incrustaciones actuales utilizan las pequeñas pistas locales que los humanos usan para distinguir gemelos monocigóticos.

Lo que señala este mes

DenseFace muestra que la densidad de incrustación local puede utilizarse como una señal de emparejamiento probabilística post-hoc, acercando varias tasas de falsos positivos no caucásicos mucho más cerca de un referente caucásico mientras se preserva la exactitud de verificación. SynThermFace usa un modelo de difusión solo durante el entrenamiento, luego despliega una única pasada adaptada de EdgeFace; su modelo de pares sintéticos alcanza 0,99% EER en MCXFace pero 14,70% en datos no vistos de Tufts, por lo que la transferencia de sensores sigue siendo significativa. CTTS contribuye con 21,120 pares enfocados en gemelos y encuentra que doce variantes modernas de emparejadores permanecen alrededor del 73-77% de exactitud aunque su promedio habitual del benchmark sea aproximadamente 97%. La lección compartida es validar la regla de emparejamiento, capturar el espectro y la población de identidades difíciles por separado en lugar de tratar un puntaje agregado como preparación para producción.

Artículo 012026-09-14cs.CV

DenseFace: Mitigación de Sesgos en el Reconocimiento Facial a través de Emparejamiento Probabilístico Consciente de la Densidad

Autores e instituciones

Mansur Bultygov

VisionLabs

Vadim Seliutin

Amazon Web Services

VisionLabs (work performed there)

Dmitry Nekhaev

VisionLabs

Ivan Laptev

Mohamed bin Zayed University of Artificial Intelligence

Qué problema resuelve

DenseFace pregunta si las disparidades raciales de falsas coincidencias pueden reducirse en el momento de la comparación, sin cambiar ni reentrenar el codificador facial subyacente. También reemplaza la desviación estándar de precisión de subgrupos por un protocolo orientado al despliegue: establecer un umbral a una tasa caucásica de falsos positivos de 0,001 y medir hasta qué punto se alejan todas las demás cohortes de la paridad.

Resultado clave

En los modelos CosFace y AdaFace entrenados con Glint360K, MS1MV2, WebFace4M, WebFace12M y BUPT-BalancedFace, el mismo umbral global se vuelve sustancialmente más uniforme. En el modelo BUPT, el múltiplo de falsos positivos de la cohorte africana cae de 6,15 a 1,43 y la cohorte india de 4,01 a 1,03 en relación con la referencia caucásica. Se mantiene la precisión convencional de verificación: para un modelo CosFace Glint360K, la precisión media de RFW sube del 98,61% al 98,68%, mientras que la desviación estándar del subgrupo cae de 0,53 a 0,44. El regresor añade aproximadamente un 0,2% de memoria y un 1,75% de latencia de extremo a extremo en la prueba GPU de los autores; su cálculo optimizado de puntuación de CPU es aproximadamente 1,5 veces el coste bruto del coseno. Los resultados siguen dependiendo de una población ancla o regresora representativa en formación.

Resumen

A pesar del progreso constante en el reconocimiento facial, los modelos actuales siguen sufriendo sesgos demográficos significativos. Aunque se han propuesto enfoques para mitigar el sesgo, los métodos existentes a menudo imponen restricciones al procedimiento de entrenamiento y resultan en la degradación de la precisión del reconocimiento. Para abordar este problema, aquí introducimos un método que reduce el sesgo racial en modelos preentrenados sin comprometer su precisión. Para ello, modelamos incrustaciones faciales de cada persona mediante la distribución von Mises-Fisher (MF). A continuación observamos la dependencia entre atributos demográficos y la densidad de distribuciones MF, y proponemos DenseFace, un procedimiento probabilístico de emparejamiento facial que tiene en cuenta las diferencias en las distribuciones MF. Nuestros extensos experimentos demuestran que DenseFace reduce consistentemente el sesgo racial en modelos fuertes de reconocimiento facial que varían en arquitecturas de red, conjuntos de datos de entrenamiento y funciones de pérdida. Cabe destacar que DenseFace preserva la precisión del reconocimiento facial y no requiere reentrenamiento del modelo subyacente. Nuestro trabajo también investiga medidas de sesgo previamente adoptadas y hace sugerencias.

Punto de partida

Los sistemas de reconocimiento facial suelen usar un umbral global de decisión, pero las distribuciones de puntuación del impostor varían entre grupos demográficos. Por tanto, un modelo puede parecer preciso en RFW cuando cada grupo recibe su propio umbral de validación cruzada, produciendo tasas de coincidencia falsa muy diferentes en un servicio real. La mayoría de los métodos de mitigación también requieren datos de reentrenamiento balanceados, cambios en la arquitectura o pérdidas de equidad que pueden reducir el rendimiento del reconocimiento y son difíciles de adaptar a un modelo aprobado.

Método

Para cada incrustación de caras, el método encuentra las identidades más cercanas en un conjunto de anclajes demográficamente equilibrado y estima la densidad local entre clases. Representa la incrustación con una distribución de von Mises-Fisher cuya concentración refleja esa densidad, y luego puntua un par por probabilidad mutua en lugar de similitud coseno pura. Un margen separa las identidades de vecinos cercanos, y una variante regresora ligera predice la densidad directamente, por lo que la emparejamiento de producción no necesita una búsqueda de ancla grande. El codificador, la dimensión de incrustación y los datos de inscripción permanecen sin cambios.

Conclusión del artículo

Un control de equidad a nivel de capa de comparación puede mejorar la paridad del grupo sin reabrir el entrenamiento del modelo, pero no elimina la necesidad de datos de calibración representativos y de supervisión de subgrupos en el umbral operativo real.

Artículo 022026-09-09cs.CV

SynThermFace: Ampliación de datos apareados limitados para reconocimiento de rostros visible-térmico mediante generación de datos sintéticos

Autores e instituciones

Anjith George

Idiap Research Institute, Switzerland

Adam Unal

Idiap Research Institute, Switzerland

Sebastien Marcel

Idiap Research Institute, Switzerland

University of Lausanne, Switzerland

Qué problema resuelve

SynThermFace amplifica la supervisión apareada limitada para el reconocimiento de visible a térmico y prueba si los pares térmicos sintéticos mejoran tanto la precisión dentro de la base de datos como la transferencia a un sensor/base de datos que nunca se utilizó para el entrenamiento. Separa el beneficio de su objetivo de adaptación del beneficio de escalar identidades sintéticas.

Resultado clave

En la división de desarrollo disjunta de MCXFace, PACT con pares reales alcanza un 3.04% EER y 96.49% Rank-1, superando las líneas base de adaptación de pares reales comparadas. Con 1,000 identidades sintéticas derivadas de CASIA, el EER cae a 0.99%, Rank-1 alcanza 99.75%, y la verificación a 0.1% FAR alcanza 93.48%; la línea base EdgeFace no adaptada tiene 23.06% EER y 40.10% Rank-1. En datos no vistos de Tufts, el entrenamiento derivado de Digi2Real mejora EdgeFace de 43.41% a 13.91% EER y de 12.03% a 56.37% Rank-1. La brecha restante de MCXFace a Tufts es grande, y el generador todavía depende de pares reales de MCXFace, por lo que el método reduce en lugar de eliminar la recolección real cross-espectral.

Resumen

El reconocimiento facial (FR) es una modalidad ampliamente utilizada para la autenticación biométrica, pero los modelos convencionales dependen de imágenes en el espectro visible y su rendimiento se degrada cuando no se pueden capturar imágenes RGB de alta calidad. El reconocimiento facial cruzado espectral aborda esta limitación al emparejar imágenes visibles con otras modalidades como imágenes térmicas, lo que permite un rendimiento más confiable en condiciones de poca luz, nocturnas y no controladas. Sin embargo, el progreso se ve limitado por la escasez de datos apareados visibles-térmicos, que son difíciles y costosos de recopilar a gran escala. Proponemos SynThermFace, un marco que amplifica la supervisión limitada de pares reales visibles-térmicos en conjuntos de datos de adaptación apareados más grandes para el reconocimiento de rostros cruzado espectral. Primero, se adapta un modelo de difusión usando un conjunto limitado de imágenes apareadas visibles-térmicas y luego se utiliza para generar datos apareados de gran escala visibles-térmicos sintéticos a partir de conjuntos de datos de rostros visibles reales o sintéticos existentes. Los pares generados se utilizan para adaptar un modelo de reconocimiento facial en el espectro visible previamente entrenado en un modelo CFR. A diferencia de los enfoques basados en síntesis que requieren traducción de imagen en tiempo de prueba, el método propuesto traslada la generación a la etapa de entrenamiento y realiza la inferencia con un solo pase hacia adelante a través del modelo de reconocimiento adaptado. Bajo el mismo protocolo MCXFace de pares reales, PACT mejora sobre las bases de adaptación CFR evaluadas, aislando el efecto del objetivo de adaptación propuesto. Entrenar PACT en conjuntos de datos apareados generados más grandes proporciona mejoras adicionales tanto sobre el modelo no adaptado como sobre la configuración de PACT con pares reales. La evaluación cruzada de bases de datos en el conjunto de datos Tufts proporciona evidencia de que la representación aprendida se transfiere a una base de datos no vista. El código fuente y los modelos entrenados estarán disponibles públicamente.

Punto de partida

Las cámaras térmicas pueden apoyar la autenticación y la vigilancia cuando la captura de luz visible falla, pero la mayoría de las galerías de identidad son RGB y los rostros visibles-térmicos apareados son costosos de recopilar. Traducir directamente cada sonda térmica en tiempo de ejecución agrega un generador a la ruta crítica y puede alterar la identidad. La pregunta práctica es si un pequeño conjunto apareado real puede supervisar un conjunto de entrenamiento mucho más grande mientras se deja el despliegue como una búsqueda de incrustación normal.

Método

Un generador de difusión se adapta primero en la división de entrenamiento emparejada de MCXFace, luego convierte imágenes reales de CASIA-WebFace o identidades sintéticas de Digi2Real en vistas térmicas correspondientes. La Afinación Cross-Espectral con Conservación comienza a partir de un modelo EdgeFace preentrenado y combina aprendizaje contrastivo simétrico de térmico a visible y de visible a térmico con una pérdida que mantiene los embeddings visibles cerca de una copia congelada del modelo original. La generación ocurre solamente mientras se construye el conjunto de adaptación; la inferencia es un único pase hacia adelante a través del reconocedor afinado.

Conclusión del artículo

La generación térmica sintética fuera de línea puede convertir una pequeña colección emparejada en una supervisión útil para el reconocimiento sin traducción en tiempo de ejecución, pero nuevos sensores y poblaciones aún necesitan sus propias pruebas de transferencia y equidad.

Artículo 032026-09-01cs.CV

Revisando el Reconocimiento Facial para Gemelos Monocigóticos: El Conjunto de Prueba Celeb Twins

Autores e instituciones

Michael Zang

Department of Computer Science and Engineering, University of Notre Dame

Haiyu Wu

Department of Computer Science and Engineering, University of Notre Dame

Mrinal Sharma

Department of Computer Science and Engineering, University of Notre Dame

Kevin W. Bowyer

Department of Computer Science and Engineering, University of Notre Dame

Qué problema resuelve

El artículo crea un benchmark estilo verificación que es lo suficientemente grande para validación cruzada disjunta de gemelos y anotado para marcas distintivas locales y posible asimetría espejo. Luego prueba si los comparadores faciales profundos modernos explotan esas señales y si eliminar supuestos de volteo horizontal o generar gemelos sintéticos proporciona un camino plausible hacia adelante.

Resultado clave

Las doce configuraciones de emparejamiento logran solo un 73,14-76,50% de precisión media en CTTS, frente a aproximadamente un 97,00-97,69% promedio en cinco conjuntos de verificación convencionales. Borrar marcas visibles deja las distribuciones de incrustaciones y distancias de pares prácticamente sin cambios, lo que indica que los modelos actuales ignoran las señales que los humanos pueden usar. El reentrenamiento consciente de la asimetría alcanza 78,58% más o menos 3,7 y no es estadísticamente diferente del modelo original; ayuda a algunos pares de gemelos espejo y perjudica a otros. Los gemelos generados no conservan una estructura realista de distancias dentro de la persona y entre gemelos, por lo que todavía no son un sustituto de entrenamiento validado.

Resumen

La literatura pasada sobre reconocimiento facial para gemelos monocigóticos ("idénticos") señala las marcas faciales y la asimetría espejo como posibles direcciones para mejorar la precisión del reconocimiento de gemelos. El Conjunto de Prueba Celeb Twins (CTTS) contiene pares de imágenes obtenidas de la web para 80 conjuntos de gemelos celebridades. Es el único conjunto de prueba de gemelos con metadatos para gemelos con marcas distintivas en la piel y posible asimetría espejo. CTTS está organizado de manera similar a conjuntos de prueba de verificación facial como LFW, CALFW, CPLFW, CFP-FP y AgeDB-30. Los comparadores profundos de CNN actuales pueden alcanzar más del 76% de precisión al clasificar pares de imágenes de CTTS como de la misma persona / diferentes personas. Mostramos que los comparadores actuales no utilizan marcas en la piel ni la asimetría, y discutimos las razones de esto. Finalmente, discutimos la viabilidad de usar herramientas de IA generativa como Grok, ChatGPT y Gemini para crear imágenes de gemelos monocigóticos imaginados como una forma de aumentar la representación de gemelos en los conjuntos de entrenamiento de reconocimiento facial.

Punto de partida

Los gemelos monocigóticos exponen un límite de identidad que los benchmarks faciales ordinarios apenas representan. NIST reportó previamente que, con un umbral elegido para una tasa de coincidencia falsa entre no gemelos de 0.0001, muchos algoritmos aceptaban a un gemelo como el otro el 98-99% del tiempo. Los conjuntos de datos de gemelos existentes son pequeños, antiguos o carecen de metadatos sobre pecas, lunares, cicatrices y estado de gemelo espejo, lo que dificulta aprender qué señales usan realmente los embeddings modernos.

Método

CTTS-80 recopila imágenes web de 80 pares de celebridades gemelas y construye 21.120 pares equilibrados de la misma persona y de impostores gemelos a lo largo de diez pliegues, manteniendo cada par de gemelos completamente dentro de un pliegue. Los autores evalúan los modelos ArcFace, AdaFace, UniFace y MagFace ResNet-100 entrenados en tres conjuntos de datos comunes. Borra marcas visibles en la piel de identidades seleccionadas, compara las distribuciones de incrustaciones originales y editadas, reentrena ArcFace sin la augmentación de volteo horizontal e inspecciona conjuntos de gemelos sintéticos solicitados a tres sistemas generativos.

Conclusión del artículo

La verificación de gemelos sigue siendo una clase de riesgo distinta: la precisión estándar dice poco al respecto, y las incrustaciones actuales parecen no usar marcas locales obvias. Las implementaciones con alta seguridad deberían probar explícitamente a los impostores gemelos en lugar de inferir el rendimiento a partir de puntos de referencia generales.