← Volver al Blog
Radar de investigaciónReconocimiento facialarXivJulio de 2026

Radar mensual de arXiv

Artículos sobre reconocimiento facial de julio de 2026: modelos de base sintética, infrarrojo cercano para vehículos y cámaras sin lentes.

Los artículos sobre reconocimiento facial publicados en julio trasladan el debate de la precisión basada únicamente en pruebas comparativas a los datos y sistemas de captura que determinan la calidad de la implementación. Los trabajos seleccionados ponen a prueba el entrenamiento sintético que respeta la privacidad en dos escalas de datos, presentan un conjunto de datos de control fronterizo espectral cruzado con sondas a través del vidrio y miden qué sucede cuando la cámara se reemplaza por un codificador óptico sin lentes.

Lo que señala este mes

La adaptación exclusivamente sintética puede hacer que un modelo de visión general sea competitivo para el reconocimiento facial, pero la estrategia ganadora cambia drásticamente con el volumen de datos. DriveFace demuestra que incluso un modelo de incrustación robusto presenta errores significativos cuando las imágenes de registro visibles se comparan con sondas NIR en movimiento a través del cristal de un automóvil. LFD lleva la pila de captura más allá al tratar la óptica sin lentes, la reconstrucción, la detección y el reconocimiento como componentes vinculados. La conclusión común es que el rendimiento de la implementación depende de todo el proceso de adquisición e incrustación, no solo de la pérdida de reconocimiento.

Artículo 012026-07-27cs.CV

IJCB-AFMFR 2026: Competición sobre la adaptación de modelos básicos para el reconocimiento facial mediante datos de entrenamiento sintéticos.

Autores e instituciones

Tahar Chettaoui

Fraunhofer Institute for Computer Graphics Research IGD, Germany

Guray Ozgur

Fraunhofer Institute for Computer Graphics Research IGD, Germany

Technical University of Darmstadt, Germany

Eduarda Caldeira

Fraunhofer Institute for Computer Graphics Research IGD, Germany

Technical University of Darmstadt, Germany

Arturas Nakvosas

Vilnius University, Lithuania

Hatef Otroshi Shahreza

Idiap Research Institute, Switzerland

Sébastien Marcel

Idiap Research Institute, Switzerland

Rishabh Shukla

Indian Institute of Technology Jammu, India

Aditya Takkar

Indian Institute of Technology Jammu, India

Rushil Khullar

Indian Institute of Technology Jammu, India

Lalak Yadav

Indian Institute of Technology Jammu, India

Gourav Gupta

ArogyaPandit Private Limited, India

Anant Gupta

ArogyaPandit Private Limited, India

Shiqi Yu

Southern University of Science and Technology, China

Vitomir Struc

University of Ljubljana, Slovenia

Naser Damer

Fraunhofer Institute for Computer Graphics Research IGD, Germany

Technical University of Darmstadt, Germany

Fadi Boutros

Fraunhofer Institute for Computer Graphics Research IGD, Germany

Qué problema resuelve

Los desafíos anteriores con datos sintéticos combinaban la calidad del generador, la elección de la arquitectura base y las recetas de entrenamiento. Esta evaluación comparativa corrige CLIP ViT-L/14 y el generador IDPERTURB para que el ajuste fino completo, LoRA, LoRA con rango estabilizado y la adaptación solo por proyección puedan compararse con los mismos datos de identidad y el mismo conjunto de evaluación.

Resultado clave

El ajuste fino completo con Sub-Center ArcFace lidera la pista de datos completos con una precisión promedio del 95,51 % en los puntos de referencia pequeños y un TAR del 87,42 % en FAR 1e-5 en IJB-C, frente al 76,71 % de la línea base FRoundation. Con datos limitados, rsLoRA es más robusto: Idiap-BSP alcanza una precisión promedio del 94,52 % y un TAR del 81,13 % en IJB-C en FAR 1e-5. La evaluación de equidad también cambia según el régimen, con el ganador de datos completos alcanzando una precisión RFW promedio del 91,70 % y el ganador de datos limitados el 88,92 %.

Resumen

Este artículo presenta un resumen de la Competencia sobre Adaptación de Modelos Fundamentales para el Reconocimiento Facial mediante Datos de Entrenamiento Sintéticos (AFMFR), celebrada en la Conferencia Internacional Conjunta sobre Biometría de 2026 (IJCB 2026). La competencia recibió un total de ocho propuestas válidas de cuatro equipos distintos en dos pistas complementarias: una Pista de Datos Completos, en la que los participantes adaptan el modelo fundamental CLIP ViT-L/14 utilizando datos de identidad sintéticos a gran escala, y una Pista de Datos Limitados, diseñada para reflejar regímenes de adaptación con recursos más restringidos. Todos los datos de entrenamiento se generaron exclusivamente utilizando IDPERTURB. Las soluciones presentadas se clasifican en función del rendimiento de verificación e identificación en un conjunto diverso de puntos de referencia, incluidos LFW, CFP-FP, AgeDB-30, CALFW, CPLFW, IJB-B, IJB-C y TinyFace, utilizando el método de conteo de Borda. Adicionalmente, se realiza una evaluación de equidad en el conjunto de datos RFW en cuatro grupos demográficos. Los resultados demuestran que la adaptación del modelo base CLIP con datos de entrenamiento sintéticos mejora sustancialmente el modelo estándar y, en varios casos, supera el modelo de referencia. En particular, el ajuste fino completo con Sub-Center ArcFace (DMSTI-Neurotechnology) lidera la categoría de datos completos, mientras que la adaptación LoRA estabilizada por rango (Idiap-BSP) resulta ser la más eficaz en condiciones de datos limitados.

Punto de partida

Los desarrolladores de reconocimiento facial carecen cada vez más de conjuntos de entrenamiento amplios y consensuados de rostros reales, mientras que los modelos básicos de visión artificial no son suficientemente discriminatorios en puntos operativos biométricos estrictos sin adaptación. La competición plantea la cuestión de si las identidades sintéticas pueden proporcionar dicha adaptación y cuánta capacidad de entrenamiento es apropiada cuando el conjunto sintético disponible cambia en más de un orden de magnitud.

Método

La competición define una pista de datos completa con aproximadamente tres millones de imágenes de 35 000 identidades sintéticas y una pista de datos limitada con 250 000 imágenes de 5000 identidades. Ocho propuestas válidas se evalúan mediante una agregación de Borda en cinco conjuntos de verificación pequeños: IJB-B, IJB-C y TinyFace, mientras que RFW mide la dispersión del rendimiento en cuatro grupos demográficos. Los métodos presentados exploran actualizaciones de la estructura principal completa, clasificaciones LoRA y rsLoRA, pérdidas de margen, aumento de datos y ajuste de proyección ligero.

Conclusión del artículo

Para los equipos que adaptan una arquitectura visual compleja, el volumen de datos sintéticos debe guiar la estrategia de optimización. La optimización completa resulta rentable a escala de millones de imágenes, mientras que el algoritmo rsLoRA de alto rango actúa como un regularizador útil cuando las identidades y las imágenes están restringidas; es poco probable que una sola solución sea óptima para ambos escenarios.

Artículo 022026-07-15cs.CV

DriveFace: Un conjunto de datos faciales de espectro cruzado a través del cristal para el control fronterizo vehicular en movimiento.

Autores e instituciones

Anjith George

Idiap Research Institute, Switzerland

Luis S. Luevano

Idiap Research Institute, Switzerland

Alain Komaty

Idiap Research Institute, Switzerland

Zeina Al Amine

Idiap Research Institute, Switzerland

Vidit Vidit

Idiap Research Institute, Switzerland

Sebastien Marcel

Idiap Research Institute, Switzerland

University of Lausanne, Switzerland

Qué problema resuelve

DriveFace cubre la falta de una herramienta de evaluación comparativa pública que conecte el registro RGB de teléfonos inteligentes con la captura externa de vehículos mediante infrarrojo cercano. También incluye un subconjunto de ataques de presentación para que la seguridad del reconocimiento y la captura puedan estudiarse bajo la misma geometría operativa.

Resultado clave

La coincidencia en exteriores es relativamente sólida, con AdaFace alcanzando un AUC del 99,45 %, un EER del 2,69 % y un Rank-1 del 97,42 %. La simulación de tinte es más difícil: el mejor AUC es del 96,23 %, y xEdgeFace registra un EER del 8,09 % y una verificación del 88,63 % con un FAR del 1 %. Los valores de referencia de PAD también se deterioran ante ataques desconocidos; el mejor ACER reportado para máscaras desconocidas es del 26,20 %, a pesar de los bajos errores en el protocolo de ataque conocido.

Resumen

El continuo aumento de la movilidad transfronteriza ejerce una presión creciente sobre las infraestructuras de control fronterizo existentes, lo que impulsa la autenticación biométrica en movimiento, en la que los viajeros son identificados directamente dentro de sus vehículos en los puntos de control. El reconocimiento facial es idóneo para este entorno, ya que puede adquirirse de forma pasiva y a distancia. Sin embargo, su desarrollo se ve obstaculizado por la falta de conjuntos de datos representativos: los conjuntos de datos de referencia existentes se recopilan en entornos controlados y no capturan los desafíos inherentes a la adquisición vehicular, como el desenfoque por movimiento, la iluminación variable, las oclusiones y el registro entre espectros. Para abordar esta deficiencia, presentamos un conjunto de datos para el reconocimiento facial en movimiento en escenarios de control fronterizo, que comprende vídeos de cruce vehicular en infrarrojo cercano (NIR) combinados con datos de preinscripción basados ​​en teléfonos inteligentes. Las evaluaciones de referencia con modelos de última generación muestran claras limitaciones de rendimiento en estas condiciones realistas, lo que subraya la necesidad de métodos específicos para avanzar en este campo.

Punto de partida

Los controles de vehículos se beneficiarían de la identificación de viajeros preinscritos sin necesidad de que salgan del coche, pero la señal se capta a través de cristales reflectantes o tintados, a menudo mientras el vehículo o la persona están en movimiento. Los conjuntos de datos VIS-NIR para interiores existentes no combinan esta degradación óptica con la postura del perfil, las condiciones meteorológicas, la velocidad y la inscripción entre sesiones.

Método

El conjunto de datos sigue a 70 voluntarios que dieron su consentimiento durante dos sesiones y registra la inscripción en el teléfono inteligente, además de sondas NIR en exteriores, en el interior del automóvil y con tinte simulado. Los metadatos cubren el tinte del vidrio, la iluminación, la posición de la cabeza, el clima y la velocidad del vehículo. Los protocolos de entrenamiento y prueba disjuntos de identidad evalúan AdaFace, LVFace, EdgeFace y un xEdgeFace adaptado espectralmente cruzado utilizando AUC, EER, tasa de verificación al 1 % FAR e identificación de rango 1; protocolos PAD separados cubren ataques de impresión o máscara conocidos y desconocidos.

Conclusión del artículo

DriveFace es valioso como conjunto de datos de prueba de aceptación para despliegues en vehículos y fronteras, ya que integra el registro, el espectro del sensor, el vidrio, el movimiento y la suplantación de identidad en un solo protocolo. Sus datos de referencia advierten que los buenos resultados en el reconocimiento facial sin restricciones no garantizan un margen de seguridad adecuado bajo captura espectral cruzada con tintado.

Artículo 032026-07-11cs.CV

LFD: Habilitando el reconocimiento facial sin lentes en el mundo real con un conjunto de datos a gran escala.

Autores e instituciones

Junho Kim

Department of Electrical and Computer Engineering, Rice University, Houston, Texas, USA

Salman S. Khan

Department of Electrical and Computer Engineering, Rice University, Houston, Texas, USA

Sara Wan

Department of Electrical and Computer Engineering, Rice University, Houston, Texas, USA

Tomi Kuye

Department of Electrical and Computer Engineering, Rice University, Houston, Texas, USA

Ashok Veeraraghavan

Department of Electrical and Computer Engineering, Rice University, Houston, Texas, USA

Qué problema resuelve

El campo carecía de un conjunto de datos considerable que combinara mediciones reales sin lentes, imágenes reconstruidas e imágenes faciales convencionales en condiciones tanto interiores como exteriores. Esta carencia dificultaba la distinción entre la calidad de la reconstrucción y los fallos del detector y el reconocedor, así como la comprobación de si un modelo se transfería entre diferentes codificadores ópticos.

Resultado clave

En el prototipo 1, el reconocedor entrenado con LFD alcanza un AUC de 0,946 en Indoor Easy, 0,808 en outdoor, 0,851 en el conjunto completo y 0,778 en el conjunto difícil. El modelo de imagen estándar correspondiente obtiene puntuaciones de 0,884, 0,625, 0,763 y 0,599. Con un FPR del 0,05 % en la coincidencia intermodal, las reconstrucciones LFD alcanzan un TPR del 77,30 % frente al 66,02 % de los datos FCFD FlatNet anteriores, y la ventaja se mantiene en un segundo prototipo óptico.

Resumen

El reconocimiento facial es una tarea de visión artificial de uso generalizado con una amplia gama de aplicaciones, desde la biometría cotidiana en teléfonos inteligentes hasta sistemas de seguridad de alto riesgo. La mayoría de los sistemas de reconocimiento facial se basan en cámaras tradicionales, que suelen presentar limitaciones como su tamaño voluminoso, su elevado coste y la escasa protección de la privacidad. Para solucionar estas limitaciones, las cámaras sin lente han surgido como una alternativa. Estas cámaras utilizan codificadores ópticos delgados, lo que permite un menor tamaño, un menor coste y una mayor flexibilidad de diseño. Normalmente, estas cámaras se combinan con algoritmos de reconstrucción que convierten las capturas originales en imágenes reconocibles. Sin embargo, las imágenes reconstruidas suelen contener artefactos, y los métodos de reconstrucción tienen dificultades para generalizarse bien a condiciones reales. Además, los conjuntos de datos faciales existentes no tienen en cuenta los artefactos presentes en las imágenes sin lente. Para abordar este problema, presentamos el Conjunto de Datos Faciales sin Lente (LFD). LFD comprende 21 080 mediciones originales, reconstrucciones e imágenes estándar de rostros capturadas bajo diversas condiciones de iluminación, ángulo y distancia. Nuestras principales contribuciones son: (1) Datos faciales reales sin lentes: LFD se centra en capturar un conjunto de datos faciales diverso con distintos niveles de artefactos introducidos en diferentes entornos; (2) Capturas en entornos naturales: se capturan 4976 imágenes en exteriores con diferentes intensidades de luz natural y distintos patrones de fondo; (3) Múltiples dispositivos sin lentes: LFD incluye imágenes faciales recopiladas de tres tipos diferentes de cámaras sin lentes, cada una con un codificador óptico único. Utilizamos esta diversidad de hardware para demostrar la generalización entre diferentes cámaras sin lentes. Mediante evaluaciones y análisis exhaustivos, demostramos que LFD captura eficazmente características y artefactos compartidos entre diferentes dispositivos de imagen sin lentes, lo que lo convierte en un valioso conjunto de datos para el avance del reconocimiento facial sin lentes.

Punto de partida

Las cámaras sin lentes reemplazan las lentes voluminosas con elementos ópticos codificados delgados, lo que reduce el tamaño y expone imágenes menos legibles para el ojo humano en el sensor. Sin embargo, sus reconstrucciones presentan desenfoque, distorsión de color y viñeteo específicos del dispositivo, por lo que los modelos de reconocimiento entrenados con fotografías normales o mediciones simuladas no se transfieren de forma fiable a las capturas físicas.

Método

LFD recopila 21 080 mediciones, reconstrucciones e imágenes estándar sin lentes, incluyendo 4976 imágenes de exteriores y capturas de tres diseños de cámaras sin lentes. Los autores entrenan los componentes de reconstrucción y detección facial por separado, y luego comparan los reconocedores SENet entrenados con imágenes estándar VGGFace2, reconstrucciones simuladas sin lentes o la división física del entrenamiento LFD. La verificación utiliza pares positivos y negativos equilibrados en subconjuntos fáciles, de exteriores, completos y difíciles, seguidos de pruebas entre dispositivos.

Conclusión del artículo

LFD demuestra que un producto biométrico sin lentes debe entrenarse con artefactos reales del sensor en lugar de tratar la reconstrucción como un paso de preprocesamiento transparente. Proporciona una base sólida para evaluar cámaras compactas o centradas en la privacidad, mientras que la brecha existente en exteriores demuestra que la ventaja del hardware aún conlleva un coste sustancial en términos de reconocimiento.