IJCB-AFMFR 2026: Competición sobre la adaptación de modelos básicos para el reconocimiento facial mediante datos de entrenamiento sintéticos.
Autores e instituciones
Tahar Chettaoui
Fraunhofer Institute for Computer Graphics Research IGD, Germany
Guray Ozgur
Fraunhofer Institute for Computer Graphics Research IGD, Germany
Technical University of Darmstadt, Germany
Eduarda Caldeira
Fraunhofer Institute for Computer Graphics Research IGD, Germany
Technical University of Darmstadt, Germany
Arturas Nakvosas
Vilnius University, Lithuania
Hatef Otroshi Shahreza
Idiap Research Institute, Switzerland
Sébastien Marcel
Idiap Research Institute, Switzerland
Rishabh Shukla
Indian Institute of Technology Jammu, India
Aditya Takkar
Indian Institute of Technology Jammu, India
Rushil Khullar
Indian Institute of Technology Jammu, India
Lalak Yadav
Indian Institute of Technology Jammu, India
Gourav Gupta
ArogyaPandit Private Limited, India
Anant Gupta
ArogyaPandit Private Limited, India
Shiqi Yu
Southern University of Science and Technology, China
Vitomir Struc
University of Ljubljana, Slovenia
Naser Damer
Fraunhofer Institute for Computer Graphics Research IGD, Germany
Technical University of Darmstadt, Germany
Fadi Boutros
Fraunhofer Institute for Computer Graphics Research IGD, Germany
Qué problema resuelve
Los desafíos anteriores con datos sintéticos combinaban la calidad del generador, la elección de la arquitectura base y las recetas de entrenamiento. Esta evaluación comparativa corrige CLIP ViT-L/14 y el generador IDPERTURB para que el ajuste fino completo, LoRA, LoRA con rango estabilizado y la adaptación solo por proyección puedan compararse con los mismos datos de identidad y el mismo conjunto de evaluación.
Resultado clave
El ajuste fino completo con Sub-Center ArcFace lidera la pista de datos completos con una precisión promedio del 95,51 % en los puntos de referencia pequeños y un TAR del 87,42 % en FAR 1e-5 en IJB-C, frente al 76,71 % de la línea base FRoundation. Con datos limitados, rsLoRA es más robusto: Idiap-BSP alcanza una precisión promedio del 94,52 % y un TAR del 81,13 % en IJB-C en FAR 1e-5. La evaluación de equidad también cambia según el régimen, con el ganador de datos completos alcanzando una precisión RFW promedio del 91,70 % y el ganador de datos limitados el 88,92 %.
Resumen
Este artículo presenta un resumen de la Competencia sobre Adaptación de Modelos Fundamentales para el Reconocimiento Facial mediante Datos de Entrenamiento Sintéticos (AFMFR), celebrada en la Conferencia Internacional Conjunta sobre Biometría de 2026 (IJCB 2026). La competencia recibió un total de ocho propuestas válidas de cuatro equipos distintos en dos pistas complementarias: una Pista de Datos Completos, en la que los participantes adaptan el modelo fundamental CLIP ViT-L/14 utilizando datos de identidad sintéticos a gran escala, y una Pista de Datos Limitados, diseñada para reflejar regímenes de adaptación con recursos más restringidos. Todos los datos de entrenamiento se generaron exclusivamente utilizando IDPERTURB. Las soluciones presentadas se clasifican en función del rendimiento de verificación e identificación en un conjunto diverso de puntos de referencia, incluidos LFW, CFP-FP, AgeDB-30, CALFW, CPLFW, IJB-B, IJB-C y TinyFace, utilizando el método de conteo de Borda. Adicionalmente, se realiza una evaluación de equidad en el conjunto de datos RFW en cuatro grupos demográficos. Los resultados demuestran que la adaptación del modelo base CLIP con datos de entrenamiento sintéticos mejora sustancialmente el modelo estándar y, en varios casos, supera el modelo de referencia. En particular, el ajuste fino completo con Sub-Center ArcFace (DMSTI-Neurotechnology) lidera la categoría de datos completos, mientras que la adaptación LoRA estabilizada por rango (Idiap-BSP) resulta ser la más eficaz en condiciones de datos limitados.
Punto de partida
Los desarrolladores de reconocimiento facial carecen cada vez más de conjuntos de entrenamiento amplios y consensuados de rostros reales, mientras que los modelos básicos de visión artificial no son suficientemente discriminatorios en puntos operativos biométricos estrictos sin adaptación. La competición plantea la cuestión de si las identidades sintéticas pueden proporcionar dicha adaptación y cuánta capacidad de entrenamiento es apropiada cuando el conjunto sintético disponible cambia en más de un orden de magnitud.
Método
La competición define una pista de datos completa con aproximadamente tres millones de imágenes de 35 000 identidades sintéticas y una pista de datos limitada con 250 000 imágenes de 5000 identidades. Ocho propuestas válidas se evalúan mediante una agregación de Borda en cinco conjuntos de verificación pequeños: IJB-B, IJB-C y TinyFace, mientras que RFW mide la dispersión del rendimiento en cuatro grupos demográficos. Los métodos presentados exploran actualizaciones de la estructura principal completa, clasificaciones LoRA y rsLoRA, pérdidas de margen, aumento de datos y ajuste de proyección ligero.
Conclusión del artículo
Para los equipos que adaptan una arquitectura visual compleja, el volumen de datos sintéticos debe guiar la estrategia de optimización. La optimización completa resulta rentable a escala de millones de imágenes, mientras que el algoritmo rsLoRA de alto rango actúa como un regularizador útil cuando las identidades y las imágenes están restringidas; es poco probable que una sola solución sea óptima para ambos escenarios.