IJCB-AFMFR 2026 : Concours sur l’adaptation des modèles de base pour la reconnaissance faciale à l’aide de données d’entraînement synthétiques
Auteurs & institutions
Tahar Chettaoui
Fraunhofer Institute for Computer Graphics Research IGD, Germany
Guray Ozgur
Fraunhofer Institute for Computer Graphics Research IGD, Germany
Technical University of Darmstadt, Germany
Eduarda Caldeira
Fraunhofer Institute for Computer Graphics Research IGD, Germany
Technical University of Darmstadt, Germany
Arturas Nakvosas
Vilnius University, Lithuania
Hatef Otroshi Shahreza
Idiap Research Institute, Switzerland
Sébastien Marcel
Idiap Research Institute, Switzerland
Rishabh Shukla
Indian Institute of Technology Jammu, India
Aditya Takkar
Indian Institute of Technology Jammu, India
Rushil Khullar
Indian Institute of Technology Jammu, India
Lalak Yadav
Indian Institute of Technology Jammu, India
Gourav Gupta
ArogyaPandit Private Limited, India
Anant Gupta
ArogyaPandit Private Limited, India
Shiqi Yu
Southern University of Science and Technology, China
Vitomir Struc
University of Ljubljana, Slovenia
Naser Damer
Fraunhofer Institute for Computer Graphics Research IGD, Germany
Technical University of Darmstadt, Germany
Fadi Boutros
Fraunhofer Institute for Computer Graphics Research IGD, Germany
Problème traité
Les précédents tests de données synthétiques combinaient la qualité du générateur, le choix du réseau de base et les méthodes d'entraînement. Ce test de référence corrige CLIP ViT-L/14 et le générateur IDPERTURB afin que l'ajustement fin complet, l'adaptation LoRA, l'adaptation LoRA stabilisée par rang et l'adaptation par projection seule puissent être comparés avec les mêmes données d'identité et la même suite d'évaluation.
Résultat clé
L'optimisation complète avec Sub-Center ArcFace domine le parcours « Données complètes » avec une précision moyenne de 95,51 % sur les petits benchmarks et un TAR de 87,42 % à un FAR de 1e-5 sur IJB-C, contre 76,71 % pour la référence FRoundation. Avec des données limitées, rsLoRA se montre plus performant : Idiap-BSP atteint une précision moyenne de 94,52 % et un TAR de 81,13 % sur IJB-C à un FAR de 1e-5. L'évaluation de l'équité varie également selon le contexte : le vainqueur avec des données complètes atteint une précision RFW moyenne de 91,70 %, tandis que le vainqueur avec des données limitées atteint 88,92 %.
Résumé
Cet article présente un résumé du concours AFMFR (Adapting Foundation Models for Face Recognition Using Synthetic Training Data), organisé lors de la Conférence internationale conjointe sur la biométrie (IJCB 2026). Le concours a reçu huit soumissions valides, émanant de quatre équipes distinctes et réparties sur deux parcours complémentaires : un parcours « Données complètes », où les participants adaptent le modèle de base CLIP ViT-L/14 à l’aide de données d’identité synthétiques à grande échelle, et un parcours « Données limitées », conçu pour refléter des contextes d’adaptation avec des ressources plus restreintes. Toutes les données d’entraînement ont été générées exclusivement avec IDPERTURB. Les solutions soumises sont classées selon leurs performances de vérification et d’identification sur un ensemble diversifié de jeux de données de référence, incluant LFW, CFP-FP, AgeDB-30, CALFW, CPLFW, IJB-B, IJB-C et TinyFace, à l’aide de la méthode de Borda. Une évaluation de l’équité est également menée sur le jeu de données RFW pour quatre groupes démographiques. Les résultats démontrent que l'adaptation du modèle de base CLIP à l'aide de données d'entraînement synthétiques améliore sensiblement les performances du modèle standard et, dans plusieurs cas, surpasse même le modèle de référence. Notamment, l'ajustement fin complet avec Sub-Center ArcFace (DMSTI-Neurotechnology) domine le test « Full Data Track », tandis que l'adaptation LoRA à stabilisation de rang (Idiap-BSP) s'avère la plus efficace en conditions de données limitées.
Point de départ de la recherche
Les développeurs de systèmes de reconnaissance faciale manquent de plus en plus d'ensembles de données d'entraînement de visages réels, vastes et consentis, tandis que les modèles de vision généraux ne sont pas suffisamment discriminants aux points de fonctionnement biométriques stricts sans adaptation. Le concours vise à déterminer si les identités synthétiques peuvent assurer cette adaptation et quelle capacité d'entraînement est appropriée lorsque l'ensemble synthétique disponible varie de plus d'un ordre de grandeur.
Méthode
Le concours propose deux voies : une voie de données complètes (environ trois millions d’images issues de 35 000 identités synthétiques) et une voie de données limitées (250 000 images issues de 5 000 identités). Huit soumissions valides sont évaluées par agrégation de Borda sur cinq petits ensembles de vérification (IJB-B, IJB-C et TinyFace), tandis que RFW mesure la dispersion des performances selon quatre groupes démographiques. Les méthodes soumises explorent les mises à jour complètes du réseau de base, les classements LoRA et rsLoRA, les pertes de marge, l’augmentation de données et l’optimisation légère des projections.
À retenir
Pour les équipes qui adoptent une architecture visuelle à grande échelle, le volume de données synthétiques doit orienter la stratégie d'optimisation. Un réglage fin complet est payant à l'échelle de plusieurs millions d'images, tandis qu'un rsLoRA de haut rang constitue un régulariseur utile lorsque les identités et les images sont limitées ; il est peu probable qu'une seule solution soit optimale dans les deux cas.