IJCB-AFMFR 2026: Competição sobre a adaptação de modelos básicos para reconhecimento facial usando dados de treinamento sintéticos.
Autores e instituições
Tahar Chettaoui
Fraunhofer Institute for Computer Graphics Research IGD, Germany
Guray Ozgur
Fraunhofer Institute for Computer Graphics Research IGD, Germany
Technical University of Darmstadt, Germany
Eduarda Caldeira
Fraunhofer Institute for Computer Graphics Research IGD, Germany
Technical University of Darmstadt, Germany
Arturas Nakvosas
Vilnius University, Lithuania
Hatef Otroshi Shahreza
Idiap Research Institute, Switzerland
Sébastien Marcel
Idiap Research Institute, Switzerland
Rishabh Shukla
Indian Institute of Technology Jammu, India
Aditya Takkar
Indian Institute of Technology Jammu, India
Rushil Khullar
Indian Institute of Technology Jammu, India
Lalak Yadav
Indian Institute of Technology Jammu, India
Gourav Gupta
ArogyaPandit Private Limited, India
Anant Gupta
ArogyaPandit Private Limited, India
Shiqi Yu
Southern University of Science and Technology, China
Vitomir Struc
University of Ljubljana, Slovenia
Naser Damer
Fraunhofer Institute for Computer Graphics Research IGD, Germany
Technical University of Darmstadt, Germany
Fadi Boutros
Fraunhofer Institute for Computer Graphics Research IGD, Germany
Que problema resolve
Os desafios anteriores com dados sintéticos misturavam a qualidade do gerador, a escolha da arquitetura backbone e as estratégias de treinamento. Este benchmark corrige o CLIP ViT-L/14 e o gerador IDPERTURB para que o ajuste fino completo, o LoRA, o LoRA com estabilização de classificação e a adaptação somente de projeção possam ser comparados sob os mesmos dados de identidade e conjunto de avaliação.
Resultado-chave
O ajuste fino completo com Sub-Center ArcFace lidera a Trilha de Dados Completos com 95,51% de precisão média nos benchmarks menores e 87,42% de TAR com FAR 1e-5 no IJB-C, contra 76,71% para a linha de base FRoundation. Com dados limitados, o rsLoRA se mostra mais robusto: o Idiap-BSP atinge 94,52% de precisão média e 81,13% de TAR no IJB-C com FAR 1e-5. A avaliação de equidade também varia conforme o regime, com o vencedor na Trilha de Dados Completos atingindo 91,70% de precisão média RFW e o vencedor na Trilha de Dados Limitados, 88,92%.
Resumo
Este artigo apresenta um resumo da Competição de Adaptação de Modelos Fundamentais para Reconhecimento Facial Usando Dados de Treinamento Sintéticos (AFMFR), realizada na Conferência Internacional Conjunta de Biometria de 2026 (IJCB 2026). A competição recebeu um total de oito submissões válidas de quatro equipes distintas, distribuídas em duas vertentes complementares: uma Vertente de Dados Completos, na qual os participantes adaptam o modelo fundamental CLIP ViT-L/14 usando dados de identidade sintéticos em larga escala, e uma Vertente de Dados Limitados, projetada para refletir regimes de adaptação com recursos mais restritos. Todos os dados de treinamento foram gerados exclusivamente usando o IDPERTURB. As soluções submetidas são classificadas com base no desempenho de verificação e identificação em um conjunto diversificado de benchmarks, incluindo LFW, CFP-FP, AgeDB-30, CALFW, CPLFW, IJB-B, IJB-C e TinyFace, usando o método de contagem de Borda. A avaliação de imparcialidade também é realizada no conjunto de dados RFW, abrangendo quatro grupos demográficos. Os resultados demonstram que a adaptação do modelo CLIP Foundation com dados de treinamento sintéticos melhora substancialmente o modelo padrão e, em vários casos, supera o modelo de referência. Notavelmente, o ajuste fino completo com Sub-Center ArcFace (DMSTI-Neurotechnology) lidera a categoria de Dados Completos, enquanto a adaptação LoRA com estabilização de classificação (Idiap-BSP) se mostra mais eficaz em condições de dados limitados.
Ponto de partida da pesquisa
Os desenvolvedores de reconhecimento facial enfrentam cada vez mais a falta de conjuntos de treinamento amplos e com consentimento de rostos reais, enquanto os modelos básicos de visão computacional não são suficientemente discriminativos em pontos de operação biométricos estritos sem adaptação. A competição questiona se identidades sintéticas podem fornecer essa adaptação e quanta capacidade de treinamento é apropriada quando o conjunto sintético disponível muda em mais de uma ordem de magnitude.
Método
A competição define uma Trilha de Dados Completos com cerca de três milhões de imagens de 35.000 identidades sintéticas e uma Trilha de Dados Limitados com 250.000 imagens de 5.000 identidades. Oito submissões válidas são pontuadas com uma agregação de Borda em cinco pequenos conjuntos de verificação: IJB-B, IJB-C e TinyFace, enquanto o RFW mede a dispersão de desempenho em quatro grupos demográficos. Os métodos submetidos exploram atualizações de backbone completo, classificações LoRA e rsLoRA, perdas de margem, aumento de dados e ajuste de projeção leve.
Síntese do artigo
Para equipes que adaptam uma grande infraestrutura visual, o volume de dados sintéticos deve orientar a estratégia de ajuste. O ajuste fino completo compensa em escalas de milhões de imagens, enquanto o rsLoRA de alta classificação atua como um regularizador útil quando as identidades e as imagens são limitadas; é improvável que uma única receita seja ideal para ambos os cenários.