作者与机构
Tahar Chettaoui
Fraunhofer Institute for Computer Graphics Research IGD, Germany
Guray Ozgur
Fraunhofer Institute for Computer Graphics Research IGD, Germany
Technical University of Darmstadt, Germany
Eduarda Caldeira
Fraunhofer Institute for Computer Graphics Research IGD, Germany
Technical University of Darmstadt, Germany
Arturas Nakvosas
Vilnius University, Lithuania
Hatef Otroshi Shahreza
Idiap Research Institute, Switzerland
Sébastien Marcel
Idiap Research Institute, Switzerland
Rishabh Shukla
Indian Institute of Technology Jammu, India
Aditya Takkar
Indian Institute of Technology Jammu, India
Rushil Khullar
Indian Institute of Technology Jammu, India
Lalak Yadav
Indian Institute of Technology Jammu, India
Gourav Gupta
ArogyaPandit Private Limited, India
Anant Gupta
ArogyaPandit Private Limited, India
Shiqi Yu
Southern University of Science and Technology, China
Vitomir Struc
University of Ljubljana, Slovenia
Naser Damer
Fraunhofer Institute for Computer Graphics Research IGD, Germany
Technical University of Darmstadt, Germany
Fadi Boutros
Fraunhofer Institute for Computer Graphics Research IGD, Germany
解决了什么问题
早期的合成数据挑战混合使用了生成器质量、骨干网络选择和训练方法等多种因素。而本次基准测试则固定了 CLIP ViT-L/14 和 IDPERTURB 生成器,从而可以在相同的身份数据和评估套件下比较完全微调、LoRA、秩稳定 LoRA 和仅投影自适应等算法的性能。
关键结果
采用子中心弧面(Sub-Center ArcFace)进行全面微调后,在小规模基准测试中,全数据追踪算法的平均准确率达到 95.51%,在 IJB-C 数据集上,当误报率(FAR)为 1e-5 时,目标准确率(TAR)达到 87.42%,而 FRoundation 基线算法的准确率为 76.71%。在数据有限的情况下,rsLoRA 算法更加稳健:Idiap-BSP 的平均准确率达到 94.52%,在 IJB-C 数据集上,当误报率(FAR)为 1e-5 时,目标准确率(TAR)达到 81.13%。公平性评估结果也因数据量限制而异,全数据追踪算法的平均 RFW 准确率达到 91.70%,而有限数据追踪算法的平均 RFW 准确率为 88.92%。
摘要
本文概述了在2026年国际生物识别联合会议(IJCB 2026)上举办的“基于合成训练数据的人脸识别基础模型自适应竞赛”(AFMFR)。本次竞赛共收到来自四个不同团队的八份有效参赛作品,分为两个互补的赛道:全数据赛道和有限数据赛道。全数据赛道要求参赛者使用大规模合成身份数据对CLIP ViT-L/14基础模型进行自适应调整;有限数据赛道则旨在反映资源受限的自适应方案。所有训练数据均使用IDPERTURB生成。参赛方案根据其在包括LFW、CFP-FP、AgeDB-30、CALFW、CPLFW、IJB-B、IJB-C和TinyFace在内的一系列基准测试中的验证和识别性能进行排名,排名采用Borda计数法。此外,还针对RFW数据集上的四个人口统计群体进行了公平性评估。结果表明,使用合成训练数据对 CLIP 基础模型进行自适应调整后,其性能显著优于现成模型,并且在某些情况下甚至超越了基线模型。值得注意的是,使用 Sub-Center ArcFace(DMSTI-Neurotechnology)进行完全微调的模型在全数据条件下表现最佳,而秩稳定化的 LoRA 自适应模型(Idiap-BSP)在数据有限的情况下则最为有效。
研究出发点
人脸识别开发者越来越缺乏广泛且经用户认可的真实人脸训练数据集,而通用视觉基础模型在严格的生物特征工作点上缺乏足够的区分度,除非进行自适应调整。本次竞赛旨在探讨合成身份能否提供这种自适应调整,以及当可用的合成数据集变化超过一个数量级时,合适的训练容量是多少。
方法概述
本次竞赛定义了一个完整数据集赛道,包含来自 35,000 个合成身份的约 300 万张图像;以及一个有限数据集赛道,包含来自 5,000 个身份的 250,000 张图像。八份有效提交的方案将使用 Borda 聚合算法在五个小型验证集(IJB-B、IJB-C 和 TinyFace)上进行评分,同时 RFW 算法用于衡量四个不同人口统计群体中的性能差异。提交的方案探索了全骨干网更新、LoRA 和 rsLoRA 排名、边际损失、数据增强以及轻量级投影调优等技术。
论文总结
对于采用大型视觉骨干网络的团队而言,合成数据量应是调优策略的驱动因素。在数百万张图像的规模下,全面的微调效果显著;而当身份和图像受到限制时,高阶rsLoRA则可作为有效的正则化工具;单一的调优方案不太可能同时适用于这两种情况。