← 返回博客
研究雷达人脸识别arXiv2026年7月

每月 arXiv 雷达

2026年7月人脸识别论文:合成基础模型、免下车近红外成像和无镜头相机

7 月份发表的人脸识别论文将讨论的重点从仅关注基准测试的准确率转移到决定部署质量的数据和采集系统。入选论文测试了两种数据规模下注重隐私的合成训练方法,引入了使用穿透玻璃探针的跨光谱边境控制数据集,并研究了用无透镜光学编码器替代摄像头后的性能变化。

本月趋势判断

仅使用合成数据进行自适应可以使通用视觉基础模型在人脸识别领域具有竞争力,但制胜策略会随着数据量的变化而发生显著变化。DriveFace 的研究表明,即使是强大的嵌入模型,在将可见光注册图像与穿过汽车玻璃的移动近红外探针进行匹配时,仍然会面临显著的误差。LFD 通过将无透镜光学、重建、检测和识别视为相互关联的组件,进一步扩展了采集流程。由此可见,部署性能取决于从采集到嵌入的整个流程,而不仅仅是识别损失。

论文 012026-07-27cs.CV

IJCB-AFMFR 2026:基于合成训练数据的人脸识别基础模型自适应竞赛

作者与机构

Tahar Chettaoui

Fraunhofer Institute for Computer Graphics Research IGD, Germany

Guray Ozgur

Fraunhofer Institute for Computer Graphics Research IGD, Germany

Technical University of Darmstadt, Germany

Eduarda Caldeira

Fraunhofer Institute for Computer Graphics Research IGD, Germany

Technical University of Darmstadt, Germany

Arturas Nakvosas

Vilnius University, Lithuania

Hatef Otroshi Shahreza

Idiap Research Institute, Switzerland

Sébastien Marcel

Idiap Research Institute, Switzerland

Rishabh Shukla

Indian Institute of Technology Jammu, India

Aditya Takkar

Indian Institute of Technology Jammu, India

Rushil Khullar

Indian Institute of Technology Jammu, India

Lalak Yadav

Indian Institute of Technology Jammu, India

Gourav Gupta

ArogyaPandit Private Limited, India

Anant Gupta

ArogyaPandit Private Limited, India

Shiqi Yu

Southern University of Science and Technology, China

Vitomir Struc

University of Ljubljana, Slovenia

Naser Damer

Fraunhofer Institute for Computer Graphics Research IGD, Germany

Technical University of Darmstadt, Germany

Fadi Boutros

Fraunhofer Institute for Computer Graphics Research IGD, Germany

解决了什么问题

早期的合成数据挑战混合使用了生成器质量、骨干网络选择和训练方法等多种因素。而本次基准测试则固定了 CLIP ViT-L/14 和 IDPERTURB 生成器,从而可以在相同的身份数据和评估套件下比较完全微调、LoRA、秩稳定 LoRA 和仅投影自适应等算法的性能。

关键结果

采用子中心弧面(Sub-Center ArcFace)进行全面微调后,在小规模基准测试中,全数据追踪算法的平均准确率达到 95.51%,在 IJB-C 数据集上,当误报率(FAR)为 1e-5 时,目标准确率(TAR)达到 87.42%,而 FRoundation 基线算法的准确率为 76.71%。在数据有限的情况下,rsLoRA 算法更加稳健:Idiap-BSP 的平均准确率达到 94.52%,在 IJB-C 数据集上,当误报率(FAR)为 1e-5 时,目标准确率(TAR)达到 81.13%。公平性评估结果也因数据量限制而异,全数据追踪算法的平均 RFW 准确率达到 91.70%,而有限数据追踪算法的平均 RFW 准确率为 88.92%。

摘要

本文概述了在2026年国际生物识别联合会议(IJCB 2026)上举办的“基于合成训练数据的人脸识别基础模型自适应竞赛”(AFMFR)。本次竞赛共收到来自四个不同团队的八份有效参赛作品,分为两个互补的赛道:全数据赛道和有限数据赛道。全数据赛道要求参赛者使用大规模合成身份数据对CLIP ViT-L/14基础模型进行自适应调整;有限数据赛道则旨在反映资源受限的自适应方案。所有训练数据均使用IDPERTURB生成。参赛方案根据其在包括LFW、CFP-FP、AgeDB-30、CALFW、CPLFW、IJB-B、IJB-C和TinyFace在内的一系列基准测试中的验证和识别性能进行排名,排名采用Borda计数法。此外,还针对RFW数据集上的四个人口统计群体进行了公平性评估。结果表明,使用合成训练数据对 CLIP 基础模型进行自适应调整后,其性能显著优于现成模型,并且在某些情况下甚至超越了基线模型。值得注意的是,使用 Sub-Center ArcFace(DMSTI-Neurotechnology)进行完全微调的模型在全数据条件下表现最佳,而秩稳定化的 LoRA 自适应模型(Idiap-BSP)在数据有限的情况下则最为有效。

研究出发点

人脸识别开发者越来越缺乏广泛且经用户认可的真实人脸训练数据集,而通用视觉基础模型在严格的生物特征工作点上缺乏足够的区分度,除非进行自适应调整。本次竞赛旨在探讨合成身份能否提供这种自适应调整,以及当可用的合成数据集变化超过一个数量级时,合适的训练容量是多少。

方法概述

本次竞赛定义了一个完整数据集赛道,包含来自 35,000 个合成身份的约 300 万张图像;以及一个有限数据集赛道,包含来自 5,000 个身份的 250,000 张图像。八份有效提交的方案将使用 Borda 聚合算法在五个小型验证集(IJB-B、IJB-C 和 TinyFace)上进行评分,同时 RFW 算法用于衡量四个不同人口统计群体中的性能差异。提交的方案探索了全骨干网更新、LoRA 和 rsLoRA 排名、边际损失、数据增强以及轻量级投影调优等技术。

论文总结

对于采用大型视觉骨干网络的团队而言,合成数据量应是调优策略的驱动因素。在数百万张图像的规模下,全面的微调效果显著;而当身份和图像受到限制时,高阶rsLoRA则可作为有效的正则化工具;单一的调优方案不太可能同时适用于这两种情况。

论文 022026-07-15cs.CV

DriveFace:用于移动车辆边境控制的跨光谱透过玻璃人脸数据集

作者与机构

Anjith George

Idiap Research Institute, Switzerland

Luis S. Luevano

Idiap Research Institute, Switzerland

Alain Komaty

Idiap Research Institute, Switzerland

Zeina Al Amine

Idiap Research Institute, Switzerland

Vidit Vidit

Idiap Research Institute, Switzerland

Sebastien Marcel

Idiap Research Institute, Switzerland

University of Lausanne, Switzerland

解决了什么问题

DriveFace填补了目前公开基准测试的空白,该基准测试将智能手机RGB注册与外部近红外车辆图像采集联系起来。它还包含一个呈现攻击子集,以便在相同的操作框架下研究识别和采集的安全性。

关键结果

户外匹配性能相对较好,AdaFace 的 AUC 为 99.45%,EER 为 2.69%,Rank-1 率为 97.42%。模拟色调匹配则较为困难:最佳 AUC 为 96.23%,xEdgeFace 的 EER 为 8.09%,在 1% FAR 下的验证率为 88.63%。PAD 基线在面对未知攻击时性能也会下降;尽管已知攻击协议的错误率较低,但针对未知掩码的最佳 ACER 也仅为 26.20%。

摘要

跨境流动性的持续增长给现有的边境管制基础设施带来了越来越大的压力,促使人们寻求移动生物特征认证,即在检查站直接在车内识别旅客身份。人脸识别非常适合这种场景,因为它可以被动且远距离地采集。然而,由于缺乏代表性数据集,人脸识别的发展受到阻碍:现有的基准数据集是在受控环境下采集的,无法反映车辆采集过程中固有的挑战,例如运动模糊、光照变化、遮挡和跨光谱注册等。为了弥补这一不足,我们引入了一个用于边境管制场景下移动人脸识别的数据集,该数据集包含近红外车辆过境视频以及基于智能手机的预注册数据。使用最先进模型进行的基线评估表明,在这些实际条件下,模型的性能存在明显的局限性,凸显了开发专门方法来推进该领域发展的必要性。

研究出发点

车辆检查站若能识别预先登记的旅客而无需其下车,将大有裨益。然而,探测图像通常透过反光或有色玻璃采集,且往往是在车辆或被测对象移动的情况下采集的。现有的室内可见光-近红外数据集并未将这种光学劣化与姿态、天气、速度以及跨会话登记等因素结合起来考虑。

方法概述

该数据集追踪了70名自愿参与的志愿者在两个实验阶段的数据,记录了他们的智能手机注册信息以及在室外、车内和模拟有色玻璃环境下的近红外探测数据。元数据涵盖了玻璃颜色、光照条件、头部姿态、天气状况和车速。采用身份不相交的训练和测试协议,使用AUC、EER、1% FAR下的验证率和Rank-1识别率来评估AdaFace、LVFace、EdgeFace以及一种跨光谱自适应的xEdgeFace;独立的PAD协议涵盖了已知和未知的打印或掩码攻击。

论文总结

DriveFace数据集对于车辆和边境部署而言极具价值,因为它将注册、传感器光谱、玻璃、运动和欺骗等功能整合在一个协议中。其基线数据表明,即使人脸识别得分良好且不受限制,在有色交叉光谱采集条件下,也无法保证足够的安全性。

论文 032026-07-11cs.CV

LFD:利用大规模数据集实现真实世界的无镜头人脸识别

作者与机构

Junho Kim

Department of Electrical and Computer Engineering, Rice University, Houston, Texas, USA

Salman S. Khan

Department of Electrical and Computer Engineering, Rice University, Houston, Texas, USA

Sara Wan

Department of Electrical and Computer Engineering, Rice University, Houston, Texas, USA

Tomi Kuye

Department of Electrical and Computer Engineering, Rice University, Houston, Texas, USA

Ashok Veeraraghavan

Department of Electrical and Computer Engineering, Rice University, Houston, Texas, USA

解决了什么问题

该领域缺乏一个足够大的数据集,该数据集应包含室内外条件下真实的无透镜测量数据、重建图像和传统人脸图像。这一空白使得区分重建质量与检测器和识别器故障,以及测试模型在不同光学编码器之间的迁移能力变得困难。

关键结果

在原型1上,经过LFD训练的识别器在室内简易数据集上达到AUC 0.946,室外数据集上达到0.808,完整数据集上达到0.851,困难数据集上达到0.778。相应的标准图像模型得分分别为0.884、0.625、0.763和0.599。在跨模态匹配中,当FPR为0.05%时,LFD重建的TPR达到77.30%,而之前的FCFD FlatNet数据集的TPR为66.02%,并且在第二个光学原型上,这一优势依然存在。

摘要

人脸识别是一项应用广泛的计算机视觉任务,其应用范围从日常智能手机生物识别到高风险安全系统均有涉及。大多数人脸识别系统依赖于传统摄像头,但传统摄像头通常存在体积庞大、成本高昂、隐私保护有限等局限性。为了克服这些局限性,无镜头摄像头应运而生。无镜头摄像头采用轻薄的光学编码器,从而实现了更小的尺寸、更低的成本和更高的设计灵活性。这些摄像头通常与重建算法配合使用,将原始图像转换为可识别的图像。然而,重建图像往往包含伪影,且重建方法难以很好地泛化到真实世界场景。此外,现有的人脸数据集并未考虑无镜头图像中存在的伪影。为了解决这个问题,我们提出了无镜头人脸数据集(LFD)。LFD 包含 21,080 张在不同光照、角度和距离下拍摄的人脸原始测量图像、重建图像和标准图像。我们的主要贡献包括:(1) 真实世界的无镜头人脸数据:LFD 专注于采集不同环境下产生的各种人脸特征和伪影;(2) 真实场景采集:我们在户外环境中采集了 4976 张图像,这些图像涵盖了不同强度的自然光和不同的背景图案;(3) 多种无镜头设备:LFD 包含从三种不同类型的无镜头相机采集的人脸图像,每种相机都配备了独特的光学编码器。我们利用这种硬件多样性来展示不同无镜头相机之间的泛化能力。通过全面的评估和分析,我们证明 LFD 能够有效地捕捉不同无镜头成像设备之间的共同特征和伪影,使其成为推进无镜头人脸识别的宝贵数据集。

研究出发点

无镜头相机用轻薄的编码光学元件取代了笨重的镜头,这可以缩小尺寸,但同时也会在传感器上呈现不太清晰的图像。然而,它们的重建图像会包含设备特有的模糊、色彩失真和暗角,因此,基于普通照片或模拟测量训练的识别模型无法可靠地迁移到实际拍摄的图像上。

方法概述

LFD 收集了 21,080 个原始的无镜头测量数据、重建图像和标准图像,其中包括 4,976 张室外图像以及来自三种无镜头相机设计的图像。作者分别训练了重建和人脸检测组件,然后比较了在标准 VGGFace2 图像、模拟的无镜头重建图像或实际 LFD 训练集上训练的 SENet 识别器。验证过程使用了平衡的正负样本对,涵盖了简单、室外、完整和困难的子集,并进行了跨设备测试。

论文总结

LFD表明,无镜头生物识别产品必须使用真实的传感器伪影进行训练,而不是将重建视为透明的预处理步骤。它为评估小型或注重隐私的摄像头提供了具体依据,而剩余的室外差距表明,硬件优势仍然会带来相当大的识别成本。