← 返回博客
研究雷达人脸识别arXiv2026年9月

每月 arXiv 雷达

2026年9月人脸识别论文:更公平的匹配、热成像适配与双胞胎测试

九月的人脸识别研究更多关注的是困难的操作环境,而不是另一场骨干网络竞赛。DenseFace 改变现有模型的匹配规则,以减少种族虚假匹配差异。SynThermFace 在训练中将稀缺的可见光-红外配对扩展为更大的适应集,而推理时不增加图像转换。Celeb Twins 测试集则检验目前的嵌入是否利用了人类区分同卵双胞胎所依赖的细小局部特征。

本月趋势判断

DenseFace 证明了局部嵌入密度可以用作事后概率匹配信号,将多个非白人群体的虚假匹配率大幅拉近至白人参考水平,同时保持验证准确率。SynThermFace 仅在训练时使用扩散模型,然后部署单次适应的 EdgeFace 前向传播;其合成配对模型在 MCXFace 上达到 0.99% EER,但在未见的 Tufts 数据上为 14.70%,因此传感器迁移仍然重要。CTTS 提供了 21,120 对以双胞胎为中心的样本,并发现即使其通常的基准平均值约为 97%,十二种现代匹配器变体的准确率仍在 73-77% 左右。共同的教训是应分别验证匹配规则、捕获范围和困难身份群体,而不是将一个综合分数当作生产准备度。

论文 012026-09-14cs.CV

DenseFace:通过密度感知概率匹配缓解人脸识别偏差

作者与机构

Mansur Bultygov

VisionLabs

Vadim Seliutin

Amazon Web Services

VisionLabs (work performed there)

Dmitry Nekhaev

VisionLabs

Ivan Laptev

Mohamed bin Zayed University of Artificial Intelligence

解决了什么问题

DenseFace 探讨了在比对时是否能够减少种族误匹配差异,而无需更改或重新训练底层人脸编码器。它还用面向部署的协议替代了子群准确率标准差:在白人人脸误识率为 0.001 时设置一个阈值,并测量每个其他群体距离平权的程度。

关键结果

在使用 Glint360K、MS1MV2、WebFace4M、WebFace12M 和 BUPT-BalancedFace 训练的 CosFace 和 AdaFace 模型中,相同的全局阈值变得明显更加均衡。在 BUPT 模型上,相对于白人参考,非洲族群的误识倍数从 6.15 降至 1.43,印度族群从 4.01 降至 1.03。常规验证准确率得到保持:对 CosFace Glint360K 模型,RFW 平均准确率从 98.61% 提升至 98.68%,子群标准差从 0.53 降至 0.44。回归器在作者的 GPU 测试中增加约 0.2% 的内存消耗和 1.75% 的端到端延迟;其优化的 CPU 分数计算成本约为原始余弦的 1.5 倍。结果仍依赖于具有代表性的锚点或回归器训练群体。

摘要

尽管人脸识别取得了稳步进展,但现有人脸识别模型仍存在显著的人口统计偏差。虽然已有缓解偏差的方法被提出,但现有方法通常会对训练过程施加限制,并导致识别准确率下降。为了解决这一问题,我们在此提出了一种方法,在不降低准确率的情况下减少预训练人脸识别模型中的种族偏差。为此,我们通过冯·米塞斯-费舍尔(vMF)分布对每个人的面部嵌入进行建模。接下来,我们观察人口统计属性与vMF分布密度之间的依赖关系,并提出DenseFace,一种考虑vMF分布差异的概率性人脸匹配方法。我们的广泛实验表明,DenseFace能够在不同网络架构、训练数据集和损失函数的强大人脸识别模型中,一致地减少种族偏差。值得注意的是,DenseFace在保留识别准确率的同时,不需要对底层人脸识别模型进行重新训练。我们的工作还研究了先前采用的偏差测量方法,并提出了相关建议。

研究出发点

面部识别系统通常使用一个全局决策阈值,但冒名顶替者的得分分布在不同的人口群体中有所不同。因此,当每个群体使用其各自的交叉验证阈值时,一个模型在RFW上可能看起来很准确,但在实际服务中却产生非常不同的误匹配率。大多数缓解方法还需要平衡的再训练数据、架构更改或可能降低识别性能且难以在已批准模型中进行补充的公平性损失。

方法概述

对于每个面部嵌入,该方法在人口统计学平衡的锚点集合中找出最近的身份,并估计局部类别间密度。它用 von Mises-Fisher 分布表示嵌入,其集中度反映该密度,然后通过相互似然而非原始余弦相似度对一对嵌入进行评分。近邻身份之间有一个边距,轻量回归器变体直接预测密度,因此生产环境中的匹配无需大规模锚点查找。编码器、嵌入维度和注册数据保持不变。

论文总结

比较层公平性控制可以在无需重新训练模型的情况下改善群体公平性,但它并不能消除在实际操作阈值下对代表性校准数据和子群监控的需求。

论文 022026-09-09cs.CV

SynThermFace:通过合成数据生成扩充有限的可见光-热成像配对人脸数据

作者与机构

Anjith George

Idiap Research Institute, Switzerland

Adam Unal

Idiap Research Institute, Switzerland

Sebastien Marcel

Idiap Research Institute, Switzerland

University of Lausanne, Switzerland

解决了什么问题

SynThermFace放大有限的配对监督以进行可见光到热成像识别,并测试合成热成像配对是否既能提高数据库内准确性,又能迁移到从未用于训练的传感器/数据库。它将其适配目标的益处与扩展合成身份的益处分离开来。

关键结果

在不相交的 MCXFace 开发集上,真实成对 PACT 达到 3.04% 的 EER 和 96.49% Rank-1,优于对比的真实成对适配基线。使用 1,000 个 CASIA 派生的合成身份时,EER 降至 0.99%,Rank-1 达到 99.75%,在 0.1% FAR 下的验证达到 93.48%;未适配的 EdgeFace 基线 EER 为 23.06%,Rank-1 为 40.10%。在未见过的 Tufts 数据上,从 Digi2Real 派生的训练使 EdgeFace 的 EER 从 43.41% 改善到 13.91%,Rank-1 从 12.03% 提升到 56.37%。剩余的 MCXFace 到 Tufts 的差距仍然很大,并且生成器仍然依赖于真实的 MCXFace 配对,因此该方法减少而不是消除了真实的跨光谱收集。

摘要

面部识别(FR)是广泛使用的生物识别认证方式,但传统模型依赖于可见光谱图像,当无法捕捉到高质量RGB图像时,其性能会下降。跨光谱面部识别通过将可见图像与热成像等其他模态匹配来解决这一限制,从而在低光、夜间和非约束条件下实现更可靠的性能。然而,由于成对的可见光-热成像数据稀缺,而这类数据难以且成本高昂地大规模收集,进展受到限制。我们提出了SynThermFace,该框架将有限的真实可见光-热成像监督放大为更大的跨光谱面部识别适配数据集。首先使用有限的可见光-热成像图像对对扩散模型进行适配,然后利用该模型从现有真实或合成的可见光面部数据集中生成大规模配对的可见光-合成热成像数据。这些生成的配对用于将预训练的可见光谱面部识别模型适配成CFR模型。与在测试时需要图像转换的基于合成的方法不同,该方法将生成转移到训练阶段,并通过适配后的识别模型的单次前向传播进行推理。在相同的MCXFace真实配对协议下,PACT在评估的CFR适配基线之上有改进,从而分离出所提出适配目标的效果。在较大规模生成配对数据集上训练PACT,相较于未经适配的模型和真实配对的PACT配置提供了额外改进。对Tufts数据集的跨数据库评估提供了学习到的表示可以迁移到未使用过的数据库的证据。源代码和训练好的模型将公开提供。

研究出发点

当可见光捕捉失败时,热成像相机可以支持认证和监控,但大多数身份图库是RGB,并且收集可见光-热成像成对面部数据的成本高昂。在运行时直接转换每个热成像探测图像会增加生成器到关键路径中,并可能改变身份。实际问题是,是否可以用少量真实配对数据监督更大的训练集,同时在部署时保持为正常的嵌入查找。

方法概述

扩散生成器首先在成对的 MCXFace 训练集上进行适配,然后将真实的 CASIA-WebFace 图像或合成的 Digi2Real 身份转换为匹配的热成像视图。感知保留的跨光谱微调从预训练的 EdgeFace 模型开始,结合对称的热到可见光和可见光到热对比学习,并使用一种损失函数将可见光嵌入保持在原模型冻结副本附近。生成仅在构建适配集时发生;推理只需通过调优后的识别器进行一次前向传递。

论文总结

离线合成热成像生成可以将小型成对数据集转化为有用的识别监督,而无需运行时转换,但新的传感器和人群仍然需要自己的迁移和公平性测试。

论文 032026-09-01cs.CV

重新审视同卵双胞胎人脸识别:Celeb Twins测试集

作者与机构

Michael Zang

Department of Computer Science and Engineering, University of Notre Dame

Haiyu Wu

Department of Computer Science and Engineering, University of Notre Dame

Mrinal Sharma

Department of Computer Science and Engineering, University of Notre Dame

Kevin W. Bowyer

Department of Computer Science and Engineering, University of Notre Dame

解决了什么问题

本文创建了一个验证风格的基准,该基准足够大,可用于双胞胎不相交的交叉验证,并为局部特征标记和可能的镜像不对称进行了标注。然后,它测试现代深度人脸匹配器是否利用这些线索,以及去除水平翻转假设或生成合成双胞胎是否提供了一个可行的前进路径。

关键结果

十二种匹配器配置的平均CTTS准确率仅为73.14%-76.50%,而在五个常规验证集上的平均准确率约为97.00%-97.69%。擦除可见标记后,嵌入和配对距离分布几乎保持不变,这表明当前模型忽略了人类可以使用的线索。考虑不对称性的再训练达到78.58%,误差范围为±3.7,与原模型在统计上没有显著差异;它对一些镜像双胞胎数据集有帮助,对其他数据集则有负面影响。生成的双胞胎未能保持现实的个体内部和双胞胎之间的距离结构,因此它们尚未成为经过验证的训练替代方案。

摘要

过去关于单卵(“同卵”)双胞胎人脸识别的文献指出,面部标记和镜像不对称性可能是提高双胞胎识别准确率的方向。名人双胞胎测试集(CTTS)包含来自网络抓取的80对名人双胞胎的图像。它是唯一一个拥有区分性皮肤标记和可能镜像不对称性元数据的双胞胎测试集。CTTS的组织方式类似于人脸验证测试集,如LFW、CALFW、CPLFW、CFP-FP和AgeDB-30。当前深度CNN匹配器在将CTTS的同一人/不同人图像对进行分类时可以达到超过76%的准确率。我们展示了当前匹配器没有利用皮肤标记或不对称性,并讨论了原因。最后,我们讨论了使用生成型AI工具如Grok、ChatGPT和Gemini创建想象中的单卵双胞胎图像的可行性,作为增加人脸识别训练集中双胞胎代表性的一种方法。

研究出发点

同卵双胞胎揭示了普通面部基准测试几乎无法代表的身份边界。NIST 曾报告,在为 0.0001 的非双胞胎错误匹配率选择阈值时,许多算法 98-99% 的时间会将一个双胞胎误认为另一个双胞胎。现有的双胞胎数据集规模小、年代久远,或者缺乏关于雀斑、痣、疤痕和镜像双胞胎状态的元数据,这使得难以学习现代嵌入实际上使用了哪些线索。

方法概述

CTTS-80 收集了 80 对名人双胞胎的网络图像,并在十个折叠中构建了 21,120 个平衡的同一人和双胞胎冒名顶替者配对,每个双胞胎集合完全保存在同一个折叠中。作者评估了在三个常用数据集上训练的 ArcFace、AdaFace、UniFace 和 MagFace ResNet-100 模型。他们在选定身份上擦除了可见的皮肤标记,比较了原始和编辑的嵌入分布,重新训练了不使用水平翻转增强的 ArcFace,并检查了从三个生成系统请求的合成双胞胎集合。

论文总结

双胞胎验证仍然是一个独特的风险类别:标准准确性对它几乎没有说明作用,而今天的嵌入似乎并未使用明显的局部特征。高保障部署应明确测试双胞胎冒名顶替者,而不是从一般基准推断性能。