← 返回博客
研究雷达人脸识别arXiv2026年8月

每月 arXiv 雷达

2026年8月人脸识别论文:低分辨率部署、亚 1 kB 压缩与巴西公平性

8月份的面部识别论文关注的是模型离开干净基准测试后才会显现的限制。所选研究使用原生低分辨率探针进行测试,而不是依赖合成降级,量化了哪些编解码器在1024字节和512字节下能保持身份信息,并在压缩的公共视频上针对巴西人口统计类别和显式难度等级进行了审计。

本月趋势判断

低分辨率研究指出,在LFW风格测试中获胜的合成降级方法可能并不适用于原生TinyFace探针。压缩基准显示了类似的急剧变化:几种常见编解码器在约1 KB时表现良好,但在512 B时崩溃,这时字节预算下的学习型编解码器变得有价值。UFPR-PEs进一步表明,在视觉困难子集下,人口统计学差距显著增加,并可能改变识别协议的排序。在全部三个研究中,生产质量依赖于测试实际的捕获和存储环境,而不是基于便捷代理的推断。

论文 012026-08-06cs.CV

有限数据下改进低分辨率人脸识别:合成数据生成如何弥合域差距

作者与机构

Luis S. Luevano

Idiap Research Institute, Switzerland

Ünsal Öztürk

Idiap Research Institute, Switzerland

Hatef Otroshi Shahreza

Idiap Research Institute, Switzerland

Anjith George

Idiap Research Institute, Switzerland

Sébastien Marcel

Idiap Research Institute, Switzerland

解决了什么问题

该研究探讨哪种合成低分辨率策略在标注的原生数据有限时实际上有助于紧凑型人脸识别器,以及从人工下采样的 LFW 风格测试得出的结论是否在真实的 TinyFace 探针上成立。研究还建立了一个直接输入基准,以便超分辨率和转换模块必须证明它们保留了身份,而不仅仅是改善视觉效果。

关键结果

合成测试偏向 28 像素的降级,但该设置在真实 TinyFace 上的表现低于高分辨率训练基线。较温和的 56 像素插值增强是最佳紧凑配置,将 TinyFace 的 mAP 从 52.55 提升到 54.68,rank-1 识别率从 59.66% 提升到 61.40%。学习型 RRDB 超分辨率加域转换管线在 EdgeFace-base 上仅达到 57.53 mAP,而直接输入达到 65.12。知识蒸馏在合成测试中带来最大增益,但未能迁移到原生低分辨率,表明合成的真实度,而非复杂度,是限制因素。

摘要

监控环境中的面部识别(FR)系统经常遇到低分辨率(LR)面部,即面部区域低于标准112 × 112输入尺寸的情况。虽然标注的高分辨率(HR)训练数据丰富,但标注的原生LR数据,尤其是配对的原生LR/HR数据稀缺。一种解决方法是从现有HR面部合成LR数据,但究竟多少合成努力能提升识别精度仍不清楚。我们提出了一项针对紧凑型、面向边缘设备的面部识别系统的简单合成生成策略研究,包括基于插值的降级、知识蒸馏、前置域转换器(PDT)、真实ESRGAN风格降级,以及带身份感知损失的学习型超分辨(SR)前端。我们在合成跨分辨率面部基准(LFW、CFP-FP、AgeDB-30)以及真实世界原生LR数据集TinyFace上评估这些策略,并揭示了合成-真实差距:在合成基准上最佳的降级设置,在真实LR上并非最佳。我们发现,更多的合成努力并非单调有效:学习型SR前端并不优于将对齐的LR图像直接输入强大的主干,而简单插值增强的紧凑主干是唯一优于自身基线的合成方法。我们得出结论,LR面部识别的生成方法必须在真实LR上进行验证,并与直接输入基线进行比较,并在https://idiap.ch/paper/synth-lrfr 发布了我们的流程。

研究出发点

监控和名单系统通常将高质量的注册图像与对齐后面部远小于标准 112×112 输入的探测图像进行比较。原生低分辨率身份数据,尤其是同一人的低分辨率和高分辨率配对捕获数据,非常稀缺,因此团队通常从大量高分辨率人脸中生成低分辨率训练数据。实际风险是,降级方法在合成基准测试中可能得分很高,但却教授识别器一些与真实摄像机产生的模糊、噪声、压缩和对齐错误不相似的特征。

方法概述

作者使用 3.65百万参数的 EdgeFace-S 主干网络,并比较了五种不同的适应努力:基于插值的下采样-上采样增强、高分辨率教师知识蒸馏、前置域转换器、使用 Real-ESRGAN 风格降级训练的原生 32 像素主干,以及具备身份感知的学习型超分辨率前端。他们在 LFW、CFP-FP 和 AgeDB-30 上评估高分辨率到低分辨率以及低分辨率到低分辨率的验证,然后在两种对齐管线下对原生低分辨率 TinyFace 重复比较。一种较大的冻结 EdgeFace-base 模型提供了参考,用于测试生成前端是否优于直接将对齐探测图像送入强识别器。

论文总结

对于边缘计算或监控部署,应在真实捕获的低分辨率人脸上验证每一种低分辨率方法,并保持强大的直接输入基线。简单、温和的插值增强可能比超分辨率堆栈更值得投入;在激进分辨率下仅有的合成增益并不能可靠地证明现场性能。

论文 022026-08-24cs.CV

面向亚 1 kB 身份保持人脸压缩:编解码器基准、自定义学习编解码器及分辨率、公平性、重压缩与对抗鲁棒性研究

作者与机构

Petr Hurtik

Innovatrics, Slovakia

Jakub Sochor

Innovatrics, Slovakia

解决了什么问题

这项工作将亚千字节的面部存储转变为可控部署基准,而非单一编解码器比较。它识别预算特定的操作点,测试图像质量指标是否能预测生物识别效用,并构建一个学习到的编解码器,其输出保证在请求的字节限制内。

关键结果

在1024字节和112像素的现代编解码器中,在Color FERET上几乎已接近操作性解决:WebP和AVIF在ArcFace上可达到0.09%的EER。然而在512字节时,AVIF、HEIF、JPEG XL和传统JPEG在FMR 1e-4时达到28-98%的FNMR,而Color FERET的学习编解码器精度为1.83%,AI-Solutions-KK为6.9%,而JPEG-AI为2.86%,WebP为24.3%。编解码器的顺序基本不变于骨干(Kendall's W=0.85)。大多数编解码器在人口统计上的EER差距不超过1.7个百分点,但JPEG 2000增加了3.4-5.0个百分点,且身份识别性保存较差。

摘要

在身份证件、智能卡生物识别和带宽受限验证中要求的硬亚千字节预算下存储人脸图像,迫使编解码器丢弃大部分信号,同时保留人脸匹配器实际读取的身份。通用编解码器优化像素真实度,而非驱动验证的嵌入距离,因此在1024字节及以下哪种编解码器、分辨率和设置中最能保护身份,以及在512字节时如何退化尚不明确。我们对十种通用和人脸特定编解码器进行了基准测试,涵盖分辨率、字节预算、两个数据集(受控色彩FERET、野外AI-Solutions-KK)和四个锚定人脸匹配器,十四个模型的ViT和CNN阵容确认排名是骨干不变的。然后我们训练一个自定义的身份保本编解码器,通过在冻结增益表上的二进制搜索准确达到字节预算,并运行四项研究:分辨率、人口统计公平性、重压缩和无框对抗鲁棒性。亚千字节的身份保护是可行的,但部署哪种编解码器完全取决于预算。在1024字节和112像素的工作分辨率下,问题接近解决:现代编解码器在ArcFace锚点上保持色彩FERET等误差率低于0.35%。在512字节时,字段会重新排序:AVIF、HEIF、JPEG XL和传统JPEG在FMR 1e-4时,伪非匹配率降至28%到98%,而WebP、JPEG-AI和我们按字节预算的学习编解码器则未进入该区间,WebP为24.3%,而我们精实变体在野外为6.9%。操作结果是这种重新排序,而非1024字节排名:选择1 kB的编解码器,无法部署到一半的编解码器。

研究出发点

身份证件、智能卡和带宽受限的验证服务在对齐面部裁剪时可能只有1024甚至512字节。通用编解码器优化像素畸变,而匹配器使用的嵌入距离,而在某种预算下表现最佳的编解码器在另一种预算下可能突然失效。买家还需要知道选择是否跨识别器转移、影响人口统计群体、经受重压缩以及与对抗扰动相互作用。

方法概述

在受控的彩色FERET和野外AI-Solutions-KK测试下,十种通用和面向人脸的编解码器在五种分辨率和两种硬预算下进行测试。四个锚点匹配器承载主要验证指标,十四个模型的ViT/CNN名单检查编解码器排名是否依赖骨干网。作者还用冻结的64个增益表和二分搜索训练了1870万参数准确且保持身份的编解码器,以确保精确预算合规。独立研究涵盖肤色和族裔差异、同档与跨编解码器压缩、无框对抗扰动、延迟和统计显著性。

论文总结

将1 KB和512 B视为不同的产品等级,而非相邻的质量设置。WebP或AVIF是合理且广泛部署的选择,约为1 KB,而字节预算的学习编解码器在512 B时则更为安全;生物识别测试应驱动决策,而非仅靠PSNR或目视检测。

论文 032026-08-31cs.CV

UFPR-PEs:采用自我申报种族/肤色标签的巴西人脸识别基准

作者与机构

Alexandre Diano

Department of Informatics, Federal University of Paraná, Curitiba, Brazil

Bernardo Biesseck

Department of Informatics, Federal University of Paraná, Curitiba, Brazil

Federal Institute of Mato Grosso (IFMT), Pontes e Lacerda, Mato Grosso, Brazil

Gabriel Polo

Department of Informatics, Federal University of Paraná, Curitiba, Brazil

Vinicius Gregorio

Department of Informatics, Federal University of Paraná, Curitiba, Brazil

Laura Lopes

Department of Informatics, Federal University of Paraná, Curitiba, Brazil

Diego Addan

Department of Informatics, Federal University of Paraná, Curitiba, Brazil

David Menotti

Department of Informatics, Federal University of Paraná, Curitiba, Brazil

解决了什么问题

UFPR-PEs为巴西官方自申种族/肤色记录的验证、封闭身份和开放式识别提供了可重复的基准。其设计旨在区分人口学效应与视觉困难,而不是在没有上下文的情况下呈现总量子群体差距。

关键结果

难度主导整体结果。验证AUC为1.000,简单探针为0.0% EER,中等探针为0.999,2.2% EER;而硬探针则降至0.440 AUC和51.7% EER。封闭组第一等级准确率同样从99.97%和98.97%降至19.10%;即使是第五级,硬样本也仅为41.49%。硬子集内种族/肤色差距扩大,尽管封闭组和开放组测试的排序有所不同。论文明确将主张限制在一个识别族,并指出检测器未定位的面部存在残余选择偏差。

摘要

尽管人脸识别系统已被广泛部署,但在无控制的视觉条件下确保其人口统计学可靠性和稳健性仍是关键挑战。为弥合这一差距,我们提出了UFPR-PES,这是一项基于官方自报种族/肤色类别的巴西当选政治人物公开视频进行面部识别偏倚评估的基准测试。该数据集采用巴西人口普查分类法,包括parda类别,该类别在以往基准中常用的美国或欧洲中心模式中没有直接对应。我们的基准基于压缩的公共视频构建,保留了困难样本,以便在现实条件下分析性能。我们描述了建设流程,报告数据集统计数据,并评估了跨验证和(封闭和开放)识别设置(包括按种族/肤色和难度等级进行子组分析)的面部识别表现。结果显示识别表现与图像质量有显著差异,且亚群差距必须与视觉难度共同解读,而非孤立分析。总体而言,UFPR-PEs为在具有挑战性公共视频条件下的人脸识别偏差研究提供了可重复且具人口统计基础的环境。

研究出发点

许多人脸识别的人口统计审计使用第三方指定的精选静态图像和以美国或欧洲为中心的种族分类法。这些选择并不代表巴西自称的人口普查类别,尤其是parda,且常常去除了主导操作错误的复杂压缩、侧面、遮挡和低分辨率帧。现实审计需要将人口来源和图像难度结合分析。

方法概述

该数据集将5,103名当选巴西政治人物的公开视频与官方选举记录关联起来,包含547,519张带有种族/颜色、年龄和性别元数据的探针图像。它保留了不受控制的压缩和挑战样本,匿名化偶然面孔,并在详尽的人工审核后将探针分层为简单、中等和困难三个子集。一台由WebFace260M预训练的ArcFace R50在大约1150万对真实与冒名顶替验证对、封闭集累积匹配和开放集FNIR/FPIR协议下进行评估,结果细分为白人、黑人、帕尔达人、黄人和土著群体。

论文总结

公平性仪表板应按捕获难度进行分层,并使用本地有意义的人口统计标签。UFPR-PE 提供了一个强有力的巴西压力测试,但它最重要的发现是方法论上的:当严重的图像质量不平衡隐藏在单一平均值中时,子群体差距可能会被误读。