← 返回博客
研究雷达人脸检测演示攻击检测arXiv2026年7月

每月 arXiv 雷达

2026年7月人脸检测论文:多光谱补丁、概念引导PAD与眼部活体挑战

7月份直接针对人脸检测器的论文寥寥无几,但捕获安全层却十分活跃。因此,本文将重点关注检测堆栈的外部结构:融合可见光-红外检测器能否被物理隐藏,人脸防欺骗模型能否推广到不可见的材料和传感器,以及眼部活动检测能否触发一种回放或生成器无法复制的实时生物反应。

本月趋势判断

VIPatch 证明,结合可见光和红外传感器并不能自动消除物理对抗风险,因为协调的掩膜和热敏贴纸可以同时抑制这两个通道。CPG-PAD 则针对另一个弱点:反欺骗提示依赖于数据集中的特定元素,而非可重用的视觉概念。眼动追踪协议从被动分类转向主动挑战,结合了注视追踪和瞳孔反应。综上所述,这些论文主张采用分层捕获防御机制、进行明确的跨域测试,并仔细区分模拟安全证据和经人工验证的部署声明。

论文 012026-07-25cs.CR

隐蔽攻击:一种针对可见光-红外融合人脸检测的有效物理对抗补丁攻击

作者与机构

Qiucheng Yu

City University of Hong Kong, Hong Kong, China

Tao Ni

King Abdullah University of Science and Technology, Saudi Arabia

Yihe Zhou

City University of Hong Kong, Hong Kong, China

Jiayimei Wang

City University of Hong Kong, Hong Kong, China

Qingchuan Zhao

City University of Hong Kong, Hong Kong, China

解决了什么问题

先前的补丁程序难以成功应用于融合探测器,因为针对可见光图像的优化可能与红外响应相冲突,而且显眼的图案更容易被人或辅助系统发现。VIPatch 旨在寻找一种物理上可实现的、联合的、且视觉上不易察觉的攻击方法。

关键结果

数字黑盒攻击在可见光探测器上的平均自动语音识别率 (ASR) 为 94.59%,在红外探测器上的平均 ASR 为 97.40%。在物理融合设置下,VIPatch 在 YOLOv8-Face 和 MTCNN 上的 ASR 达到 97.27%,在 TFW 和 OpenCV 上的 ASR 达到 100%。其在 12,000 勒克斯光照条件下的可见光物理 ASR 保持在 80.29%,在 1 至 3 米的测试距离内,ASR 范围为 92.51% 至 100%。

摘要

基于深度学习的可见光-红外融合人脸检测模型在各种应用中得到日益广泛的部署,但它们仍然容易受到对抗性补丁攻击。大多数现有的攻击方法仅针对数字域中的可见光图像或红外图像,这使得它们在物理世界中对融合模型无效。此外,许多此类方法很容易被察觉,因为它们生成的补丁图案与真实世界中的图案存在显著差异。本文提出了一种新型的物理对抗性补丁攻击方法——VIPatch(可见光-红外补丁),该方法能够生成不显眼、逼真且自然的人脸图像补丁。具体而言,VIPatch 在可见光图像和红外图像上构建了一个渐变色掩码和一个创可贴贴纸,并联合优化这两个元素;由此生成的数字补丁进一步指导了其物理对应物的生成。实验结果表明,VIPatch 在数字域和物理域中均取得了具有竞争力的攻击成功率(超过 90%),同时保持了补丁对人眼观察者的不干扰性。

研究出发点

可见光-红外融合技术用于在低光照和温度筛查环境下保持人脸检测的有效性,但大多数对抗性研究仅攻击单一模态或仍停留在数字层面。生产系统需要了解,在打印、放置、光照变化和相机移动等因素的影响下,一个外观普通的物体是否能够同时抑制两个通道的信号。

方法概述

VIPatch 联合优化了用于可见光通道的渐变色面罩和用于红外通道的绷带式热敏贴片,并制造了相应的物理模型。评估过程结合了多种可见光和红外探测器、白盒和黑盒传递测试,以及在视角、200 至 12,000 勒克斯的照度范围和 1 至 3 米的距离下的物理测试。

论文总结

多光谱传感应被视为一个耦合系统进行威胁建模,而非两个独立的防御机制。此次攻击是红队演练的结果,而非缓解措施,但它为探测器供应商提供了具体的物理条件、传递模型和攻击成功目标,以便评估补丁检测、传感器一致性检查和回退策略。

论文 022026-07-01cs.CV

CPG-PAD:概念提示引导式演示攻击检测

作者与机构

Haoyuan Zhang

School of Artificial Intelligence, University of Chinese Academy of Sciences, China

State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, China

Xiangyu Zhu

State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, China

School of Artificial Intelligence, University of Chinese Academy of Sciences, China

Li Gao

China Mobile Financial Technology Co., Ltd., China

Ajian Liu

State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, China

School of Artificial Intelligence, University of Chinese Academy of Sciences, China

Siran Peng

State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, China

School of Artificial Intelligence, University of Chinese Academy of Sciences, China

Zhen Lei

State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, China

School of Artificial Intelligence, University of Chinese Academy of Sciences, China

Centre for Artificial Intelligence and Robotics, Hong Kong Institute of Science and Innovation, Chinese Academy of Sciences, Hong Kong, China

School of Computer Science and Engineering, Macau University of Science and Technology, Macau, China

解决了什么问题

本文旨在将学习到的提示与细粒度的、与攻击相关的视觉证据相匹配,同时抑制特定领域的捷径。此外,本文还针对多源、有限源、单源和未见过的呈现-攻击-工具协议,而非仅仅依赖于单一的跨数据集划分,对这一理念进行了验证。

关键结果

在不使用补充数据的情况下,CPG-PAD 在四向多源协议中平均 HTER 达到 2.08%,较 CLIP 基线的 5.43% 有所改进;使用 CelebA-Spoof 后,其 HTER 达到 1.19%。在单源传输中,CPG-PAD 的平均 HTER 为 5.33%,在未见过的攻击工具上的平均 HTER 为 1.02%,而 CLIP 基线为 3.03%。使用验证集阈值而非测试集阈值得到的平均 HTER 为 2.28%,这凸显了阈值设置的局限性。

摘要

呈现攻击检测 (PAD) 是人脸识别系统抵御呈现攻击(例如打印照片、重放视频和 3D 面具)的关键保障。尽管取得了显著进展,但由于传感器、光照和攻击材料的变化,现有的 PAD 模型在跨领域泛化方面仍然面临挑战。近年来,视觉语言模型 (VLM) 展现出了强大的泛化能力,但它们在 PAD 中的应用仍然有限,因为学习到的提示信息(通常在类别标签监督下优化)无法与细粒度的攻击相关视觉语义明确匹配。因此,学习到的表征往往过度拟合特定领域的特征,而不是捕捉可迁移的攻击线索。为了解决这个问题,我们提出了概念提示引导的呈现攻击检测 (CPG-PAD) 框架,该框架将模型级概念指导引入到提示信息的学习过程中。具体而言,我们设计了一个基于视觉概念的增强(VCE)模块,该模块采用可解释人工智能(XAI)技术自动发现与PAD相关的视觉概念,并生成概念关联的热图,从而提供局部化的细粒度指导。在这些热图的引导下,基于提示的概念注入(PCI)机制通过视觉提示解码器(VPD)和概念映射损失将这些概念整合到提示空间中,使提示与模型的内部概念空间保持一致。这种设计使得CPG-PAD能够捕获可泛化且领域不变的攻击线索,同时有效抑制数据集特定的偏差。在九个基准数据集上的大量实验表明,CPG-PAD在多源、有限源和单源设置下均能始终保持最先进的跨领域性能。

研究出发点

人脸防欺骗模型在训练过程中通常对传感器和攻击介质表现良好,但当光照、摄像头、打印工艺、面具或妆容发生变化时,模型就会失效。视觉语言模型虽然提供了广泛的先验信息,但仅基于标签的提示学习仍然可能锁定局部数据集特征,而非描述真实呈现攻击的概念。

方法概述

CPG-PAD 首先在其视觉概念驱动增强模块中使用可解释性方法来发现概念并生成局部概念热图。然后,视觉提示解码器和概念映射损失函数将这些热图注入到提示空间中,从而将 CLIP 的视觉特征与多个可学习的真实/虚假提示连接起来。该纯视觉模型在九个数据集上进行了评估,并报告了传统的 HTER/AUC 和符合 ISO 标准的运行点指标。

论文总结

当 PAD 产品需要跨越传感器和攻击材料时,概念引导提示很有前景,尤其因为它们比多模态语言模型占用更少的视觉资源。买家仍应在部署校准阈值下比较结果:该论文明确指出,常见的基于测试的 EER 阈值可能会高估现场就绪程度。

论文 032026-07-10cs.CV

一种用于眼部活体验证的双流挑战-响应协议

作者与机构

Ismail Kably

Konelia Inc., Austin, Texas, USA

解决了什么问题

该方案通过将自主平滑追踪注视与非自主瞳孔光反射相结合,解决了重放攻击、生成式深度伪造以及假体对眼部和虹膜系统的威胁。其核心问题是:渲染延迟是否会在重复的随机挑战中造成可测量的同步差距。

关键结果

模拟结果显示,当生成器渲染不增加延迟时,AUC 为 0.502;25 毫秒时为 0.717;50 毫秒时为 0.948;单轮渲染延迟超过 75 毫秒后,AUC 至少为 0.997。在 25 毫秒的延迟下,十轮渲染可将 AUC 提升至 0.966;五轮或更多轮渲染可将模拟的 0.90 AUC 检测阈值从 50 毫秒降低至 25 毫秒。以上结果为计算机模拟结果,未进行任何人体测试或实际的生成攻击实验。

摘要

眼部生物识别系统面临着复杂的呈现攻击,包括高分辨率视频回放和实时生成式深度伪造,这些攻击很容易绕过静态活体检测。当前的呈现攻击检测(PAD)框架通常依赖于孤立的生理指标,例如注视追踪或瞳孔光反射(PLR),这些指标可以被独立地伪造。本文提出了一种空间-亮度传感器融合协议,该协议通过将这些指标融合到一个同步认证挑战中,引入了一个双流挑战-响应框架,用于眼部活体验证。通过生成一个随机的、随时间变化的视觉刺激(其空间轨迹和亮度强度均会波动),我们构建了一个数学耦合的状态空间似然模型,称为同步矩阵,用于评估平滑追踪和瞳孔收缩的预期生物延迟之间的连续互相关性。本文利用基于文献中延迟分布的蒙特卡罗模拟,论证了真实攻击条件与模拟攻击条件之间的理论可分离性,并表明当渲染延迟存在非零差距时,多轮挑战设计能够提高生成式深度伪造技术的检测率。这项工作为下一代眼部和虹膜生物识别动态欺骗防御提供了一个基于模拟的理论框架;在正式部署之前,还需要进行人体受试者验证。

研究出发点

静态注视或瞳孔检查可以独立重现,而实时生成系统也越来越能再现逼真的眼球运动。更严格的活体检测应该要求对新的挑战做出两次符合生物学规律的反应,并验证它们之间的时间关系,而不是仅仅对单个捕获帧进行分类。

方法概述

显示器同时改变目标位置和亮度。系统估计注视延迟、瞳孔收缩延迟及其在同步矩阵中的互相关性,然后将它们组合成一个联合得分。蒙特卡罗模拟研究使用从先前文献中提取的延迟分布,对每种条件下的延迟进行 10,000 次试验,并评估在假定的发生器延迟下进行的 1、3、5 或 10 轮独立试验。

论文总结

该设计为实现实时性提供了一个有用的蓝图,并明确了安全性和延迟之间的权衡,但目前尚无法保证其准确性。产品评估仍需进行人工校准、传感器计时测量、相关延迟攻击以及针对实际实时渲染器的红队测试。