← 返回博客
研究雷达人脸检测呈现攻击检测arXiv2026年8月

每月 arXiv 雷达

2026年8月人脸检测论文:动态关键点、无脸反欺骗与基础模型

面部检测堆栈正在从固定的边界框扩展为可配置的几何形状和可靠的捕获。本月的论文统一了不兼容的标志模板,探讨是否可以完全从非面部对象中学习打印/重放伪影,并在展示和变形攻击数据集上测试了三十个视觉编码器和十六个多模态模型。

本月趋势判断

统一动态面部关键点检测(Unified Dynamic FLD)用语义轮廓查询取代了模板特定的关键点头,并可以在运行时返回请求的布局。TPO挑战了更深层的假设,展示了从蔬菜中学习到的打印和重放证据能够很好地迁移到人脸防伪,使得基于隐私意识的补充数据变得可行。基础模型研究提供了边界条件:通用预训练有帮助,但零样本多模态大语言模型(MLLM)提示仍然表现弱,PAD通常需要视觉编码器的适配。实践方向是一个由显式跨域采集安全支持的统一几何服务,而不是一堆数据集特定的模型。

论文 012026-08-11cs.CV

迈向统一动态人脸关键点检测

作者与机构

Sebastian Regalado

University of Toronto, Canada

ModiFace, Canada

Varshanth R. Rao

ModiFace, Canada

Ruowei Jiang

ModiFace, Canada

Parham Aarabi

University of Toronto, Canada

Igor Gilitschenski

University of Toronto, Canada

解决了什么问题

本文为异构地标布局定义了一个通用的语义坐标系统,并利用它在多个数据集上训练一个检测器。在推理时,同一网络可以回答任意集合的地标查询,包括在其源数据集训练期间未显式请求的点。

关键结果

使用适配器的统一 ViT-B 模型在 WFLW 上记录了 4.02 的 NME 和 2.19% 的失败率,在 300W 的普通/挑战集上分别为 2.43/4.19 NME,在 AFLW-19 上为 2.76 NME,同时支持融合训练和动态输出。当仅在 300W 上训练时,其在具有挑战性的 WFLW68 迁移测试上达到 6.08 NME,而 DTLD 和 PIPNet 分别为 7.23 和 8.09。在未见的本地图标上,学习到的查询相比样条插值在 300W 上提升了 19.0%,在 WFLW 各分割上提升了 15.7-16.3%,表明该模型学习的是可复用的轮廓语义,而不仅仅是记住固定索引。

摘要

尽管面部关键点检测(FLD)方法的进展不断推动性能边界,但它们忽视了两个主要功能限制:(1)不同的网络参数需要针对每个“$N$点”基准数据集独立训练;(2)在“$N$点”数据集上训练的模型只能可靠地输出$N$个关键点。在我们的工作中,我们首先构想了面部部位锚定关键点位置(FPALPs),其中每一个关键点被视为面部部位轮廓上从零(起点)到一(终点)的进展值。每个关键点都可以用FPALP格式表示,无论其来源数据集,因此能够将所有“$N$点”数据集合并为单一数据集。其次,我们使用基于FPALP的查询表示每个关键点,通过跨模态解码器逐步优化,并根据最终表示预测其坐标。我们的方法称为统一动态FLD,体现了这两个设计选择,并通过实现(1)单一模型能够在任意数量的“$N$点”数据集上学习,以及(2)在运行时加载指定的关键点查询即可生成任意数量的特定关键点预测,从而简化了关键点检测流程。在多个基准数据集上的大量实验表明,我们的方法在提供这些优势的同时,仍能与现有最先进方法保持竞争力,并在若干情况下表现更优。

研究出发点

面部标志点数据集对于面部是否拥有19个、68个、98个或其他数量的标注点存在分歧。传统模型将其回归头绑定到一个模板,迫使团队为每个数据集训练和维护单独的参数,并阻止已部署的模型按需返回新的子集或更密集的布局。这种分散对于使用不同标志点规范的对齐、重建、化妆和表情处理流程来说成本很高。

方法概述

每个关键点都变成一个面部部分锚定的关键点位置:沿着如眉毛、眼睛、鼻子、嘴巴或面部边界的语义轮廓,从零到一的归一化进程。数据集模板在该轮廓空间中对齐,每一个请求的点都被编码为 FPALP 查询。跨模态解码器在回归坐标前,逐步结合图像标记和查询。ViT-B 模型在 AFLW-19、300W 和 WFLW 上联合训练;可选的轻量级数据集适配器可以恢复系统性的标注偏差,而不放弃统一的主干网络或运行时可配置的输出布局。

论文总结

单一的查询驱动地标服务可以取代多个特定模板的模型,同时保持竞争性的准确性。当产品需要多种对齐格式或预计添加新的地标定义时,这种方法尤其有吸引力,不过团队仍应对每个生产数据集测试标注偏移适配器。

论文 022026-08-20cs.CV

西红柿、土豆和洋葱:人脸呈现攻击检测真的需要人脸吗?

作者与机构

Guray Ozgur

Fraunhofer Institute for Computer Graphics Research IGD, Germany

Department of Computer Science, Technical University of Darmstadt, Germany

Fadi Boutros

Fraunhofer Institute for Computer Graphics Research IGD, Germany

Naser Damer

Fraunhofer Institute for Computer Graphics Research IGD, Germany

Department of Computer Science, Technical University of Darmstadt, Germany

解决了什么问题

该研究通过受控无脸数据集将呈现过程线索从面部语义中分离出来,并探讨这些线索是否会回传到标准人脸PAD基准测试。它还测试了用无脸攻击替换部分面部样本是否能在固定训练预算下增加信息,而不仅仅是增加数据集规模。

关键结果

仅用蔬菜训练时,四个人脸基准测试的平均AUC达到92.70%,HTER为14.15%,而合成人脸训练为81.02%,ImageNet初始化对照组为67.81%。用TPO替代固定单一来源人脸预算的一部分,将跨数据集平均AUC从89.33%提升到92.55%,HTER从17.54%降至13.97%;在多源训练中,AUC从92.11%升至96.96%,HTER从14.72%降至7.84%。攻击多样性比冗余帧更重要:仅使用10%的TPO帧仍能获得92.97%的AUC,而仅打印或仅回放训练则降至86.14%和83.97%。

摘要

面部呈现攻击检测(PAD)传统上被表述为面向面部的问题,尽管许多由打印、回放和重捕获过程引入的视觉伪影本身并不与面部外观直接相关。本研究中,我们探讨了在下游PAD训练中是否可以在不使用面部的情况下学习可转移的PAD表示。为此,我们引入了TPO,这是一个受控的无面部演示攻击数据集,由真实、打印和回放的番茄、土豆和洋葱的录制组成,这些记录几乎随机选择,这些记录在与传统面部PAD数据集高度相似的协议下获得。通过基于基础模型的PAD架构,我们证明了在TPO训练的检测器在四个标准跨数据集人脸PAD基准测试中的平均AUC达到92.70%,优于合成人脸训练,并与真实人脸数据集训练模型保持竞争力。相反,在人脸PAD数据集上训练的模型,其迁移率超过偶然,表明所学的表征捕捉的是呈现过程的特征,而非对象语义。此外,将TPO纳入传统人脸PAD训练,在固定优化预算下持续提升跨数据集性能,表明无面数据提供了互补信息,而不仅仅是额外训练样本。最后,表示和频率分析进一步证明可转移的PAD表示不能仅由单一光谱伪影解释,而是编码了跨对象类别共享的更丰富的表现线索。这些结果共同提供了实证证据,表明可转移展示攻击表示可以独立于面部内容学习,为保护隐私和身份独立的PAD开发开辟新机遇。

研究出发点

印刷和回放攻击引入了莫尔纹理、显示子像素、纸张纹理、伽马偏移、反射和重捕获噪声,这些都是展示工具的特性,而非所展示的身份。然而,反欺骗研究几乎总是收集更多人脸,增加同意和人口统计关注,同时鼓励检测器吸收面部或数据集的捷径。作者检验了一个刻意强有力的假说:可转移攻击证据可以在完全没有人脸的情况下学习。

方法概述

TPO包含12,480个真实、印刷和回放的番茄、土豆和洋葱演示,均采用基于人脸PAD数据集建模的协议捕获。CLIP ViT-B/16 FoundPAD模型仅用TPO通过LoRA适配,然后在MSU-MFSD、CASIA-FASD、Replay-Attack和OULU-NPU等多个平台进行评估。对照包括零shot CLIP、ImageNet初始化架构匹配、SynthASpoof、单源和多源真脸训练、从人脸数据集逆向传输到TPO、固定预算替换实验、频率分析以及对象类、攻击类型和帧数的消融。

论文总结

对于印刷/回放反伪装,真实的再捕获多样性可能比收集另一组身份更为重要。无面孔补充数据提供了一种注重隐私的方式来改善跨传感器传输,但证据适用于测试的印刷和展示过程,不应自动泛化到口罩或新型物理攻击上。

论文 032026-08-30cs.CV

用于人脸呈现攻击与形变攻击检测的基础模型和多模态大语言模型

作者与机构

Hatef Otroshi Shahreza

Idiap Research Institute, Switzerland

Asif Hussain Khan

Idiap Research Institute, Switzerland

Peter Lorenz

Idiap Research Institute, Switzerland

Alain Komaty

Idiap Research Institute, Switzerland

Sébastien Marcel

Idiap Research Institute, Switzerland

University of Lausanne, Switzerland

解决了什么问题

本研究对面部呈现攻击检测和形态攻击检测的访问策略进行了单一且大规模的比较。它区分了零样本语言输出、输出logit、冻结视觉特征、任务特定MLLM调优和LoRA适应的价值,而非将所有收益归因于通用的基础模型标签。

关键结果

即用型提示不是可靠的检测器:零样本情况下的最佳平均值为PAD的ACER 31.1%,MAD为19.4%。冻结的编码器和线性头可以将这些数值提升到24.4%和5.0%;特定任务的PADLLM和MADLLM在生成解释时分别达到13.6%和2.9%。最佳的LoRA适配编码器在PAD上的平均ACER为14.9%,而最强引用的专用模型为17.3%;在MAD上为3.7%,而专用模型为11.3%。MAD比PAD更容易迁移:最佳跨数据集ACER为4.9%,而PAD为19.8%,而预训练目标比参数数量更能预测迁移能力。

摘要

人脸识别系统越来越多地应用于安全关键应用,但它们仍然容易受到呈现攻击和变形攻击。因此,呈现攻击检测(PAD)和变形攻击检测(MAD)是可信面部生物识别的关键组成部分。尽管PAD和MAD方法取得了进步,现有的检测器在泛化性有限且跨数据集评估方面有所下降。本文系统地研究了通用基础模型(FM)和多模态大型语言模型(MLLM)是否编码了PAD相关和MAD相关信息,以及如何在这两种任务中部署这些模型。我们研究了五种方法,以不断增加对模型内部信息的访问:(i)现成MLLM的零样本提示;(ii)在MLLM输出处的下一标记logit概率上训练浅模型;(iii)对任务特定问答数据进行参数高效微调,产生两个专用MLLMs,称为PADLM和MADLLM,它们还为其决策提供文本推理;(iv)对冻结视觉编码器的线性探测;以及(v)FM和MLLM的视觉编码器的微调。我们在四个PAD数据集(MSU-MFSD、CASIA-FASD、Replay-Attack和OULU-NPU)和四个MAD数据集(FFHQ、FRGC、FRLL和FERET)上对16个开放权重MLLM和30个视觉编码器骨干进行了基准测试。我们的实验表明,FM和MLLM在PAD和MAD方面能够实现显著性能。此外,经过精细调优的模型在跨数据集评估中实现了最先进的检测性能,表明通用预训练表示蕴含大量攻击相关信息。我们所有实验的源代码将公开发布。

研究出发点

通用视觉和多模态模型可能已经编码了用于展示和形态攻击的纹理、几何和语义线索,但仅靠模型大小并不能揭示如何提取这些证据。安全团队需要知道现成提示是否足够,解释是否需要专门的MLLM,以及视觉编码器本身何时需要调整以适应跨数据集的传感器和攻击变化。

方法概述

在四个PAD数据集(MSU-MFSD、CASIA-FASD、Replay-Attack、OULU-NPU)和四个MAD数据集(FFHQ、FRGC、FRLL、FERET)上,评估了十六个开放权重MLLMs和三十个视觉编码器。五种部署模式逐步暴露每个模型的能力:零样本提示、基于下一个令牌概率的浅层分类器、通过文本推理对PADLLM或MADLLM进行参数高效的问答调优、冻结视觉编码器的线性探测,以及对编码器的LoRA适配。开发集的EER阈值被应用于数据集内和跨数据集的ACER测试。

论文总结

不要将提示过的多模态大语言模型(MLLM)部署为生物识别攻击检测器。冻结的视觉特征是一个有用的基线,但攻击展示检测(PAD)通常需要编码器的适配,而经过微调的MLLM在需要人类可读推理时非常有价值;模型选择应分别针对展示攻击和形态攻击进行验证。