← 返回博客
研究雷达深度伪造检测面部鉴定arXiv2026年7月

每月 arXiv 雷达

2026年7月深度伪造检测论文:重建证据、面部生理信号与紧凑重放

7 月份发表的深度伪造论文探讨了检测器在脱离静态基准测试后出现的三个弱点:解释可能缺乏依据、人脸生成器可以绕过伪造分类器,以及持续更新可能会遗忘先前的篡改手段。所选方法引入了显式重建残差、生理视频通道和信息密集的重放缓冲区。

本月趋势判断

LaP-Forensics 将定位和结构化解释建立在扩散重建残差之上,但它正确地避免声称其自由文本经过事实验证。rPPG 研究表明,即使分类器和协议保持不变,说话人脸检测的难度也会因生成器的不同而显著变化。InfoDense 解决了在不存储完整历史人脸图像的情况下更新检测器的操作难题。在这三种方法中,最强的信号并非普遍存在的伪影:可靠性来自于结合互补证据、隔离评估协议以及保留在分布演变过程中至关重要的线索。

论文 012026-07-28cs.CV

LaP-Forensics:基于潜在像素一致性的多模态推理用于深度伪造检测

作者与机构

Can Wang

The Hong Kong Polytechnic University, Hong Kong, China

Yuhao Wang

University College London, United Kingdom

Yushe Cao

Tsinghua University, China

Canran Xiao

Sun Yat-sen University, China

Fei Shen

National University of Singapore, Singapore

解决了什么问题

LaP-Forensics 通过明确的兼容性参考,解决了跨生成器图像检测和像素级伪影定位的问题。它旨在使结构化的“位置、内容、原因”推理能够参考这些证据,同时承认参考的使用本身并不能证明自由解释中的每个句子。

关键结果

在 UniversalFakeDetect 数据集上,图像识别头在 GAN 上的准确率达到 97.23%,在 Deepfakes 上的准确率达到 71.30%,在 Diffusion 上的准确率达到 92.18%,在 CRN 上的准确率达到 98.98%。在官方 SynthScars 协议下,人为痕迹定位的 mIoU 达到 61.40,F1 值达到 66.00。在受控分割中,移除残差会使 mIoU 从 72.19 降至 61.83,F1 值从 63.62 降至 41.71;将残差替换为零或供体图也会显著改变输出结果。

摘要

近期的生成模型能够生成几乎没有明显视觉伪影的图像,这削弱了仅依赖表面外观的检测器和解释方法。我们提出了 LaP-Forensics,一个多模态框架,它利用基于重建的取证证据来增强 RGB 语义。一个冻结的稳定扩散 DDIM 反演重建模型提供了一个固定的重建参考,其残差图衡量了与该参考的局部兼容性。在结构化的 Where-What-Why 模型预测文本分析和伪影掩码之前,独立的投影仪对 RGB 图像和残差图进行编码。监督式微调之后是组相对策略优化 (GRPO),其奖励结合了掩码重叠、输出结构和证据参考术语。这些文本侧术语鼓励模型参考一致性图,但并不构成对自由文本真实性的验证。一个独立的图像级头部融合了 RGB 和 DDIM 残差类别特征。实验表明,该方法在 UniversalFakeDetect 上具有跨生成器检测能力,并在官方 SynthScars 基准测试中具有竞争力的伪影定位能力。受控线索构建、反转视界、成分、奖励项和反事实分析支持在评估设置下残差流的效用,而自由形式的文本忠实度和后处理可靠性仍然是开放的局限性。

研究出发点

由于生成的图像会丢失明显的表面缺陷,因此仅使用RGB检测器或视觉语言解释可能听起来很有说服力,但却无法提供可靠的取证证据。对于企业审查而言,一个有效的系统应该将检测分数、空间定位和文本描述分开,同时展示哪些额外的信号真正改变了结果。

方法概述

冻结稳定扩散DDIM反演重建过程生成输入和重建之间的残差图。独立的投影器对RGB语义和残差证据进行编码;多模态分支生成结构化文本和掩码,而独立的图像处理头融合用于检测的类别特征。监督式微调之后,根据掩码重叠、输出格式和证据参考情况给予GRPO奖励,官方基准测试与较小的受控消融实验分开进行。

论文总结

重建残差是另一个有用的取证通道,能够显著提高定位精度,但它并非经过校准的操作图或来源归属信号。团队应重视检测、定位和解释的清晰分离,并在将生成的推理结果应用于审查工作流程之前,独立测试后处理的鲁棒性和文本忠实度。

论文 022026-07-23cs.LG

生理信号作为一种用于检测人脸深度伪造视频的法医手段

作者与机构

Othmane Harraq

Temple University, Philadelphia, Pennsylvania, USA

Tamer Aldwairi

Temple University, Philadelphia, Pennsylvania, USA

解决了什么问题

本文探讨了远程光电容积脉搏波描记法在识别会说话的人脸伪造方面是否更具优势,以及当所有测试身份均未参与训练时,该方法的性能是否仍然可靠。此外,本文还分别针对七种生成方法评估了检测器的难度,而不是将这些差异隐藏在一个综合评分中。

关键结果

参数数为 165K 的一维 ResNet 模型达到了 0.806 ± 0.003 的 AUC 值和 27.8% 的 EER 值,相比之下,先前复现的 rPPG 检测器的 AUC 值为 0.622,而引用的通用 Effort 模型的 AUC 值为 0.830。各生成器的 AUC 值范围从 Real3DPortrait 的 0.985 到 IP-LAP 的 0.690,稳定在 0.295 的范围内,远大于种子方差。

摘要

会说话的脸(TF)深度伪造技术利用静态源图像和音频信号合成逼真的面部视频,其伪造效果是目前基于图像的检测器难以识别的。与换脸伪造不同,TF 合成没有可供继承生理特征的底层真实视频,因此远程光电容积脉搏波描记法(rPPG)成为检测此类伪造技术的独特有效方法。我们提出了一种检测框架,该框架利用 RhythmFormer 提取每个视频的 rPPG 波形,并训练一系列轻量级分类器来区分真实生理信号和合成生理信号。在严格的受试者独立协议下,我们的 1D ResNet 模型在 Celeb-DF++ 的 TF 子集上进行了评估,其中测试身份与训练身份完全分离。该模型取得了 0.806 的 AUC 和 27.8% 的 EER,与已发表的最佳通用检测器(Effort,ICML 2025)的差距仅为 2.4 分,且仅在生理通道上运行。我们记录了一项受控复现研究,该研究针对的是具有代表性的先前 rPPG 检测器 DeepFakesON-Phys,结果表明,其性能从传统换脸数据集上的 0.999 AUC 下降到 Celeb-DF++ TF 子集上的 0.622。我们进一步证明,检测难度与方法密切相关:在七个TF生成器中,AUC值从0.985(Real3DPortrait)到0.690(IP-LAP)不等,且排名在所有评估协议中均保持稳定。这种差异反映了每个生成器可解释的生理特性,而非评估噪声,这也是本研究的主要理论贡献。

研究出发点

会说话的人脸生成器会根据静态身份信息和音频合成整个视频,因此可能无法保留真实的瞬时血容量信号。现有的rPPG检测器主要在较早的人脸替换视频上进行验证,这些视频中原始视频的生理特征得以保留,并且身份信息在分割过程中的泄露可能会导致结果失真。

方法概述

RhythmFormer 从每个面部视频中提取波形,然后使用轻量级的一维 ResNet 和 Transformer 分类器区分真实生理特征和合成生理特征。Celeb-DF++ 说话人脸子集按名人身份划分,其中 18 个身份用于评估。作者在相同设置下复现了 DeepFakesON-Phys,并运行了五种子聚合分析和每个生成器的分析。

论文总结

面部生理学是一个补充性的、可解释的通道,而非独立的答案。它接近于参数极少的大型视觉检测器,但某些生成器对伪周期信号的保留程度足以接近随机水平;生成系统应将rPPG与空间、频率和视听证据融合,并在不同身份和生成器之间进行验证。

论文 032026-07-18cs.CV

InfoDense:面向内存高效的增量式人脸伪造检测的密度感知区域决策重放

作者与机构

Jikang Cheng

Peking University, China

Hao Shen

Huazhong Agricultural University, China

Xueyi Zhang

National University of Singapore, Singapore

Guangcheng Wang

Nantong University, China

Zhongyuan Wang

Wuhan University, China

Renye Yan

Peking University, China

Baojin Huang

Huazhong Agricultural University, China

解决了什么问题

InfoDense 将回放问题重新定义为信息密度问题:保留包含操纵证据的紧凑区域,选择一组多样化的区域,并将它们与当前任务样本结合起来,而不会引入与旧完整图像缓冲区相关的领域偏差。

关键结果

在主协议下,InfoDense 在增量数据集上的平均 AUC 为 90.42%,性能下降了 4.52 个百分点,跨数据集的平均 AUC 为 90.03%。该论文报告称,在存储空间减少 80% 后,性能依然可观,并且在相同存储空间下,重放多样性最多可提高十倍。此外,在报告的隐私分析中,存储的片段还将身份检索召回率降低到 0.02% 以下。

摘要

人脸伪造技术的快速发展带来了日益多样化的篡改手段。增量式人脸伪造检测(IFFD)通过逐步添加新的伪造数据来微调先前训练的模型,已成为应对不断演变的伪造威胁的一种很有前景的方法。然而,传统的基于回放的IFFD方法存在严重的记忆遗忘问题。在内存有限的情况下存储完整的历史图像,往往会导致无法保留细微的伪造线索,或者引入领域偏差,从而降低模型学习内在和可迁移的篡改特征的能力。本文提出了一种密度感知的区域决定性回放策略,称为InfoDense,以应对这些挑战。InfoDense优先考虑伪造密集和伪造关键区域,在显著降低存储需求的同时,保持了高保真度的伪造证据。我们首先引入InfoDense Cut,利用基于CLIP的嵌入来定位决定性区域。然后,InfoDense Select 通过结合潜在空间代表性和关键图像块计数对候选片段进行排序,从而确保回放缓冲区中既有多样性又有信息密度。最后,InfoDense Fuse 通过自适应地将存储的片段与当前任务样本融合,重建无偏的训练输入,从而增强知识保持和泛化能力。在具有挑战性的增量式深度伪造基准测试中进行的大量实验表明,InfoDense 能够有效缓解灾难性遗忘,同时提升跨域泛化能力。

研究出发点

随着新的篡改手段不断涌现,深度伪造检测器需要持续更新。然而,重放完整的历史人脸图像会消耗大量内存,保留可识别的内容,并且可能还会将大部分缓冲区空间用于背景或冗余的面部结构。在存储预算有限的情况下,检测器必须在不丢失先前任务结果的前提下,保留细微的伪造线索。

方法概述

InfoDense Cut 使用 CLIP 图像块嵌入和与伪造相关的文本来对关键区域进行评分。InfoDense Select 根据潜在空间代表性和关键图像块的数量对候选分割区域进行排序。InfoDense Fuse 通过将存储的历史分割区域与当前样本相结合来重建训练输入,从而在相同的内存预算下增加源图像的表示数量。评估过程采用增量伪造序列和独立的跨数据集测试。

论文总结

对于需要在存储或隐私限制下持续学习的检测器而言,区域级重放极具吸引力。其部署价值取决于所选图像块在实际压缩、策略变更和对抗性后处理后是否仍具有信息价值,但它为保留完整的历史人脸提供了一种切实可行的替代方案。