← 返回博客
研究雷达深度伪造检测媒体取证arXiv2026年9月

每月 arXiv 雷达

2026年9月Deepfake检测论文:多人脸推理、手机照片误报与持续学习

最强的九月深度伪造研究关注系统行为,而不是另一个封闭集评分。IMFD要求视觉语言模型在一次基于指令的流程中定位并分类每一张人脸。LAION-Mobile在现代合成内容和近一百万张智能手机照片上审核了原始检测器的检查点,显示出严重的校准漂移。MSFD将视频检测器更新视为一个持续学习问题,并分别保留空间、时间和联合频率证据。

本月趋势判断

IMFD的坐标感知指令使其在OpenForensics上的两阶段结果达到0.98微F1、0.98宏F1和0.94精确匹配准确率;端到端单阶段版本下降到0.90、0.84和0.77,因为人脸定位仍会传播错误。LAION-Mobile发现,在现代AI混合数据上,没有十二个发布的检测器超过0.624 AUC,并且经过现代校准的阈值会标记17%-91%的真实手机照片;然而,其语料库几乎不涵盖当前旗舰神经图像信号处理器。MSFD在六个连续视频数据集上达到93.02%的平均AUC,并有2.29点遗忘,在少量样本协议下达到83.65%的平均准确率并且表现出负遗忘。综合来看,这些论文主张进行整场景评估、使用当前设备的负样本、明确校准责任,以及在每次检测器更新后进行回归测试。

论文 012026-09-17cs.CV

IMFD:基于指令式大视觉语言模型的端到端多人脸伪造检测

作者与机构

Dasom Choi

Chungnam National University

Sangjun Moon

Chungnam National University

Hyeongchan Im

Chungnam National University

Jaeeon Park

Institute of Science Tokyo

Jingun Kwon

Chungnam National University

Hidetaka Kamigaito

Nara Institute of Science and Technology

Taro Watanabe

Nara Institute of Science and Technology

Manabu Okumura

Institute of Science Tokyo

解决了什么问题

IMFD将多人脸造假检测重新表述为一个基于指令的视觉-语言任务,它能够联合定位人脸并分配每张人脸的真实性标签。这可以测试显式的人脸坐标和图像上下文是否有助于大型视觉-语言模型将从左到右的人脸索引与正确的输出对齐。

关键结果

在整个测试集上使用真实坐标,IMFD达到0.98的微平均F1、0.98的宏平均F1和0.94的完全匹配精度;在人脸较多的子集上得分为0.97、0.98和0.87。在实际单阶段设置中,这些完整集指标降至0.90、0.84和0.77,暴露出人脸定位仍是主要瓶颈。完整集的人脸框AP为81.9,多人脸子集为83.6。将输入分辨率从112提高到672像素,受控微平均F1从0.917升至0.981,完全匹配从0.654升至0.948。IMFD优于对比基线,但比最快的单阶段方法慢,并且仍依赖于合成基准操控。

摘要

由于深度伪造的快速增加及其在社交媒体上的传播,人们对其产生了严重关切。传统的多人脸造假检测器会独立裁剪和验证每张人脸,忽略背景上下文和人脸之间的关系,这通常会导致性能不佳。为克服这些局限性,我们利用基于指令的大型视觉-语言模型(LVLMs),它们能够解释整张图像并遵循复杂的文本指令。我们提出了一个简单而有效的单阶段多人脸造假检测器,称为IMFD(基于指令的多人脸造假检测器),该检测器实现端到端训练,能够联合定位人脸并预测每张人脸的造假标签。IMFD不是仅将人脸框预测作为联合目标,而是将预测的人脸边界框明确地整合到指令中,作为增强指令定位和造假检测的视觉提示。为了支持IMFD的训练和评估,我们将现有的多人脸造假数据集转换为基于指令的格式。实验结果和分析表明,通过将人脸边界框整合到指令中,IMFD提升了多人脸造假检测性能,并持续优于各种最先进的方法。

研究出发点

多人照片打破了通常的先裁剪再分类的假设。独立的人脸裁剪会丢失场景和人脸间的上下文,需要对每个人进行顺序操作,并将检测器或排序错误传播到鉴定结果中。一个有效的系统必须指出哪些人脸是伪造的,而不仅仅判断图像是否包含任何操控。

方法概述

该系统将OpenForensics样本转换为从左到右命名人脸的指令。基于CLIP的锚阶段对候选区域进行评分,融合重叠的边界框,并将预测的坐标注入文本指令中,同时结合图像表示。随后,LVLM返回伪造的人脸索引和边界框。作者评估了两种设置:使用真实坐标的受控两阶段设置和使用IMFD预测框的端到端单阶段设置,并报告了微平均F1、宏平均F1、图像级完全匹配、边界框AP、延迟和吞吐量。

论文总结

整体图像推理可以改善拥挤场景的取证,但提供的框与预测框之间的差距很大。采购测试应对每个面部的决策和定位失败进行评分,而不仅仅是图像级别的AUC。

论文 022026-09-10cs.CV

LAION-Mobile:用一百万张智能手机照片评估Deepfake检测器

作者与机构

Achim von Stryk

Stralsund University, Germany

Janis Keuper

Institute for Machine Learning and Analytics, Offenburg University, Germany

解决了什么问题

LAION-Mobile审计了十二种原始检测器检查点是否能泛化到现代AI图像以及它们在真实智能手机照片上误报警的频率。它将与阈值无关的判别能力与阈值校准分开,并探讨了传统GAN校准是否会导致误导性的部署情况。

关键结果

在 NTIRE 2026 上,最佳检测器的 AUC 仅达到 0.624;十二个检测器中有五个低于随机水平,并且在 5% 假阳性率下,没有一个超过 13.5% 的真正阳性率。使用传统校准阈值会使几个系统在不超过 11% 手机照片误报的情况下看起来可用,但现代校准使同样的检测器标记 17-91% 的真实照片。UnivFD 展示了这种变化:在相同的手机图像上,0.2% 变为 39.1%。该语料库以较老设备为主,几乎不包含当前旗舰机型,照片的真实性是推断得出的而非每张图像认证,并且 LAION-Mobile 仅包含真实照片,因此无法提供二分类的手机图片 AUC。

摘要

大多数深度伪造检测器在其参考基准上报告接近完美的AUC分数。然而,最近的一篇ICML立场论文认为,这些评估总体上忽略了现代智能手机摄影的影响:广泛使用的设备端神经图像信号处理管线(如多传感器融合或噪声与运动模糊抑制)越来越多地将成像范式从简单的镜头投影转向计算摄影。因此,设备实际上是生成照片,而不是记录照片。这增加了深度伪造检测器可能将普通手机照片标记为伪造的风险。由于缺乏包含现代智能手机图像的大规模数据集,这一假设迄今仅在小规模概念验证研究中进行过测试。本文的目标是弥补这一空白。我们引入了LAION-Mobile,一个包含约100万张带EXIF元数据的智能手机图像的开放数据集,这些数据来自重新整理的LAION-5B。在该数据池中的9,115张图像评估样本上,使用十二种最先进的深度伪造检测器及其原始论文模型检查点进行评估(DIRE为738张),我们报告了三项关键发现:(i) 在现代AI内容上,没有任何检测器的AUC超过0.624,其中五个低于随机水平。(ii) 真实照片的误报率是阈值校准的产物:在传统GAN数据上拟合的阈值使若干检测器看起来可部署(FPR低于11%),但是一旦在现代内容上重新拟合相同标准,这些检测器会标记17-91%的真实照片。(iii) 因此,没有检测器可以在现代AI内容上超越随机水平,同时保持可部署的真实照片误报率。为了反映网络收集的设备组合,该语料库探测了第一代神经ISP(2018-2020);当前旗舰设备几乎缺席,使现代ISP范式成为开放的空白。

研究出发点

已发表的深度伪造检测器在其自身基准上往往接近完美的AUC,而现代手机对真实照片应用HDR融合、降噪、锐化、运动抑制及其他学习的图像信号处理。这些计算伪影可能类似于生成图像的指纹。如果没有大型真实手机数据集和针对当前合成内容校准的阈值,检测器可能看起来安全,但会以不可用的频率标记普通照片。

方法概述

作者通过智能手机EXIF和非照片启发式过滤重新整理的LAION-5B,创建了一个包含935,399张真实照片的池,并包含设备元数据,然后对固定的9,115张评估样本进行评分,DIRE除外,有738张昂贵重建图像。十二种检测器首先在其原始或ProGAN风格基准上进行检查,然后在NTIRE 2026现代真实/伪造混合数据上进行评估。在传统ProGAN-ISP和现代NTIRE上分别拟合的等误差阈值被转移到相同的手机照片上,以暴露校准漂移。

论文总结

接近完美的论文 AUC 无法迁移到现代内容,阈值归属能够使真实照片误报数量发生数量级变化。每次部署都需要当前设备的负样本、一个记录的校准集,以及对操作点漂移的监控。

论文 032026-09-03cs.CV

跨越空间与时间保留知识的持续视频Deepfake检测

作者与机构

Taehoon Kim

Graduate School of Artificial Intelligence, Chung-Ang University

Jongwook Choi

Graduate School of Artificial Intelligence, Chung-Ang University

Heejae Jo

Department of Advanced Imaging, Graduate School of Advanced Imaging Science, Multimedia and Film, Chung-Ang University

Byungmin Park

Graduate School of Artificial Intelligence, Chung-Ang University

Jongwon Choi

Graduate School of Artificial Intelligence, Chung-Ang University

Department of Advanced Imaging, Graduate School of Advanced Imaging Science, Multimedia and Film, Chung-Ang University

Department of Metaverse Convergence, Chung-Ang University

解决了什么问题

MSFD 专门针对视频深度伪造检测中的稳定性-可塑性问题。它在更新检测器时分别保留空间、时间和空间-时间的取证知识,并评估全数据、生成器增量和少样本序列,而非单一静态训练-测试划分。

关键结果

在六任务协议中,完整系统达到 93.02% 的平均 AUC,平均遗忘为 2.29 点,而 iCaRL 风格的基线为 89.84% 和 6.81。在生成器增量协议中,它达到 96.67% 的平均 AUC,其中图像到视频伪造的 AUC 为 91.47%,遗忘为 1.37。在每个新任务仅使用 25 个真实和 25 个伪造视频的情况下,它实现了 83.65% 的平均准确率和 -1.25 的遗忘,表明存在正向的向后迁移;IDER 的遗忘较少,为 -2.10,但准确率略低,为 83.47%。消融实验显示,所有三个频率分支都优于单一未分割的表示。该方法在主要为亚洲的 KoDF 任务之后仍显示遗忘增加,表明人口统计和领域迁移问题尚未解决。

摘要

高质量视频深度伪造的持续出现需要检测器不断适应新的伪造模式,而现有的方法是针对深度伪造图像设计的,无法捕捉视频特有的线索。与仅包含空间伪影的深度伪造图像不同,深度伪造视频在空间和时间轴上都留下了明显证据,需要在顺序模型更新期间分别保留每种模态。为克服这一限制,我们提出了一个连续深度伪造视频检测框架——模态特异频率蒸馏(MSFD),该框架在频域中将视频特征显式分解为空间、时间和空间-时间模态。这种分解使每种模态可以独立保留,因为不同类型的深度伪造视频在任务中对空间和时间线索的依赖程度不同。此外,MSFD 采用跨模态去相关损失,鼓励空间-时间表示与单一模态线索保持正交。大量实验表明,我们的框架在各种连续深度伪造视频场景中实现了更强的适应能力,并且相比最新方法更有效地保持了性能。

研究出发点

视频伪造类型在部署后是顺序出现的,因此检测器必须在不抹去旧证据的情况下学习新的生成器。从图像分类继承的连续方法往往只保留一个交织表示,即使视频深度伪造会留下空间边界、时间不一致和时空联合伪影的不同混合。即使遗忘率低,如果系统拒绝适应新任务,也是无用的。

方法概述

中间视频特征被转换为二维空间、二维时间以及联合时空频率表示。模态特定频率蒸馏在连续更新过程中将每个频谱与先前模型对齐。模态特定适配器对通道重新加权,并为任务相关的频率带学习 Gumbel-Softmax 掩码,同时去相关损失防止联合分支重复单模态线索。在六个深度伪造视频数据集上的大多数基线比较中使用了重放示例和相同的 3D ResNet-18 主干网络。

论文总结

将空间和时间的法医记忆分离可以提高检测器的更新,尤其是在新数据很少的情况下。剩余的 KoDF 转移提醒我们在每次持续学习发布后对两类生成器以及人口域进行回归测试。