← 返回博客
研究雷达深度伪造检测视频取证arXiv2026年8月

每月 arXiv 雷达

2026年8月深度伪造检测论文:图像到视频迁移、多智能体取证与公平性

八月的论文将深度伪造检测视为部署系统,而不仅仅是单一的AUC数值。一项研究显示,通过帧调优和学习聚合,图像检测器可以优于专用视频模型;另一项研究将纹理、光照、运动和物理分析分别分配给不同的代理;第三项研究针对空间和微调残差特征中的人口统计学捷径。

本月趋势判断

FakeI2V-Bench 发现,视频帧微调加上统计聚合可以将成熟的图像检测器转变为更强大、有时更轻量的视频系统,但稀疏编辑仍然困难。FaceVid-Forensics-100K 使用四个独立的取证代理和一名评审员来提高对未见过生成器的检测,同时提供解释。FairReL 显示泛化和公平性是分开的目标:检测器整体上可以良好迁移,但仍可能将假阳性集中在少数群体子集中。因此,一个可信的生产评估需要生成器多样性、时间稀疏性测试、可复查证据以及固定阈值的子组指标。

论文 012026-08-04cs.CR

FakeI2V-Bench:评测图像级深度伪造检测器在视频检测中的适用性

作者与机构

Pei Li

School of Cyber Science and Technology, Shandong University, Qingdao, China

Sihan Chen

School of Cyber Science and Technology, Shandong University, Qingdao, China

Delong Ran

Institute for Network Sciences and Cyberspace, BNRist, Tsinghua University, Beijing, China

Tianshuo Cong

School of Cryptologic Science and Engineering, Shandong University, Jinan, China

解决了什么问题

FakeI2V-Bench 提供了一个统一的图像和视频级别检测测试,并引入了一个可重复使用的桥接方法,将帧分数转化为视频决策。它量化了准确率、跨生成器行为、延迟、模型大小以及仅对 20% 剪辑进行篡改时的性能表现。

关键结果

在最佳的简单聚合下,最强的图像检测器达到 80.16% AUC,已略高于顶尖视频模型 FTCN 的 79.99%。经过 IV-Bridge 处理后,十二个图像检测器中有十一超过 FTCN;RINE-IV 达到 93.80% AUC 和 97.63% AP,4.34百万参数的 Patch-IV 达到 89.26% AUC 和 96.12% AP。在十四个生成器中,增强的图像模型平均 95.51% AUC,而最佳视频检测器为 91.01%,尽管 Sora 在平均 AUC 上仍然困难,只有 72.76%。在仅 20% 帧被伪造的情况下,每个模型的表现有所下降,Patch-IV 以 77.15% AUC 领先。

摘要

近期视频生成模型的进展显著加剧了深度伪造威胁,但当前的深度伪造视频检测基准仍不完善。尤其是,图像级检测器在视频领域的有效性尚未得到系统评估。为填补这一空白,我们提出了 FakeI2V-Bench,这是一项针对最先进视频级深度伪造检测器在挑战性场景下的评估基准,特别关注系统性评估图像级深度伪造检测器在视频领域的性能。FakeI2V-Bench 包含 97,548 个视频,涵盖由最新强大生成模型生成的内容,并覆盖更广泛的类别。基于该数据集,我们系统评估了八个视频级检测器和十二个代表性图像级检测器。实验结果显示,表现最佳的图像级检测器达到 80.16% 的 AUC,略高于最强的视频级检测器(即 79.99% 的 AUC)。超越基准评测,我们提出了 IV-Bridge,这是一个增强图像级深度伪造检测器在视频中适用性的通用框架。IV-Bridge 使用带有统计特征的随机森林模型聚合帧级预测,使得十一种图像级检测器能够超过最先进的视频级方法,表现最佳的变体实现了 93.80% 的 AUC。总体而言,FakeI2V-Bench 建立了深度伪造视频检测的严格基准,并引入了将图像级检测器扩展至视频领域的新途径,为未来研究提供了新的见解和方向。代码和数据可在 https://github.com/CryptoAILab/FakeI2V-Bench 获取。

研究出发点

图像深度伪造检测器受益于成熟的训练流水线,但视频基准通常只比较视频特定架构,并且对帧模型应用简单平均。这让团队无法确定是否需要时序网络,近期的视频生成器如何改变排名,以及现有图像检测器是否可以经济地适应视频。稀疏篡改,即只有部分帧是伪造的,使得简单聚合尤其风险较大。

方法概述

该基准整合了来自四个面部与通用生成数据集的 97,548 个视频,并评估了八个视频检测器以及十二个代表性图像检测器。作者首先比较固定分数聚合方法,如平均值、最大值和最小值。然后,IV-Bridge 对不重叠的 FF 和 GenVideo 帧进行视频-帧微调,并将帧级分数的统计描述输入到一个包含最多 800 棵树、深度为 8 的随机森林中。结果按十四种生成模型、面部与通用内容、部署成本和短期伪造进行分类。

论文总结

现有的图像检测器如果在真实视频帧上进行调优,并与学习到的时序分数聚合结合,就可以成为具有竞争力的视频服务。该桥接方法对于轻量级部署具有吸引力,但稀疏编辑仍明显是失败模式,并且准确率最高的模型并非最便宜。

论文 022026-08-07cs.CV

面向泛化深度伪造视频检测的多智能体取证推理

作者与机构

Xuechao Zou

Beijing Jiaotong University, China

Shun Zhang

Beijing Jiaotong University, China

Kai Li

Tsinghua University, China

Yi Zhou

Beijing Jiaotong University, China

Xinyu Sun

Beijing Jiaotong University, China

Yuhui Chen

Ant Group, China

Zhe Wu

Tsinghua University, China

Congyan Lang

Beijing Jiaotong University, China

Junliang Xing

Tsinghua University, China

解决了什么问题

论文既提供了一个当前且解释丰富的基准,也提供了一个为未见生成器设计的协作推理系统。它测试了独立专家报告是否能改善超越较长思考链提示或反复向同一模型展示相同框架的泛化能力。

关键结果

在域外测试中,带视频感知判决的完整系统准确率达到69.87%,回忆率81.82%,F1评分53.28%。最强的封闭模型Gemini 2.5 Pro分别记录了63.78%、75.29%和47.45%,而最佳小视觉基线测试精度为64.28%,F1评分为45.20%。仅用文本评判的代理报告判定率仍以67.41%准确率和51.01%的F1排名第二。联合SFT将视频感知系统准确率从42.29%提升至67.03%,GRPO进一步提升;将四位法医代理组合,在两种评判设置下均获得最佳F1。

摘要

恶意利用生成式人工智能创建高度逼真的深度伪造视频引发严重的伦理问题,并对人工智能安全构成重大挑战。然而,现有深度伪造视频基准对最新合成方法的覆盖有限,且普遍缺乏可靠且细粒度的文本注释。与此同时,传统检测器和多模态大型语言模型(MLLM),无论是作为单一模型运行还是依赖单一分析视角,常常无法捕捉到微妙的伪造伪造伪造,限制了其在新兴AI生成方法中的推广。为解决这些限制,我们介绍了FaceVid-Forensics-100K,这是一个大规模深度伪造视频数据集,包含10万个视频,涵盖33种合成方法,涵盖面部交换、面部重现和全脸合成,包括近期生成器如Seedance 2.0。该数据集提供了细粒度的视觉观察文本注释和判决一致的法医解释,通过由先进的MLLM驱动的多模型聚合和冲突解决流水线自动合成。基于该基准,我们提出了一个多代理法医推理框架,利用四位专业领域专家代理从纹理、光照、运动和物理四个视角独立分析伪造线索。随后,法官代理将他们的报告进行整合,生成最终预测并附有解释。对域外测试集的广泛评估显示,尽管我们的框架完全由小型开源MLLM组成,但其表现优于包括闭源GPT和Gemini模型在内的所有方法,并在该基准测试中所有报告的指标中排名第一。项目页面可在 https://xavierjiezou.github.io/ARGUS/ 访问。

研究出发点

现代人脸视频生成器能很好地保持身份和运动,单个分类器或通用MLLM可能会遗漏细微且生成器特定的证据。现有数据集常常落后于新的综合系统,且仅提供二元标签,难以训练或审计解释。对于高风险审查,探测器应检查独立的法医维度并协调相互矛盾的观察,而非产生无依无据的结论。

方法概述

FaceVid-Forensics-100K 包含来自 33 种面部交换、重现和全脸合成方法的 100,000 段视频,包括 Seedance 2.0。通过多模型聚合和冲突解决,创建细粒度的观察和判决一致的解释。四个小型开源 MLLM 代理分别检查纹理、光照、运动和物理一致性;法官接收报告,可选择采样视频,并发布裁决及说明。代理和法官接受监督微调培训,随后进行组相对策略优化,并使用域外生成器供评估。

论文总结

将法医观察与裁决形成分离可以提高审计性和未知生成器的性能。该架构对于分析员辅助工作流具有吸引力,但其多模型推理成本和自动生成的解释标签应在生产采纳前,与更简单的检测器加人工审核进行比较衡量。

论文 032026-08-28cs.CV

FairReL:基于公平性感知表征学习的深度伪造检测

作者与机构

Xiaoman Lu

Department of Computer Science, University of Warwick, Coventry, United Kingdom

Jiaqi Li

Department of Computer Science, University of Warwick, Coventry, United Kingdom

Shuntian Zheng

Department of Computer Science, University of Warwick, Coventry, United Kingdom

Huiping Chen

School of Computer Science, University of Birmingham, Birmingham, United Kingdom

Yu Guan

Department of Computer Science, University of Warwick, Coventry, United Kingdom

解决了什么问题

FairReL隔离了两个对子群敏感的组成部分——多尺度空间频率和微调期间引入的残差表示——并对每个部分应用不同的公平控制。它在固定操作阈值下评估假阳性差异,因此改进不能仅通过整体拒绝更少样本来制造。

关键结果

在最强的以公平为导向的基线方法上,作者报告了在未见数据集上的AUC提升了3.9点,子群体FPR差异减少了10.2%。FairReL在Celeb-DF、DFD和DFDC上的AUC分别达到80.64、86.13和66.34,同时在三者上记录了最低的等FPR差异(10.12、13.55和38.36)。在DFDC上,它的群组平均AUC为67.03,最佳与最差子群体AUC差距为1.09点。它在两个数据集上的整体AUC略低于以准确率为中心的GenD,但表现分布更均衡,尤其是在女性和黑人子群体中。

摘要

尽管近期深度伪造检测器在总体准确率上表现出色,但其错误在不同人口子群体中分布仍不均衡,某些群体的真实面孔更容易被误判为伪造。现有的公平感知检测器通常对整个特征表示进行正则化,而不识别或控制导致不公平预测的特定组成部分。这种粗略干预可能会过度抑制有用的伪造线索,同时在特定子空间中保留人口结构。为了解决这一问题,我们识别出两个对子群敏感的组成部分:多尺度空间特征,它编码局部面部和伪造模式;以及微调引入的残差特征,它将主干网络适配到不公平的训练分布。我们提出FairReL,一种公平感知表示学习框架,通过专门的人口监督针对这两个组件。FairReL使用SVD分解的基础模型主干来隔离微调引入的残差表示,并引入两种互补的损失。群组条件小波去相关(GCWD)抑制空间小波子带中子群不平衡结构,而子空间局部均值对齐(SLMA)仅在残差表示中对真实/伪造类别内的子群均值进行对齐。对FF、Celeb-DF、DFD和DFDC的实验表明,与最先进的公平感知检测器相比,FairReL在未知数据集上的AUC提高了3.9%,同时子群FPR差异降低了10.2%。代码可在https://github.com/xiaoman89/FairReL获取。

研究出发点

一个检测器可能在全局AUC上表现出色,但错误地指控某些人口子群体成员的频率远高于其他群体。现有的公平损失通常对最终预测或整个嵌入进行正则化,这可能会保留局部人口捷径或抹去有用的伪造证据。挑战在于定位子群信息进入检测器的地方,并同时保留公平性和跨域准确性。

方法概述

该方法对CLIP ViT-L/14中的每个自注意投影进行SVD分解,并在保留基础表示的同时学习一个秩一残差。群组条件小波去相关分别抑制空间小波子带中的子群不平衡结构。子空间局部均值对齐仅在适配残差中对真实/伪造类别的人口均值进行对齐,避免无差别的全特征平滑。模型在FaceForensics上训练,并迁移到Celeb-DF、DFD和DFDC,使用六个交叉性别/种族群体,并在源验证阈值固定为90% TPR时计算FPR指标。

论文总结

深度伪造评估应在固定操作点报告子群假阳性,而不仅仅是总体 AUC。FairReL 表明,局部去偏可以保持具有竞争力的跨域检测,尽管剩余的 DFDC 差异仍然足够大,因此生产阈值和升级路径仍然需要进行子群感知的验证。