作者与机构
Pei Li
School of Cyber Science and Technology, Shandong University, Qingdao, China
Sihan Chen
School of Cyber Science and Technology, Shandong University, Qingdao, China
Delong Ran
Institute for Network Sciences and Cyberspace, BNRist, Tsinghua University, Beijing, China
Tianshuo Cong
School of Cryptologic Science and Engineering, Shandong University, Jinan, China
解决了什么问题
FakeI2V-Bench 提供了一个统一的图像和视频级别检测测试,并引入了一个可重复使用的桥接方法,将帧分数转化为视频决策。它量化了准确率、跨生成器行为、延迟、模型大小以及仅对 20% 剪辑进行篡改时的性能表现。
关键结果
在最佳的简单聚合下,最强的图像检测器达到 80.16% AUC,已略高于顶尖视频模型 FTCN 的 79.99%。经过 IV-Bridge 处理后,十二个图像检测器中有十一超过 FTCN;RINE-IV 达到 93.80% AUC 和 97.63% AP,4.34百万参数的 Patch-IV 达到 89.26% AUC 和 96.12% AP。在十四个生成器中,增强的图像模型平均 95.51% AUC,而最佳视频检测器为 91.01%,尽管 Sora 在平均 AUC 上仍然困难,只有 72.76%。在仅 20% 帧被伪造的情况下,每个模型的表现有所下降,Patch-IV 以 77.15% AUC 领先。
摘要
近期视频生成模型的进展显著加剧了深度伪造威胁,但当前的深度伪造视频检测基准仍不完善。尤其是,图像级检测器在视频领域的有效性尚未得到系统评估。为填补这一空白,我们提出了 FakeI2V-Bench,这是一项针对最先进视频级深度伪造检测器在挑战性场景下的评估基准,特别关注系统性评估图像级深度伪造检测器在视频领域的性能。FakeI2V-Bench 包含 97,548 个视频,涵盖由最新强大生成模型生成的内容,并覆盖更广泛的类别。基于该数据集,我们系统评估了八个视频级检测器和十二个代表性图像级检测器。实验结果显示,表现最佳的图像级检测器达到 80.16% 的 AUC,略高于最强的视频级检测器(即 79.99% 的 AUC)。超越基准评测,我们提出了 IV-Bridge,这是一个增强图像级深度伪造检测器在视频中适用性的通用框架。IV-Bridge 使用带有统计特征的随机森林模型聚合帧级预测,使得十一种图像级检测器能够超过最先进的视频级方法,表现最佳的变体实现了 93.80% 的 AUC。总体而言,FakeI2V-Bench 建立了深度伪造视频检测的严格基准,并引入了将图像级检测器扩展至视频领域的新途径,为未来研究提供了新的见解和方向。代码和数据可在 https://github.com/CryptoAILab/FakeI2V-Bench 获取。
研究出发点
图像深度伪造检测器受益于成熟的训练流水线,但视频基准通常只比较视频特定架构,并且对帧模型应用简单平均。这让团队无法确定是否需要时序网络,近期的视频生成器如何改变排名,以及现有图像检测器是否可以经济地适应视频。稀疏篡改,即只有部分帧是伪造的,使得简单聚合尤其风险较大。
方法概述
该基准整合了来自四个面部与通用生成数据集的 97,548 个视频,并评估了八个视频检测器以及十二个代表性图像检测器。作者首先比较固定分数聚合方法,如平均值、最大值和最小值。然后,IV-Bridge 对不重叠的 FF 和 GenVideo 帧进行视频-帧微调,并将帧级分数的统计描述输入到一个包含最多 800 棵树、深度为 8 的随机森林中。结果按十四种生成模型、面部与通用内容、部署成本和短期伪造进行分类。
论文总结
现有的图像检测器如果在真实视频帧上进行调优,并与学习到的时序分数聚合结合,就可以成为具有竞争力的视频服务。该桥接方法对于轻量级部署具有吸引力,但稀疏编辑仍明显是失败模式,并且准确率最高的模型并非最便宜。