作者与机构
Can Wang
The Hong Kong Polytechnic University, Hong Kong, China
Yuhao Wang
University College London, United Kingdom
Yushe Cao
Tsinghua University, China
Canran Xiao
Sun Yat-sen University, China
Fei Shen
National University of Singapore, Singapore
解决了什么问题
LaP-Forensics 通过明确的兼容性参考,解决了跨生成器图像检测和像素级伪影定位的问题。它旨在使结构化的“位置、内容、原因”推理能够参考这些证据,同时承认参考的使用本身并不能证明自由解释中的每个句子。
关键结果
在 UniversalFakeDetect 数据集上,图像识别头在 GAN 上的准确率达到 97.23%,在 Deepfakes 上的准确率达到 71.30%,在 Diffusion 上的准确率达到 92.18%,在 CRN 上的准确率达到 98.98%。在官方 SynthScars 协议下,人为痕迹定位的 mIoU 达到 61.40,F1 值达到 66.00。在受控分割中,移除残差会使 mIoU 从 72.19 降至 61.83,F1 值从 63.62 降至 41.71;将残差替换为零或供体图也会显著改变输出结果。
摘要
近期的生成模型能够生成几乎没有明显视觉伪影的图像,这削弱了仅依赖表面外观的检测器和解释方法。我们提出了 LaP-Forensics,一个多模态框架,它利用基于重建的取证证据来增强 RGB 语义。一个冻结的稳定扩散 DDIM 反演重建模型提供了一个固定的重建参考,其残差图衡量了与该参考的局部兼容性。在结构化的 Where-What-Why 模型预测文本分析和伪影掩码之前,独立的投影仪对 RGB 图像和残差图进行编码。监督式微调之后是组相对策略优化 (GRPO),其奖励结合了掩码重叠、输出结构和证据参考术语。这些文本侧术语鼓励模型参考一致性图,但并不构成对自由文本真实性的验证。一个独立的图像级头部融合了 RGB 和 DDIM 残差类别特征。实验表明,该方法在 UniversalFakeDetect 上具有跨生成器检测能力,并在官方 SynthScars 基准测试中具有竞争力的伪影定位能力。受控线索构建、反转视界、成分、奖励项和反事实分析支持在评估设置下残差流的效用,而自由形式的文本忠实度和后处理可靠性仍然是开放的局限性。
研究出发点
由于生成的图像会丢失明显的表面缺陷,因此仅使用RGB检测器或视觉语言解释可能听起来很有说服力,但却无法提供可靠的取证证据。对于企业审查而言,一个有效的系统应该将检测分数、空间定位和文本描述分开,同时展示哪些额外的信号真正改变了结果。
方法概述
冻结稳定扩散DDIM反演重建过程生成输入和重建之间的残差图。独立的投影器对RGB语义和残差证据进行编码;多模态分支生成结构化文本和掩码,而独立的图像处理头融合用于检测的类别特征。监督式微调之后,根据掩码重叠、输出格式和证据参考情况给予GRPO奖励,官方基准测试与较小的受控消融实验分开进行。
论文总结
重建残差是另一个有用的取证通道,能够显著提高定位精度,但它并非经过校准的操作图或来源归属信号。团队应重视检测、定位和解释的清晰分离,并在将生成的推理结果应用于审查工作流程之前,独立测试后处理的鲁棒性和文本忠实度。