作者与机构
Dasom Choi
Chungnam National University
Sangjun Moon
Chungnam National University
Hyeongchan Im
Chungnam National University
Jaeeon Park
Institute of Science Tokyo
Jingun Kwon
Chungnam National University
Hidetaka Kamigaito
Nara Institute of Science and Technology
Taro Watanabe
Nara Institute of Science and Technology
Manabu Okumura
Institute of Science Tokyo
解决了什么问题
IMFD将多人脸造假检测重新表述为一个基于指令的视觉-语言任务,它能够联合定位人脸并分配每张人脸的真实性标签。这可以测试显式的人脸坐标和图像上下文是否有助于大型视觉-语言模型将从左到右的人脸索引与正确的输出对齐。
关键结果
在整个测试集上使用真实坐标,IMFD达到0.98的微平均F1、0.98的宏平均F1和0.94的完全匹配精度;在人脸较多的子集上得分为0.97、0.98和0.87。在实际单阶段设置中,这些完整集指标降至0.90、0.84和0.77,暴露出人脸定位仍是主要瓶颈。完整集的人脸框AP为81.9,多人脸子集为83.6。将输入分辨率从112提高到672像素,受控微平均F1从0.917升至0.981,完全匹配从0.654升至0.948。IMFD优于对比基线,但比最快的单阶段方法慢,并且仍依赖于合成基准操控。
摘要
由于深度伪造的快速增加及其在社交媒体上的传播,人们对其产生了严重关切。传统的多人脸造假检测器会独立裁剪和验证每张人脸,忽略背景上下文和人脸之间的关系,这通常会导致性能不佳。为克服这些局限性,我们利用基于指令的大型视觉-语言模型(LVLMs),它们能够解释整张图像并遵循复杂的文本指令。我们提出了一个简单而有效的单阶段多人脸造假检测器,称为IMFD(基于指令的多人脸造假检测器),该检测器实现端到端训练,能够联合定位人脸并预测每张人脸的造假标签。IMFD不是仅将人脸框预测作为联合目标,而是将预测的人脸边界框明确地整合到指令中,作为增强指令定位和造假检测的视觉提示。为了支持IMFD的训练和评估,我们将现有的多人脸造假数据集转换为基于指令的格式。实验结果和分析表明,通过将人脸边界框整合到指令中,IMFD提升了多人脸造假检测性能,并持续优于各种最先进的方法。
研究出发点
多人照片打破了通常的先裁剪再分类的假设。独立的人脸裁剪会丢失场景和人脸间的上下文,需要对每个人进行顺序操作,并将检测器或排序错误传播到鉴定结果中。一个有效的系统必须指出哪些人脸是伪造的,而不仅仅判断图像是否包含任何操控。
方法概述
该系统将OpenForensics样本转换为从左到右命名人脸的指令。基于CLIP的锚阶段对候选区域进行评分,融合重叠的边界框,并将预测的坐标注入文本指令中,同时结合图像表示。随后,LVLM返回伪造的人脸索引和边界框。作者评估了两种设置:使用真实坐标的受控两阶段设置和使用IMFD预测框的端到端单阶段设置,并报告了微平均F1、宏平均F1、图像级完全匹配、边界框AP、延迟和吞吐量。
论文总结
整体图像推理可以改善拥挤场景的取证,但提供的框与预测框之间的差距很大。采购测试应对每个面部的决策和定位失败进行评分,而不仅仅是图像级别的AUC。