저자 및 소속
Pei Li
School of Cyber Science and Technology, Shandong University, Qingdao, China
Sihan Chen
School of Cyber Science and Technology, Shandong University, Qingdao, China
Delong Ran
Institute for Network Sciences and Cyberspace, BNRist, Tsinghua University, Beijing, China
Tianshuo Cong
School of Cryptologic Science and Engineering, Shandong University, Jinan, China
해결하는 문제
FakeI2V-Bench는 이미지 및 비디오 수준의 감지를 통합적으로 테스트하고, 프레임 점수를 비디오 결정으로 전환하는 재사용 가능한 브릿지를 도입합니다. 이 브리지는 클립의 20%만 조작될 때 정확도, 교차 생성기 동작, 지연 시간, 모델 크기, 성능을 정량화합니다.
핵심 결과
최상의 순수 집계 결과, 가장 강력한 이미지 검출기는 80.16% AUC에 도달하며, 이미 최고 비디오 모델 FTCN(79.99%)을 근소하게 앞서고 있습니다. IV-브리지 이후 12개 이미지 검출기 중 11개가 FTCN을 앞섰습니다; RINE-IV는 93.80% AUC, 97.63% AP로 선두를 달리고, 434만 파라미터 Patch-IV는 89.26% AUC, 96.12% AP를 기록합니다. 14개의 생성기를 통틀어 향상된 이미지 모델은 평균 95.51% AUC, 최고 비디오 검출기는 91.01%에 비해 높은 수준입니다. 다만 Sora는 72.76% 평균 AUC로 여전히 어렵습니다. 20%만 위조된 프레임으로 모든 모델이 드랍되고 Patch-IV가 77.15% AUC로 선두를 달리고 있습니다.
초록
최근 비디오 생성 모델의 발전으로 딥페이크 위협이 크게 강화되었지만, 현재의 딥페이크 비디오 감지 벤치마크는 여전히 미흡하게 개발되어 있습니다. 특히 비디오 영역에서 이미지 수준 감지기의 효과는 체계적으로 평가되지 않았습니다. 이 공백을 메우기 위해, 우리는 최신 비디오 레벨 딥페이크 감지기를 어려운 시나리오에서 평가하기 위한 벤치마크인 FakeI2V-Bench를 제시하며, 특히 영상 수준 딥페이크 감지기의 비디오 영역 성능 체계적 평가에 중점을 둡니다. FakeI2V-Bench는 최신 강력한 세대 모델에서 생성된 콘텐츠를 포함하고 더 넓은 범주를 포괄하는 97,548개의 동영상으로 구성되어 있습니다. 이 데이터셋을 사용하여 8개의 비디오 수준 감지기와 12개의 대표적인 이미지 수준 감지기를 체계적으로 평가합니다. 실험 결과, 가장 성능이 우수한 이미지 수준 검출기는 80.16% AUC를 달성하며, 가장 강력한 비디오 수준 검출기(79.99% AUC)보다 약간 더 우수합니다. 벤치마킹을 넘어, 영상 수준 딥페이크 검출기의 비디오 적용성을 높이는 일반 프레임워크인 IV-Bridge를 소개합니다. IV-Bridge는 통계적 특징을 가진 무작위 포레스트 모델을 사용하여 프레임 수준 예측을 집계하여, 11개의 이미지 수준 검출기가 최첨단 비디오 수준 접근법을 능가하도록 하며, 가장 우수한 변형은 93.80% AUC를 달성했습니다. 전반적으로 FakeI2V-Bench는 딥페이크 비디오 탐지에 대한 엄격한 벤치마크를 설정하고, 이미지 수준 검출기를 비디오 영역으로 확장하는 새로운 경로를 제시하여 향후 연구에 새로운 통찰과 방향을 제시합니다. 코드와 데이터는 https://github.com/CryptoAILab/FakeI2V-Bench 에서 이용 가능합니다.
연구 출발점
이미지 딥페이크 검출기는 성숙한 학습 파이프라인의 혜택을 누리지만, 비디오 벤치마크는 보통 비디오별 아키텍처만 비교하고 단순한 평균화를 적용하는 프레임 모델을 적용합니다. 이로 인해 팀은 시간 네트워크가 필요한지, 최근 비디오 생성기가 순위를 어떻게 바꾸는지, 기존 이미지 검출기를 비디오에 경제적으로 적용할 수 있는지를 확신하지 못하게 됩니다. 프레임의 일부만 가짜인 희소 조작은 순진한 집계를 특히 위험하게 만듭니다.
방법
이 벤치마크는 네 개의 얼굴 및 일반 생성 데이터셋에서 97,548개의 비디오를 결합하고, 8개의 비디오 검출기와 12개의 대표적인 이미지 검출기를 평가합니다. 저자들은 먼저 평균, 최대, 최소와 같은 고정 점수 집계를 비교합니다. IV-Bridge는 이후 겹치지 않는 FF 및 GenVideo 프레임에 대해 비디오 프레임 미세 조정을 수행하고, 최대 800개의 트리와 깊이 8의 랜덤 포레스트에 프레임 수준 점수의 통계적 설명자를 제공합니다. 결과는 14세대 모델, 얼굴 및 일반 콘텐츠, 배포 비용, 단기 위조 데이터로 나뉩니다.
논문 요약
기존 이미지 검출기는 실제 비디오 프레임에 맞춰 조정되고 학습된 시간 점수 집계와 결합되면 경쟁력 있는 비디오 서비스가 될 수 있습니다. 브리지는 경량 배포에 매력적이지만, 드문드문 편집은 명확한 실패 모드이며, 가장 높은 정확도 승자는 가장 저렴한 모델이 아닙니다.