저자 및 소속
Can Wang
The Hong Kong Polytechnic University, Hong Kong, China
Yuhao Wang
University College London, United Kingdom
Yushe Cao
Tsinghua University, China
Canran Xiao
Sun Yat-sen University, China
Fei Shen
National University of Singapore, Singapore
해결하는 문제
LaP-Forensics는 명시적인 호환성 참조를 통해 다양한 생성기의 이미지 감지 및 픽셀 수준의 아티팩트 위치 파악 문제를 해결합니다. 이는 구조화된 추론 과정에서 해당 증거를 활용하도록 설계되었으며, 동시에 참조 사용만으로는 자유 형식 설명의 모든 문장을 증명할 수 없다는 점을 인지하도록 합니다.
핵심 결과
UniversalFakeDetect에서 이미지 헤드는 GAN에서 97.23%, Deepfakes에서 71.30%, Diffusion에서 92.18%, CRN에서 98.98%의 정확도를 달성했습니다. 공식 SynthScars 프로토콜을 사용했을 때, 사람 얼굴-인공 흉터 위치 판별은 mIoU 61.40, F1 점수 66.00을 기록했습니다. 제어된 분할에서 잔여 데이터를 제거하면 mIoU는 72.19에서 61.83으로, F1 점수는 63.62에서 41.71로 감소합니다. 잔여 데이터를 0 또는 도너 맵으로 대체하는 것 또한 출력에 상당한 변화를 가져옵니다.
초록
최근의 생성 모델은 시각적 아티팩트가 거의 없는 이미지를 생성할 수 있어 표면적인 외관에만 의존하는 탐지기와 설명의 정확도를 떨어뜨립니다. 본 논문에서는 RGB 의미론에 재구성 기반 포렌식 증거를 추가하는 멀티모달 프레임워크인 LaP-Forensics를 제시합니다. 고정된 안정 확산 DDIM 역재구성 모델은 고정된 재구성 참조를 제공하며, 잔차 맵은 해당 참조와의 국소적 호환성을 측정합니다. 독립적인 프로젝터는 RGB 이미지와 잔차 맵을 인코딩한 후, 구조화된 Where-What-Why 모델을 통해 텍스트 분석과 아티팩트 마스크를 예측합니다. 지도 학습 기반의 미세 조정 후에는 그룹 상대 정책 최적화(GRPO)를 수행하며, 보상은 마스크 중첩과 출력 구조 및 증거 참조 항을 결합합니다. 이러한 텍스트 측 항은 모델이 일관성 맵을 참조하도록 유도하지만, 자유 형식 텍스트의 진실성을 검증하는 역할을 하지는 않습니다. 별도의 이미지 레벨 헤드는 RGB 및 DDIM 잔차 클래스 특징을 융합합니다. 실험 결과, UniversalFakeDetect에서 다양한 생성기 간의 탐지 성능을 보였으며, 공식 SynthScars 벤치마크에서 경쟁력 있는 아티팩트 위치 파악 성능을 보여주었습니다. 제어된 단서 구성, 반전 지평선, 구성 요소, 보상 조건 및 반사실적 분석은 평가된 설정에서 잔여 스트림의 유용성을 뒷받침하는 반면, 사후 처리 하에서의 자유 형식 텍스트 충실도 및 신뢰성은 여전히 해결되지 않은 한계로 남아 있습니다.
연구 출발점
생성된 이미지가 명확한 표면 결함을 잃어버리면 RGB 전용 탐지기나 영상-언어 설명은 확실한 법의학적 증거를 제시하지 않고도 설득력 있게 들릴 수 있습니다. 기업 검토를 위해서는 유용한 시스템이 탐지 점수, 공간 위치 파악, 텍스트 설명을 분리하고 어떤 추가 신호가 결과에 실제로 영향을 미치는지 보여줘야 합니다.
방법
고정된 안정 확산 DDIM 역변환-재구성 프로세스는 입력과 재구성 사이의 잔차 맵을 생성합니다. 별도의 프로젝터가 RGB 의미론적 정보와 잔차 증거를 인코딩하고, 멀티모달 분기는 구조화된 텍스트와 마스크를 생성하며, 별도의 이미지 헤드는 객체 탐지를 위해 클래스 특징을 융합합니다. 지도 학습 기반 미세 조정 후 마스크 중첩, 출력 형식 및 증거 참조에 대한 GRPO 보상이 적용되며, 공식 벤치마크 테스트는 더 작은 규모의 제어된 어블레이션 분할과 별도로 진행됩니다.
논문 요약
재구성 잔차는 유용한 두 번째 포렌식 채널이며 위치 파악 정확도를 상당히 향상시키지만, 보정된 조작 지도나 출처 귀속 신호는 아닙니다. 팀은 탐지, 위치 파악 및 설명의 명확한 분리를 중요하게 여겨야 하며, 생성된 근거를 검토 워크플로에 사용하기 전에 사후 처리의 견고성과 텍스트 충실도를 독립적으로 테스트해야 합니다.