저자 및 소속
Dasom Choi
Chungnam National University
Sangjun Moon
Chungnam National University
Hyeongchan Im
Chungnam National University
Jaeeon Park
Institute of Science Tokyo
Jingun Kwon
Chungnam National University
Hidetaka Kamigaito
Nara Institute of Science and Technology
Taro Watanabe
Nara Institute of Science and Technology
Manabu Okumura
Institute of Science Tokyo
해결하는 문제
IMFD는 다중 얼굴 위조 감지를 지침 기반 시각-언어 과제로 재구성하여 얼굴을 동시에 위치시키고 얼굴별 진위 레이블을 할당합니다. 이는 명시적인 얼굴 좌표와 이미지 맥락이 대규모 시각-언어 모델이 왼쪽에서 오른쪽으로 얼굴 인덱스를 올바른 출력과 정렬하는 데 도움이 되는지를 테스트합니다.
핵심 결과
전체 테스트 세트에 지상 진실 좌표를 적용하면 IMFD는 0.98 마이크로-F1, 0.98 매크로 F1, 0.94 정확 일치 정확도에 도달합니다; 얼굴이 많은 부분집합은 0.97, 0.98, 0.87 점수를 얻습니다. 진정한 단일 단계 환경에서는 전체 세트 지표가 0.90, 0.84, 0.77로 떨어져 로컬라이징이 남은 병목 현상을 드러냅니다. 페이스박스 AP는 전체 세트에서 81.9, 다면 서브셋에서 83.6입니다. 입력 해상도를 112픽셀에서 672픽셀로 올리면 제어 마이크로-F1이 0.917에서 0.981로, 정확한 일치율이 0.654에서 0.948로 증가합니다. IMFD는 비교 기준선보다 성능이 우수하지만 가장 빠른 단일 단계 방법보다 느리며 여전히 합성 벤치마크 조작에 의존합니다.
초록
딥페이크의 급격한 증가는 소셜 미디어에서의 확산으로 인해 상당한 우려를 불러일으켰습니다. 기존의 다중 얼굴 위조 탐지기는 각 얼굴을 독립적으로 자르고 검증하며, 배경 맥락과 얼굴 간 관계를 무시하여 종종 최적이 아닌 성능을 초래합니다. 이러한 한계를 극복하기 위해 우리는 전체 이미지를 해석하고 복잡한 텍스트 지시를 따를 수 있는 명령어 기반 대형 시각 언어 모델(LVLM)을 활용합니다. 우리는 간단하지만 효과적인 단일 단계 다중 얼굴 위조 탐지기인 IMFD(명령어 기반 다중 얼굴 위조 탐지기)를 제안하며, 이는 종단 간 훈련되어 얼굴을 공동 위치시키고 각 얼굴별 위조 라벨을 예측하도록 훈련됩니다. 얼굴 상자 예측을 단지 공동 목표로 다루는 대신, IMFD는 예측된 얼굴 경계 상자를 명령어에 명시적으로 통합하여 명령어 접지성과 위조 탐지를 향상시키는 시각적 단서입니다. IMFD의 학습 및 평가를 지원하기 위해 기존의 다중 면 위조 데이터셋을 명령어 기반 형식으로 변환합니다. 실험 결과 및 분석 결과, IMFD는 얼굴 경계 상자를 명령에 통합하여 다중 면 위조 탐지를 향상시키며, 다양한 최첨단 방법보다 지속적으로 우수한 성능을 보여줍니다.
연구 출발점
다인자 사진은 일반적인 자르기 후 분류 가정을 깨뜨립니다. 독립적인 얼굴 크롭은 장면과 얼굴 간 맥락을 버리고, 모든 인물에 대해 순차적인 작업을 요구하며, 탐지기나 순서 오류를 법의학 판단에 전파시킵니다. 유용한 시스템은 단순히 조작 여부만 판단하는 것이 아니라 어떤 얼굴이 가짜인지 알려야 합니다.
방법
이 시스템은 OpenForensics 샘플을 왼쪽에서 오른쪽 순서로 얼굴 이름을 붙이는 명령어로 변환합니다. CLIP 기반 앵커 단계는 후보 영역을 점수 채점하고, 겹치는 박스를 융합하며, 이미지 표현과 함께 텍스트 명령어에 예측된 좌표를 주입합니다. LVLM은 그 후 위조된 면 인덱스와 박스를 반환합니다. 저자들은 IMFD의 예측 박스를 이용한 통제된 2단계 설정과 마이크로-F1, 매크로 F1, 정확한 이미지 수준 매칭, 박스 AP, 지연 시간, 처리량을 보고하는 종단 간 단일 단계 설정을 모두 평가합니다.
논문 요약
전체 이미지 추론은 혼잡한 장면 포렌식을 개선하지만, 제공된 박스와 예측된 박스 간의 격차는 큽니다. 조달 테스트는 이미지 수준 AUC뿐만 아니라 정확한 각 페이스 결정과 현지화 실패를 평가해야 합니다.