← 블로그로 돌아가기
연구 레이더딥페이크 탐지미디어 포렌식arXiv2026년 9월

월간 arXiv 레이더

2026년 9월 딥페이크 탐지 논문: 다면적 추론, 스마트폰 오경보, 그리고 지속적인 학습

가장 강력한 9월 딥페이크 연구는 또 다른 폐쇄형 점수보다는 시스템 행동에 초점을 맞춥니다. IMFD는 시각 언어 모델을 요청하여 한 번의 명령 기반 패스로 모든 얼굴을 현지화하고 분류하도록 요청합니다. LAION-Mobile은 현대 합성 콘텐츠와 거의 100만 건의 스마트폰 사진 기록에서 원본 검출 체크포인트를 감사하여 심각한 보정 드리프트를 밝혀냈습니다. MSFD는 비디오 탐지기 업데이트를 지속적인 학습 문제로 취급하며 공간적, 시간적, 공동 주파수 증거를 별도로 보존합니다.

이번 달이 보여주는 신호

IMFD의 좌표 인지 지침은 OpenForensics 2단계 결과를 0.98 micro-F1, 0.98 macro-F1, 0.94 정확 일치 정확도로 올렸습니다; 종단 간 단일 단계 버전은 얼굴 위치 추적이 여전히 오류를 전파하기 때문에 0.90, 0.84, 0.77로 떨어집니다. LAION-Mobile은 현대 AI 혼합 시 12개의 공개된 검출기 중 0.624 AUC를 초과하는 것이 없으며, 현대 보정 임계값이 진짜 휴대폰 사진의 17-91%를 표시한다고 밝혔습니다; 하지만 이 코퍼스는 현재 대표적인 신경 ISP를 간신히 다루지 못합니다. MSFD는 6개의 순차 비디오 데이터셋에서 평균 AUC가 93.02%에 도달하며, 음성 잊기 시 83.65%의 평균 정확도를 기록했습니다. 이 논문들은 전체 장면 평가, 현재 장치 음성, 명시적 보정 소유권, 그리고 검출기 업데이트 후 회귀 테스트를 요구합니다.

논문 012026-09-17cs.CV

IMFD: 지침 기반 대규모 비전-언어 모델을 통한 종단 간 다중 얼굴 위조 탐지

저자 및 소속

Dasom Choi

Chungnam National University

Sangjun Moon

Chungnam National University

Hyeongchan Im

Chungnam National University

Jaeeon Park

Institute of Science Tokyo

Jingun Kwon

Chungnam National University

Hidetaka Kamigaito

Nara Institute of Science and Technology

Taro Watanabe

Nara Institute of Science and Technology

Manabu Okumura

Institute of Science Tokyo

해결하는 문제

IMFD는 다중 얼굴 위조 감지를 지침 기반 시각-언어 과제로 재구성하여 얼굴을 동시에 위치시키고 얼굴별 진위 레이블을 할당합니다. 이는 명시적인 얼굴 좌표와 이미지 맥락이 대규모 시각-언어 모델이 왼쪽에서 오른쪽으로 얼굴 인덱스를 올바른 출력과 정렬하는 데 도움이 되는지를 테스트합니다.

핵심 결과

전체 테스트 세트에 지상 진실 좌표를 적용하면 IMFD는 0.98 마이크로-F1, 0.98 매크로 F1, 0.94 정확 일치 정확도에 도달합니다; 얼굴이 많은 부분집합은 0.97, 0.98, 0.87 점수를 얻습니다. 진정한 단일 단계 환경에서는 전체 세트 지표가 0.90, 0.84, 0.77로 떨어져 로컬라이징이 남은 병목 현상을 드러냅니다. 페이스박스 AP는 전체 세트에서 81.9, 다면 서브셋에서 83.6입니다. 입력 해상도를 112픽셀에서 672픽셀로 올리면 제어 마이크로-F1이 0.917에서 0.981로, 정확한 일치율이 0.654에서 0.948로 증가합니다. IMFD는 비교 기준선보다 성능이 우수하지만 가장 빠른 단일 단계 방법보다 느리며 여전히 합성 벤치마크 조작에 의존합니다.

초록

딥페이크의 급격한 증가는 소셜 미디어에서의 확산으로 인해 상당한 우려를 불러일으켰습니다. 기존의 다중 얼굴 위조 탐지기는 각 얼굴을 독립적으로 자르고 검증하며, 배경 맥락과 얼굴 간 관계를 무시하여 종종 최적이 아닌 성능을 초래합니다. 이러한 한계를 극복하기 위해 우리는 전체 이미지를 해석하고 복잡한 텍스트 지시를 따를 수 있는 명령어 기반 대형 시각 언어 모델(LVLM)을 활용합니다. 우리는 간단하지만 효과적인 단일 단계 다중 얼굴 위조 탐지기인 IMFD(명령어 기반 다중 얼굴 위조 탐지기)를 제안하며, 이는 종단 간 훈련되어 얼굴을 공동 위치시키고 각 얼굴별 위조 라벨을 예측하도록 훈련됩니다. 얼굴 상자 예측을 단지 공동 목표로 다루는 대신, IMFD는 예측된 얼굴 경계 상자를 명령어에 명시적으로 통합하여 명령어 접지성과 위조 탐지를 향상시키는 시각적 단서입니다. IMFD의 학습 및 평가를 지원하기 위해 기존의 다중 면 위조 데이터셋을 명령어 기반 형식으로 변환합니다. 실험 결과 및 분석 결과, IMFD는 얼굴 경계 상자를 명령에 통합하여 다중 면 위조 탐지를 향상시키며, 다양한 최첨단 방법보다 지속적으로 우수한 성능을 보여줍니다.

연구 출발점

다인자 사진은 일반적인 자르기 후 분류 가정을 깨뜨립니다. 독립적인 얼굴 크롭은 장면과 얼굴 간 맥락을 버리고, 모든 인물에 대해 순차적인 작업을 요구하며, 탐지기나 순서 오류를 법의학 판단에 전파시킵니다. 유용한 시스템은 단순히 조작 여부만 판단하는 것이 아니라 어떤 얼굴이 가짜인지 알려야 합니다.

방법

이 시스템은 OpenForensics 샘플을 왼쪽에서 오른쪽 순서로 얼굴 이름을 붙이는 명령어로 변환합니다. CLIP 기반 앵커 단계는 후보 영역을 점수 채점하고, 겹치는 박스를 융합하며, 이미지 표현과 함께 텍스트 명령어에 예측된 좌표를 주입합니다. LVLM은 그 후 위조된 면 인덱스와 박스를 반환합니다. 저자들은 IMFD의 예측 박스를 이용한 통제된 2단계 설정과 마이크로-F1, 매크로 F1, 정확한 이미지 수준 매칭, 박스 AP, 지연 시간, 처리량을 보고하는 종단 간 단일 단계 설정을 모두 평가합니다.

논문 요약

전체 이미지 추론은 혼잡한 장면 포렌식을 개선하지만, 제공된 박스와 예측된 박스 간의 격차는 큽니다. 조달 테스트는 이미지 수준 AUC뿐만 아니라 정확한 각 페이스 결정과 현지화 실패를 평가해야 합니다.

논문 022026-09-10cs.CV

LAION-Mobile: 백만 장의 스마트폰 사진에서 딥페이크 탐지기 평가

저자 및 소속

Achim von Stryk

Stralsund University, Germany

Janis Keuper

Institute for Machine Learning and Analytics, Offenburg University, Germany

해결하는 문제

LAION-Mobile은 12개의 원래 검출기 체크포인트가 최신 AI 이미지에 일반화되는지, 그리고 실제 스마트폰 사진에서 얼마나 자주 오경보되는지 감사합니다. 이 검사는 임계값 독립적 식별과 임계값 보정을 구분하며, 기존 GAN 보정이 오해를 불러일으키는 배포 이미지를 만드는지 여부를 묻습니다.

핵심 결과

NTIRE 2026에서, 최고의 탐지기도 0.624 AUC에 불과하며, 열두 개 중 다섯 개는 우연보다 낮은 점수를 기록하고, 누구도 5%의 위양성률에서 13.5%를 초과하는 진양성률을 달성하지 못한다. 기존 방식으로 보정된 임계값은 몇몇 시스템이 최대 11%의 전화-사진 오경보에서 사용 가능한 것처럼 보이게 하지만, 최신 보정 방식은 동일한 탐지기가 실제 사진의 17-91%를 경고하게 만든다. UnivFD가 이러한 변화를 보여준다: 0.2%가 동일한 전화 이미지에서 39.1%로 증가한다. 데이터는 오래된 기기가 대부분을 차지하며 현재의 플래그십 모델은 거의 포함하지 않고, 이미지별로 인증된 것이 아니라 진위가 추론되며, LAION-Mobile은 실제 사진만 포함하므로 두 클래스 전화 AUC를 제공할 수 없다.

초록

대부분의 딥페이크 감지기는 참조 기준에서 거의 완벽한 AUC 점수를 보고합니다. 하지만 최근 ICML 입장 문서는 이러한 평가들이 현대 스마트폰 사진의 영향을 무시한다고 주장합니다. 널리 사용되는 기기 내 신경 신호 처리 파이프라인(다중 센서 융합, 노이즈 및 모션 블러 억제 등)은 점점 더 단순한 렌즈 투사에서 계산 사진 촬영으로 영상 패러다임을 전환하고 있습니다. 따라서 기기들은 실제로 사진을 기록하기보다는 생성합니다. 이로 인해 딥페이크 탐지기가 일반 휴대폰 사진을 가짜로 표시할 위험이 높아집니다. 현대 스마트폰 이미지를 포함한 대규모 데이터셋이 부족해 이 가설은 지금까지 소규모 개념 증명 연구에서만 검증되었습니다. 이 논문의 목적은 이 격차를 해소하는 것입니다. 우리는 re-LAION-5B에서 추출한 EXIF 메타데이터를 포함한 약 100만 장의 스마트폰 이미지를 포함하는 오픈 데이터셋인 LAION-Mobile을 소개합니다. 이 풀의 9,115장 이미지 평가 샘플(DIRE 738) 평가 샘플에서 12개의 최첨단 딥페이크 검출기와 원본 종이 체크포인트를 평가한 결과, 우리는 세 가지 주요 결과를 보고합니다: (i) 현대 AI 콘텐츠에서 AUC 0.624를 초과하는 검출기는 없으며, 12개 중 5개가 확률 이하입니다. (ii) 실포 오경보율은 임계값 보정의 산물입니다: 기존 GAN 데이터에 임계값을 부여하면 여러 감지기가 배치 가능해 보이지만(FPR 11% 미만), 동일한 기준을 현대 콘텐츠에 재조정하면 실제 사진의 17-91%가 표시됩니다. (iii) 따라서 현대 AI 콘텐츠에서는 우연을 이기지 못하고 배포 가능한 실제 사진 오경보율을 유지하는 검출기는 없습니다. 웹 수집의 장치 구성을 반영하여, 코퍼스는 첫 번째 신경-ISP 세대(2018-2020)를 탐구합니다; 현재의 대표 모델들은 사실상 부재하여 현대 ISP 체제가 열린 공백 상태로 남았습니다.

연구 출발점

공개된 딥페이크 검출기는 자체 벤치마크에서 완벽한 AUC에 근접하는 경우가 많지만, 현대 휴대폰은 HDR 융합, 노이즈 제거, 선명, 모션 억제 등 학습된 이미지 신호 처리를 실제 사진에 적용합니다. 이러한 계산 산출물은 생성된 이미지 지문과 유사할 수 있습니다. 대규모 실제 휴대폰 코퍼스와 현재 합성 콘텐츠에 대한 임계값이 없으면, 검출기는 일반 사진에 대해 사용할 수 없는 속도로 플래그를 표시하면서도 안전해 보일 수 있습니다.

방법

저자들은 re-LAION-5B를 스마트폰 EXIF 및 비사진 휴리스틱으로 필터링하여 장치 메타데이터가 포함된 935,399장의 실물 사진 풀을 만들고, 738개의 고가 재구성에 대해 DIRE를 제외한 고정된 9,115장 이미지 평가 샘플을 획득합니다. 12개의 검출기는 먼저 원본 또는 ProGAN 스타일 벤치마크와 비교한 후 NTIRE 2026 현대 실/가짜 혼합물로 평가합니다. 기존 ProGAN-ISP와 최신 NTIRE에 별도로 적용된 동일한 오차 임계값이 동일한 휴대폰 사진에 옮겨져 보정 드리프트를 노출시킵니다.

논문 요약

거의 완벽한 논문 AUC는 현대 콘텐츠로 이전되지 않으며, 임계값 소유권은 실제 사진 오경보를 수십 배 변화시킬 수 있다. 모든 배포에서는 최신 기기 부정 사례, 문서화된 보정 세트 및 운영 지점 변화 모니터링이 필요하다.

논문 032026-09-03cs.CV

지속적 비디오 딥페이크 탐지를 위한 공간적·시간적 지식 보존

저자 및 소속

Taehoon Kim

Graduate School of Artificial Intelligence, Chung-Ang University

Jongwook Choi

Graduate School of Artificial Intelligence, Chung-Ang University

Heejae Jo

Department of Advanced Imaging, Graduate School of Advanced Imaging Science, Multimedia and Film, Chung-Ang University

Byungmin Park

Graduate School of Artificial Intelligence, Chung-Ang University

Jongwon Choi

Graduate School of Artificial Intelligence, Chung-Ang University

Department of Advanced Imaging, Graduate School of Advanced Imaging Science, Multimedia and Film, Chung-Ang University

Department of Metaverse Convergence, Chung-Ang University

해결하는 문제

MSFD는 비디오 딥페이크 탐지를 위해 안정성-가소성 문제를 구체적으로 대상으로 한다. 탐지기를 업데이트하면서 공간적, 시간적, 시공간적인 포렌식 지식을 개별적으로 보존하며, 단일 정적 학습-테스트 분할 대신 전체 데이터, 생성기 점진적, 소수 샷 시퀀스를 평가한다.

핵심 결과

6-과제 프로토콜에서 전체 시스템은 평균 AUC 93.02%와 평균 망각 2.29 포인트를 기록했으며, iCaRL 스타일의 기준선은 각각 89.84%와 6.81을 기록했습니다. 생성기-점진 프로토콜에서는 평균 AUC 96.67%를 달성했으며, 이미지-비디오 위조에서는 91.47%를 기록했고, 망각은 1.37이었습니다. 새로운 과제당 실제 동영상 25개와 가짜 동영상 25개만 사용했을 때, 평균 정확도 83.65%와 -1.25 망각을 달성하여 긍정적인 역전달을 나타냈습니다; IDER는 -2.10으로 망각이 더 적지만, 정확도는 약간 낮은 83.47%입니다. 제약 실험(ablation)은 세 개의 주파수 분기 모두 단일 통합 표현보다 더 우수함을 보여줍니다. 이 방법은 주로 아시아 동영상 데이터가 포함된 KoDF 과제 이후에도 망각이 증가하는 것을 보여, 인구 통계 및 도메인 변환 문제가 여전히 해결되지 않았음을 나타냅니다.

초록

고품질 비디오 딥페이크의 지속적인 출현은 새로운 위조 패턴에 계속 적응하는 탐지기를 요구하지만, 딥페이크 이미지를 위해 설계된 기존 접근법은 비디오 특유의 신호를 포착하지 못한다. 공간적 인공물만 포함하는 딥페이크 이미지와 달리, 딥페이크 비디오는 공간적·시간적 축 모두에서 뚜렷한 증거를 남기므로 순차 모델 업데이트 동안 각 모드를 별도로 보존해야 한다. 이 한계를 극복하기 위해, 우리는 주파수 영역에서 비디오 특징을 공간, 시간 및 시공간 모드로 명시적으로 분해하는 지속적 딥페이크 비디오 탐지 프레임워크인 Modality-Specific Frequency Distillation(MSFD)을 소개한다. 이 분해는 다양한 딥페이크 비디오 유형이 임무마다 공간 및 시간 신호 의존도가 다르기 때문에 각 모드를 독립적으로 보존할 수 있게 한다. 또한 MSFD는 시공간 표현이 단일 모드 신호와 직교하도록 유도하는 교차 모드 상관 제거 손실을 채택한다. 광범위한 실험 결과, 본 프레임워크는 다양한 지속적 딥페이크 비디오 시나리오에서 최첨단 방법보다 강력한 적응력과 성능 보존 능력을 보여준다.

연구 출발점

비디오 위조 유형은 배포 후 순차적으로 나타나므로, 탐지기는 이전 증거를 지우지 않고 새로운 생성기를 학습해야 한다. 이미지 분류에서 상속된 지속 학습 방법은 하나의 얽힌 표현만 보존하는 경향이 있으나, 비디오 딥페이크는 공간 경계, 시간적 불일치 및 공간-시간 혼합물의 서로 다른 결합을 남긴다. 낮은 망각 점수도 시스템이 새로운 작업에 적응하지 못하면 유용하지 않다.

방법

중간 비디오 특징은 2D 공간, 1D 시간, 그리고 결합된 시공간 주파수 표현으로 변환된다. 모달리티별 주파수 증류는 순차적 업데이트 동안 이전 모델과 각 스펙트럼을 정렬한다. 모달리티별 어댑터는 채널을 재가중치하고 작업 관련 주파수 대역에 대해 Gumbel-Softmax 마스크를 학습하는 한편, 디코릴레이션 손실은 결합 브랜치가 단일 모달리티 신호를 중복하는 것을 방지한다. 재생 예제와 동일한 3D ResNet-18 백본은 여섯 개의 딥페이크 비디오 데이터셋에 걸친 대부분의 기준 비교를 위해 사용된다.

논문 요약

공간적 및 시간적 포렌식 메모리를 분리하면 특히 새로운 데이터가 적을 때 탐지기 업데이트가 향상됩니다. 남아 있는 KoDF 이동은 모든 지속 학습 릴리스 후 생성기 계열과 인구 도메인을 모두 회귀 테스트해야 함을 상기시켜줍니다.