← 블로그로 돌아가기
리서치 레이더얼굴 검출프레젠테이션 공격 탐지arXiv2026년 8월

월간 arXiv 레이더

2026년 8월 얼굴 검출 논문: 동적 랜드마크, 얼굴 없는 안티스푸핑, 기반 모델

얼굴 감지 스택은 고정된 경계 상자에서 구성 가능한 기하학과 신뢰할 수 있는 캡처로 확장되고 있습니다. 이번 달 논문들은 호환되지 않는 랜드마크 템플릿을 통합하고, 인쇄/재생 아티팩트가 얼굴이 아닌 객체로부터 완전히 학습할 수 있는지 질문하며, 30개의 시각 인코더와 16개의 멀티모달 모델을 프레젠테이션 및 모프 공격 데이터셋에서 테스트합니다.

이번 달이 보여주는 신호

통합 동적 FLD는 템플릿 전용 랜드마크 헤드를 의미론적 윤곽선 쿼리로 대체하며, 런타임에 요청된 레이아웃을 반환할 수 있습니다. TPO는 Vegetables에서 학습한 인쇄 및 재생 증거가 얼굴 스푸핑 방지에 강력하게 전이된다는 점을 보여주어 프라이버시를 고려한 보조 데이터도 타당하게 만든다는 더 깊은 가정에 도전합니다. 기초 모델 연구는 경계 조건을 제공합니다: 일반적인 사전 학습이 도움이 되지만, 제로 샷 MLLM 프롬프트는 여전히 약하고 PAD는 보통 시각적 인코더 적응이 필요합니다. 실질적인 방향은 데이터셋별 모델 집합이 아닌 명시적 크로스 도메인 캡처 보안으로 뒷받침된 통합 기하학 서비스입니다.

논문 012026-08-11cs.CV

통합 동적 얼굴 랜드마크 탐지를 향해

저자 및 소속

Sebastian Regalado

University of Toronto, Canada

ModiFace, Canada

Varshanth R. Rao

ModiFace, Canada

Ruowei Jiang

ModiFace, Canada

Parham Aarabi

University of Toronto, Canada

Igor Gilitschenski

University of Toronto, Canada

해결하는 문제

이 논문은 이질적인 랜드마크 레이아웃을 위한 공통 의미 좌표계를 정의하고, 이를 사용해 여러 데이터셋에서 하나의 탐지기를 학습합니다. 추론 시, 동일한 네트워크는 소스 데이터셋 학습 동안 명시적으로 요청되지 않은 포인트를 포함하여 임의의 랜드마크 쿼리 집합에 응답할 수 있습니다.

핵심 결과

어댑터가 적용된 통합 ViT-B 모델은 WFLW에서 4.02 NME와 2.19% 실패율을 기록하며, 300W 공통/도전(split)에서는 2.43/4.19 NME, AFLW-19에서는 2.76 NME를 기록하면서 융합 학습과 동적 출력을 지원합니다. 300W만 학습할 경우, 도전적인 WFLW68 전이 테스트에서 6.08 NME에 도달하며, 이는 DTLD의 7.23과 PIPNet의 8.09보다 낮습니다. 격리된 고유 랜드마크에서 학습된 쿼리는 스플라인 보간 대비 300W에서 19.0%, WFLW split에서 15.7-16.3% 향상되어, 모델이 단순히 고정된 인덱스를 암기하는 것이 아니라 재사용 가능한 윤곽 의미를 학습함을 나타냅니다.

초록

얼굴 랜드마크 탐지(FLD) 방법의 발전은 성능 한계를 계속 확장하고 있지만, 두 가지 주요 기능적 한계를 간과합니다: (1) 각 '$N$-포인트' 벤치마크 데이터셋마다 서로 다른 네트워크 매개변수를 독립적으로 학습해야 한다는 점, (2) '$N$-포인트' 데이터셋에서 학습된 모델이 신뢰성 있게 $N$ 랜드마크만 출력합니다. 저희 연구에서는 먼저 Face Part-Anchored Landmark Positions(FPALP)를 개념화하는데, 각 랜드마크를 얼굴 부분 윤곽선을 따라 0(시작)에서 1(끝)까지의 진행 값으로 취급합니다. 모든 랜드마크는 출처 데이터셋과 관계없이 FPALP 형식으로 표현할 수 있어, 모든 '$N$-포인트' 데이터셋을 단일 데이터셋으로 통합할 수 있습니다. 둘째, 각 랜드마크를 FPALP 기반 쿼리로 표현하고, 교차 모달리티 디코더로 점진적으로 다듬으며, 최종 표현을 바탕으로 좌표를 예측합니다. 우리의 접근법인 Unified Dynamic FLD는 이 두 가지 설계 선택을 구현하며, (1) 단일 모델이 원하는 수의 '$N$-포인트' 데이터셋에서 학습할 수 있고, (2) 지정된 랜드마크 쿼리를 런타임에 불러와 특정 랜드마크 예측을 생성할 수 있게 하여 랜드마크 탐지 파이프라인을 간소화합니다. 여러 벤치마크 데이터셋에 대한 광범위한 실험 결과, 우리의 방법은 이러한 이점을 제공하면서도 기존 최첨단 방법들과 경쟁력을 유지하거나 여러 경우에는 더 뛰어난 성능을 유지함을 보여줍니다.

연구 출발점

얼굴 랜드마크 데이터셋은 얼굴에 19, 68, 98 또는 다른 수의 주석 포인트가 있는지 여부에 대해 일치하지 않습니다. 기존 모델은 회귀 헤드를 하나의 템플릿에 고정하여, 각 데이터셋마다 별도의 파라미터를 학습하고 유지해야 하며, 배포된 모델이 요청에 따라 새로운 하위 집합이나 더 촘촘한 레이아웃을 반환하는 것을 방지합니다. 이러한 단편화는 서로 다른 랜드마크 규칙을 사용하는 정렬, 재구성, 화장 및 표정 파이프라인에 비용이 많이 듭니다.

방법

각 랜드마크는 얼굴 부위 기준 랜드마크 위치(FPALP)가 됩니다: 눈썹, 눈, 코, 입 또는 얼굴 경계와 같은 의미적 윤곽선을 따라 0에서 1까지 정규화된 진행입니다. 데이터셋 템플릿은 이 윤곽 공간에서 정렬되며, 요청된 모든 포인트는 FPALP 쿼리로 인코딩됩니다. 교차 모달 디코더는 좌표를 회귀하기 전에 이미지 토큰과 쿼리를 점진적으로 결합합니다. ViT-B 모델은 AFLW-19, 300W, WFLW에서 공동 학습되며; 선택적 경량 데이터셋 어댑터는 통합 백본이나 런타임 설정 출력 레이아웃을 포기하지 않고 체계적인 주석 오프셋을 복원합니다.

논문 요약

단일 쿼리 기반 랜드마크 서비스는 경쟁력 있는 정확도를 유지하면서 템플릿별 여러 모델을 대체할 수 있습니다. 이 접근법은 특히 제품이 여러 정렬 형식을 필요로 하거나 새로운 랜드마크 정의를 추가할 것으로 예상될 때 매력적이지만, 팀은 여전히 각 생산 데이터셋에 대해 주석 오프셋 어댑터를 테스트해야 합니다.

논문 022026-08-20cs.CV

토마토, 감자, 양파: 얼굴 프레젠테이션 공격 탐지에서 얼굴의 필요성에 대한 의문

저자 및 소속

Guray Ozgur

Fraunhofer Institute for Computer Graphics Research IGD, Germany

Department of Computer Science, Technical University of Darmstadt, Germany

Fadi Boutros

Fraunhofer Institute for Computer Graphics Research IGD, Germany

Naser Damer

Fraunhofer Institute for Computer Graphics Research IGD, Germany

Department of Computer Science, Technical University of Darmstadt, Germany

해결하는 문제

이 연구는 통제된 얼굴 없는 데이터셋을 통해 얼굴 의미론에서 표현 과정 단서를 분리하고, 그 단서들이 표준 얼굴 PAD 벤치마크로 전송되는지 여부를 묻습니다. 또한 일부 얼굴 샘플을 얼굴 없는 공격으로 대체하는 것이 단순히 데이터셋 크기를 늘리는 것이 아니라 고정된 훈련 예산 내에서 정보를 추가하는지 테스트합니다.

핵심 결과

채소 단독 훈련은 네 가지 얼굴 벤치마크 전체에서 평균 AUC가 92.70%, HTER가 14.15%에 도달하는 반면, 합성 얼굴 훈련은 81.02%, ImageNet 초기화 대조군은 67.81%에 해당합니다. 고정된 단일 소스 얼굴 예산의 일부를 TPO로 대체하면 평균 데이터셋 간 AUC가 89.33%에서 92.55%로 상승하고 HTER가 17.54%에서 13.97%로 낮아졌습니다; 다중 소스 훈련에서는 AUC가 92.11%에서 96.96%로, HTER는 14.72%에서 7.84%로 감소했습니다. 공격 다양성이 중복 프레임보다 더 중요합니다: TPO 프레임의 10%만 사용해도 92.97%의 AUC가 나오고, 인쇄 전용 또는 재생 전용 훈련은 86.14%와 83.97%로 떨어집니다.

초록

얼굴 표현 공격 탐지(PAD)는 전통적으로 얼굴 특정 문제로 공식화되어 왔으나, 인쇄, 재생, 재캡처 과정에서 발생하는 많은 시각적 아티팩트는 본질적으로 얼굴 외모와 연관되어 있지 않습니다. 본 연구에서는 하위 PAD 훈련 중 얼굴을 사용하지 않고도 전이 가능한 PAD 표현을 학습할 수 있는지 조사합니다. 이를 위해 TPO는 토마토, 감자, 양파 등 거의 무작위로 선택된 프로토콜 하에서 획득한 진짜, 인쇄 및 재생 녹화로 구성된 통제된 얼굴 없는 프레젠테이션 공격 데이터셋 TPO를 도입했습니다. 기초 모델 기반 PAD 아키텍처를 사용하여, TPO에서 훈련된 검출기가 네 가지 표준 교차 데이터셋 얼굴 PAD 벤치마크에서 평균 AUC가 92.70%를 달성하며, 합성 얼굴 학습보다 우수하며 실제 얼굴 데이터셋에서 학습된 모델과 경쟁할 수 있음을 입증했습니다. 반대로, 얼굴 PAD 데이터셋에서 학습된 모델은 TPO로 일관되게 우연히 전송되어, 학습된 표현이 객체 의미론보다는 표현 과정의 특성을 포착함을 시사합니다. 더불어, TPO를 기존 얼굴 PAD 훈련에 통합하면 고정된 최적화 예산 하에서 교차 데이터셋 성능이 지속적으로 향상되어, 얼굴 없는 데이터가 단순한 추가 학습 샘플이 아니라 보완적인 정보를 제공함을 나타냅니다. 마지막으로, 표현 및 빈도 분석은 전이 가능한 PAD 표현이 단일 스펙트럼 인티팩트로 설명될 수 없으며, 객체 범주 간에 공유되는 더 풍부한 표현 단서를 인코딩한다는 추가 증거를 제공합니다. 이 결과들은 전이 가능한 프레젠테이션 공격 표현이 얼굴 콘텐츠와 독립적으로 학습될 수 있다는 실증적 증거를 제공하며, 개인정보 보호와 신원 독립적 PAD 개발에 새로운 기회를 열어줍니다.

연구 출발점

인쇄 및 재생 공격은 모아레 패턴, 디스플레이 서브픽셀, 종이 질감, 감마 이동, 반사, 재캡처 노이즈 등을 도입하는데, 이는 표현 도구의 특성이지 표현된 정체성보다는 특성입니다. 그러나 반스푸핑 연구는 거의 항상 더 많은 인간 얼굴을 수집하여 동의와 인구통계학적 우려를 증가시키고, 탐지기가 얼굴이나 데이터셋의 지름길을 흡수하도록 유도합니다. 저자들은 얼굴 없이도 전이 가능한 공격 증거를 학습할 수 있다는 의도적으로 강한 가설을 검증합니다.

방법

TPO에는 얼굴 PAD 데이터셋을 모델링한 프로토콜로 캡처된 토마토, 감자, 양파의 진짜 인쇄 및 재생 프레젠테이션 12,480개가 포함되어 있습니다. CLIP ViT-B/16 FoundPAD 모델은 LoRA로 TPO만을 사용하여 적응한 후 MSU-MFSD, CASIA-FASD, Replay-Attack, OULU-NPU 전반에서 평가됩니다. 대조 방법은 ImageNet 초기화된 아키텍처 매칭 제로 샷 CLIP, SynthASpoof, 단일 및 다중 소스 실면 학습, 얼굴 데이터셋에서 TPO로의 역전송, 고정 예산 대체 실험, 빈도 분석, 객체 클래스, 공격 유형, 프레임 수에 대한 소작 제거가 포함됩니다.

논문 요약

인쇄/재생 안티스푸핑에서는 현실적인 재포획 다양성이 또 다른 신원 수집보다 더 중요할 수 있습니다. 얼굴 없는 보조 데이터는 프라이버시를 고려한 교차 센서 전송 개선 방법을 제공하지만, 증거는 테스트된 인쇄 및 디스플레이 과정에 적용되므로 마스크나 새로운 물리적 공격으로 자동으로 일반화되어서는 안 됩니다.

논문 032026-08-30cs.CV

얼굴 표현 및 형태 공격 탐지를 위한 기초 및 다중 모달 대형 언어 모델

저자 및 소속

Hatef Otroshi Shahreza

Idiap Research Institute, Switzerland

Asif Hussain Khan

Idiap Research Institute, Switzerland

Peter Lorenz

Idiap Research Institute, Switzerland

Alain Komaty

Idiap Research Institute, Switzerland

Sébastien Marcel

Idiap Research Institute, Switzerland

University of Lausanne, Switzerland

해결하는 문제

이 연구는 얼굴 표현 공격 탐지와 형태 공격 탐지에 대한 접근 전략을 단일 대규모로 비교합니다. 제로 샷 언어 출력, 출력 로그잇, 동결된 시각 특징, 작업별 MLLM 튜닝, LoRA 적응의 가치를 구분하며, 모든 이점을 일반적인 기초 모델 라벨에 귀속시키지 않습니다.

핵심 결과

기성 프롬프트는 신뢰할 만한 검출자가 아니다: 최고의 제로 샷 평균은 PAD에서 31.1% ACER, MAD에서 19.4%이다. 얼음 인코더와 선형 헤드를 사용하면 이 수치가 24.4%와 5.0%로 향상된다; 작업별 PADLM과 MADLM은 설명을 생성할 때 각각 13.6%와 2.9%에 이른다. 최고의 LoRA 적응 인코더는 PAD에서 평균 ACER가 14.9%를 달성하며, 가장 강력한 인용된 전문가는 17.3%, MAD는 3.7%로 11.3%를 기록한다. MAD는 PAD보다 더 쉽게 전이된다: 최고의 크로스 데이터셋 ACER는 4.9% 대 19.8%이며, 사전 학습 목적 분석은 매개변수 수보다 더 나은 전이 예측을 한다.

초록

얼굴 인식 시스템은 보안에 중요한 응용 분야에서 점점 더 많이 배치되고 있지만, 여전히 프레젠테이션 및 모프 공격에 취약합니다. 따라서 프레젠테이션 공격 탐지(PAD)와 모핑 공격 탐지(MAD)는 신뢰할 수 있는 얼굴 생체 인식의 필수 구성 요소입니다. PAD 및 MAD 방법의 발전에도 불구하고, 기존 탐지기는 일반화가 제한적이며 데이터셋 간 평가가 저하되고 있습니다. 본 논문에서는 범용 기초 모델(FM)과 다중 모달 대형 언어 모델(MLLM)이 PAD와 MAD 관련 정보를 인코딩하는지 체계적으로 조사하며, 이러한 모델이 두 작업에 어떻게 가장 잘 적용될 수 있는지를 연구합니다. 모델 내부 정보에 대한 접근성이 높아지는 다섯 가지 접근법을 연구합니다: (i) 기성 MLLM 제로 샷 프롬프트; (ii) MLLM 출력에서 다음 토큰 로그트 확률로 얕은 모델을 학습; (iii) 작업별 질문-답변 데이터에 대한 매개변수 효율적인 미세 조정을 통해 PADLM과 MADLM이라는 두 가지 전문 MLLM(의사결정에 대한 텍스트적 추론을 추가로 제공함)을 산출합니다; (iv) 동결된 시각 인코더의 선형 탐침; 그리고 (v) FM 및 MLLM의 시각 인코더의 미세 조정. 우리는 4개의 PAD 데이터셋(MSU-MFSD, CASIA-FASD, REPLAY-ATTACK, OULU-NPU)과 4개의 MAD 데이터셋(FFHQ, FRGC, FRLL, FERET)에서 16개의 개방형 중치 MLLM 및 30개의 비전 인코더 백본을 벤치마킹했습니다. [EOS]우리의 실험은 FM과 MLLM이 PAD 및 MAD에서 상당한 성능을 달성할 수 있음을 보여줍니다. 또한, 미세 조정된 모델은 데이터 교차 평가에서 최첨단 탐지 성능을 달성하여, 범용 사전 학습 표현이 상당한 공격 관련 정보를 담고 있음을 나타냅니다. 모든 실험의 소스 코드는 공개될 예정입니다.

연구 출발점

범용 비전 및 다중 모달 모델은 이미 프레젠테이션 및 모프 공격에 유용한 질감, 기하학, 의미 단서를 인코딩할 수 있지만, 모델 크기만으로는 그 증거를 추출하는 방법을 알 수 없습니다. 보안 팀은 기성 프롬프트만으로도 충분한지, 설명에 전문 MLLM(MLLM)이 필요한지, 그리고 시각 인코더 자체가 데이터 세트 간 센서 및 공격 변화에 견딜 수 있도록 언제 적응해야 하는지 알아야 합니다.

방법

16개의 개방 중치 MLLM 및 30개의 시각 인코더가 4개의 PAD 데이터셋(MSU-MFSD, CASIA-FASD, REPLAY-ATTACK, OULU-NPU)과 4개의 MAD 데이터셋(FFHQ, FRGC, FRLL, FERET)에서 평가됩니다. 5가지 배포 모드가 점진적으로 각 모델을 더 많이 노출합니다: 제로 샷 프롬프트, 다음 토큰 확률에 대한 얕은 분류기, 텍스트 추론을 통한 파라미터 효율적인 질문-답변 조정, 동결된 시각 인코더의 선형 프로빙, 인코더의 LoRA 적응. 개발에서 설정한 EER 임계값은 데이터셋 내 및 교차 ACER 테스트 모두에 포함됩니다.

논문 요약

프롬프트 MLLM을 생체 인식 공격 탐지기로 배치하지 마십시오. 고정된 시각적 특징은 유용한 기준선이지만, PAD는 일반적으로 인코더 적응이 필요하며, 인간이 읽을 수 있는 추론이 필요할 때는 조정된 MLLM이 유용합니다; 모델 선택은 프레젠테이션 공격과 모프 공격에 대해 별도로 검증되어야 합니다.