← 블로그로 돌아가기
리서치 레이더얼굴 인식프레젠테이션 공격 탐지arXiv2026년 7월

월간 arXiv 레이더

2026년 7월 얼굴 인식 논문: 다중 스펙트럼 패치, 개념 기반 PAD 및 안구 관련 과제

7월에는 직접적인 얼굴 인식 기술 관련 논문이 드물었지만, 캡처 보안 계층은 활발하게 연구되고 있었습니다. 따라서 이번 종합 분석에서는 인식 스택을 확장하여 살펴봅니다. 즉, 시각-적외선 융합 인식기를 물리적으로 숨길 수 있는지, 얼굴 위조 방지 모델이 보이지 않는 재질이나 센서에도 적용될 수 있는지, 그리고 안구 생체 인식이 재생이나 생성기가 재현할 수 없는 실시간 생물학적 반응을 유도할 수 있는지 등을 다룹니다.

이번 달이 보여주는 신호

VIPatch는 가시광선 및 적외선 센서를 결합한다고 해서 물리적 공격 위험이 자동으로 제거되는 것은 아니라는 점을 보여줍니다. 마스크와 열 스티커를 적절히 조합하면 두 채널 모두를 차단할 수 있기 때문입니다. CPG-PAD는 다른 취약점, 즉 재사용 가능한 시각적 개념보다는 데이터셋의 아티팩트에 의존하는 스푸핑 방지 프롬프트를 공격합니다. 안구 프로토콜은 수동적 분류에서 능동적 검증으로 전환하여 시선 추적과 동공 반응을 결합합니다. 이러한 논문들을 종합해 보면, 계층적 캡처 방어, 명시적인 도메인 간 테스트, 그리고 시뮬레이션된 보안 증거와 사람이 검증한 배포 결과를 신중하게 분리하는 것이 중요하다는 점을 알 수 있습니다.

논문 012026-07-25cs.CR

눈에 띄지 않게 숨기기: 시각-적외선 융합 얼굴 감지에 대한 효과적인 물리적 적대적 패치 공격

저자 및 소속

Qiucheng Yu

City University of Hong Kong, Hong Kong, China

Tao Ni

King Abdullah University of Science and Technology, Saudi Arabia

Yihe Zhou

City University of Hong Kong, Hong Kong, China

Jiayimei Wang

City University of Hong Kong, Hong Kong, China

Qingchuan Zhao

City University of Hong Kong, Hong Kong, China

해결하는 문제

기존 패치는 가시광선 이미지 최적화가 적외선 응답과 충돌하여 융합 검출기에 제대로 적용되지 못하고, 눈에 띄는 패턴은 사람이나 보조 시스템이 쉽게 알아차릴 수 있기 때문에 문제가 있습니다. VIPatch는 물리적으로 구현 가능하고, 통합 가능하며, 시각적으로 눈에 띄지 않는 공격 방식을 추구합니다.

핵심 결과

디지털 블랙박스 공격은 가시광선 감지기에서 평균 94.59%, 적외선 감지기에서 평균 97.40%의 인식률(ASR)을 보였습니다. 물리적 융합 설정에서 VIPatch는 YOLOv8-Face 및 MTCNN에서 97.27%, TFW 및 OpenCV에서 100%의 ASR을 달성했습니다. 가시광선 환경에서의 물리적 ASR은 12,000lux 조명 조건에서 80.29%를 유지했으며, 테스트된 1~3m 거리에서는 92.51%에서 100% 사이의 범위를 보였습니다.

초록

딥러닝 기반 시각-적외선 융합 얼굴 탐지 모델은 다양한 응용 분야에서 점점 더 많이 활용되고 있지만, 여전히 적대적 패치 공격에 취약합니다. 기존의 공격 기법들은 대부분 디지털 영역에서 시각 이미지 또는 적외선 이미지 중 하나만을 표적으로 삼기 때문에 물리적 환경에서 융합된 모델에는 효과적이지 못합니다. 더욱이, 이러한 공격 기법들은 패치 패턴이 실제와 크게 다르기 때문에 쉽게 눈에 띕니다. 본 논문에서는 얼굴 이미지에 대해 눈에 띄지 않고 사실적이며 자연스러운 패치를 생성하는 새로운 물리적 적대적 패치 공격 기법인 VIPatch(Visual-Infrared Patch)를 소개합니다. VIPatch는 시각 이미지와 적외선 이미지 모두에 그라데이션 색상 마스크와 반창고 스티커를 적용하고, 이 두 요소를 동시에 최적화합니다. 이렇게 생성된 디지털 패치는 물리적 패치 제작에 활용됩니다. 실험 결과, VIPatch는 디지털 및 물리적 영역 모두에서 90% 이상의 높은 공격 성공률을 달성하는 동시에 패치가 사람에게 눈에 띄지 않도록 유지하는 것으로 나타났습니다.

연구 출발점

시각-적외선 융합 기술은 저조도 및 온도 환경에서도 얼굴 인식 기능을 유지하는 데 사용되지만, 대부분의 공격 연구는 한 가지 모달리티만 공격하거나 디지털 방식에 그칩니다. 실제 운영 시스템에서는 평범해 보이는 물체가 인쇄, 배치, 조명 변화, 카메라 움직임 등의 다양한 상황에서 두 채널 모두를 억제할 수 있는지 여부를 파악해야 합니다.

방법

VIPatch는 가시광선 채널용 그라데이션 색상 마스크와 적외선 채널용 밴드 형태의 열 스티커를 공동으로 최적화한 후, 실제 제품을 제작합니다. 평가는 여러 가시광선 및 적외선 검출기, 화이트박스 및 블랙박스 전송 테스트, 그리고 시야각, 200~12,000룩스의 조도, 1~3미터의 거리에서의 물리적 테스트를 종합적으로 수행하여 진행되었습니다.

논문 요약

다중 스펙트럼 감지는 두 개의 독립적인 방어 체계가 아니라 결합된 시스템으로 위협 모델링되어야 합니다. 공격은 완화 조치라기보다는 레드팀의 결과물이지만, 탐지기 공급업체에게 패치 탐지, 센서 일관성 검사 및 대체 정책을 평가하는 데 필요한 구체적인 물리적 조건, 전송 모델 및 공격 성공 목표를 제공합니다.

논문 022026-07-01cs.CV

CPG-PAD: 개념 기반 프롬프트 안내 프레젠테이션 공격 탐지

저자 및 소속

Haoyuan Zhang

School of Artificial Intelligence, University of Chinese Academy of Sciences, China

State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, China

Xiangyu Zhu

State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, China

School of Artificial Intelligence, University of Chinese Academy of Sciences, China

Li Gao

China Mobile Financial Technology Co., Ltd., China

Ajian Liu

State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, China

School of Artificial Intelligence, University of Chinese Academy of Sciences, China

Siran Peng

State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, China

School of Artificial Intelligence, University of Chinese Academy of Sciences, China

Zhen Lei

State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, China

School of Artificial Intelligence, University of Chinese Academy of Sciences, China

Centre for Artificial Intelligence and Robotics, Hong Kong Institute of Science and Innovation, Chinese Academy of Sciences, Hong Kong, China

School of Computer Science and Engineering, Macau University of Science and Technology, Macau, China

해결하는 문제

본 논문은 도메인별 단축 표현을 억제하면서, 학습된 프롬프트를 공격과 관련된 세밀한 시각적 증거와 일치시키는 것을 목표로 합니다. 또한, 단일 데이터셋 분할에 의존하는 대신, 다중 소스, 제한된 소스, 단일 소스 및 미공개 프레젠테이션-공격 도구 프로토콜 전반에 걸쳐 동일한 아이디어를 검증합니다.

핵심 결과

추가 데이터 없이 CPG-PAD는 4방향 다중 소스 프로토콜에서 평균 2.08%의 HTER을 달성하여 CLIP 기준선인 5.43%를 개선했습니다. CelebA-Spoof를 사용했을 때는 1.19%를 달성했습니다. 단일 소스 전송에서는 평균 5.33%의 HTER을, 미확인 공격 도구에서는 1.02%의 HTER을 보고했는데, 이는 CLIP 기준선인 3.03%와 비교됩니다. 테스트에서 도출된 임계값 대신 검증 세트 임계값을 사용하면 평균 HTER이 2.28%로 나타나 임계값 설정의 한계를 확인할 수 있습니다.

초록

프레젠테이션 공격 탐지(PAD)는 인쇄된 사진, 재생된 비디오, 3D 마스크와 같은 프레젠테이션 공격으로부터 얼굴 인식 시스템을 보호하는 중요한 안전장치입니다. 상당한 진전에도 불구하고, 기존 PAD 모델은 센서, 조명, 공격 자료의 변화로 인해 미지의 영역에 대한 일반화 능력이 여전히 부족합니다. 최근의 비전-언어 모델(VLM)은 강력한 일반화 능력을 보여주었지만, 일반적으로 클래스 레이블 지도 하에서 최적화된 학습된 프롬프트가 공격과 관련된 세부적인 시각적 의미론과 명확하게 일치하지 못하기 때문에 PAD에서의 적용은 여전히 ​​제한적입니다. 결과적으로, 학습된 표현은 전이 가능한 공격 단서를 포착하는 대신 특정 영역에 특화된 특징에 과적합되는 경향이 있습니다. 이러한 문제를 해결하기 위해, 본 논문에서는 프롬프트 학습 과정에 모델 수준의 개념 안내를 도입한 개념 정보 기반 프롬프트 안내 프레젠테이션 공격 탐지(CPG-PAD) 프레임워크를 제안합니다. 구체적으로, 본 연구에서는 PAD 관련 시각적 개념을 자동으로 발견하고, 지역별 세밀한 안내를 제공하는 개념 연관 히트맵을 생성하는 XAI(설명 가능한 AI) 기술을 활용하는 시각적 개념 기반 향상(VCE) 모듈을 설계했습니다. 이러한 히트맵을 기반으로, 프롬프트 기반 개념 주입(PCI) 메커니즘은 시각적 프롬프트 디코더(VPD)와 개념 매핑 손실 함수를 통해 이러한 개념들을 프롬프트 공간에 통합하여 프롬프트가 모델의 내부 개념 공간과 일치하도록 합니다. 이러한 설계를 통해 CPG-PAD는 일반화 가능하고 도메인 불변적인 공격 단서를 포착하는 동시에 데이터셋별 편향을 효과적으로 억제할 수 있습니다. 9개의 벤치마크 데이터셋에 대한 광범위한 실험을 통해 CPG-PAD가 다중 소스, 제한된 소스 및 단일 소스 설정 모두에서 일관되게 최첨단 크로스 도메인 성능을 달성함을 입증했습니다.

연구 출발점

얼굴 위조 방지 모델은 학습 과정에서 사용된 센서 및 공격 매체에서는 우수한 성능을 보이지만, 조명, 카메라, 인쇄 공정, 마스크 또는 메이크업이 변경되면 제대로 작동하지 못하는 경우가 많습니다. 시각-언어 모델은 광범위한 사전 정보를 제공하지만, 레이블만 사용하는 프롬프트 학습 방식은 실제 프레젠테이션 공격을 설명하는 개념 대신 지역 데이터셋의 특정 특징에만 의존하는 경향이 있습니다.

방법

CPG-PAD는 먼저 시각적 개념 기반 향상 모듈에서 설명 가능성 방법을 사용하여 개념을 발견하고 지역화된 개념 히트맵을 생성합니다. 그런 다음 시각적 프롬프트 디코더와 개념 매핑 손실 함수를 통해 이러한 맵을 프롬프트 공간에 삽입하여 CLIP의 시각적 특징을 학습 가능한 여러 실제/가짜 프롬프트에 연결합니다. 이 비전 전용 모델은 9개의 데이터셋에서 평가되었으며, 기존의 HTER/AUC 지표와 ISO 표준에 따른 작동점 지표를 모두 보고합니다.

논문 요약

개념 기반 프롬프트는 PAD 제품이 센서를 통과하고 재료를 분석해야 할 때, 특히 멀티모달 언어 모델보다 비전 전용 리소스 사용량이 적다는 점에서 유망합니다. 하지만 구매자는 배포 환경에 맞춰 보정된 임계값을 기준으로 결과를 비교해야 합니다. 논문에서는 일반적인 테스트 기반 EER 임계값이 현장 준비 상태를 과대평가할 수 있다고 명시적으로 지적합니다.

논문 032026-07-10cs.CV

안구 활성도 검증을 위한 이중 스트림 챌린지-응답 프로토콜

저자 및 소속

Ismail Kably

Konelia Inc., Austin, Texas, USA

해결하는 문제

본 프로토콜은 자발적인 시선추적과 비자발적인 동공 빛반사를 결합하여 재생, 생성형 딥페이크, 그리고 안구 및 홍채 시스템에 대한 보철물 위협에 대응합니다. 핵심 질문은 렌더링 지연이 반복적인 무작위 과제에서 측정 가능한 동기화 차이를 발생시키는지 여부입니다.

핵심 결과

시뮬레이션 결과, 생성기 렌더링에 지연 시간이 추가되지 않을 경우 AUC는 0.502, 25ms에서는 0.717, 50ms에서는 0.948, 그리고 75ms 이상에서는 단일 라운드 기준으로 최소 0.997을 기록했습니다. 25ms에서 10라운드를 진행하면 AUC는 0.966으로 상승하고, 5라운드 이상을 진행하면 시뮬레이션된 0.90 AUC 탐지 임계값이 50ms에서 25ms로 낮아집니다. 이는 컴퓨터 시뮬레이션 결과이며, 실제 사람을 대상으로 한 측정이나 실제 생성기 공격은 수행되지 않았습니다.

초록

안구 생체인식 시스템은 고해상도 비디오 재생 및 실시간 딥페이크 생성과 같은 정교한 조작 공격에 직면해 있으며, 이러한 공격은 정적 생체인식 검사를 쉽게 우회합니다. 현재의 조작 공격 탐지(PAD) 프레임워크는 일반적으로 시선 추적이나 동공 반사(PLR)와 같은 개별적인 생리적 지표에 의존하는데, 이러한 지표들은 독립적으로 위조될 수 있습니다. 본 논문에서는 이러한 지표들을 통합하여 동시 인증 챌린지를 생성하는 이중 스트림 챌린지-응답 프레임워크를 도입한 공간-휘도 센서 융합 프로토콜을 제안합니다. 공간 궤적과 휘도 강도가 모두 변동하는 무작위 시간 가변 시각 자극을 생성함으로써, 부드러운 추적 운동과 동공 수축의 예상 생물학적 지연 시간 간의 연속적인 상호 상관 관계를 평가하기 위한 수학적으로 결합된 상태 공간 가능성 모델인 동기화 행렬을 구축합니다. 본 연구에서는 기존 문헌에서 도출된 지연 시간 분포를 기반으로 한 몬테카를로 시뮬레이션을 통해 실제 공격 상황과 모의 공격 상황 간의 이론적 분리 가능성을 입증하고, 렌더링 지연 시간 차이가 0이 아닌 경우 다중 라운드 챌린지 설계가 생성형 딥페이크 탐지 성능을 향상시킨다는 것을 보여줍니다. 이 연구는 안구 및 홍채 생체 인식 분야에서 차세대 동적 스푸핑 방어를 위한 시뮬레이션 기반 이론적 프레임워크를 제공하며, 실제 배포에 앞서 인체 대상 검증이 필수적임을 제시합니다.

연구 출발점

정적인 시선이나 동공 검사는 독립적으로 재생될 수 있으며, 실시간 생성 시스템은 점점 더 그럴듯한 눈 움직임을 재현합니다. 더욱 강력한 생체 인식 검사는 단일 캡처 프레임을 분류하는 대신, 새로운 자극에 대한 두 가지 생물학적 제약 조건이 있는 반응을 요구하고 그 시간적 관계를 검증해야 합니다.

방법

디스플레이는 목표 위치와 밝기를 동시에 변화시킵니다. 시스템은 시선 지연 시간, 동공 수축 지연 시간, 그리고 동기화 행렬에서 이들의 상호 상관 관계를 추정하고, 이를 결합하여 종합 점수를 산출합니다. 몬테카를로 시뮬레이션은 기존 연구에서 도출된 지연 시간 분포를 사용하여 각 조건당 10,000회의 시행을 수행하고, 가정된 생성기 지연 시간에 따라 1회, 3회, 5회 또는 10회의 독립적인 시행을 평가합니다.

논문 요약

이 설계는 활성 라이브 상태를 위한 유용한 청사진을 제공하고 보안과 지연 시간 간의 상충 관계를 명확히 보여주지만, 아직 실제 배포 가능한 정확도를 보장하는 것은 아닙니다. 제품 평가를 위해서는 사람의 보정, 센서 타이밍 측정, 상관 지연 공격, 그리고 실제 실시간 렌더링 엔진을 대상으로 한 레드팀 테스트가 여전히 필요합니다.