← 블로그로 돌아가기
리서치 레이더얼굴 인식arXiv2026년 7월

월간 arXiv 레이더

2026년 7월 안면 인식 논문: 합성 기반 모델, 드라이브스루 NIR 및 렌즈리스 카메라

7월에 발표된 안면 인식 논문들은 벤치마크 정확도에만 초점을 맞추던 논의를 넘어, 실제 배포 품질을 결정하는 데이터 및 캡처 시스템에 대한 논의로 전환하고 있습니다. 선정된 연구들은 두 가지 데이터 규모에서 개인정보 보호를 고려한 합성 학습을 테스트하고, 유리 투과 프로브를 사용한 교차 스펙트럼 국경 통제 데이터 세트를 소개하며, 카메라 자체를 렌즈 없는 광학 인코더로 대체했을 때 발생하는 현상을 측정합니다.

이번 달이 보여주는 신호

합성 이미지만을 이용한 적응은 일반적인 비전 기반 모델을 얼굴 인식에 경쟁력 있게 만들 수 있지만, 데이터 양이 많아질수록 최적의 전략은 크게 달라집니다. DriveFace는 강력한 임베딩 모델조차도 자동차 유리를 통해 움직이는 근적외선 프로브에 가시광선으로 촬영한 등록 이미지를 매칭할 때 여전히 상당한 오류가 발생한다는 것을 보여줍니다. LFD는 렌즈리스 광학 장치, 재구성, 검출 및 인식을 연결된 구성 요소로 취급하여 캡처 스택을 더욱 발전시켰습니다. 공통적인 교훈은 배포 성능이 인식 손실뿐만 아니라 전체 획득-임베딩 파이프라인에 달려 있다는 것입니다.

논문 012026-07-27cs.CV

IJCB-AFMFR 2026: 합성 훈련 데이터를 활용한 얼굴 인식용 기초 모델 적응 경진대회

저자 및 소속

Tahar Chettaoui

Fraunhofer Institute for Computer Graphics Research IGD, Germany

Guray Ozgur

Fraunhofer Institute for Computer Graphics Research IGD, Germany

Technical University of Darmstadt, Germany

Eduarda Caldeira

Fraunhofer Institute for Computer Graphics Research IGD, Germany

Technical University of Darmstadt, Germany

Arturas Nakvosas

Vilnius University, Lithuania

Hatef Otroshi Shahreza

Idiap Research Institute, Switzerland

Sébastien Marcel

Idiap Research Institute, Switzerland

Rishabh Shukla

Indian Institute of Technology Jammu, India

Aditya Takkar

Indian Institute of Technology Jammu, India

Rushil Khullar

Indian Institute of Technology Jammu, India

Lalak Yadav

Indian Institute of Technology Jammu, India

Gourav Gupta

ArogyaPandit Private Limited, India

Anant Gupta

ArogyaPandit Private Limited, India

Shiqi Yu

Southern University of Science and Technology, China

Vitomir Struc

University of Ljubljana, Slovenia

Naser Damer

Fraunhofer Institute for Computer Graphics Research IGD, Germany

Technical University of Darmstadt, Germany

Fadi Boutros

Fraunhofer Institute for Computer Graphics Research IGD, Germany

해결하는 문제

이전의 합성 데이터 관련 문제들은 생성기 품질, 백본 선택, 학습 방식 등을 혼합하여 고려했습니다. 이번 벤치마크에서는 CLIP ViT-L/14와 IDPERTURB 생성기를 수정하여, 완전 미세 조정, LoRA, 순위 안정화 LoRA, 투영 전용 적응 방식을 동일한 신원 데이터와 평가 도구 모음에서 비교할 수 있도록 했습니다.

핵심 결과

Sub-Center ArcFace를 사용한 완벽한 미세 조정은 소규모 벤치마크에서 평균 정확도 95.51%, IJB-C FAR 1e-5에서 TAR 87.42%를 달성하며 전체 데이터 트랙에서 선두를 차지했습니다. 이는 FRoundation 기준선의 76.71%보다 높은 수치입니다. 제한된 데이터 환경에서는 rsLoRA가 더욱 견고한 성능을 보였습니다. Idiap-BSP는 평균 정확도 94.52%, IJB-C FAR 1e-5에서 TAR 81.13%를 기록했습니다. 공정성 평가 또한 데이터 환경에 따라 달라지는데, 전체 데이터 환경에서는 평균 RFW 정확도 91.70%, 제한된 데이터 환경에서는 88.92%를 달성했습니다.

초록

본 논문은 2026년 국제생명통계학회(IJCB 2026)에서 개최된 얼굴 인식 기초 모델 적응 경진대회(AFMFR)에 대한 요약을 제시합니다. 이 대회에는 두 가지 보완적인 트랙, 즉 참가자들이 대규모 합성 신원 데이터를 사용하여 CLIP ViT-L/14 기초 모델을 적응시키는 전체 데이터 트랙과 보다 자원이 제한된 적응 환경을 반영하도록 설계된 제한 데이터 트랙에 걸쳐 4개 팀에서 총 8개의 유효한 제출물이 접수되었습니다. 모든 훈련 데이터는 IDPERTURB만을 사용하여 생성되었습니다. 제출된 솔루션은 Borda 계수법을 사용하여 LFW, CFP-FP, AgeDB-30, CALFW, CPLFW, IJB-B, IJB-C 및 TinyFace를 포함한 다양한 벤치마크에서 검증 및 식별 성능을 기준으로 순위가 매겨졌습니다. 또한, 4개의 인구통계학적 그룹에 걸쳐 RFW 데이터셋에 대한 공정성 평가가 추가로 수행되었습니다. 연구 결과는 CLIP 기반 모델을 합성 훈련 데이터에 적용했을 때 기성 모델 대비 성능이 크게 향상되고, 여러 경우에서 기준 모델을 능가함을 보여줍니다. 특히, Sub-Center ArcFace(DMSTI-Neurotechnology)를 사용한 전체 미세 조정이 전체 데이터 트랙에서 가장 우수한 성능을 보였으며, 순위 안정화 LoRA 적용(Idiap-BSP)은 제한된 데이터 조건에서 가장 효과적인 것으로 나타났습니다.

연구 출발점

얼굴 인식 개발자들은 점점 더 광범위하고 동의를 얻은 실제 얼굴 학습 데이터셋이 부족한 상황에 직면하고 있으며, 일반적인 컴퓨터 비전 기반 모델은 적응 과정 없이는 엄격한 생체 인식 작동 지점에서 충분한 판별력을 제공하지 못합니다. 본 대회는 합성 신원이 이러한 적응성을 제공할 수 있는지, 그리고 사용 가능한 합성 데이터셋이 10배 이상 변화할 때 적절한 학습 용량은 어느 정도인지에 대한 질문을 던집니다.

방법

본 대회는 약 35,000개의 합성 신원으로부터 추출한 300만 개의 이미지를 사용하는 전체 데이터 트랙과 5,000개의 신원으로부터 추출한 25만 개의 이미지를 사용하는 제한 데이터 트랙으로 구성됩니다. 유효한 제출물 8개에 대해 IJB-B, IJB-C, TinyFace 등 5개의 소규모 검증 데이터셋을 사용하여 보르다 집계 방식으로 점수를 매기고, RFW는 4개의 인구통계학적 그룹에 걸친 성능 분산을 측정합니다. 제출된 방법들은 전체 백본 업데이트, LoRA 및 rsLoRA 랭크, 마진 손실, 데이터 증강, 경량 투영 튜닝 등을 탐구합니다.

논문 요약

대규모 비주얼 백본을 적용하는 팀의 경우, 합성 데이터 볼륨이 튜닝 전략을 결정하는 중요한 요소가 되어야 합니다. 수백만 개의 이미지 규모에서는 완벽한 미세 조정이 효과적이며, 신원과 이미지에 제약이 있는 경우에는 고차 rsLoRA가 유용한 정규화 도구 역할을 합니다. 따라서 단일 최적화 방식으로는 두 가지 상황 모두에 최적의 결과를 얻기 어려울 수 있습니다.

논문 022026-07-15cs.CV

DriveFace: 이동 중인 차량의 출입 통제를 위한 유리창을 통한 얼굴 인식 다중 스펙트럼 데이터셋

저자 및 소속

Anjith George

Idiap Research Institute, Switzerland

Luis S. Luevano

Idiap Research Institute, Switzerland

Alain Komaty

Idiap Research Institute, Switzerland

Zeina Al Amine

Idiap Research Institute, Switzerland

Vidit Vidit

Idiap Research Institute, Switzerland

Sebastien Marcel

Idiap Research Institute, Switzerland

University of Lausanne, Switzerland

해결하는 문제

DriveFace는 스마트폰의 RGB 등록과 차량 외부의 근적외선 캡처를 연결하는 공개 벤치마크가 부족한 부분을 보완합니다. 또한, 인식 및 캡처 보안을 동일한 운영 환경에서 연구할 수 있도록 프레젠테이션 공격 하위 집합도 포함합니다.

핵심 결과

실외 매칭은 AdaFace가 99.45% AUC, 2.69% EER, 97.42% Rank-1로 비교적 우수한 성능을 보였습니다. 하지만 시뮬레이션된 색조는 매칭이 더 어려웠습니다. 최고 AUC는 96.23%에 불과했고, xEdgeFace는 1% FAR에서 8.09% EER과 88.63%의 검증률을 기록했습니다. PAD 기준선 역시 미확인 공격에 대해 성능이 저하되었습니다. 알려진 공격 프로토콜에서 오류율이 낮았음에도 불구하고, 미확인 마스크에 대한 최고 ACER은 26.20%에 그쳤습니다.

초록

국경을 넘나드는 이동의 지속적인 증가는 기존 국경 통제 인프라에 점점 더 큰 부담을 주고 있으며, 이로 인해 이동 중 생체 인증, 즉 검문소에서 차량 내에서 직접 신원을 확인하는 방식이 요구되고 있습니다. 얼굴 인식은 수동적으로 원거리에서 데이터를 획득할 수 있기 때문에 이러한 환경에 매우 적합합니다. 그러나 얼굴 인식 기술 개발은 대표적인 데이터셋의 부족으로 인해 저해받고 있습니다. 기존 벤치마크 데이터셋은 통제된 환경에서 수집되었으며, 모션 블러, 가변 조명, 가림 현상, 교차 스펙트럼 등록 등 차량 내 데이터 획득에 내재된 어려움을 제대로 반영하지 못합니다. 이러한 격차를 해소하기 위해 본 연구에서는 국경 통제 시나리오에서 이동 중 얼굴 인식을 위한 데이터셋을 개발했습니다. 이 데이터셋은 근적외선(NIR) 차량 통과 영상과 스마트폰 기반 사전 등록 데이터를 결합한 것입니다. 최첨단 모델을 사용한 기준선 평가 결과, 이러한 현실적인 조건에서는 성능상의 한계가 명확하게 드러나며, 이 분야의 발전을 위해서는 특화된 방법론 개발이 필요함을 보여줍니다.

연구 출발점

차량 검문소에서는 탑승자가 차에서 내리지 않고도 사전 등록된 탑승자를 식별할 수 있다는 장점이 있지만, 프로브는 반사 유리나 착색 유리를 통해 촬영되는 경우가 많고, 차량이나 대상자가 움직이는 중에 촬영되는 경우가 흔합니다. 기존의 실내 가시광선-근적외선(VIS-NIR) 데이터 세트는 이러한 광학적 열화 현상과 함께 탑승자의 자세, 날씨, 속도, 그리고 세션 간 등록 정보를 고려하지 않습니다.

방법

이 데이터 세트는 동의한 자원봉사자 70명을 대상으로 두 차례에 걸쳐 수집되었으며, 스마트폰 등록 정보와 실외, 차량 내부, 그리고 모의 색조 NIR 프로브를 이용한 측정값을 기록합니다. 메타데이터에는 유리 색조, 조명, 머리 자세, 날씨, 차량 속도가 포함됩니다. 신원 정보가 분리된 학습 및 테스트 프로토콜을 사용하여 AdaFace, LVFace, EdgeFace, 그리고 스펙트럼에 따라 적응된 xEdgeFace를 AUC, EER, 1% FAR에서의 검증률, Rank-1 식별률을 기준으로 평가합니다. 별도의 PAD 프로토콜은 알려진 또는 알려지지 않은 지문이나 마스크 공격에 대한 대응을 다룹니다.

논문 요약

DriveFace는 등록, 센서 스펙트럼, 유리, 움직임 및 스푸핑을 하나의 프로토콜로 처리하기 때문에 차량 및 국경 보안 시스템 구축을 위한 수용성 테스트 데이터 세트로서 가치가 있습니다. 하지만 기본 수치는 제약 없는 환경에서 우수한 얼굴 인식 점수가 색조가 있는 교차 스펙트럼 캡처 환경에서 충분한 보안 마진을 보장하지 않는다는 점을 시사합니다.

논문 032026-07-11cs.CV

LFD: 대규모 데이터셋을 활용한 실세계 렌즈리스 얼굴 인식 구현

저자 및 소속

Junho Kim

Department of Electrical and Computer Engineering, Rice University, Houston, Texas, USA

Salman S. Khan

Department of Electrical and Computer Engineering, Rice University, Houston, Texas, USA

Sara Wan

Department of Electrical and Computer Engineering, Rice University, Houston, Texas, USA

Tomi Kuye

Department of Electrical and Computer Engineering, Rice University, Houston, Texas, USA

Ashok Veeraraghavan

Department of Electrical and Computer Engineering, Rice University, Houston, Texas, USA

해결하는 문제

이 분야에는 실내외 환경에서 실제 렌즈리스 측정값, 재구성된 이미지, 기존 얼굴 이미지를 모두 포함하는 상당한 규모의 데이터 세트가 부족했습니다. 이러한 데이터 부족으로 인해 재구성 품질을 검출기 및 인식기 오류와 구분하거나 모델이 서로 다른 광학 인코더 간에 전이되는지 여부를 테스트하기 어려웠습니다.

핵심 결과

프로토타입 1에서 LFD로 학습된 인식기는 실내 쉬운 데이터셋에서 AUC 0.946, 실외에서 0.808, 전체 데이터셋에서 0.851, 어려운 데이터셋에서 0.778을 달성했습니다. 이에 상응하는 표준 이미지 모델은 각각 0.884, 0.625, 0.763, 0.599의 점수를 기록했습니다. 교차 모달 매칭에서 0.05%의 FPR(오류율)을 적용했을 때, LFD 재구성은 이전 FCFD FlatNet 데이터의 66.02%에 비해 77.30%의 TPR(트랜스포머 인식률)을 달성했으며, 이러한 우위는 두 번째 광학 프로토타입에서도 유지되었습니다.

초록

얼굴 인식은 일상적인 스마트폰 생체 인식부터 고도의 보안 시스템에 이르기까지 광범위한 응용 분야를 가진 보편적으로 사용되는 컴퓨터 비전 작업입니다. 대부분의 얼굴 인식 시스템은 기존 카메라에 의존하는데, 이는 부피가 크고 가격이 비싸며 개인 정보 보호가 제한적이라는 등의 한계를 가지고 있습니다. 이러한 한계를 극복하기 위해 렌즈리스 카메라가 대안으로 등장했습니다. 렌즈리스 카메라는 얇은 광학 인코더를 사용하여 크기를 줄이고 비용을 낮추며 설계 유연성을 높입니다. 이러한 카메라는 일반적으로 원본 이미지를 인식 가능한 이미지로 변환하는 재구성 알고리즘과 함께 사용됩니다. 그러나 재구성된 이미지에는 종종 아티팩트가 포함되며, 재구성 방법은 실제 환경에 잘 적용되지 못하는 문제가 있습니다. 더욱이 기존의 얼굴 데이터셋은 렌즈리스 이미지에 존재하는 아티팩트를 고려하지 않습니다. 이러한 문제를 해결하기 위해 본 논문에서는 렌즈리스 얼굴 데이터셋(LFD)을 소개합니다. LFD는 다양한 조명, 각도 및 거리에서 촬영된 21,080개의 렌즈리스 원본 측정값, 재구성 이미지 및 표준 얼굴 이미지로 구성됩니다. 본 연구의 주요 기여는 다음과 같습니다. (1) 실제 환경의 렌즈리스 얼굴 데이터: LFD는 다양한 환경에서 발생하는 다양한 수준의 아티팩트를 포함하는 다채로운 얼굴 데이터셋을 수집하는 데 중점을 두었습니다. (2) 실제 환경 촬영: 4,976개의 이미지는 다양한 자연광 강도와 배경 패턴을 가진 야외 환경에서 촬영되었습니다. (3) 다양한 렌즈리스 장치: LFD는 각각 고유한 광학 인코더를 갖춘 세 가지 유형의 렌즈리스 카메라에서 수집된 얼굴 이미지를 포함합니다. 이러한 하드웨어 다양성을 활용하여 서로 다른 렌즈리스 카메라 간의 일반화 성능을 입증했습니다. 종합적인 평가 및 분석을 통해 LFD가 다양한 렌즈리스 이미징 장치에서 공통적으로 나타나는 특징과 아티팩트를 효과적으로 포착함을 보여주며, 이는 렌즈리스 얼굴 인식 기술 발전에 유용한 데이터셋임을 시사합니다.

연구 출발점

렌즈가 없는 카메라는 부피가 큰 렌즈를 얇은 코딩된 광학 요소로 대체하여 크기를 줄이고 센서에서 사람이 읽을 수 있는 이미지를 덜 노출시킬 수 있습니다. 그러나 이러한 카메라로 재구성한 이미지에는 장치 특유의 흐림, 색 왜곡 및 비네팅이 포함되므로 일반 사진이나 시뮬레이션 측정값으로 학습된 인식 모델은 실제 촬영 이미지에 안정적으로 적용되지 않습니다.

방법

LFD는 4,976개의 실외 이미지와 세 가지 렌즈리스 카메라 설계로 촬영한 이미지를 포함하여 총 21,080개의 렌즈리스 측정 원본, 재구성 이미지 및 표준 이미지를 수집합니다. 연구진은 재구성 및 얼굴 인식 구성 요소를 각각 별도로 학습시킨 후, 표준 VGGFace2 이미지, 시뮬레이션된 렌즈리스 재구성 이미지 또는 실제 LFD 학습 데이터 세트를 사용하여 학습된 SENet 인식기를 비교합니다. 검증은 쉬운 데이터셋, 실외 데이터셋, 전체 데이터셋 및 어려운 데이터셋에 걸쳐 균형 잡힌 긍정 및 부정 쌍을 사용하여 수행하며, 이후 다양한 기기에서 테스트를 진행합니다.

논문 요약

LFD는 렌즈 없는 생체 인식 제품이 재구성을 투명한 전처리 단계로 취급하는 대신 실제 센서 아티팩트를 기반으로 학습해야 함을 보여줍니다. 이는 소형 ​​또는 개인 정보 보호용 카메라를 평가하는 구체적인 근거를 제공하는 동시에, 실외 환경에서의 성능 격차가 여전히 하드웨어적 이점이 상당한 인식 비용을 수반한다는 것을 보여줍니다.