저자 및 소속
Tahar Chettaoui
Fraunhofer Institute for Computer Graphics Research IGD, Germany
Guray Ozgur
Fraunhofer Institute for Computer Graphics Research IGD, Germany
Technical University of Darmstadt, Germany
Eduarda Caldeira
Fraunhofer Institute for Computer Graphics Research IGD, Germany
Technical University of Darmstadt, Germany
Arturas Nakvosas
Vilnius University, Lithuania
Hatef Otroshi Shahreza
Idiap Research Institute, Switzerland
Sébastien Marcel
Idiap Research Institute, Switzerland
Rishabh Shukla
Indian Institute of Technology Jammu, India
Aditya Takkar
Indian Institute of Technology Jammu, India
Rushil Khullar
Indian Institute of Technology Jammu, India
Lalak Yadav
Indian Institute of Technology Jammu, India
Gourav Gupta
ArogyaPandit Private Limited, India
Anant Gupta
ArogyaPandit Private Limited, India
Shiqi Yu
Southern University of Science and Technology, China
Vitomir Struc
University of Ljubljana, Slovenia
Naser Damer
Fraunhofer Institute for Computer Graphics Research IGD, Germany
Technical University of Darmstadt, Germany
Fadi Boutros
Fraunhofer Institute for Computer Graphics Research IGD, Germany
해결하는 문제
이전의 합성 데이터 관련 문제들은 생성기 품질, 백본 선택, 학습 방식 등을 혼합하여 고려했습니다. 이번 벤치마크에서는 CLIP ViT-L/14와 IDPERTURB 생성기를 수정하여, 완전 미세 조정, LoRA, 순위 안정화 LoRA, 투영 전용 적응 방식을 동일한 신원 데이터와 평가 도구 모음에서 비교할 수 있도록 했습니다.
핵심 결과
Sub-Center ArcFace를 사용한 완벽한 미세 조정은 소규모 벤치마크에서 평균 정확도 95.51%, IJB-C FAR 1e-5에서 TAR 87.42%를 달성하며 전체 데이터 트랙에서 선두를 차지했습니다. 이는 FRoundation 기준선의 76.71%보다 높은 수치입니다. 제한된 데이터 환경에서는 rsLoRA가 더욱 견고한 성능을 보였습니다. Idiap-BSP는 평균 정확도 94.52%, IJB-C FAR 1e-5에서 TAR 81.13%를 기록했습니다. 공정성 평가 또한 데이터 환경에 따라 달라지는데, 전체 데이터 환경에서는 평균 RFW 정확도 91.70%, 제한된 데이터 환경에서는 88.92%를 달성했습니다.
초록
본 논문은 2026년 국제생명통계학회(IJCB 2026)에서 개최된 얼굴 인식 기초 모델 적응 경진대회(AFMFR)에 대한 요약을 제시합니다. 이 대회에는 두 가지 보완적인 트랙, 즉 참가자들이 대규모 합성 신원 데이터를 사용하여 CLIP ViT-L/14 기초 모델을 적응시키는 전체 데이터 트랙과 보다 자원이 제한된 적응 환경을 반영하도록 설계된 제한 데이터 트랙에 걸쳐 4개 팀에서 총 8개의 유효한 제출물이 접수되었습니다. 모든 훈련 데이터는 IDPERTURB만을 사용하여 생성되었습니다. 제출된 솔루션은 Borda 계수법을 사용하여 LFW, CFP-FP, AgeDB-30, CALFW, CPLFW, IJB-B, IJB-C 및 TinyFace를 포함한 다양한 벤치마크에서 검증 및 식별 성능을 기준으로 순위가 매겨졌습니다. 또한, 4개의 인구통계학적 그룹에 걸쳐 RFW 데이터셋에 대한 공정성 평가가 추가로 수행되었습니다. 연구 결과는 CLIP 기반 모델을 합성 훈련 데이터에 적용했을 때 기성 모델 대비 성능이 크게 향상되고, 여러 경우에서 기준 모델을 능가함을 보여줍니다. 특히, Sub-Center ArcFace(DMSTI-Neurotechnology)를 사용한 전체 미세 조정이 전체 데이터 트랙에서 가장 우수한 성능을 보였으며, 순위 안정화 LoRA 적용(Idiap-BSP)은 제한된 데이터 조건에서 가장 효과적인 것으로 나타났습니다.
연구 출발점
얼굴 인식 개발자들은 점점 더 광범위하고 동의를 얻은 실제 얼굴 학습 데이터셋이 부족한 상황에 직면하고 있으며, 일반적인 컴퓨터 비전 기반 모델은 적응 과정 없이는 엄격한 생체 인식 작동 지점에서 충분한 판별력을 제공하지 못합니다. 본 대회는 합성 신원이 이러한 적응성을 제공할 수 있는지, 그리고 사용 가능한 합성 데이터셋이 10배 이상 변화할 때 적절한 학습 용량은 어느 정도인지에 대한 질문을 던집니다.
방법
본 대회는 약 35,000개의 합성 신원으로부터 추출한 300만 개의 이미지를 사용하는 전체 데이터 트랙과 5,000개의 신원으로부터 추출한 25만 개의 이미지를 사용하는 제한 데이터 트랙으로 구성됩니다. 유효한 제출물 8개에 대해 IJB-B, IJB-C, TinyFace 등 5개의 소규모 검증 데이터셋을 사용하여 보르다 집계 방식으로 점수를 매기고, RFW는 4개의 인구통계학적 그룹에 걸친 성능 분산을 측정합니다. 제출된 방법들은 전체 백본 업데이트, LoRA 및 rsLoRA 랭크, 마진 손실, 데이터 증강, 경량 투영 튜닝 등을 탐구합니다.
논문 요약
대규모 비주얼 백본을 적용하는 팀의 경우, 합성 데이터 볼륨이 튜닝 전략을 결정하는 중요한 요소가 되어야 합니다. 수백만 개의 이미지 규모에서는 완벽한 미세 조정이 효과적이며, 신원과 이미지에 제약이 있는 경우에는 고차 rsLoRA가 유용한 정규화 도구 역할을 합니다. 따라서 단일 최적화 방식으로는 두 가지 상황 모두에 최적의 결과를 얻기 어려울 수 있습니다.