← 블로그로 돌아가기
연구 레이더얼굴 인식arXiv2026년 9월

월간 arXiv 레이더

2026년 9월 얼굴 인식 논문: 공정한 매칭, 열 적응, 그리고 쌍둥이 테스트

9월의 얼굴 인식 연구는 또 다른 백본 경쟁보다는 어려운 운영 환경에 더 초점을 맞추고 있습니다. DenseFace는 기존 모델의 매칭 규칙을 변경하여 인종 간 잘못 일치되는 차이를 줄입니다. SynThermFace는 추론 시 이미지 변환을 추가하지 않고도 희소한 가시-열 쌍을 더 큰 적응 세트로 전환합니다. 그 후 Celeb Twins Test Set은 오늘날의 임베딩이 일란성 쌍둥이를 구분하기 위해 인간이 의존하는 작은 국소 신호를 사용하는지 여부를 묻습니다.

이번 달이 보여주는 신호

DenseFace는 지역 임베딩 밀도를 사후 확률적 매칭 신호로 활용할 수 있음을 보여주며, 검증 정확성을 유지하면서 여러 비-백인 그룹의 오류 매칭률을 백인 기준에 훨씬 더 가깝게 가져옵니다. SynThermFace는 훈련 중에만 확산 모델을 사용하고, 이후 단일 적응된 EdgeFace 순전파를 배포합니다; 합성 쌍 모델은 MCXFace에서 0.99% EER을 달성하지만, 보지 못한 Tufts 데이터에서는 14.70%에 도달하여 센서 전이가 여전히 중요함을 보여줍니다. CTTS는 21,120개의 쌍둥이 중심 쌍을 제공하며, 12개의 최신 매처 변형이 일반 벤치마크 평균 약 97%임에도 불구하고 여전히 약 73-77% 정확도를 유지함을 발견했습니다. 공통 교훈은 매칭 규칙, 캡처 스펙트럼, 어려운 신원 집단을 별도로 검증해야 하며, 하나의 종합 점수를 생산 준비도로 간주해서는 안 된다는 점입니다.

논문 012026-09-14cs.CV

DenseFace: 밀도 인식 확률적 매칭을 통한 얼굴 인식의 편향 완화

저자 및 소속

Mansur Bultygov

VisionLabs

Vadim Seliutin

Amazon Web Services

VisionLabs (work performed there)

Dmitry Nekhaev

VisionLabs

Ivan Laptev

Mohamed bin Zayed University of Artificial Intelligence

해결하는 문제

DenseFace는 기반 얼굴 인코더를 변경하거나 재학습하지 않고 비교 시점에서 인종별 오매칭 차이를 줄일 수 있는지 여부를 묻습니다. 또한 하위 그룹 정확도 표준편차를 배포 지향 프로토콜로 대체합니다: 백인 오탐률을 0.001로 설정하고 다른 모든 집단이 균형에서 얼마나 이동하는지 측정합니다.

핵심 결과

Glint360K, MS1MV2, WebFace4M, WebFace12M, BUPT-BalancedFace로 훈련된 CosFace 및 AdaFace 모델 전반에서 동일한 글로벌 임계값이 상당히 균일해진다. BUPT 모델에서는 아프리카 그룹의 거짓 긍정 비율이 6.15에서 1.43으로, 인도 그룹은 4.01에서 1.03으로 백인 기준과 비교하여 떨어진다. 기존 검증 정확도는 유지된다: CosFace Glint360K 모델의 경우 RFW 평균 정확도는 98.61%에서 98.68%로 상승하고, 하위 그룹 표준 편차는 0.53에서 0.44로 감소한다. 회귀기는 저자들의 GPU 테스트에서 약 0.2% 메모리와 1.75% 엔드투엔드 지연을 추가하며, 최적화된 CPU 점수 계산은 원시 코사인 비용의 약 1.5배이다. 결과는 여전히 대표적인 앵커나 회귀기 훈련 집단에 의존한다.

초록

안면 인식에서 꾸준한 진전에도 불구하고, 현재의 안면 인식 모델은 여전히 상당한 인구통계학적 편향을 겪고 있습니다. 편향 완화 방법들이 제안되었지만, 기존의 방법들은 종종 학습 절차에 제약을 가하며 인식 정확도의 저하를 초래합니다. 이 문제를 해결하기 위해, 우리는 정확도를 손상시키지 않으면서 사전 학습된 안면 인식 모델에서 인종적 편향을 줄이는 방법을 소개합니다. 이를 위해, 우리는 각 사람의 얼굴 임베딩을 본 미세스-피셔(von Mises-Fisher, MF) 분포로 모델링합니다. 다음으로, 우리는 인구통계학적 속성과 MF 분포의 밀도 간의 의존성을 관찰하고, MF 분포의 차이를 고려하는 확률적 얼굴 매칭 절차인 DenseFace를 제안합니다. 우리의 광범위한 실험은 DenseFace가 네트워크 아키텍처, 학습 데이터셋 및 손실 함수가 다양한 강력한 안면 인식 모델에서 인종적 편향을 일관되게 줄임을 보여줍니다. 특히, DenseFace는 인식 정확도를 유지하며, 기본 안면 인식 모델의 재학습을 필요로 하지 않습니다. 또한, 우리의 연구는 이전에 사용된 편향 측정 방법을 조사하고 제안을 제공합니다.

연구 출발점

안면 인식 시스템은 종종 하나의 전역 결정 임계값을 사용하지만, 사기꾼 점수 분포는 인구 집단별로 다릅니다. 따라서 각 집단이 자체 교차 검증 임계값을 받을 때 모델은 RFW에서 정확해 보일 수 있지만 실제 서비스에서는 매우 다른 잘못된 일치율을 생성할 수 있습니다. 대부분의 완화 방법은 또한 균형 잡힌 재학습 데이터, 아키텍처 변경, 또는 인식 성능을 저하시킬 수 있는 공정성 손실을 필요로 하며, 승인된 모델에 나중에 적용하기 어렵습니다.

방법

각 얼굴 임베딩에 대해, 이 방법은 인구통계학적으로 균형 잡힌 앵커 세트에서 가장 가까운 아이덴티티를 찾고 지역 간 클래스 밀도를 추정합니다. 임베딩을 해당 밀도를 반영하는 집중도를 가진 본 마이시스-피셔(von Mises-Fisher) 분포로 나타내고, 원시 코사인 유사도 대신 상호 가능성(mutual likelihood)으로 쌍을 평가합니다. 경계(margin)는 근접 이웃 아이덴티티를 분리하며, 경량 회귀기 변형은 밀도를 직접 예측하므로 생산 환경에서 매칭할 때 큰 앵커 조회가 필요하지 않습니다. 인코더, 임베딩 차원, 등록 데이터는 변경되지 않습니다.

논문 요약

비교 계층 공정성 제어는 모델 훈련을 다시 열지 않고도 집단 균형을 향상시킬 수 있지만, 실제 운영 임계값에서 대표성 있는 보정 데이터와 하위 그룹 모니터링의 필요성을 제거하지는 않습니다.

논문 022026-09-09cs.CV

SynThermFace: 합성 데이터 생성을 통한 가시-열 얼굴 인식을 위한 제한된 페어 데이터 증폭

저자 및 소속

Anjith George

Idiap Research Institute, Switzerland

Adam Unal

Idiap Research Institute, Switzerland

Sebastien Marcel

Idiap Research Institute, Switzerland

University of Lausanne, Switzerland

해결하는 문제

SynThermFace는 가시-열 인식을 위해 제한된 페어 감독을 증폭하며, 합성 열 페어가 데이터베이스 내 정확성뿐 아니라 학습에 전혀 사용되지 않은 센서/데이터베이스로의 전이에도 향상을 주는지 테스트합니다. 이는 적응 목적의 이익과 합성 신원 확장의 이익을 분리합니다.

핵심 결과

단동적인 MCXFace 개발 구분에서 실제 쌍 PACT는 3.04% EER, 96.49% Rank-1에 도달하여 비교된 실제 쌍 적응 기준선을 능가합니다. 1,000개의 CASIA 기반 합성 식별자를 가진 EER(EER는 0.99%, Rank-1은 99.75%, 검증율은 0.1%, FAR는 93.48%에 도달합니다; 비적응 EdgeFace 기준선은 23.06%의 EER, 40.10%의 Rank-1을 기록합니다. 공개되지 않은 Tufts 데이터에 따르면, Digi2Real 기반 학습은 EdgeFace를 43.41%에서 13.91%로, 12.03%에서 56.37%의 Rank-1로 향상시켰습니다. 남은 MCXFace-투-터프츠 간 간극은 크고, 생성기는 여전히 실제 MCXFace 쌍에 의존하기 때문에 이 방법은 실제 교차 스펙트럼 수집을 없애기보다는 줄이는 데 효과적입니다.

초록

얼굴 인식(FR)은 생체 인증에 널리 사용되는 방식이지만, 기존 모델은 가시광 스펙트럼 이미지를 기반으로 하며, 고품질 RGB 이미지를 캡처할 수 없을 때 성능이 저하됩니다. 교차 스펙트럼 얼굴 인식은 가시 이미지를 열 이미지와 같은 다른 모달리티와 매칭함으로써 이 제한을 해결하여 저조도, 야간 및 제한 없는 조건에서도 보다 신뢰할 수 있는 성능을 가능하게 합니다. 그러나 진행은 페어 가시-열 데이터의 부족으로 제한되며, 이는 대규모로 수집하기 어렵고 비용이 많이 듭니다. 우리는 SynThermFace를 제안하는데, 이는 제한된 실제 가시-열 감독 데이터를 더욱 큰 페어 적응 데이터셋으로 증폭하여 교차 스펙트럼 얼굴 인식을 지원하는 프레임워크입니다. 먼저 확산 모델을 제한된 가시--열 이미지 세트로 적응시키고, 기존 실제 또는 합성 가시 얼굴 데이터셋에서 대규모 페어 가시--합성 열 데이터를 생성하는 데 사용합니다. 생성된 페어는 사전 학습된 가시 스펙트럼 얼굴 인식 모델을 CFR 모델로 적응시키는 데 사용됩니다. 테스트 시 이미지 변환을 요구하는 합성 기반 접근 방식과 달리, 제안된 방법은 생성 과정을 학습 단계로 이동시키며, 적응된 인식 모델을 통한 단일 전달만으로 추론을 수행합니다. 동일한 MCXFace 실제 페어 프로토콜 하에서, PACT는 평가된 CFR 적응 기준선을 능가하며 제안된 적응 목적의 효과를 분리합니다. 더 큰 생성된 페어 데이터셋에서 PACT를 훈련하면, 미적응 모델과 실제 페어 PACT 구성 모두에 비해 추가적인 향상을 제공합니다. Tufts 데이터셋에서의 교차 데이터베이스 평가를 통해, 학습된 표현이 미사용 데이터베이스로 이전되는 증거가 제시됩니다. 소스 코드와 학습된 모델은 공개될 예정입니다.

연구 출발점

열 카메라는 가시광 캡처가 실패할 때 인증 및 감시를 지원할 수 있지만 대부분의 신원 갤러리는 RGB이며, 페어 가시-열 얼굴은 수집 비용이 높습니다. 런타임에 모든 열 프로브를 직접 변환하면 핵심 경로에 생성기가 추가되고 신원이 변경될 수 있습니다. 실제적인 질문은 작은 실제 페어 세트가 훨씬 큰 학습 세트를 감독할 수 있는지, 배포는 정상적인 임베딩 조회로 유지할 수 있는지입니다.

방법

확산 생성기는 먼저 쌍으로 연결된 MCXFace 훈련 분할에 적응한 후, 실제 CASIA-WebFace 이미지 또는 합성된 Digi2Real 식별자를 일치하는 열 뷰로 변환합니다. 보존 인식 교차 스펙트럼 튜닝은 사전 학습된 EdgeFace 모델에서 출발하여 대칭적인 열-가시광선 및 가시-열-대비 학습을 결합하고, 가시광선 임베딩이 원본 모델의 동결된 복사본 근처에 머무르도록 손실을 둡니다. 생성은 적응 집합을 구축하는 동안에만 이루어집니다; 추론은 조율된 인식기를 한 번 순방향으로 통과하는 것입니다.

논문 요약

오프라인 합성 열 생성은 소규모 쌍 집합을 실행 시간 변환 없이도 유용한 인식 감독으로 전환할 수 있지만, 새로운 센서와 집단은 여전히 자체 전송 및 공정성 테스트가 필요합니다.

논문 032026-09-01cs.CV

일란성 쌍둥이 얼굴 인식 재검토: 셀럽 쌍둥이 테스트 세트

저자 및 소속

Michael Zang

Department of Computer Science and Engineering, University of Notre Dame

Haiyu Wu

Department of Computer Science and Engineering, University of Notre Dame

Mrinal Sharma

Department of Computer Science and Engineering, University of Notre Dame

Kevin W. Bowyer

Department of Computer Science and Engineering, University of Notre Dame

해결하는 문제

이 논문은 쌍동-불순 교차 검증에 충분히 큰 검증 스타일 벤치마크를 만들고, 국소적 구별 표시와 가능한 미러 비대칭에 대해 주석을 달았습니다. 그 후 현대 딥 페이스 매커가 이러한 단서를 활용하는지, 수평 뒤집기 가정을 제거하거나 합성 쌍둥이를 생성하는 것이 그럴듯한 향후 방향을 제시하는지 테스트합니다.

핵심 결과

12개의 매처 구성은 평균 CTTS 정확도가 73.14%에서 76.50%에 불과하며, 다섯 개의 기존 검증 세트에서 평균 약 97.00%에서 97.69%에 비해 높습니다. 가시적 표시를 지워도 임베딩과 쌍거리 분포는 사실상 변하지 않으며, 이는 현재 모델이 인간이 사용할 수 있는 단서를 무시함을 나타냅니다. 비대칭 인지 재학습은 78.58%의 ± 3.7에 도달하며 원래 모델과 통계적으로 차이가 없습니다; 일부 미러 쌍둥이 집합에는 도움이 되고 다른 집합에는 불리합니다. 생성된 쌍둥이는 실제 인물 및 쌍둥이 간 거리 구조를 유지하지 않아 아직 검증된 훈련 대체물이 아닙니다.

초록

과거 일란성 쌍둥이 얼굴 인식에 관한 문헌들은 쌍둥이 인식 정확도 향상을 위해 얼굴 표식과 거울 비대칭을 지적했습니다. 셀럽 쌍둥이 테스트 세트(CTTS)는 80쌍의 유명인 쌍둥이 이미지 세트를 웹으로 긁어 수집한 것입니다. 이 쌍둥이 테스트 세트는 피부 마크와 거울 비대칭이 있을 수 있는 쌍둥이에 대한 메타데이터를 가진 유일한 쌍둥이 테스트 세트입니다. CTTS는 LFW, CALFW, CPLFW, CFP-FP, AGEDB-30과 같은 얼굴 검증 테스트 세트 방식으로 구성되어 있습니다. [EOS]현재 딥 CNN 매처는 CTTS 동일인/다른 사람 이미지 쌍을 분류하는 데 76% 이상의 정확도를 달성할 수 있습니다. [EOS]현재 매처들이 피부 표시나 비대칭을 사용하지 않는다는 점을 보여주며, 그 이유를 논의합니다. 마지막으로, Grok, ChatGPT, Gemini와 같은 생성형 AI 도구를 활용해 상상 속 일이성 쌍둥이 이미지를 생성하는 것이 얼굴 인식 훈련 세트에서 쌍둥이 표현력을 높이는 방법의 실현 가능성에 대해 논의합니다.

연구 출발점

일란성 쌍둥이는 일반 얼굴 벤치마크가 거의 나타내지 못하는 정체성 경계를 노출시킨다. NIST는 이전에 0.0001의 비쌍둥이 오매치 기준에서 많은 알고리즘이 98-99%의 확률로 한 쌍둥이를 다른 쌍둥이로 받아들인다고 보고했다. 기존의 쌍둥이 데이터셋은 작거나 오래되었거나 주근깨, 점, 흉터, 거울 쌍둥이 상태에 관한 메타데이터가 부족해 현대 임베딩이 실제로 어떤 단서를 사용하는지 파악하기 어렵다.

방법

CTTS-80은 80개의 유명인 쌍둥이 세트에 대한 웹 이미지를 수집하고, 10개의 쌍 중 21,120개의 균형 잡힌 동일 인물 및 쌍둥이 사기꾼 쌍을 구성하여 각 쌍둥이 세트를 한 가지 접드 내에 완전히 유지합니다. 저자들은 세 가지 공통 데이터셋으로 학습된 ArcFace, AdaFace, UniFace, MagFace ResNet-100 모델을 평가합니다. 선택된 정체성에서 보이는 피부 자국을 지우고, 원본과 편집된 임베딩 분포를 비교하며, 수평 뒤집기 증강 없이 ArcFace를 재학습하고, 세 가지 생성 시스템에서 요청한 합성 쌍둥이 세트를 검사합니다.

논문 요약

쌍열 검증은 여전히 뚜렷한 위험 등급으로 남아 있습니다: 표준 정확도만으로는 이를 알려주지 않고, 오늘날의 임베딩은 명확한 로컬 마크를 사용하지 않는 것으로 보입니다. 고보증 배포는 일반적인 벤치마크에서 성능을 추론하기보다는 쌍둥이 사기꾼을 명시적으로 테스트해야 합니다.