저자 및 소속
Luis S. Luevano
Idiap Research Institute, Switzerland
Ünsal Öztürk
Idiap Research Institute, Switzerland
Hatef Otroshi Shahreza
Idiap Research Institute, Switzerland
Anjith George
Idiap Research Institute, Switzerland
Sébastien Marcel
Idiap Research Institute, Switzerland
해결하는 문제
본 연구는 라벨이 지정된 원본 데이터가 제한된 경우, 어떤 합성 저해상도 전략이 실제로 컴팩트 얼굴 인식기에 도움이 되는지, 그리고 인위적으로 다운샘플링한 LFW 스타일 테스트에서 도출된 결론이 실제 TinyFace 탐지 이미지에서도 유효한지를 질문한다. 또한 직접 입력 기준선을 설정하여, 초해상도 및 변환 모듈이 단순히 시각적 외관을 개선하는 것이 아니라 신원을 보존함을 증명해야 한다.
핵심 결과
합성 테스트에서는 28픽셀 열화를 선호했으나, 같은 설정은 실제 TinyFace에서 고해상도 학습 기준선보다 낮았습니다. 더 온화한 56픽셀 보간 증강이 가장 컴팩트한 구성으로, TinyFace mAP를 52.55에서 54.68로, 랭크-1 식별률을 59.66%에서 61.40%로 올렸습니다. 학습된 RRDB 초해상도 및 도메인 변환 파이프라인은 EdgeFace 기반에서 57.53 mAP에 불과했으며, 직접 입력은 65.12mAP였습니다. 지식 추출이 가장 큰 합성 성능 향상을 제공했으나 네이티브 저해상도로 전환되지 않아 합성 정밀도가 한계 요인임을 보여줍니다.
초록
감시 환경에서 얼굴 인식(FR) 시스템은 종종 저해상도(LR) 얼굴, 즉 얼굴 영역이 표준 112 $\times$ 112 입력 크기 미만인 얼굴을 마주칩니다. 라벨링된 고해상도(HR) 학습 데이터는 풍부하지만, 라벨링된 네이티브 LR 데이터와 무엇보다 쌍으로 연결된 네이티브 LR/HR 데이터는 드물다. 한 가지 우회 방법은 사용 가능한 HR 얼굴에서 LR 데이터를 합성하는 것이지만, 합성 노력이 인식 정확도에 얼마나 보상받는지는 불분명하다. 우리는 보간 기반 저하, 지식 증류, Prepended 도메인 트랜스포머(PDT), Real ESRGAN 스타일 저하, 그리고 식별 인식 손실이 있는 학습된 슈퍼 해상도(SR) 프론트엔드를 아우르는 컴팩트하고 엣지 디바이스 지향의 얼굴 인식 시스템을 위한 간단한 합성 생성 전략 연구를 제시한다. 우리는 합성 교차해상도 얼굴 벤치마크(LFW, CFP-FP, AgeDB-30)와 실제 네이티브 LR 데이터셋인 TinyFace에서 이러한 전략을 평가하며, 합성-실물 간의 격차를 드러냈습니다: 합성 벤치마크에서 최적의 열화 설정이 실제 LR에서는 최적이 아닌 것. 더 많은 합성 노력은 단조적으로 도움이 되지 않는다는 것을 발견했습니다: 학습된 SR 프론트엔드는 정렬된 LR 이미지를 강한 백본으로 직접 피드하는 것보다 더 크지 않고, 콤팩트 백본의 단순 보간 증강만이 자체 기준선 이상으로 개선되는 합성입니다. 우리는 LR 얼굴 인식을 위한 생성 방법은 실제 LR과 직접 피드 기준선에서 검증되어야 한다고 결론지어 파이프라인을 https://idiap.ch/paper/synth-lrfr 공개합니다
연구 출발점
감시 및 관심 인물 목록 시스템은 일반적으로 고품질 등록 이미지와 정렬된 얼굴이 표준 112 x 112 입력보다 훨씬 작은 탐지 이미지를 비교한다. 원래 저해상도 신원 데이터, 특히 동일 인물의 저해상도와 고해상도 캡처 쌍 자료는 희귀하므로, 연구팀들은 풍부한 고해상도 얼굴 이미지로부터 저해상도 학습 데이터를 일반적으로 제작한다. 실제 위험은 저하 처리 레시피가 합성 벤치마크에서 좋은 점수를 받을 수 있지만, 실제 카메라에서 발생하는 블러, 노이즈, 압축 및 정렬 오류와는 다른 단서를 인식기에 학습시킬 수 있다는 점이다.
방법
저자들은 3.65백만 매개변수 EdgeFace-S 백본을 사용하고 다섯 수준의 적응 노력을 비교한다: 보간 기반 다운샘플-업샘플 증강, 고해상도 교사 지식 증류, 선행 도메인 변환기, Real-ESRGAN 스타일 열화로 학습된 원본 32픽셀 스템, 신원 인식 기반 학습 초해상도 프론트 엔드. 그들은 LFW, CFP-FP, AgeDB-30에서 고->저 및 저->저 검증을 평가하고, 두 가지 정렬 파이프라인에서 원본 저해상도 TinyFace로 동일 비교를 반복한다. 더 큰 고정된 EdgeFace-base 모델은 생성 프론트 엔드가 정렬된 탐지 이미지를 강력한 인식기에 직접 입력하는 것보다 뛰어난지를 테스트하기 위한 기준을 제공한다.
논문 요약
엣지 또는 감시 배포의 경우, 모든 저해상도 레시피를 실제로 캡처된 저해상도 얼굴에 검증하고 강력한 직접 피드 기준선을 유지하세요. 간단하고 온건한 보간 증강이 초해상도 스택보다 더 나은 투자일 수 있습니다; 공격적인 해상도에서 합성 효과만 얻는 것은 현장 성능을 신뢰성 있게 입증하지 못합니다.