저자 및 소속
Shun Ren
College of Computer and Information Technology, China Three Gorges University
Kaijie Jin
College of Computer and Information Technology, China Three Gorges University
Shengkai Hu
School of Information Engineering, Zhongnan University of Economics and Law
Beihang Song
National Institute of Natural Hazards, Ministry of Emergency Management of China
Hang Sun
College of Computer and Information Technology, China Three Gorges University
Wenwen Min
School of Information Science and Engineering, Yunnan University
Youfa Liu
School of Computer Science, Wuhan University
Jun Wan
School of Information Engineering, Zhongnan University of Economics and Law
School of Computer Science and Engineering, Nanyang Technological University
해결하는 문제
FreqFLD는 300W, AFLW, COFW, WFLW에서 공동 학습이 가능한 하나의 올인원 랜드마크 검출기를 목표로 하며, 각 벤치마크에서 경쟁력을 유지하고 어려운 하위 집합에서도 견고함을 유지합니다. 이 논문은 명시적 주파수 선험이 전문가 전문화를 무제한 전문가 혼합 라우팅보다 더 신뢰성 있게 안내할 수 있는지 묻습니다.
핵심 결과
통합 모델은 300W 공통에서 2.72 NME, 300W 챌린지에서 4.52, WFLW 테스트 세트에서 4.50에 도달합니다; WFLW 자세, 조명, 가림, 흐림 하위 집합은 7.54, 4.55, 5.53, 5.15 점수를 받았습니다. 심하게 차단된 COFW에서는 4.80 NME와 0.39%의 실패율을 보고합니다. 전체 주파수 모듈과 라우팅 손실은 300W 난이도의 기준선을 4.71에서 4.52로 개선했으며, 네 가지 훈련 데이터셋을 모두 추가하면 단일 데이터셋 4.97 결과가 4.52로 향상되었습니다. 성능은 일관된 최고가 아니라 경쟁력 있는 편이며, AFLW에서는 1.69 NME를 기록했는데, 이는 이전 전문 방법들이 오차가 더 적은 결과를 보고하는 경우입니다.
초록
최근 딥러닝의 발전은 얼굴 랜드마크 검출을 크게 향상시켰습니다. 그러나 기존의 대부분 방법들은 데이터셋 특정 학습 패러다임 하에서 공간 영역 방식으로 특징을 처리하기 때문에, 얼굴 랜드마크 검출이 본질적으로 기하학적이고 주파수 변화에 민감하다는 사실을 간과하게 됩니다. 이는 복잡한 시나리오에서 데이터셋 간 일반화를 제한하고 얼굴 랜드마크 검출 모델의 개발을 저해합니다. 이 문제를 해결하기 위해, 우리는 All-in-One 얼굴 랜드마크 검출을 위한 주파수 조절 프레임워크인 extbf{FreqFLD}를 제안합니다. 구체적으로, FreqFLD는 저주파와 고주파 성분을 분리하고 조절함으로써 주파수 사전 정보를 명시적으로 유도하는 주파수 조절 모듈(FreqMoM)을 도입하며, 이후 특징 모델링에 주입하여 글로벌 얼굴 구조와 지역 랜드마크 세부 정보의 균형 잡힌 모델링을 가능하게 합니다. 또한, FreqFLD는 주파수 조절 사전에 따라 전문가 선택이 적응적으로 이루어지는 주파수 조절 전문가 혼합(FreqMoE)을 사용하여, 다양한 도전적인 시나리오에서 이질적인 얼굴 랜드마크 패턴을 유연하게 모델링할 수 있도록 합니다. All-in-One 패러다임에서 주파수 일관 모델링을 규제하기 위해, 우리는 주파수를 인식하는 전문가의 라우팅과 할당을 제한하여 다양한 얼굴 시나리오에서 전문가 활용의 균형을 촉진하는 주파수 일관 라우팅(FreqCR) 손실을 추가로 도입합니다. 이를 통해 안정적인 전문가 특화가 가능해지고, 강인한 얼굴 랜드마크 검출을 달성할 수 있습니다. 다양한 실험 결과, 제안된 FreqFLD는 인기 있는 데이터셋에서 비교 가능한 성능을 달성함을 보여줍니다. 코드 관련 정보는 다음에서 확인할 수 있습니다: https://github.com/jkj1059657014/FreqFLD.
연구 출발점
얼굴 랜드마크 모델은 실제 입력이 랜드마크 규약, 포즈, 가림, 블러, 조명을 혼합하더라도 일반적으로 데이터셋별로 학습됩니다. 순수한 공간적 특징은 하나의 주석 체계에 과적합될 수 있으며, 저주파 얼굴 구조와 고주파 랜드마크 세부사항 간의 구분을 놓칠 수 있습니다. 통합 모델은 또한 모든 기하 구조와 이미지 품질 체계를 하나의 전문가가 처리해야 할 때 라우팅 충돌을 발생시킵니다.
방법
주파수 변조 모듈은 특징을 저주파와 고주파 구성 요소로 분해하고, 각각 모델링한 후 결과 사전을 하위 계층에 주입합니다. 주파수 변조 전문가들이 이를 사용하여 이질적인 얼굴 패턴을 라우팅하며, 주파수-일관된 라우팅 손실은 활용도를 균형 있게 조정하고 안정적인 전문화를 촉진합니다. 공동 훈련은 네 개의 소스 데이터셋을 각각 20,000개의 샘플로 평등화하여 각 데이터셋의 네이티브 랜드마크 및 정규화 프로토콜로 평가하는 80,000장의 이미지 학습 풀을 생성합니다.
논문 요약
주파수 인식 라우팅은 여러 랜드마크 모델을 하나로 통합하는 데 설득력 있는 근거를 제공하지만, 통합 훈련만으로는 모든 개별 벤치마크를 모두 이기지 못하므로 각 카메라별 오차와 랜드마크 스킴별 오차를 비교해야 합니다.