저자 및 소속
Sebastian Regalado
University of Toronto, Canada
ModiFace, Canada
Varshanth R. Rao
ModiFace, Canada
Ruowei Jiang
ModiFace, Canada
Parham Aarabi
University of Toronto, Canada
Igor Gilitschenski
University of Toronto, Canada
해결하는 문제
이 논문은 이질적인 랜드마크 레이아웃을 위한 공통 의미 좌표계를 정의하고, 이를 사용해 여러 데이터셋에서 하나의 탐지기를 학습합니다. 추론 시, 동일한 네트워크는 소스 데이터셋 학습 동안 명시적으로 요청되지 않은 포인트를 포함하여 임의의 랜드마크 쿼리 집합에 응답할 수 있습니다.
핵심 결과
어댑터가 적용된 통합 ViT-B 모델은 WFLW에서 4.02 NME와 2.19% 실패율을 기록하며, 300W 공통/도전(split)에서는 2.43/4.19 NME, AFLW-19에서는 2.76 NME를 기록하면서 융합 학습과 동적 출력을 지원합니다. 300W만 학습할 경우, 도전적인 WFLW68 전이 테스트에서 6.08 NME에 도달하며, 이는 DTLD의 7.23과 PIPNet의 8.09보다 낮습니다. 격리된 고유 랜드마크에서 학습된 쿼리는 스플라인 보간 대비 300W에서 19.0%, WFLW split에서 15.7-16.3% 향상되어, 모델이 단순히 고정된 인덱스를 암기하는 것이 아니라 재사용 가능한 윤곽 의미를 학습함을 나타냅니다.
초록
얼굴 랜드마크 탐지(FLD) 방법의 발전은 성능 한계를 계속 확장하고 있지만, 두 가지 주요 기능적 한계를 간과합니다: (1) 각 '$N$-포인트' 벤치마크 데이터셋마다 서로 다른 네트워크 매개변수를 독립적으로 학습해야 한다는 점, (2) '$N$-포인트' 데이터셋에서 학습된 모델이 신뢰성 있게 $N$ 랜드마크만 출력합니다. 저희 연구에서는 먼저 Face Part-Anchored Landmark Positions(FPALP)를 개념화하는데, 각 랜드마크를 얼굴 부분 윤곽선을 따라 0(시작)에서 1(끝)까지의 진행 값으로 취급합니다. 모든 랜드마크는 출처 데이터셋과 관계없이 FPALP 형식으로 표현할 수 있어, 모든 '$N$-포인트' 데이터셋을 단일 데이터셋으로 통합할 수 있습니다. 둘째, 각 랜드마크를 FPALP 기반 쿼리로 표현하고, 교차 모달리티 디코더로 점진적으로 다듬으며, 최종 표현을 바탕으로 좌표를 예측합니다. 우리의 접근법인 Unified Dynamic FLD는 이 두 가지 설계 선택을 구현하며, (1) 단일 모델이 원하는 수의 '$N$-포인트' 데이터셋에서 학습할 수 있고, (2) 지정된 랜드마크 쿼리를 런타임에 불러와 특정 랜드마크 예측을 생성할 수 있게 하여 랜드마크 탐지 파이프라인을 간소화합니다. 여러 벤치마크 데이터셋에 대한 광범위한 실험 결과, 우리의 방법은 이러한 이점을 제공하면서도 기존 최첨단 방법들과 경쟁력을 유지하거나 여러 경우에는 더 뛰어난 성능을 유지함을 보여줍니다.
연구 출발점
얼굴 랜드마크 데이터셋은 얼굴에 19, 68, 98 또는 다른 수의 주석 포인트가 있는지 여부에 대해 일치하지 않습니다. 기존 모델은 회귀 헤드를 하나의 템플릿에 고정하여, 각 데이터셋마다 별도의 파라미터를 학습하고 유지해야 하며, 배포된 모델이 요청에 따라 새로운 하위 집합이나 더 촘촘한 레이아웃을 반환하는 것을 방지합니다. 이러한 단편화는 서로 다른 랜드마크 규칙을 사용하는 정렬, 재구성, 화장 및 표정 파이프라인에 비용이 많이 듭니다.
방법
각 랜드마크는 얼굴 부위 기준 랜드마크 위치(FPALP)가 됩니다: 눈썹, 눈, 코, 입 또는 얼굴 경계와 같은 의미적 윤곽선을 따라 0에서 1까지 정규화된 진행입니다. 데이터셋 템플릿은 이 윤곽 공간에서 정렬되며, 요청된 모든 포인트는 FPALP 쿼리로 인코딩됩니다. 교차 모달 디코더는 좌표를 회귀하기 전에 이미지 토큰과 쿼리를 점진적으로 결합합니다. ViT-B 모델은 AFLW-19, 300W, WFLW에서 공동 학습되며; 선택적 경량 데이터셋 어댑터는 통합 백본이나 런타임 설정 출력 레이아웃을 포기하지 않고 체계적인 주석 오프셋을 복원합니다.
논문 요약
단일 쿼리 기반 랜드마크 서비스는 경쟁력 있는 정확도를 유지하면서 템플릿별 여러 모델을 대체할 수 있습니다. 이 접근법은 특히 제품이 여러 정렬 형식을 필요로 하거나 새로운 랜드마크 정의를 추가할 것으로 예상될 때 매력적이지만, 팀은 여전히 각 생산 데이터셋에 대해 주석 오프셋 어댑터를 테스트해야 합니다.