← 블로그로 돌아가기
연구 레이더얼굴 인식얼굴 지형 지물arXiv2026년 9월

월간 arXiv 레이더

2026년 9월 얼굴 탐지 논문: 통합 랜드마크, 확산 정렬, 교실 배치

9월에는 직접 페이스박스 종이가 드물었기에, 이 요약은 박스를 찾은 후 생산 시스템이 필요로 하는 인접 위치 스택을 따라갑니다. FreqFLD는 4개 데이터셋에서 하나의 주파수 인식 랜드마크 모델을 훈련시킵니다. FAHCD-Net은 랜드마크 히트맵을 포즈, 오클루전, 흐림, 조명 변화에 따른 조건부 노이즈 제거 문제로 취급합니다. Visage 연구는 혼잡한 교실 이미지에서 탐지와 인식을 다시 결합시켰으며, 처리량과 누락된 얼굴이 탑라인 정체성 정확도만큼 중요합니다.

이번 달이 보여주는 신호

FreqFLD는 주파수 성분을 분할하고 주파수 조건화된 전문가를 통해 샘플을 라우팅함으로써 글로벌 구조와 로컬 디테일의 균형을 맞춘다. 하나의 공동 학습 모델은 WFLW에서 4.50 NME를, 가려진 COFW에서는 0.39% 실패율로 4.80 NME를 달성한다. 대신 FAHCD-Net은 조건부 확산 단계를 연속적으로 적용하고 중복된 고주파 히트맵 노이즈를 억제하여, stage one에서 4.48이었던 300W 챌린징 세트 NME를 stage three에서는 4.29로 줄인다. Visage 연구에 따르면, 320만 파라미터의 YOLOv8n은 0.935 mAP@0.5를 달성하는 반면, 훨씬 더 큰 탐지기는 상당한 파라미터 비용을 들여 정확도를 높인다. 몇몇 인식기는 100-클래스 인식 세트에서 99.75% Top-1을 달성한다. 이러한 결과는 유망하지만, 두 개의 주요 논문은 여전히 벤치마크 연구이며, 학습 데이터는 제한된 기관 환경에서 나온 것이므로 크로스 카메라 검증이 여전히 필요하다.

논문 012026-09-09cs.CV

FreqFLD: 주파수 변조를 통한 올인원 얼굴 랜드마크 검출을 향하여

저자 및 소속

Shun Ren

College of Computer and Information Technology, China Three Gorges University

Kaijie Jin

College of Computer and Information Technology, China Three Gorges University

Shengkai Hu

School of Information Engineering, Zhongnan University of Economics and Law

Beihang Song

National Institute of Natural Hazards, Ministry of Emergency Management of China

Hang Sun

College of Computer and Information Technology, China Three Gorges University

Wenwen Min

School of Information Science and Engineering, Yunnan University

Youfa Liu

School of Computer Science, Wuhan University

Jun Wan

School of Information Engineering, Zhongnan University of Economics and Law

School of Computer Science and Engineering, Nanyang Technological University

해결하는 문제

FreqFLD는 300W, AFLW, COFW, WFLW에서 공동 학습이 가능한 하나의 올인원 랜드마크 검출기를 목표로 하며, 각 벤치마크에서 경쟁력을 유지하고 어려운 하위 집합에서도 견고함을 유지합니다. 이 논문은 명시적 주파수 선험이 전문가 전문화를 무제한 전문가 혼합 라우팅보다 더 신뢰성 있게 안내할 수 있는지 묻습니다.

핵심 결과

통합 모델은 300W 공통에서 2.72 NME, 300W 챌린지에서 4.52, WFLW 테스트 세트에서 4.50에 도달합니다; WFLW 자세, 조명, 가림, 흐림 하위 집합은 7.54, 4.55, 5.53, 5.15 점수를 받았습니다. 심하게 차단된 COFW에서는 4.80 NME와 0.39%의 실패율을 보고합니다. 전체 주파수 모듈과 라우팅 손실은 300W 난이도의 기준선을 4.71에서 4.52로 개선했으며, 네 가지 훈련 데이터셋을 모두 추가하면 단일 데이터셋 4.97 결과가 4.52로 향상되었습니다. 성능은 일관된 최고가 아니라 경쟁력 있는 편이며, AFLW에서는 1.69 NME를 기록했는데, 이는 이전 전문 방법들이 오차가 더 적은 결과를 보고하는 경우입니다.

초록

최근 딥러닝의 발전은 얼굴 랜드마크 검출을 크게 향상시켰습니다. 그러나 기존의 대부분 방법들은 데이터셋 특정 학습 패러다임 하에서 공간 영역 방식으로 특징을 처리하기 때문에, 얼굴 랜드마크 검출이 본질적으로 기하학적이고 주파수 변화에 민감하다는 사실을 간과하게 됩니다. 이는 복잡한 시나리오에서 데이터셋 간 일반화를 제한하고 얼굴 랜드마크 검출 모델의 개발을 저해합니다. 이 문제를 해결하기 위해, 우리는 All-in-One 얼굴 랜드마크 검출을 위한 주파수 조절 프레임워크인 extbf{FreqFLD}를 제안합니다. 구체적으로, FreqFLD는 저주파와 고주파 성분을 분리하고 조절함으로써 주파수 사전 정보를 명시적으로 유도하는 주파수 조절 모듈(FreqMoM)을 도입하며, 이후 특징 모델링에 주입하여 글로벌 얼굴 구조와 지역 랜드마크 세부 정보의 균형 잡힌 모델링을 가능하게 합니다. 또한, FreqFLD는 주파수 조절 사전에 따라 전문가 선택이 적응적으로 이루어지는 주파수 조절 전문가 혼합(FreqMoE)을 사용하여, 다양한 도전적인 시나리오에서 이질적인 얼굴 랜드마크 패턴을 유연하게 모델링할 수 있도록 합니다. All-in-One 패러다임에서 주파수 일관 모델링을 규제하기 위해, 우리는 주파수를 인식하는 전문가의 라우팅과 할당을 제한하여 다양한 얼굴 시나리오에서 전문가 활용의 균형을 촉진하는 주파수 일관 라우팅(FreqCR) 손실을 추가로 도입합니다. 이를 통해 안정적인 전문가 특화가 가능해지고, 강인한 얼굴 랜드마크 검출을 달성할 수 있습니다. 다양한 실험 결과, 제안된 FreqFLD는 인기 있는 데이터셋에서 비교 가능한 성능을 달성함을 보여줍니다. 코드 관련 정보는 다음에서 확인할 수 있습니다: https://github.com/jkj1059657014/FreqFLD.

연구 출발점

얼굴 랜드마크 모델은 실제 입력이 랜드마크 규약, 포즈, 가림, 블러, 조명을 혼합하더라도 일반적으로 데이터셋별로 학습됩니다. 순수한 공간적 특징은 하나의 주석 체계에 과적합될 수 있으며, 저주파 얼굴 구조와 고주파 랜드마크 세부사항 간의 구분을 놓칠 수 있습니다. 통합 모델은 또한 모든 기하 구조와 이미지 품질 체계를 하나의 전문가가 처리해야 할 때 라우팅 충돌을 발생시킵니다.

방법

주파수 변조 모듈은 특징을 저주파와 고주파 구성 요소로 분해하고, 각각 모델링한 후 결과 사전을 하위 계층에 주입합니다. 주파수 변조 전문가들이 이를 사용하여 이질적인 얼굴 패턴을 라우팅하며, 주파수-일관된 라우팅 손실은 활용도를 균형 있게 조정하고 안정적인 전문화를 촉진합니다. 공동 훈련은 네 개의 소스 데이터셋을 각각 20,000개의 샘플로 평등화하여 각 데이터셋의 네이티브 랜드마크 및 정규화 프로토콜로 평가하는 80,000장의 이미지 학습 풀을 생성합니다.

논문 요약

주파수 인식 라우팅은 여러 랜드마크 모델을 하나로 통합하는 데 설득력 있는 근거를 제공하지만, 통합 훈련만으로는 모든 개별 벤치마크를 모두 이기지 못하므로 각 카메라별 오차와 랜드마크 스킴별 오차를 비교해야 합니다.

논문 022026-09-15cs.CV

FAHCD-Net: 견고한 얼굴 랜드마크 탐지를 위한 주파수 적응형 히트맵-조건부 확산 네트워크

저자 및 소속

Jun Wan

School of Information Engineering, Zhongnan University of Economics and Law

Jiwei Hu

School of Information Engineering, Zhongnan University of Economics and Law

Shengkai Hu

School of Information Engineering, Zhongnan University of Economics and Law

Qilu Zhu

School of Information Engineering, Zhongnan University of Economics and Law

해결하는 문제

FAHCD-Net은 포즈, 가림, 조명 및 블러 상황에서 견고한 랜드마크 위치를 찾기 위해, 히트맵 조건 확산 과정을 명시적으로 주파수 인식하게 만듭니다. 또한 고품질 탐지기가 생성한 시작 히트맵에 의존하는 대신, 초기 평균 형태 조건을 점진적으로 개선할 수 있는지 테스트합니다.

핵심 결과

FAHCD-Net은 300W 공통 환경에서 2.51 NME, 전체 세트에서 2.99, AFLW 전면 1.17, AFLW 전면 2.08을 보고합니다. 300W Challousing에서는 연속적인 확산 단계가 NME를 4.48에서 4.33, 그리고 4.29로 감소시키며, 이는 평균 형태 조건 시 4.81, 4.73, 4.69와 비교됩니다. COFW, WFLW, AFLW 훈련 데이터를 추가하면 다중 데이터셋 소작에서 보고된 300W 도전 결과가 4.76에서 4.49로 향상되었습니다. 논문은 벤치마크 견고성을 보여주지만 검출기와 랜드마크 지연 시간을 보고하지 않아 반복 확산 비용은 여전히 배포 시 의문으로 남아 있습니다.

초록

얼굴 랜드마크 탐지(FLD)는 다양한 응용 분야에서 중요한 과제이며 최근 몇 년간 상당한 발전을 이루었습니다. 그러나 현재 FLD 방법은 얼굴 구조 변화, 정보 손실, 노이즈 간섭이 학습된 얼굴 특징의 무결성과 정확성을 심각하게 저해하는 어려운 조건에서 여전히 어려움을 겪고 있습니다. 이러한 문제를 해결하기 위해, 우리는 주파수 적응형 히트맵-조건부 확산 네트워크(FAHCD-Net)를 제안하는데, 이는 주파수 적응형 히트맵-조건부 확산(FAHCD) 모델과 매끄러운 정규화(SR) 손실을 연쇄 프레임워크 내에서 통합한 것입니다. 구체적으로, FAHCD 모델은 다층 주파수 분해와 적응적 재구성을 통해 중복 고주파 잡음을 억제하여 필수 얼굴 구조를 보존하도록 설계된 계층적 주파수 적응(HFA) 모듈을 포함하고 있습니다. 또한, SR 손실은 고주파 잡음의 간섭을 더욱 완화하고 생성된 랜드마크 히트맵의 부드럽음을 향상시키기 위해 제안됩니다. FAHCD 모델에 SR 손실을 연쇄적으로 적용함으로써, FAHCD-Net은 데이터의 통계적 및 주파수 기반 분포 특성을 효과적으로 활용하여 노이즈 입력에서 점진적으로 더 정확한 랜드마크 히트맵을 생성합니다. 인기 있는 벤치마크에서의 광범위한 실험은 제안된 방법의 효과성과 견고성을 입증하며, 도전적인 시나리오에서 FLD 작업에서 최첨단 성능을 달성했습니다. 소스 코드는 https://github.com/HJWKryptonite/FAHCD-Net 에서 확인할 수 있습니다.

연구 출발점

랜드마크 히트맵은 얼굴 구조가 포즈나 표정 변화로 변하거나, 가림으로 증거가 제거되거나, 블러 또는 조명으로 고주파 잡음이 생길 때 악화됩니다. 표준 회귀는 이러한 효과를 직접적인 예측 오류로 처리합니다. 확산(diffusion)은 노이즈가 있거나 불완전한 증거로부터 반복적인 복구를 제공합니다. 그러나 제약 없는 노이즈 제거는 오히려 잘못된 고주파 히트맵 에너지와 불안정한 피크를 생성할 수 있습니다.

방법

각 캐스케이드 단계는 주파수 적응 히트맵 조건 확산 모델(Frequency-Adaptive Heatmap-Conditional Diffusion)을 사용하여 랜드마크 분포를 정제합니다. 계층적 주파수 적응(Hierarchical Frequency Adaptation)은 특징을 반복적으로 분해하고 재구성하여, 저주파 얼굴 구조는 유지하면서 중복되는 고주파 잡음을 억제합니다. 평활화 규제항(smoothness regularization term)은 생성된 히트맵 주파수 행동을 실제 값과 정렬합니다. 다중 데이터셋 훈련은 300W에 COFW, WFLW 및 AFLW를 추가하고, 세 단계는 예측한 히트맵을 다음 조건으로 전달합니다.

논문 요약

조건부 확산은 어려운 영상에서도 더 깨끗한 랜드마크 히트맵을 복원할 수 있지만, 반복 비용은 카메라의 지연 시간 예산과 강력한 비확산 정렬 기준선을 기준으로 측정해야 합니다.

논문 032026-09-19cs.CV

강건한 교실 출석 관리를 향하여: 얼굴 검출 및 인식 모델의 종합 평가

저자 및 소속

Himani Trivedi

Computer Engineering Department, LDRP Institute of Technology and Research, Kadi Sarva Vishwavidyalaya

Hiren Patel

Vidush Somany Institute of Technology and Research, Kadi Sarva Vishwavidyalaya

Ridham Patel

Information Technology Department, LDRP Institute of Technology and Research, Kadi Sarva Vishwavidyalaya

Krutika Patel

Information Technology Department, LDRP Institute of Technology and Research, Kadi Sarva Vishwavidyalaya

Nancy Patel

Information Technology Department, LDRP Institute of Technology and Research, Kadi Sarva Vishwavidyalaya

해결하는 문제

이 연구는 교실 환경을 위한 쌍으로 된 검출 및 인식 데이터셋을 소개하고, 다양한 크기의 검출기들과 7가지 최신 얼굴 인식 아키텍처를 비교합니다. 목표는 가장 큰 검출기나 인식기를 사용하는 것이 최적이라고 가정하는 것이 아니라, 실용적인 정확도-효율성 운영 지점을 식별하는 것입니다.

핵심 결과

YOLOv8n은 320만 개의 파라미터를 사용하며 0.932 정밀도, 0.886 재현율, 0.91 F1, 0.935 mAP@0.5에 도달합니다; 더 큰 변형은 약 0.97 mAP@0.5에 접근하지만 4,370만에서 6,820만 개의 파라미터를 사용합니다. 인식에서는 FaceLiVTv2-L, EdgeFace Base, LVFace ViT-B, TransFace ViT-B이 각각 보고된 표에서 99.75% Top-1에 도달합니다. EdgeFace Base는 4.029ms에 도달하여 FaceLiVTv2-L 6.081ms보다 빠르며, 모델 크기는 크게 다릅니다. 이는 제한된 교육 기관 세트에서의 폐쇄형 세트 결과이므로 스푸핑 저항성, 학교 간 일반화, 자동 출석 정책 적합성을 확립하지 않습니다.

초록

종이 또는 등록기 기반 수동 출석 방법은 시간이 많이 걸리고 오류가 발생할 수 있으며 조작이 쉽습니다. 얼굴 인식은 더 신뢰할 수 있지만, 조명 및 기타 조건이 다양해 교실에서는 자주 어려움을 겪습니다. 얼굴 인식 데이터셋은 규제된 환경을 위해 설계되어 실제 교실에서 발생하는 문제를 반영하지 못합니다. 이를 해결하기 위해 얼굴 인식 및 인식 작업을 위해 16,234개의 얼굴 샘플로 구성된 새로운 얼굴 인식 데이터셋인 Visage Face 데이터셋이 제안되었습니다. 사진은 다양한 각도와 조명 조건에서 촬영되며, 학생들은 다양한 표정을 보여주고 일부 얼굴은 실제 상황을 반영하기 위해 부분적으로 가려져 있습니다. YOLO 기반 시스템을 사용해 얼굴을 감지하고 LVFace, QCFace, FaceLiVTv2, TopoFR, EdgeFace, TransFace, GhostFaceNet 등 13가지 구성의 7가지 고급 얼굴 인식 모델을 테스트했습니다. 이 중 FaceLiVTv2-M이 99.75%의 Top-1/Top-5 정확도와 6.459ms의 추론 시간을 기록하며 가장 우수한 성과를 냈습니다. 이 결과는 Visage Face Dataset가 교실 출석률에서 얼굴 인식에 있어 현실적이고 도전적인 벤치마크임을 보여줍니다.

연구 출발점

교실 출석은 많은 작은 얼굴, 다양한 자세와 조명, 부분적 가림 현상, 그리고 저렴한 하드웨어에서 반복되는 비디오 프레임을 처리할 필요성을 결합합니다. 일반 얼굴 데이터셋은 이러한 운영 환경을 재현하지 못하며, 단순히 인식 정확도만 보고하는 것은 놓친 검출과 계산 비용을 숨깁니다. 기관들은 또한 신원 이미지를 재사용하기보다는 동의하에 수집된 데이터를 필요로 합니다.

방법

저자들은 801장의 교실 이미지를 수집하고 얼굴을 수동으로 주석 처리하며, 회전, 스케일, 이동, 잡음, 반전을 사용해 검출 세트를 구성합니다. 논문에서는 증강 후 3,635개의 검출 이미지와 96,409개의 얼굴 주석을 보고합니다. 인식 세트에는 100개 클래스에 걸쳐 3,500장의 이미지가 포함되며, 다섯 개의 RetinaFace 랜드마크에서 정렬되고 112×112로 정규화됩니다. YOLOv8 n/s/m/l/x 변형들이 검출을 위해 평가되었으며, LVFace, QCFace, FaceLiVTv2, TopoFR, EdgeFace, TransFace, GhostFaceNets의 13가지 구성은 인식을 위해 비교되었습니다.

논문 요약

유용한 결과는 거의 완벽한 폐쇄형 세트 점수가 아니라 측정된 검출기-인식기 간 균형입니다. 파일럿 프로젝트는 기관 자체 카메라에서 재현율, 지연 시간, 동의, 스푸핑, 미지 인물 행동을 재현해야 합니다.