FreqFLD : vers une détection tout-en-un des repères faciaux via modulation de fréquence
Auteurs & institutions
Shun Ren
College of Computer and Information Technology, China Three Gorges University
Kaijie Jin
College of Computer and Information Technology, China Three Gorges University
Shengkai Hu
School of Information Engineering, Zhongnan University of Economics and Law
Beihang Song
National Institute of Natural Hazards, Ministry of Emergency Management of China
Hang Sun
College of Computer and Information Technology, China Three Gorges University
Wenwen Min
School of Information Science and Engineering, Yunnan University
Youfa Liu
School of Computer Science, Wuhan University
Jun Wan
School of Information Engineering, Zhongnan University of Economics and Law
School of Computer Science and Engineering, Nanyang Technological University
Problème traité
FreqFLD cible un détecteur tout-en-un repère pouvant être entraîné conjointement sur 300W, AFLW, COFW et WFLW tout en restant compétitif sur chaque benchmark et robuste sur leurs sous-ensembles difficiles. L’article se demande si des priors explicites de fréquence peuvent guider la spécialisation des experts de manière plus fiable que le routage mixte d’experts non contraint.
Résultat clé
Le modèle unifié atteint 2,72 NME sur 300W Common, 4,52 NME sur 300W Challenging et 4,50 sur le test WFLW ; WFLW pose, illumination, occlusion et flou scores 7,54, 4,55, 5,53 et 5,15. Sur COFW fortement occlus, il rapporte 4,80 NME et un taux d’échec de 0,39 %. Les modules de fréquence complets et la perte de routage améliorent la base de défi de 300W de 4,71 à 4,52, tandis que l’addition des quatre ensembles de données d’entraînement porte un résultat de 4,97 à 4,52 sur un seul jeu de données. La performance est compétitive plutôt que uniformément meilleure, incluant 1,69 NME sur AFLW où les anciennes méthodes spécialisées rapportent une erreur moindre.
Résumé
Les progrès récents en apprentissage profond ont considérablement avancé la détection de repères faciaux. Cependant, la plupart des méthodes existantes traitent les caractéristiques dans le domaine spatial sous un paradigme d’entraînement spécifique à chaque ensemble, ce qui néglige le fait que la détection de repères faciaux est intrinsèquement guidée par la géométrie et sensible aux variations de fréquence, limitant ainsi la généralisation croisée dans des scénarios complexes et entravant le développement d’un modèle de détection de repères faciaux. Pour répondre à ce problème, nous proposons \textbf{FreqFLD}, un cadre modulé par \textbf{freq}uency-modulé vers All-in-One \textbf{f}acial \textbf{l}andmark \textbf{d}etection. Plus précisément, FreqFLD introduit un module de modulation de fréquence (FreqMoM) pour induire explicitement la fréquence précédente en découplant et modulant les composants basse et haute fréquence, qui est ensuite injecté dans la modélisation des caractéristiques ultérieures pour permettre une modélisation équilibrée de la structure faciale globale et des détails locaux des repères. De plus, FreqFLD utilise un mélange d’experts modulé en fréquence (FreqMoE), avec une sélection d’experts conditionnée de manière adaptative à des priors modulés en fréquence, permettant une modélisation flexible de motifs de repères faciaux hétérogènes dans des scénarios divers et complexes. Pour régulariser la modélisation cohérente en fréquence sous le paradigme tout-en-un, nous introduisons également une perte de routage cohérent en fréquence (FreqCR), qui contraint le routage et l’affectation d’experts sensibles à la fréquence pour favoriser une utilisation équilibrée des experts à travers divers scénarios faciaux, permettant ainsi une spécialisation stable des experts et une détection robuste des repères faciaux. Des expériences approfondies démontrent que le FreqFLD proposé atteint des performances comparables sur des ensembles de données populaires. Le code est disponible à : https://github.com/jkj1059657014/FreqFLD.
Point de départ de la recherche
Les modèles de repères faciaux sont généralement entraînés par ensemble de données, même si les entrées de production mélangent conventions de repères, poses, occlusions, flou et éclairage. Les caractéristiques purement spatiales peuvent surajuster un régime d’annotation et manquer la distinction entre la structure faciale basse fréquence et le détail des repères à haute fréquence. Un modèle unifié crée également des conflits de routage lorsqu’un expert doit gérer chaque régime géométrique et qualité d’image.
Méthode
Le module de modulation de fréquence décompose les caractéristiques en composants basse et haute fréquence, les modélise séparément, puis injecte le prior résultant dans les couches en aval. Un mélange d’experts modulé en fréquence utilise ce précédent pour router des motifs faciaux hétérogènes, tandis que le routage régulier en fréquence équilibre l’utilisation et encourage une spécialisation stable. L’entraînement conjoint égalise les quatre ensembles de données sources à 20 000 échantillons chacun, produisant un pool d’entraînement de 80 000 images évalué selon le protocole de référence et de normalisation natif de chaque jeu de données.
À retenir
Le routage sensible à la fréquence présente un argument crédible pour consolider plusieurs modèles de référence en un seul, mais les équipes devraient comparer l’erreur par caméra et par schéma de repère, car la formation unifiée ne remporte pas chaque benchmark individuel.