← Retour au Blog
Radar de rechercheDétection de visagesRepères faciauxarXivSeptembre 2026

Radar arXiv mensuel

Articles sur la détection de visages de septembre 2026 : Repères unifiés, Alignement par diffusion et Déploiement en classe

Les articles sur les boîtes de visages directes étaient rares en septembre, donc ce tour d’horizon suit la pile de localisation adjacente dont les systèmes de production ont besoin après avoir trouvé une boîte. FreqFLD entraîne un modèle de repères conscient de la fréquence sur quatre ensembles de données. FAHCD-Net traite les cartes de chaleur de repères comme un problème de débruitage conditionnel sous changements de pose, d’occlusion, de flou et d’éclairage. L’étude Visage rapproche détection et reconnaissance dans des images de classes encombrées, où le débit et les visages manqués importent autant que la précision d’identité globale.

Ce que révèle ce mois-ci

FreqFLD équilibre la structure globale et les détails locaux en divisant les composants de fréquence et en acheminant les échantillons via des experts conditionnés en fréquence ; un modèle entraîné conjointement atteint 4,50 NME sur WFLW et 4,80 NME avec un taux de défaillance de 0,39 % sur COFW occulté. FAHCD-Net cascade plutôt des phases de diffusion conditionnelles et supprime le bruit redondant de la carte thermique haute fréquence, réduisant le NME de 300W de 4,48 à la première étape à 4,29 à la troisième étape. L’étude Visage rapporte qu’un YOLOv8n de 3,2 millions de paramètres atteint 0,935 mAP@0,5, tandis que des détecteurs beaucoup plus grands gagnent en précision à un coût important ; plusieurs reconnaisseurs atteignent 99,75 % du Top 1 sur son ensemble de reconnaissance de 100 classes. Ces résultats sont prometteurs, mais les deux articles phares restent des études de référence et les données en classe proviennent d’un cadre institutionnel limité, donc une validation croisée reste nécessaire.

Article 012026-09-09cs.CV

FreqFLD : vers une détection tout-en-un des repères faciaux via modulation de fréquence

Auteurs & institutions

Shun Ren

College of Computer and Information Technology, China Three Gorges University

Kaijie Jin

College of Computer and Information Technology, China Three Gorges University

Shengkai Hu

School of Information Engineering, Zhongnan University of Economics and Law

Beihang Song

National Institute of Natural Hazards, Ministry of Emergency Management of China

Hang Sun

College of Computer and Information Technology, China Three Gorges University

Wenwen Min

School of Information Science and Engineering, Yunnan University

Youfa Liu

School of Computer Science, Wuhan University

Jun Wan

School of Information Engineering, Zhongnan University of Economics and Law

School of Computer Science and Engineering, Nanyang Technological University

Problème traité

FreqFLD cible un détecteur tout-en-un repère pouvant être entraîné conjointement sur 300W, AFLW, COFW et WFLW tout en restant compétitif sur chaque benchmark et robuste sur leurs sous-ensembles difficiles. L’article se demande si des priors explicites de fréquence peuvent guider la spécialisation des experts de manière plus fiable que le routage mixte d’experts non contraint.

Résultat clé

Le modèle unifié atteint 2,72 NME sur 300W Common, 4,52 NME sur 300W Challenging et 4,50 sur le test WFLW ; WFLW pose, illumination, occlusion et flou scores 7,54, 4,55, 5,53 et 5,15. Sur COFW fortement occlus, il rapporte 4,80 NME et un taux d’échec de 0,39 %. Les modules de fréquence complets et la perte de routage améliorent la base de défi de 300W de 4,71 à 4,52, tandis que l’addition des quatre ensembles de données d’entraînement porte un résultat de 4,97 à 4,52 sur un seul jeu de données. La performance est compétitive plutôt que uniformément meilleure, incluant 1,69 NME sur AFLW où les anciennes méthodes spécialisées rapportent une erreur moindre.

Résumé

Les progrès récents en apprentissage profond ont considérablement avancé la détection de repères faciaux. Cependant, la plupart des méthodes existantes traitent les caractéristiques dans le domaine spatial sous un paradigme d’entraînement spécifique à chaque ensemble, ce qui néglige le fait que la détection de repères faciaux est intrinsèquement guidée par la géométrie et sensible aux variations de fréquence, limitant ainsi la généralisation croisée dans des scénarios complexes et entravant le développement d’un modèle de détection de repères faciaux. Pour répondre à ce problème, nous proposons \textbf{FreqFLD}, un cadre modulé par \textbf{freq}uency-modulé vers All-in-One \textbf{f}acial \textbf{l}andmark \textbf{d}etection. Plus précisément, FreqFLD introduit un module de modulation de fréquence (FreqMoM) pour induire explicitement la fréquence précédente en découplant et modulant les composants basse et haute fréquence, qui est ensuite injecté dans la modélisation des caractéristiques ultérieures pour permettre une modélisation équilibrée de la structure faciale globale et des détails locaux des repères. De plus, FreqFLD utilise un mélange d’experts modulé en fréquence (FreqMoE), avec une sélection d’experts conditionnée de manière adaptative à des priors modulés en fréquence, permettant une modélisation flexible de motifs de repères faciaux hétérogènes dans des scénarios divers et complexes. Pour régulariser la modélisation cohérente en fréquence sous le paradigme tout-en-un, nous introduisons également une perte de routage cohérent en fréquence (FreqCR), qui contraint le routage et l’affectation d’experts sensibles à la fréquence pour favoriser une utilisation équilibrée des experts à travers divers scénarios faciaux, permettant ainsi une spécialisation stable des experts et une détection robuste des repères faciaux. Des expériences approfondies démontrent que le FreqFLD proposé atteint des performances comparables sur des ensembles de données populaires. Le code est disponible à : https://github.com/jkj1059657014/FreqFLD.

Point de départ de la recherche

Les modèles de repères faciaux sont généralement entraînés par ensemble de données, même si les entrées de production mélangent conventions de repères, poses, occlusions, flou et éclairage. Les caractéristiques purement spatiales peuvent surajuster un régime d’annotation et manquer la distinction entre la structure faciale basse fréquence et le détail des repères à haute fréquence. Un modèle unifié crée également des conflits de routage lorsqu’un expert doit gérer chaque régime géométrique et qualité d’image.

Méthode

Le module de modulation de fréquence décompose les caractéristiques en composants basse et haute fréquence, les modélise séparément, puis injecte le prior résultant dans les couches en aval. Un mélange d’experts modulé en fréquence utilise ce précédent pour router des motifs faciaux hétérogènes, tandis que le routage régulier en fréquence équilibre l’utilisation et encourage une spécialisation stable. L’entraînement conjoint égalise les quatre ensembles de données sources à 20 000 échantillons chacun, produisant un pool d’entraînement de 80 000 images évalué selon le protocole de référence et de normalisation natif de chaque jeu de données.

À retenir

Le routage sensible à la fréquence présente un argument crédible pour consolider plusieurs modèles de référence en un seul, mais les équipes devraient comparer l’erreur par caméra et par schéma de repère, car la formation unifiée ne remporte pas chaque benchmark individuel.

Article 022026-09-15cs.CV

FAHCD-Net : réseaux de diffusion conditionnés par carte de chaleur et adaptatifs en fréquence pour une détection robuste des repères faciaux

Auteurs & institutions

Jun Wan

School of Information Engineering, Zhongnan University of Economics and Law

Jiwei Hu

School of Information Engineering, Zhongnan University of Economics and Law

Shengkai Hu

School of Information Engineering, Zhongnan University of Economics and Law

Qilu Zhu

School of Information Engineering, Zhongnan University of Economics and Law

Problème traité

FAHCD-Net cherche à obtenir une localisation robuste des points de repère sous des variations de pose, d'occlusion, d'illumination et de flou en rendant un processus de diffusion conditionné par une carte de chaleur explicitement conscient des fréquences. Il teste également si une cascade peut améliorer progressivement une condition de forme moyenne initiale au lieu de se fier à une carte de chaleur de départ générée par un détecteur de haute qualité.

Résultat clé

FAHCD-Net rapporte 2,51 NME sur 300W Common, 2,99 sur l'ensemble complet, 1,17 sur AFLW frontal et 2,08 sur AFLW complet. Sur 300W Challenging, les étapes successives de diffusion réduisent le NME de 4,48 à 4,33 puis à 4,29, comparé à 4,81, 4,73 et 4,69 lors de la condition sur une forme moyenne. L'ajout des données d'entraînement COFW, WFLW et AFLW améliore le résultat signalé sur 300W Challenging de 4,76 à 4,49 dans l'ablation multi-dataset. L'article démontre la robustesse du benchmark mais ne rapporte pas la latence du détecteur plus des points de repère, donc le coût de la diffusion itérative reste une question de déploiement.

Résumé

La détection de repères faciaux (FLD) est une tâche cruciale dans diverses applications et a réalisé des avancées significatives ces dernières années. Cependant, les méthodes FLD actuelles peinent encore dans des conditions difficiles, où les variations structurelles faciales, la perte d’information et les interférences sonores compromettent gravement l’intégrité et la précision des traits faciaux appris. Pour répondre à ces problèmes, nous proposons un réseau FAHCD-Net, qui intègre un modèle FAHCD (Frequency-Adaptive Heatmap Heatmap - Conditional Diffusion) avec une perte de régularisation de fluidité (SR) dans un cadre en cascade. Plus précisément, le modèle FAHCD intègre un module d’adaptation hiérarchique de fréquence (HFA) conçu pour supprimer le bruit rédondant à haute fréquence par décomposition multi-couches et reconstruction adaptative, préservant ainsi les structures faciales essentielles. De plus, la perte SR est proposée pour atténuer davantage l’interférence du bruit à haute fréquence et améliorer la lissabilité des cartes de chaleur générées. En cascadant le modèle FAHCD avec la perte SR, FAHCD-Net exploite efficacement à la fois les caractéristiques statistiques et de distribution basées sur la fréquence des données pour générer progressivement des cartes thermiques plus précises à partir d’entrées bruitantes. Des expériences approfondies sur des benchmarks populaires démontrent l’efficacité et la robustesse de la méthode proposée, atteignant des performances de pointe dans les tâches FLD dans des scénarios complexes. Le code source est disponible à https://github.com/HJWKryptonite/FAHCD-Net.

Point de départ de la recherche

Les cartes thermiques de repères se détériorent lorsque la pose ou l'expression modifie la structure du visage, lorsque l'occlusion supprime des preuves, et lorsque le flou ou l'éclairage injecte du bruit à haute fréquence. La régression standard traite ces effets comme des erreurs de prédiction directes. La diffusion offre une récupération itérative à partir de preuves bruyantes ou incomplètes, mais le débruitage non contraint peut lui-même produire de l'énergie de carte thermique à haute fréquence spurious et des pics instables.

Méthode

Chaque étape de cascade utilise un modèle de diffusion conditionnelle par carte thermique adaptative en fréquence pour affiner les distributions de points de repère. L'adaptation hiérarchique en fréquence décompose et reconstruit les caractéristiques de manière répétée afin de conserver la structure faciale basse fréquence tout en supprimant le bruit haute fréquence redondant. Un terme de régularisation de la douceur aligne le comportement fréquentiel de la carte thermique générée avec la vérité terrain. L'entraînement multi-ensemble ajoute COFW, WFLW et AFLW à 300W, et les trois étapes transmettent leurs cartes thermiques prédites comme condition pour l'étape suivante.

À retenir

La diffusion conditionnelle peut récupérer des cartes thermiques de points de repère plus propres dans des images difficiles, mais son coût itératif doit être mesuré par rapport au budget de latence de la caméra et à une solide référence d'alignement non diffusif.

Article 032026-09-19cs.CV

Vers une gestion robuste des présences en classe : évaluation complète des modèles de détection et de reconnaissance faciale

Auteurs & institutions

Himani Trivedi

Computer Engineering Department, LDRP Institute of Technology and Research, Kadi Sarva Vishwavidyalaya

Hiren Patel

Vidush Somany Institute of Technology and Research, Kadi Sarva Vishwavidyalaya

Ridham Patel

Information Technology Department, LDRP Institute of Technology and Research, Kadi Sarva Vishwavidyalaya

Krutika Patel

Information Technology Department, LDRP Institute of Technology and Research, Kadi Sarva Vishwavidyalaya

Nancy Patel

Information Technology Department, LDRP Institute of Technology and Research, Kadi Sarva Vishwavidyalaya

Problème traité

L'étude introduit des ensembles de données jumelés de détection et de reconnaissance dans des conditions de classe et compare une famille de tailles de détecteurs avec sept architectures actuelles de reconnaissance faciale. Son objectif est d'identifier un point de fonctionnement pratique en termes de précision-efficacité plutôt que de supposer que le plus grand détecteur ou reconnaisseur est le meilleur composant d'assiduité.

Résultat clé

YOLOv8n utilise 3,2 millions de paramètres et atteint une précision de 0,932, un rappel de 0,886, un F1 de 0,91 et un mAP@0.5 de 0,935 ; les variantes plus grandes s'approchent d'environ 0,97 mAP@0.5 mais utilisent entre 43,7 et 68,2 millions de paramètres. En reconnaissance, FaceLiVTv2-L, EdgeFace Base, LVFace ViT-B et TransFace ViT-B atteignent chacun 99,75 % Top-1 dans le tableau rapporté. EdgeFace Base le fait en 4,029 ms, plus rapide que FaceLiVTv2-L à 6,081 ms, tandis que les tailles des modèles varient considérablement. Ce sont des résultats à ensemble fermé provenant d'un nombre limité d'établissements éducatifs, donc ils n'établissent pas la résistance aux falsifications, la généralisation inter-écoles ou l'adéquation à la politique pour la fréquentation automatisée.

Résumé

Les méthodes de présence manuelles, telles que les systèmes basés sur le papier ou le registre, prennent beaucoup de temps, peuvent entraîner des erreurs et sont faciles à falsifier. La reconnaissance faciale est plus fiable, mais elle rencontre souvent des difficultés dans les salles de classe car l'éclairage et d'autres conditions peuvent varier. Les ensembles de données de reconnaissance faciale sont conçus pour des environnements réglementés et ne captent pas les défis réels rencontrés dans les salles de classe. Pour remédier à cela, un nouvel ensemble de données de détection et de reconnaissance faciale, le jeu de données Visage Face, comprenant 16 234 échantillons de visages, est proposé pour la tâche de détection et de reconnaissance faciale. Les photos sont prises sous différents angles et dans des conditions d’éclairage variables, les étudiants affichant une gamme d’expressions, et certains visages étant partiellement couverts pour refléter les situations réelles. Un système basé sur YOLO est utilisé pour détecter les visages et sept modèles avancés de reconnaissance faciale ont été testés avec treize configurations : LVFace, QCFace, FaceLiVTv2, TopoFR, EdgeFace, TransFace et GhostFaceNets. Parmi ceux-ci, FaceLiVTv2-M a obtenu les meilleurs résultats, avec une précision Top-1/Top-5 de 99,75 % et un temps d'inférence de 6,459 ms. Ces résultats montrent que le jeu de données Visage Face est une référence réaliste et exigeante pour la reconnaissance faciale dans la prise de présence en classe.

Point de départ de la recherche

La fréquentation en classe combine de nombreux petits visages, des poses et un éclairage variables, une occlusion partielle et la nécessité de traiter des images vidéo répétées sur du matériel abordable. Les ensembles de données généraux sur les visages ne reproduisent pas cet environnement opérationnel, tandis que le seul rapport sur la précision de la reconnaissance masque les détections manquées et le coût computationnel. Les établissements ont également besoin de données collectées avec consentement plutôt que d'images d'identité réutilisées.

Méthode

Les auteurs collectent 801 images de classes, annotent manuellement les visages et utilisent la rotation, l'échelle, la translation, le bruit et le retournement pour constituer l'ensemble de détection ; l'article rapporte 3 635 images de détection et 96 409 annotations de visages après augmentation. L'ensemble de reconnaissance contient 3 500 images réparties sur 100 classes, alignées à partir de cinq points de repère RetinaFace et normalisées à 112 par 112. Les variantes YOLOv8 n/s/m/l/x sont évaluées pour la détection, et treize configurations de LVFace, QCFace, FaceLiVTv2, TopoFR, EdgeFace, TransFace et GhostFaceNets sont comparées pour la reconnaissance.

À retenir

Le résultat utile est le compromis mesuré détecteur-reconnaisseur, et non le score quasi parfait à ensemble fermé. Un projet pilote devrait reproduire le rappel, la latence, le consentement, la falsification et le comportement des personnes inconnues sur les propres caméras de l'établissement.