← Retour au Blog
Radar de rechercheReconnaissance facialearXivSeptembre 2026

Radar arXiv mensuel

Articles sur la reconnaissance faciale de septembre 2026 : correspondance plus équitable, adaptation thermique et test des jumeaux

La recherche sur la reconnaissance faciale de septembre porte moins sur une nouvelle course aux architectures de base et davantage sur des régimes opérationnels difficiles. DenseFace modifie la règle de correspondance d'un modèle existant pour réduire les disparités de faux-positifs raciaux. SynThermFace transforme des paires visible-thermique rares en un ensemble d'adaptation plus large sans ajouter de traduction d'image lors de l'inférence. Le jeu de test Celeb Twins Test Set demande ensuite si les embeddings actuels utilisent les minuscules indices locaux sur lesquels les humains se basent pour distinguer les jumeaux monozygotes.

Ce que révèle ce mois-ci

DenseFace montre que la densité d'embedding locale peut être utilisée comme signal de correspondance probabiliste post-hoc, rapprochant plusieurs taux de faux-positifs non caucasiens du niveau de référence caucasien tout en préservant la précision de vérification. SynThermFace utilise un modèle de diffusion uniquement pendant l'entraînement, puis déploie une seule passe avant adaptée d'EdgeFace ; son modèle de paires synthétiques atteint 0,99 % de EER sur MCXFace mais 14,70 % sur les données Tufts inconnues, de sorte que le transfert entre capteurs reste significatif. CTTS contribue avec 21 120 paires centrées sur les jumeaux et constate que douze variantes modernes de matchers restent autour de 73-77 % de précision même si leur moyenne habituelle de benchmark est d'environ 97 %. La leçon commune est de valider séparément la règle de correspondance, le spectre de capture et la population d'identité difficile plutôt que de traiter un score agrégé unique comme indicateur de préparation à la production.

Article 012026-09-14cs.CV

DenseFace : atténuation des biais en reconnaissance faciale par appariement probabiliste sensible à la densité

Auteurs & institutions

Mansur Bultygov

VisionLabs

Vadim Seliutin

Amazon Web Services

VisionLabs (work performed there)

Dmitry Nekhaev

VisionLabs

Ivan Laptev

Mohamed bin Zayed University of Artificial Intelligence

Problème traité

DenseFace demande si les disparités raciales de fausse correspondance peuvent être réduites au moment de la comparaison, sans changer ni réentraîner l’encodeur facial sous-jacent. Il remplace également l’écart-type de précision des sous-groupes par un protocole orienté déploiement : fixer un seuil à un taux caucasien de faux positifs de 0,001 et mesurer la distance que chaque autre cohorte s’éloigne de la parité.

Résultat clé

Sur les modèles CosFace et AdaFace entraînés avec Glint360K, MS1MV2, WebFace4M, WebFace12M et BUPT-BalancedFace, le même seuil global devient nettement plus équilibré. Sur le modèle BUPT, le multiple faux positif de la cohorte africaine passe de 6,15 à 1,43 et celui de la cohorte indienne de 4,01 à 1,03 par rapport à la référence caucasienne. La précision de la vérification conventionnelle est préservée : pour un modèle CosFace Glint360K, la précision moyenne RFW passe de 98,61 % à 98,68 % tandis que l’écart-type du sous-groupe passe de 0,53 à 0,44. Le régresseur ajoute environ 0,2 % de mémoire et 1,75 % de latence de bout en bout dans le test GPU des auteurs ; son calcul optimisé du score CPU est environ 1,5 fois le coût brut du cosinus. Les résultats dépendent encore d’une population d’entraînement représentative d’ancrage ou de régresseur.

Résumé

Malgré des progrès constants dans la reconnaissance faciale, les modèles actuels souffrent encore de biais démographiques importants. Bien que des approches de mitigation des biais aient été proposées, les méthodes existantes imposent souvent des contraintes à la procédure d’entraînement et entraînent une dégradation de la précision de la reconnaissance. Pour répondre à ce problème, nous introduisons ici une méthode qui réduit les biais raciaux dans les modèles pré-entraînés sans compromettre leur précision. À cette fin, nous modélisons les embeddings faciaux de chaque personne selon la distribution von Mises-Fisher (MF). Nous observons ensuite la dépendance entre les attributs démographiques et la densité des distributions MF, et proposons DenseFace, une procédure probabiliste de correspondance faciale qui prend en compte les différences dans les distributions MF. Nos expériences approfondies démontrent que DenseFace réduit systématiquement les biais raciaux dans des modèles forts de reconnaissance faciale variant en architectures réseau, ensembles de données d’entraînement et fonctions de perte. Notamment, DenseFace préserve la précision de la reconnaissance et ne nécessite aucun réentraînement du modèle sous-jacent. Notre travail étudie également les mesures de biais précédemment adoptées et fait des suggestions.

Point de départ de la recherche

Les systèmes de reconnaissance faciale utilisent souvent un seuil global de décision, mais les distributions des scores imposteurs diffèrent selon les groupes démographiques. Un modèle peut donc paraître exact sur RFW lorsque chaque groupe reçoit son propre seuil validé croisément, tout en produisant des taux de fausse correspondance très différents dans un service réel. La plupart des méthodes d’atténuation nécessitent également des données de réentraînement équilibrées, des modifications d’architecture ou des pertes d’équité qui peuvent réduire la performance de reconnaissance et sont difficiles à adapter dans un modèle approuvé.

Méthode

Pour chaque plongement de face, la méthode trouve les identités les plus proches dans un ensemble d’ancrage démographiquement équilibré et estime la densité locale inter-classes. Elle représente l’inclusion avec une distribution de von Mises-Fisher dont la concentration reflète cette densité, puis évalue une paire selon la vraisemblance mutuelle plutôt que la similarité cosinus brute. Une marge sépare les identités des proches voisins, et une variante régresseur légère prédit directement la densité, de sorte que l’appariement de production n’a pas besoin d’une grande recherche d’ancre. L’encodeur, la dimension d’inclusion et les données d’inscription restent inchangées.

À retenir

Un contrôle de l'équité au niveau de la couche de comparaison peut améliorer la parité des cohortes sans rouvrir l'entraînement du modèle, mais il ne supprime pas le besoin de données de calibration représentatives et de suivi des sous-groupes au seuil opérationnel réel.

Article 022026-09-09cs.CV

SynThermFace : Amplification des données appariées limitées pour la reconnaissance faciale visible-thermique via la génération de données synthétiques

Auteurs & institutions

Anjith George

Idiap Research Institute, Switzerland

Adam Unal

Idiap Research Institute, Switzerland

Sebastien Marcel

Idiap Research Institute, Switzerland

University of Lausanne, Switzerland

Problème traité

SynThermFace amplifie la supervision appariée limitée pour la reconnaissance visible-vers-thermique et teste si les paires thermiques synthétiques améliorent à la fois la précision intra-base et le transfert vers un capteur/une base de données jamais utilisé pour la formation. Il sépare le bénéfice de son objectif d'adaptation du bénéfice du passage à l'échelle des identités synthétiques.

Résultat clé

Sur la division de développement disjointe MCXFace, le PACT par paires réelles atteint 3,04 % EER et 96,49 % Rank-1, battant les références d’adaptation par paires réelles comparées. Avec 1 000 identités synthétiques dérivées de CASIA, EER tombe à 0,99 %, Rank-1 atteint 99,75 %, et la vérification à 0,1 % FAR atteint 93,48 % ; la base EdgeFace non adaptée a 23,06 % EER et 40,10 % Rank-1. Sur des données Tufts invisibles, l’entraînement dérivé de Digi2Real améliore EdgeFace de 43,41 % à 13,91 % EER et de 12,03 % à 56,37 % Rank-1. L’écart restant entre MCXFace et Tufts est important, et le générateur dépend toujours de paires MCXFace réelles, donc la méthode réduit plutôt qu’élimine la collecte interspectrale réelle.

Résumé

La reconnaissance faciale (RF) est une modalité largement utilisée pour l'authentification biométrique, mais les modèles conventionnels reposent sur l'imagerie du spectre visible et se dégradent lorsque des images RVB de haute qualité ne peuvent pas être capturées. La reconnaissance faciale interspectrale répond à cette limitation en associant des images visibles avec d'autres modalités telles que l'imagerie thermique, permettant des performances plus fiables dans des conditions de faible luminosité, nocturnes et non contraintes. Cependant, les avancées sont limitées par la rareté des données appariées visible-thermique, difficiles et coûteuses à collecter à grande échelle. Nous proposons SynThermFace, un cadre qui amplifie la supervision réelle visible-thermique limitée en ensembles de données d'adaptation appariés plus vastes pour la reconnaissance faciale interspectrale. Un modèle de diffusion est d'abord adapté en utilisant un ensemble limité d'images visibles-thermiques appariées, puis utilisé pour générer des données appariées visibles-thermiques synthétiques à grande échelle à partir d'ensembles de visages visibles réels ou synthétiques existants. Les paires générées sont utilisées pour adapter un modèle de reconnaissance faciale du spectre visible préentraîné en un modèle CFR. Contrairement aux approches basées sur la synthèse qui nécessitent une traduction d'image au moment du test, la méthode proposée déplace la génération à l'étape de formation et effectue l'inférence avec une seule passe avant à travers le modèle de reconnaissance adapté. Sous le même protocole MCXFace pour paires réelles, PACT s'améliore par rapport aux bases d'adaptation CFR évaluées, isolant l'effet de l'objectif d'adaptation proposé. L'entraînement de PACT sur des ensembles de paires générées plus larges apporte des améliorations supplémentaires par rapport au modèle non adapté et à la configuration PACT avec paires réelles. L'évaluation sur une base de données différente sur le jeu Tufts fournit la preuve que la représentation apprise se transfère à une base de données non vue. Le code source et les modèles entraînés seront rendus publics.

Point de départ de la recherche

Les caméras thermiques peuvent soutenir l'authentification et la surveillance lorsque la capture en lumière visible échoue, mais la plupart des galeries d'identité sont en RVB et les visages visibles-thermiques appariés sont coûteux à collecter. Traduire directement chaque sonde thermique au moment de l'exécution ajoute un générateur au chemin critique et peut modifier l'identité. La question pratique est de savoir si un petit ensemble réel apparié peut superviser un ensemble d'entraînement beaucoup plus grand tout en laissant le déploiement comme une simple recherche d'embedding.

Méthode

Un générateur de diffusion est d’abord adapté sur la division d’entraînement MCXFace en paire, puis convertit soit des images réelles CASIA-WebFace, soit des identités Digi2Real synthétiques en vues thermiques correspondantes. L’ajustement cross-spectral conscient de la préservation part d’un modèle EdgeFace préentraîné et combine un apprentissage contrastif symétrique thermique-visible et visible-thermique avec une perte qui maintient les embeddings visibles près d’une copie gelée du modèle original. La génération n’a lieu qu’en construisant l’ensemble d’adaptation ; l’inférence est un passage avant à travers le reconnaisseur accordé.

À retenir

La génération thermique synthétique hors ligne peut transformer une petite collection en paire en supervision utile de reconnaissance sans traduction en temps réel, mais les nouveaux capteurs et populations nécessitent encore leurs propres tests de transfert et d’équité.

Article 032026-09-01cs.CV

Repenser la reconnaissance faciale des jumeaux monozygotes : le jeu de test Celeb Twins

Auteurs & institutions

Michael Zang

Department of Computer Science and Engineering, University of Notre Dame

Haiyu Wu

Department of Computer Science and Engineering, University of Notre Dame

Mrinal Sharma

Department of Computer Science and Engineering, University of Notre Dame

Kevin W. Bowyer

Department of Computer Science and Engineering, University of Notre Dame

Problème traité

L’article crée un benchmark de type vérification suffisamment grand pour la validation croisée de jumeaux disjoints et annoté pour les marques distinctives locales et l’éventuelle asymétrie miroir. Il teste ensuite si les apparieurs profonds modernes exploitent ces indices, et si la suppression des hypothèses de flip horizontal ou la génération de jumeaux synthétiques offre une voie plausible à suivre.

Résultat clé

Les douze configurations de comparateurs atteignent seulement 73,14-76,50 % de précision moyenne sur CTTS, contre environ 97,00-97,69 % en moyenne sur cinq ensembles de vérification conventionnels. L’effacement des marques visibles laisse les embeddings et les distributions de distances entre paires essentiellement inchangés, indiquant que les modèles actuels ignorent les indices que les humains peuvent utiliser. Le réentraînement conscient de l’asymétrie atteint 78,58 % plus ou moins 3,7 et n’est pas statistiquement différent du modèle original ; il aide certaines paires de jumeaux miroir et en pénalise d’autres. Les jumeaux générés ne préservent pas la structure réaliste des distances intra-personne et inter-jumeaux, donc ils ne constituent pas encore un substitut d’entraînement validé.

Résumé

La littérature antérieure sur la reconnaissance faciale pour les jumeaux monozygotes ((« identiques ») pointe les marques faciales et l’asymétrie du miroir comme des indications possibles pour améliorer la précision de la reconnaissance des jumeaux. Le Celeb Twins Test Set (CTTS) contient des paires d’images scrapées pour 80 paires de jumeaux célèbres. C’est le seul ensemble de test pour jumeaux contenant des métadonnées pour des jumeaux présentant des marques de peau distinctives et une possible asymétrie miroir. Le CTTS est organisé selon les ensembles de tests de vérification faciale tels que LFW, CALFW, CPLFW, CFP-FP et AgeDB-30. Les apparieurs CNN profonds actuels peuvent atteindre une précision de plus de 76 % dans la classification des paires d’images CTTS entre personnes et personnes différentes. Nous montrons que les jumeaux actuels n’utilisent pas de marques de peau ni d’asymétrie, et discutons des raisons à cela. Enfin, nous discutons de la faisabilité d’utiliser des outils d’IA générative tels que Grok, ChatGPT et Gemini pour créer des images de jumeaux monozygotes imaginaires afin d’augmenter leur représentation dans les ensembles d’entraînement de reconnaissance faciale.

Point de départ de la recherche

Les jumeaux monozygotes exposent une frontière identitaire que les benchmarks faciaux ordinaires représentent à peine. Le NIST a précédemment rapporté qu’à un seuil choisi pour un taux de fausse correspondance non-jumeau de 0,0001, de nombreux algorithmes acceptaient un jumeau comme l’autre 98 à 99 % du temps. Les ensembles de données existants sur les jumeaux sont petits, anciens ou manquent de métadonnées sur les taches de rousseur, les grains de beauté, les cicatrices et le statut de jumeau miroir, ce qui rend difficile d’apprendre quels indices utilisent réellement les embeddings modernes.

Méthode

CTTS-80 collecte des images Web pour 80 paires de jumeaux célébrités et construit 21 120 paires équilibrées de même personne et d’imposteurs jumeaux à travers dix plis, en gardant chaque paire de jumeaux entièrement dans un seul pli. Les auteurs évaluent les modèles ArcFace, AdaFace, UniFace et MagFace ResNet-100 entraînés sur trois ensembles de données courants. Ils effacent les marques de peau visibles pour certaines identités, comparent les distributions des embeddings originales et modifiées, réentraînent ArcFace sans augmentation par retournement horizontal, et examinent des ensembles de jumeaux synthétiques générés par trois systèmes génératifs.

À retenir

La vérification des jumeaux reste une catégorie de risque distincte : la précision standard en dit peu à ce sujet, et les embeddings actuels semblent ne pas utiliser de marques locales évidentes. Les déploiements à haute assurance devraient tester explicitement les imposteurs jumeaux plutôt que d’inférer la performance à partir de benchmarks généraux.