Auteurs & institutions
Sebastian Regalado
University of Toronto, Canada
ModiFace, Canada
Varshanth R. Rao
ModiFace, Canada
Ruowei Jiang
ModiFace, Canada
Parham Aarabi
University of Toronto, Canada
Igor Gilitschenski
University of Toronto, Canada
Problème traité
L'article définit un système de coordonnées sémantique commun pour des dispositions de points de repère hétérogènes et l'utilise pour entraîner un détecteur unique sur plusieurs ensembles de données. Lors de l'inférence, le même réseau peut répondre à une collection arbitraire de requêtes de points de repère, y compris des points non explicitement demandés lors de son entraînement sur l'ensemble de données source.
Résultat clé
Le modèle ViT-B unifié avec adaptateurs enregistre 4,02 NME et un taux d'échec de 2,19 % sur WFLW, 2,43/4,19 NME sur les divisions communes/challenge de 300W, et 2,76 NME sur AFLW-19 tout en supportant l'entraînement fusionné et la sortie dynamique. Lorsqu'il est entraîné uniquement sur 300W, il atteint 6,08 NME sur le test de transfert difficile WFLW68, contre 7,23 pour DTLD et 8,09 pour PIPNet. Sur les points de repère natifs mis de côté, les requêtes apprises améliorent l'interpolation par spline de 19,0 % sur 300W et de 15,7-16,3 % sur les divisions WFLW, indiquant que le modèle apprend des sémantiques de contour réutilisables plutôt que de mémoriser uniquement des indices fixes.
Résumé
Bien que les avancées dans les méthodes de détection des points de repère faciaux (FLD) continuent de repousser les limites de performance, elles négligent deux limitations fonctionnelles majeures : (1) différents paramètres réseau doivent être entraînés indépendamment pour chaque jeu de données de référence « $N point $ », et (2) un modèle entraîné sur un jeu de données « $N$ point » ne produit de manière fiable que les repères $N$. Dans notre travail, nous conceptualisons d’abord les positions de points de repère ancrées par partie de face (FPALP), où chaque point de repère est traité comme une valeur de progression entre zéro (début) et un (extrémité) le long du contour d’une partie de face. Chaque point de repère peut être exprimé au format FPALP, indépendamment de son jeu de données source, libérant ainsi la possibilité d’unifier tous les jeux de données « $N point $ » en un seul ensemble de données. Deuxièmement, nous représentons chaque point de repère avec une requête basée sur FPALP, la peaufinons progressivement avec un décodeur intermodal, et prédisons ses coordonnées à partir de la représentation finale. Notre approche, appelée Unified Dynamic FLD, incarne ces deux choix de conception et simplifie la chaîne de détection de points de repère en permettant (1) à un seul modèle d’apprendre sur un nombre quelconque de jeux de données « $N point $ », et (2) de produire un certain nombre de prédictions spécifiques en chargeant les requêtes de référence désignées à l’exécution. Des expériences approfondies sur plusieurs ensembles de données de référence montrent que notre méthode offre ces avantages tout en restant compétitive et dans plusieurs cas surpassant les méthodes de pointe existantes.
Point de départ de la recherche
Les ensembles de données de points de repère faciaux ne sont pas d'accord sur le nombre exact de points annotés sur un visage, celui-ci pouvant être de 19, 68, 98 ou un autre nombre. Les modèles conventionnels lient leur tête de régression à un seul modèle, obligeant les équipes à entraîner et à maintenir des paramètres séparés pour chaque ensemble de données et empêchant un modèle déployé de retourner un nouveau sous-ensemble ou une disposition plus dense sur demande. Cette fragmentation est coûteuse pour les pipelines d'alignement, de reconstruction, de maquillage et d'expression qui utilisent différentes conventions de points de repère.
Méthode
Chaque point de repère devient une Position de Point de Repère Ancrée à une Partie du Visage (FPALP) : une progression normalisée de zéro à un le long d'un contour sémantique tel qu'un sourcil, un œil, un nez, une bouche ou la limite du visage. Les modèles d'ensembles de données sont alignés dans cet espace de contour, et chaque point demandé est codé en tant que requête FPALP. Un décodeur cross-modal combine progressivement les jetons d'image et les requêtes avant de régressuer les coordonnées. Le modèle ViT-B est entraîné conjointement sur AFLW-19, 300W et WFLW ; des adaptateurs légers optionnels pour chaque ensemble de données récupèrent les décalages d'annotation systématiques sans abandonner la base unifiée ou la configuration de sortie configurable à l'exécution.
À retenir
Un service unique de points de repère piloté par requête peut remplacer plusieurs modèles spécifiques à un modèle tout en conservant une précision compétitive. L'approche est particulièrement attractive lorsque les produits nécessitent plusieurs formats d'alignement ou prévoient d'ajouter de nouvelles définitions de points de repère, bien que les équipes devraient toujours tester les adaptateurs de décalage d'annotation pour chaque ensemble de données de production.