Autores e instituciones
Sebastian Regalado
University of Toronto, Canada
ModiFace, Canada
Varshanth R. Rao
ModiFace, Canada
Ruowei Jiang
ModiFace, Canada
Parham Aarabi
University of Toronto, Canada
Igor Gilitschenski
University of Toronto, Canada
Qué problema resuelve
El artículo define un sistema de coordenadas semánticas común para diseños de puntos heterogéneos y lo utiliza para entrenar un detector único a través de múltiples conjuntos de datos. En tiempo de inferencia, la misma red puede responder a una colección arbitraria de consultas de puntos de referencia, incluidos puntos no solicitados explícitamente durante su entrenamiento en el conjunto de datos de origen.
Resultado clave
El modelo unificado ViT-B con adaptadores registra un NME de 4.02 y una tasa de falla del 2.19% en WFLW, 2.43/4.19 NME en las divisiones comunes/desafío 300W y 2.76 NME en AFLW-19, al tiempo que soporta entrenamiento fusionado y salida dinámica. Cuando se entrena solo en 300W, alcanza un NME de 6.08 en la prueba de transferencia desafiante WFLW68, frente a 7.23 para DTLD y 8.09 para PIPNet. En puntos de referencia nativos reservados, las consultas aprendidas mejoran sobre la interpolación por splines en un 19.0% en 300W y en 15.7-16.3% en las divisiones de WFLW, lo que indica que el modelo aprende semánticas de contorno reutilizables en lugar de solo memorizar índices fijos.
Resumen
Aunque los avances en los métodos de detección de puntos de referencia facial (FLD) siguen empujando los límites del rendimiento, pasan por alto dos limitaciones funcionales principales: (1) es necesario entrenar de forma independiente diferentes parámetros de red para cada conjunto de datos de referencia de ''$N$-point'', y (2) un modelo entrenado con un conjunto de datos ''$N$-point'' que solo genera de forma fiable los hitos de $N$. En nuestro trabajo, primero conceptualizamos las Posiciones de Hitos Ancladas por Parte de la Cara (FPALPs), en las que cada punto de referencia se trata como un valor de progresión entre cero (inicio) y uno (extremo) a lo largo del contorno de una parte de la cara. Cada punto de referencia puede expresarse en formato FPALP, independientemente de su conjunto de datos de origen, desbloqueando así la capacidad de unificar todos los conjuntos de datos ''$N$-point'' en un solo conjunto de datos. En segundo lugar, representamos cada punto de referencia con una consulta basada en FPALP, la refinamos progresivamente con un decodificador de modalidad cruzada y predecimos sus coordenadas basándonos en la representación final. Nuestro enfoque, llamado Unified Dynamic FLD, incorpora estas dos opciones de diseño y agiliza la canalización de detección de hitos al permitir (1) que un único modelo aprenda sobre cualquier número de conjuntos de datos de ''$N$-point'', y (2) generar cualquier número de predicciones específicas de hitmark cargando las consultas designadas en tiempo de ejecución. Experimentos extensos con múltiples conjuntos de datos de referencia demuestran que nuestro método ofrece estos beneficios mientras sigue siendo competitivo y, en varios casos, supera a los métodos de vanguardia existentes.
Punto de partida
Los conjuntos de datos de puntos faciales no coinciden en si un rostro tiene 19, 68, 98 u otro número de puntos anotados. Los modelos convencionales vinculan su cabeza de regresión a una plantilla, obligando a los equipos a entrenar y mantener parámetros separados para cada conjunto de datos e impidiendo que un modelo desplegado devuelva un subconjunto nuevo o un diseño más denso bajo demanda. Esa fragmentación es costosa para los procesos de alineación, reconstrucción, maquillaje y expresión que consumen diferentes convenciones de puntos de referencia.
Método
Cada punto de referencia se convierte en una Posición de Punto de Referencia Anclado a Parte Facial (FPALP, por sus siglas en inglés): una progresión normalizada de cero a uno a lo largo de un contorno semántico como una ceja, ojo, nariz, boca o límite facial. Las plantillas de los conjuntos de datos se alinean en este espacio de contorno, y cada punto solicitado se codifica como una consulta FPALP. Un decodificador de modalidad cruzada combina progresivamente los tokens de la imagen y las consultas antes de regredir coordenadas. El modelo ViT-B se entrena conjuntamente en AFLW-19, 300W y WFLW; los adaptadores opcionales livianos de conjuntos de datos recuperan desfases sistemáticos de anotación sin renunciar a la columna vertebral unificada ni al diseño de salida configurable en tiempo de ejecución.
Conclusión del artículo
Un único servicio de puntos de referencia impulsado por consultas puede reemplazar varios modelos específicos de plantillas mientras mantiene una precisión competitiva. El enfoque es especialmente atractivo cuando los productos necesitan múltiples formatos de alineación o anticipan agregar nuevas definiciones de puntos de referencia, aunque los equipos aún deberían probar adaptadores de desfase de anotación para cada conjunto de datos de producción.