FreqFLD: Hacia la detección todo-en-uno de puntos de referencia faciales mediante modulación de frecuencia
Autores e instituciones
Shun Ren
College of Computer and Information Technology, China Three Gorges University
Kaijie Jin
College of Computer and Information Technology, China Three Gorges University
Shengkai Hu
School of Information Engineering, Zhongnan University of Economics and Law
Beihang Song
National Institute of Natural Hazards, Ministry of Emergency Management of China
Hang Sun
College of Computer and Information Technology, China Three Gorges University
Wenwen Min
School of Information Science and Engineering, Yunnan University
Youfa Liu
School of Computer Science, Wuhan University
Jun Wan
School of Information Engineering, Zhongnan University of Economics and Law
School of Computer Science and Engineering, Nanyang Technological University
Qué problema resuelve
FreqFLD apunta a un detector de referencia todo en uno que puede entrenarse conjuntamente en 300W, AFLW, COFW y WFLW, manteniéndose competitivo en cada benchmark y robusto en sus subconjuntos difíciles. El artículo pregunta si los priors explícitos de frecuencia pueden guiar la especialización de expertos de forma más fiable que el enrutamiento de mezcla de expertos sin restricciones.
Resultado clave
El modelo unificado alcanza 2,72 NME en 300W Común, 4,52 en 300W desafiante y 4,50 en el conjunto de pruebas WFLW; WFLW obtienen una puntuación de 7,54, 4,55, 5,53 y 5,15. En COFW fuertemente ocluido reporta 4,80 NME y una tasa de fallo del 0,39%. Los módulos de frecuencia completa y la pérdida de enrutamiento mejoran la línea base desafiante de 300W de 4,71 a 4,52, mientras que sumando los cuatro conjuntos de datos de entrenamiento se mejora un resultado de 4,97 en un solo conjunto de datos a 4,52. El rendimiento es competitivo más que uniformemente mejor, incluyendo 1,69 NME en AFLW donde los métodos especializados antiguos reportan menor error.
Resumen
Los avances recientes en aprendizaje profundo han avanzado significativamente la detección de puntos de referencia faciales. Sin embargo, la mayoría de los métodos existentes procesan características en el dominio espacial bajo un paradigma de entrenamiento específico para cada conjunto de datos, lo que pasa por alto el hecho de que la detección de puntos de referencia faciales es inherentemente impulsada por la geometría y sensible a las variaciones de frecuencia, limitando así la generalización entre distintos conjuntos de datos en escenarios complejos y obstaculizando el desarrollo de un modelo de detección de puntos de referencia faciales. Para abordar este problema, proponemos \textbf{FreqFLD}, un marco \textbf{modulado por \textit{freq}uencia} dirigido hacia la detección \textbf{todo-en-uno de puntos de referencia faciales (f\textit{l}d)}. Específicamente, FreqFLD introduce un Módulo de Modulación de Frecuencia (FreqMoM) para inducir explícitamente el prior de frecuencia mediante la desacoplación y modulación de componentes de baja y alta frecuencia, que luego se inyecta en el modelado posterior de características para permitir un modelado equilibrado de la estructura facial global y los detalles locales de los puntos de referencia. Además, FreqFLD emplea una Mezcla de Expertos Modulada por Frecuencia (FreqMoE), con selección de expertos adaptativamente condicionada por priors modulados por frecuencia, lo que permite un modelado flexible de patrones heterogéneos de puntos de referencia faciales en escenarios diversos y desafiantes. Para regular el modelado consistente en frecuencia bajo el paradigma Todo-en-uno, introducimos además una pérdida de Enrutamiento Consistente en Frecuencia (FreqCR), que restringe el enrutamiento y asignación de expertos conscientes de la frecuencia para promover una utilización equilibrada de expertos a través de diversos escenarios faciales, habilitando así la especialización estable de expertos y logrando una detección robusta de puntos de referencia faciales. Experimentos extensivos demuestran que el FreqFLD propuesto alcanza un rendimiento comparable en conjuntos de datos populares. El código está disponible en: https://github.com/jkj1059657014/FreqFLD.
Punto de partida
Los modelos de puntos de referencia faciales generalmente se entrenan por conjunto de datos, aunque las entradas de producción mezclan convenciones de puntos de referencia, poses, oclusiones, desenfoque e iluminación. Las características espaciales puras pueden sobreajustarse a un régimen de anotación y no distinguir entre la estructura facial de baja frecuencia y el detalle de los puntos de alta frecuencia. Un modelo unificado también crea conflictos de enrutamiento cuando se espera que un experto maneje todos los regímenes de geometría y calidad de imagen.
Método
El Módulo de Modulación de Frecuencia descompone las características en componentes de baja y alta frecuencia, las modela por separado e inyecta el prior resultante en capas posteriores. Una mezcla modulada en frecuencia de expertos utiliza ese prior para enrutar patrones faciales heterogéneos, mientras que la pérdida de enrutamiento consistente en frecuencia equilibra la utilización y fomenta una especialización estable. El entrenamiento conjunto iguala los cuatro conjuntos de datos fuente a 20.000 muestras cada uno, dando lugar a un pool de entrenamiento de 80.000 imágenes evaluado bajo el protocolo nativo de referencia y normalización de cada conjunto de datos.
Conclusión del artículo
El enrutamiento con conciencia de frecuencia presenta un argumento creíble para consolidar varios modelos de referencia en uno solo, pero los equipos deberían comparar errores por cámara y por esquema de hitos porque el entrenamiento unificado no gana todos los benchmarks individuales.