FreqFLD: Rumo à Detecção Completa de Marcos Faciais via Modulação de Frequência
Autores e instituições
Shun Ren
College of Computer and Information Technology, China Three Gorges University
Kaijie Jin
College of Computer and Information Technology, China Three Gorges University
Shengkai Hu
School of Information Engineering, Zhongnan University of Economics and Law
Beihang Song
National Institute of Natural Hazards, Ministry of Emergency Management of China
Hang Sun
College of Computer and Information Technology, China Three Gorges University
Wenwen Min
School of Information Science and Engineering, Yunnan University
Youfa Liu
School of Computer Science, Wuhan University
Jun Wan
School of Information Engineering, Zhongnan University of Economics and Law
School of Computer Science and Engineering, Nanyang Technological University
Que problema resolve
O FreqFLD tem como alvo um detector de referência tudo-em-um que pode ser treinado conjuntamente em 300W, AFLW, COFW e WFLW, mantendo-se competitivo em cada benchmark e robusto em seus subconjuntos difíceis. O artigo questiona se priors explícitos de frequência podem orientar a especialização de especialistas de forma mais confiável do que o roteamento de mistura de especialistas sem restrições.
Resultado-chave
O modelo unificado atinge 2,72 NME em 300W Comum, 4,52 em 300W desafiador e 4,50 no conjunto de teste WFLW; Os subconjuntos de pose, iluminação, oclusão e desfoque WFLW pontuam 7,54, 4,55, 5,53 e 5,15. Em COFW fortemente ocluído, ele reporta 4,80 NME e taxa de falha de 0,39%. Os módulos de frequência completos e a perda de roteamento melhoram a linha base desafiadora de 300W de 4,71 para 4,52, enquanto a somação dos quatro conjuntos de dados de treinamento eleva um resultado único de 4,97 para 4,52. O desempenho é competitivo, e não uniformemente melhor, incluindo 1,69 NME no AFLW, onde métodos especializados mais antigos reportam menor erro.
Resumo
Avanços recentes em aprendizado profundo avançaram significativamente a detecção de marcos faciais. No entanto, a maioria dos métodos existentes processa características de forma espacial sob um paradigma de treinamento específico para cada conjunto, o que ignora o fato de que a detecção de marcos faciais é inerentemente orientada pela geometria e sensível a variações de frequência, limitando assim a generalização entre conjuntos de dados em cenários complexos e dificultando o desenvolvimento de um modelo de detecção de marcos faciais. Para resolver essa questão, propomos \textbf{FreqFLD}, uma estrutura modulada por frequência \textbf{f}acial \textbf{l}andmark \textbf{d}etection. Especificamente, a FreqFLD introduz um Módulo de Modulação de Frequência (FreqMoM) para induzir explicitamente o prior de frequência por meio do desacoplamento e modulação de componentes de baixa e alta frequência, que é então injetado na modelagem de características subsequentes para permitir modelagem equilibrada da estrutura facial global e dos detalhes locais de referência. Além disso, o FreqFLD emprega uma Mistura de Especialistas Modulada em Frequência (FreqMoE), com seleção de especialistas condicionada adaptativamente a priors modulados em frequência, permitindo modelagem flexível de padrões heterogêneos de marcos faciais sob cenários diversos e desafiadores. Para regularizar a modelagem consistente em frequência sob o paradigma All-in-One, introduzimos ainda uma perda de Roteamento Consistente em Frequência (FreqCR), que restringe o roteamento e a atribuição de especialistas conscientes da frequência para promover uma utilização equilibrada de especialistas em diversos cenários faciais, permitindo assim especialização estável de especialistas e alcançando detecção robusta de marcos faciais. Experimentos extensos demonstram que o FreqFLD proposto alcança desempenho comparável em conjuntos de dados populares. O código está disponível em: https://github.com/jkj1059657014/FreqFLD.
Ponto de partida da pesquisa
Modelos de marcos faciais geralmente são treinados por conjunto de dados, mesmo que as entradas de produção misturem convenções de marcos, poses, oclusões, desfoque e iluminação. Características espaciais puras podem se ajustar demais a um regime de anotação e perder a distinção entre estrutura facial de baixa frequência e detalhes de pontos de referência de alta frequência. Um modelo unificado também cria conflitos de roteamento quando se espera que um especialista cuide de todos os regimes de geometria e qualidade de imagem.
Método
O Módulo de Modulação de Frequência decompõe características em componentes de baixa e alta frequência, os modela separadamente e injeta o prior resultante em camadas a jusante. Uma mistura modulada em frequência de especialistas usa essa do prior para rotear padrões faciais heterogêneos, enquanto o Roteamento Consistente em Frequência equilibra a utilização e incentiva uma especialização estável. O treinamento conjunto iguala os quatro conjuntos de dados fonte para 20.000 amostras cada, resultando em um pool de treinamento de 80.000 imagens avaliado sob o marco nativo de cada conjunto de dados e protocolo de normalização.
Síntese do artigo
O roteamento consciente da frequência apresenta um argumento credível para consolidar vários modelos de referência em um só, mas as equipes devem comparar erros por câmera e por esquema de referência, pois o treinamento unificado não vence todos os benchmarks individuais.