Autores e instituições
Sebastian Regalado
University of Toronto, Canada
ModiFace, Canada
Varshanth R. Rao
ModiFace, Canada
Ruowei Jiang
ModiFace, Canada
Parham Aarabi
University of Toronto, Canada
Igor Gilitschenski
University of Toronto, Canada
Que problema resolve
O artigo define um sistema de coordenadas semântico comum para layouts heterogêneos de pontos de referência e o utiliza para treinar um detector em múltiplos conjuntos de dados. No momento da inferência, a mesma rede pode responder a uma coleção arbitrária de consultas de pontos de referência, incluindo pontos não explicitamente solicitados durante o treinamento no conjunto de dados de origem.
Resultado-chave
O modelo unificado ViT-B com adaptadores registra 4,02 NME e uma taxa de falha de 2,19% no WFLW, 2,43/4,19 NME nas divisões comuns/desafiadoras do 300W e 2,76 NME no AFLW-19, enquanto suporta treinamento fundido e saída dinâmica. Quando treinado apenas no 300W, atinge 6,08 NME no teste de transferência desafiador WFLW68, versus 7,23 para DTLD e 8,09 para PIPNet. Em pontos de referência nativos retidos, consultas aprendidas melhoram sobre a interpolação por spline em 19,0% no 300W e em 15,7-16,3% nas divisões WFLW, indicando que o modelo aprende semântica de contorno reutilizável em vez de apenas memorizar índices fixos.
Resumo
Embora os avanços em métodos de detecção de marcos de rosto (FLD) continuem ultrapassando limites de desempenho, eles ignoram duas grandes limitações funcionais: (1) diferentes parâmetros de rede precisam ser treinados independentemente para cada conjunto de dados de referência ''$N$-point'', e (2) um modelo treinado em um conjunto de dados ''$N$-point'' gera de forma confiável apenas os marcos de referência $N$. Em nosso trabalho, primeiro conceituamos as Face-Part-Anchored Landmark Positions (FPALPs), onde cada marco é tratado como um valor de progressão entre zero (início) e um (extremidade) ao longo do contorno de uma parte de face. Cada marco pode ser expresso no formato FPALP, independentemente do conjunto de dados de origem, desbloqueando assim a capacidade de unificar todos os conjuntos de dados ''$N$-point'' em um único conjunto de dados. Em segundo lugar, representamos cada ponto com uma consulta baseada em FPALP, refinamos progressivamente com um decodificador cross-modality e prevemos suas coordenadas com base na representação final. Nossa abordagem, chamada Unified Dynamic FLD, incorpora essas duas escolhas de design e simplifica o pipeline de detecção de marcos ao permitir (1) que um único modelo aprenda em qualquer número de conjuntos de dados ''$N$-point'', e (2) gerar qualquer número de previsões específicas de marcos ao carregar as consultas designadas em tempo de execução. Experimentos extensos em múltiplos conjuntos de dados de referência mostram que nosso método entrega esses benefícios enquanto permanece competitivo e, em vários casos, supera métodos de ponta existentes.
Ponto de partida da pesquisa
Conjuntos de dados de pontos faciais discordam sobre se um rosto possui 19, 68, 98 ou outro número de pontos anotados. Modelos convencionais vinculam sua cabeça de regressão a um modelo específico, obrigando as equipes a treinar e manter parâmetros separados para cada conjunto de dados e impedindo que um modelo implantado retorne um novo subconjunto ou um layout mais denso sob demanda. Essa fragmentação é custosa para pipelines de alinhamento, reconstrução, maquiagem e expressão que consomem diferentes convenções de pontos de referência faciais.
Método
Cada ponto de referência se torna uma Posição de Ponto de Referência Ancorada a Parte do Rosto (FPALP, na sigla em inglês): uma progressão normalizada de zero a um ao longo de um contorno semântico, como sobrancelha, olho, nariz, boca ou limite do rosto. Os modelos de conjuntos de dados são alinhados nesse espaço de contorno, e cada ponto solicitado é codificado como uma consulta FPALP. Um decodificador multimodal combina progressivamente tokens de imagem e consultas antes de regredir as coordenadas. O modelo ViT-B é treinado conjuntamente nos conjuntos AFLW-19, 300W e WFLW; adaptadores de conjunto de dados opcionais e leves recuperam deslocamentos sistemáticos de anotação sem abrir mão do backbone unificado ou do layout de saída configurável em tempo de execução.
Síntese do artigo
Um único serviço de pontos de referência orientado por consultas pode substituir vários modelos específicos de template, preservando precisão competitiva. A abordagem é especialmente atraente quando produtos precisam de múltiplos formatos de alinhamento ou antecipam a adição de novas definições de pontos de referência, embora as equipes ainda devam testar adaptadores de deslocamento de anotação para cada conjunto de dados de produção.