← Voltar ao Blog
Radar de PesquisaDetecção facialMarcos FaciaisarXivSetembro de 2026

Radar Mensal do arXiv

Artigos de Setembro de 2026 sobre Detecção de Rostos: Marcos Unificados, Alinhamento de Difusão e Implantação em Salas de Aula

Os artigos diretos de face-box eram escassos em setembro, então este resumo segue a pilha de localização adjacente que os sistemas de produção precisam após a encontração de uma caixa. O FreqFLD treina um modelo de referência consciente da frequência em quatro conjuntos de dados. O FAHCD-Net trata os mapas de calor de marcos como um problema condicional de desruído sob mudanças de pose, oclusão, desfoque e iluminação. O estudo do Visage reúne detecção e reconhecimento em imagens de sala de aula congestionadas, onde o throughput e os rostos perdidos importam tanto quanto a precisão da identidade no top.

O que este mês sinaliza

O FreqFLD equilibra a estrutura global e o detalhe local dividindo componentes de frequência e roteando amostras por especialistas condicionados à frequência; um modelo treinado conjuntamente atinge 4,50 NME em WFLW e 4,80 NME com taxa de falha de 0,39% em COFW ocluído. FAHCD-Net, por sua vez, cascata estágios de difusão condicional e suprime ruído redundante de mapas de calor de alta frequência, reduzindo o NME de 300W de 4,48 no estágio um para 4,29 no estágio três. O estudo Visage relata que um YOLOv8n com 3,2 milhões de parâmetros atinge 0,935 mAP@0,5, enquanto detectores muito maiores ganham precisão a um custo significativo de parâmetro; vários reconhecedores alcançam 99,75% no top-1 em seu conjunto de 100 classes de reconhecimento. Esses resultados são promissores, mas os dois artigos emblemáticos permanecem como estudos de referência e os dados de sala de aula vêm de um ambiente institucional limitado, então validação cruzada ainda é necessária.

Artigo 012026-09-09cs.CV

FreqFLD: Rumo à Detecção Completa de Marcos Faciais via Modulação de Frequência

Autores e instituições

Shun Ren

College of Computer and Information Technology, China Three Gorges University

Kaijie Jin

College of Computer and Information Technology, China Three Gorges University

Shengkai Hu

School of Information Engineering, Zhongnan University of Economics and Law

Beihang Song

National Institute of Natural Hazards, Ministry of Emergency Management of China

Hang Sun

College of Computer and Information Technology, China Three Gorges University

Wenwen Min

School of Information Science and Engineering, Yunnan University

Youfa Liu

School of Computer Science, Wuhan University

Jun Wan

School of Information Engineering, Zhongnan University of Economics and Law

School of Computer Science and Engineering, Nanyang Technological University

Que problema resolve

O FreqFLD tem como alvo um detector de referência tudo-em-um que pode ser treinado conjuntamente em 300W, AFLW, COFW e WFLW, mantendo-se competitivo em cada benchmark e robusto em seus subconjuntos difíceis. O artigo questiona se priors explícitos de frequência podem orientar a especialização de especialistas de forma mais confiável do que o roteamento de mistura de especialistas sem restrições.

Resultado-chave

O modelo unificado atinge 2,72 NME em 300W Comum, 4,52 em 300W desafiador e 4,50 no conjunto de teste WFLW; Os subconjuntos de pose, iluminação, oclusão e desfoque WFLW pontuam 7,54, 4,55, 5,53 e 5,15. Em COFW fortemente ocluído, ele reporta 4,80 NME e taxa de falha de 0,39%. Os módulos de frequência completos e a perda de roteamento melhoram a linha base desafiadora de 300W de 4,71 para 4,52, enquanto a somação dos quatro conjuntos de dados de treinamento eleva um resultado único de 4,97 para 4,52. O desempenho é competitivo, e não uniformemente melhor, incluindo 1,69 NME no AFLW, onde métodos especializados mais antigos reportam menor erro.

Resumo

Avanços recentes em aprendizado profundo avançaram significativamente a detecção de marcos faciais. No entanto, a maioria dos métodos existentes processa características de forma espacial sob um paradigma de treinamento específico para cada conjunto, o que ignora o fato de que a detecção de marcos faciais é inerentemente orientada pela geometria e sensível a variações de frequência, limitando assim a generalização entre conjuntos de dados em cenários complexos e dificultando o desenvolvimento de um modelo de detecção de marcos faciais. Para resolver essa questão, propomos \textbf{FreqFLD}, uma estrutura modulada por frequência \textbf{f}acial \textbf{l}andmark \textbf{d}etection. Especificamente, a FreqFLD introduz um Módulo de Modulação de Frequência (FreqMoM) para induzir explicitamente o prior de frequência por meio do desacoplamento e modulação de componentes de baixa e alta frequência, que é então injetado na modelagem de características subsequentes para permitir modelagem equilibrada da estrutura facial global e dos detalhes locais de referência. Além disso, o FreqFLD emprega uma Mistura de Especialistas Modulada em Frequência (FreqMoE), com seleção de especialistas condicionada adaptativamente a priors modulados em frequência, permitindo modelagem flexível de padrões heterogêneos de marcos faciais sob cenários diversos e desafiadores. Para regularizar a modelagem consistente em frequência sob o paradigma All-in-One, introduzimos ainda uma perda de Roteamento Consistente em Frequência (FreqCR), que restringe o roteamento e a atribuição de especialistas conscientes da frequência para promover uma utilização equilibrada de especialistas em diversos cenários faciais, permitindo assim especialização estável de especialistas e alcançando detecção robusta de marcos faciais. Experimentos extensos demonstram que o FreqFLD proposto alcança desempenho comparável em conjuntos de dados populares. O código está disponível em: https://github.com/jkj1059657014/FreqFLD.

Ponto de partida da pesquisa

Modelos de marcos faciais geralmente são treinados por conjunto de dados, mesmo que as entradas de produção misturem convenções de marcos, poses, oclusões, desfoque e iluminação. Características espaciais puras podem se ajustar demais a um regime de anotação e perder a distinção entre estrutura facial de baixa frequência e detalhes de pontos de referência de alta frequência. Um modelo unificado também cria conflitos de roteamento quando se espera que um especialista cuide de todos os regimes de geometria e qualidade de imagem.

Método

O Módulo de Modulação de Frequência decompõe características em componentes de baixa e alta frequência, os modela separadamente e injeta o prior resultante em camadas a jusante. Uma mistura modulada em frequência de especialistas usa essa do prior para rotear padrões faciais heterogêneos, enquanto o Roteamento Consistente em Frequência equilibra a utilização e incentiva uma especialização estável. O treinamento conjunto iguala os quatro conjuntos de dados fonte para 20.000 amostras cada, resultando em um pool de treinamento de 80.000 imagens avaliado sob o marco nativo de cada conjunto de dados e protocolo de normalização.

Síntese do artigo

O roteamento consciente da frequência apresenta um argumento credível para consolidar vários modelos de referência em um só, mas as equipes devem comparar erros por câmera e por esquema de referência, pois o treinamento unificado não vence todos os benchmarks individuais.

Artigo 022026-09-15cs.CV

FAHCD-Net: Redes de Difusão Condicional de Mapa de Calor Adaptativo à Frequência para Detecção Robusta de Marcos Faciais

Autores e instituições

Jun Wan

School of Information Engineering, Zhongnan University of Economics and Law

Jiwei Hu

School of Information Engineering, Zhongnan University of Economics and Law

Shengkai Hu

School of Information Engineering, Zhongnan University of Economics and Law

Qilu Zhu

School of Information Engineering, Zhongnan University of Economics and Law

Que problema resolve

O FAHCD-Net busca localização robusta de marcos sob pose, oclusão, iluminação e desfoque, tornando um processo de difusão condicionado a mapa de calor explicitamente consciente da frequência. Também testa se uma cascata pode melhorar progressivamente uma condição inicial de forma média em vez de depender de um mapa de calor inicial gerado pelo detector de alta qualidade.

Resultado-chave

FAHCD-Net relata 2,51 NME em 300W Comum, 2,99 no conjunto completo, 1,17 em AFLW frontal e 2,08 em AFLW completo. Em 300W desafiador, estágios sucessivos de difusão reduzem NME de 4,48 para 4,33 e depois 4,29, em comparação com 4,81, 4,73 e 4,69 ao condicionar em uma forma média. Adicionar dados de treinamento COFW, WFLW e AFLW melhora o resultado desafiador relatado de 300W de 4,76 para 4,49 na ablação multi-conjunto. O artigo demonstra robustez em benchmarks, mas não relata latência detector-mais-marco, então o custo da difusão iterativa permanece uma questão de implantação.

Resumo

A Detecção de Marcos Faciais (FLD) é uma tarefa crucial em várias aplicações e alcançou avanços significativos nos últimos anos. No entanto, os métodos atuais de FLD ainda enfrentam dificuldades em condições desafiadoras, onde variações estruturais faciais, perda de informação e interferência de ruído comprometem severamente a integridade e precisão das características faciais aprendidas. Para resolver essas questões, propomos a Frequency-Adaptive Heatmap-Conditional Diffusion Network (FAHCD-Net), que integra um modelo de Frequency-Adaptive Heatmap-Conditional Diffusion (FAHCD) com uma perda de Regularização de Suavidade (SR) em uma estrutura em cascata. Especificamente, o modelo FAHCD incorpora um módulo de Adaptação de Frequência Hierárquica (HFA) projetado para suprimir ruído redundante de alta frequência por meio de decomposição de frequências multicamadas e reconstrução adaptativa, preservando assim estruturas faciais essenciais. Além disso, a perda SR é proposta para mitigar ainda mais a interferência do ruído de alta frequência e melhorar a suavidade dos mapas de calor gerados por marcos históricos. Ao conjurar o modelo FAHCD com a perda de SR, o FAHCD-Net aproveita efetivamente tanto características estatísticas quanto de distribuição baseadas em frequência dos dados para gerar progressivamente mapas de calor de referência mais precisos a partir de entradas ruidosas. Experimentos extensivos em benchmarks populares demonstram a eficácia e robustez do método proposto, alcançando desempenho de ponta em tarefas FLD sob cenários desafiadores. O código-fonte está disponível em https://github.com/HJWKryptonite/FAHCD-Net.

Ponto de partida da pesquisa

Mapas de calor de marcos se deterioram quando a pose ou expressão muda a estrutura do rosto, quando a oclusão remove evidências e quando o desfoque ou a iluminação injetam ruído de alta frequência. A regressão padrão trata esses efeitos como erros diretos de previsão. A difusão oferece recuperação iterativa de evidências ruidosas ou incompletas, mas a redução de ruído sem restrições pode produzir energia espúria de mapas de calor de alta frequência e picos instáveis.

Método

Cada estágio em cascata utiliza um modelo de Mapa de Calor Adaptativo em Frequência - Difusão Condicional para refinar distribuições de marcos de referência. A Adaptação Hierárquica de Frequência decompõe e reconstrói repetidamente características para que a estrutura facial de baixa frequência seja mantida enquanto ruído redundante de alta frequência é suprimido. Um termo de regularização de suavidade alinha o comportamento de frequência gerado em mapas de calor com a verdade no terreno. O treinamento multi-conjunto de dados adiciona COFW, WFLW e AFLW a 300W, e três estágios passam seus mapas de calor previstos como a próxima condição.

Síntese do artigo

A difusão condicional pode recuperar mapas de calor de marcos mais limpos em imagens difíceis, mas seu custo iterativo deve ser medido em relação ao orçamento de latência da câmera e a uma base forte de alinhamento não difusivo.

Artigo 032026-09-19cs.CV

Rumo a uma Chamada Escolar Robusta: Uma Avaliação Abrangente de Modelos de Detecção e Reconhecimento Facial

Autores e instituições

Himani Trivedi

Computer Engineering Department, LDRP Institute of Technology and Research, Kadi Sarva Vishwavidyalaya

Hiren Patel

Vidush Somany Institute of Technology and Research, Kadi Sarva Vishwavidyalaya

Ridham Patel

Information Technology Department, LDRP Institute of Technology and Research, Kadi Sarva Vishwavidyalaya

Krutika Patel

Information Technology Department, LDRP Institute of Technology and Research, Kadi Sarva Vishwavidyalaya

Nancy Patel

Information Technology Department, LDRP Institute of Technology and Research, Kadi Sarva Vishwavidyalaya

Que problema resolve

O estudo introduz conjuntos de dados de detecção e reconhecimento pareados para condições de sala de aula e compara uma família de tamanhos de detectores com sete arquiteturas atuais de reconhecimento facial. Seu objetivo é identificar um ponto operacional prático de precisão e eficiência, em vez de assumir que o maior detector ou reconhecor é o melhor componente de presença.

Resultado-chave

O YOLOv8n usa 3,2 milhões de parâmetros e atinge 0,932 de precisão, 0,886 de recall, 0,91 F1 e 0,935 mAP@0,5; variantes maiores se aproximam de aproximadamente 0,97 mAP@0,5, mas usam de 43,7 milhões a 68,2 milhões de parâmetros. Em reconhecimento, FaceLiVTv2-L, EdgeFace Base, LVFace ViT-B e TransFace ViT-B alcançam 99,75% de Top-1 na tabela reportada. EdgeFace Base faz isso em 4,029 ms, mais rápido que FaceLiVTv2-L com 6,081 ms, enquanto os tamanhos dos modelos variam amplamente. São resultados fechados de um conjunto limitado de instituições educacionais, portanto não estabelecem resistência a falsificações, generalização entre escolas ou adequação política para frequência automatizada.

Resumo

Métodos manuais de assiduidade, como sistemas baseados em papel ou registro, levam muito tempo, podem causar erros e são fáceis de falsificar. O reconhecimento facial é mais confiável, mas frequentemente tem dificuldades em salas de aula porque a iluminação e outras condições podem variar. Conjuntos de dados de reconhecimento facial são projetados para ambientes regulados e não capturam os desafios reais encontrados nas salas de aula. Para resolver isso, é proposto um novo conjunto de dados de detecção e reconhecimento facial, o Visage Face, composto por 16.234 amostras faciais, para a tarefa de detecção e reconhecimento de rostos. As fotos são tiradas de diferentes ângulos e sob condições de iluminação variadas, com estudantes exibindo uma variedade de expressões e alguns rostos parcialmente cobertos para refletir situações da vida real. Um sistema baseado em YOLO é usado para detectar rostos e testou sete modelos avançados de reconhecimento facial com treze configurações: LVFace, QCFace, FaceLiVTv2, TopoFR, EdgeFace, TransFace e GhostFaceNets. Desses, o FaceLiVTv2-M teve o melhor desempenho, com 99,75% de precisão no Top-1/Top-5 e um tempo de inferência de 6,459 ms. Esses resultados mostram que o Visage Face Dataset é um parâmetro realista e desafiador para o reconhecimento facial na frequência em sala de aula.

Ponto de partida da pesquisa

A frequência em sala de aula combina muitos rostos pequenos, poses e iluminação variadas, oclusão parcial e a necessidade de processar quadros de vídeo repetidos em hardware acessível. Conjuntos de dados gerais de rostos não reproduzem esse ambiente operacional, enquanto apenas o relato de precisão do reconhecimento esconde detecções perdidas e custos computacionais. As instituições também precisam de dados coletados com consentimento, em vez de imagens de identidade reaproveitadas.

Método

Os autores coletam 801 imagens de sala de aula, anotam manualmente rostos e usam rotação, escala, translação, ruído e inversão para construir o conjunto de detecção; o artigo relata 3.635 imagens de detecção e 96.409 anotações faciais após a ampliação. O conjunto de reconhecimento contém 3.500 imagens em 100 classes, alinhadas a partir de cinco marcos do RetinaFace e normalizadas para 112 por 112. Variantes YOLOv8 n/s/m/l/x são avaliadas para detecção, e treze configurações de LVFace, QCFace, FaceLiVTv2, TopoFR, EdgeFace, TransFace e GhostFaceNets são comparadas para reconhecimento.

Síntese do artigo

O resultado útil é a troca entre detector e reconhecimento medido, não a pontuação quase perfeita em conjunto fechado. Um piloto deve reproduzir recall, latência, consentimento, falsificação e comportamento de pessoa desconhecida nas próprias câmeras da instituição.