← Voltar ao Blog
Radar de PesquisaReconhecimento FacialarXivSetembro de 2026

Radar Mensal do arXiv

Artigos sobre Reconhecimento Facial de Setembro de 2026: Correspondência Mais Justa, Adaptação Térmica e o Teste dos Gêmeos

A pesquisa de setembro sobre reconhecimento facial trata menos de outra corrida por backbones e mais sobre regimes operacionais difíceis. DenseFace altera a regra de correspondência de um modelo existente para reduzir disparidades de falsos pares por raça. SynThermFace transforma pares visível-térmico escassos em um conjunto de adaptação maior sem adicionar tradução de imagem na inferência. O Conjunto de Teste Celeb Twins, então, pergunta se os embeddings atuais usam os pequenos sinais locais nos quais os humanos confiam para distinguir gêmeos monozigóticos.

O que este mês sinaliza

DenseFace mostra que a densidade local do embedding pode ser usada como um sinal probabilístico de correspondência pós-hoc, aproximando várias taxas de falso par não caucasianas de uma referência caucasiana enquanto preserva a precisão da verificação. SynThermFace usa um modelo de difusão apenas durante o treinamento, depois realiza uma única passagem adaptada do EdgeFace; seu modelo de pares sintéticos alcança 0,99% EER no MCXFace, mas 14,70% nos dados não vistos do Tufts, então a transferência de sensor continua sendo relevante. CTTS contribui com 21.120 pares focados em gêmeos e encontra que doze variantes modernas de comparadores mantêm cerca de 73-77% de precisão, embora sua média usual de benchmark seja cerca de 97%. A lição compartilhada é validar separadamente a regra de correspondência, o espectro de captura e a população de identidades difíceis, em vez de tratar uma pontuação agregada como preparação para produção.

Artigo 012026-09-14cs.CV

DenseFace: Mitigação de Viés em Reconhecimento Facial via Correspondência Probabilística Sensível à Densidade

Autores e instituições

Mansur Bultygov

VisionLabs

Vadim Seliutin

Amazon Web Services

VisionLabs (work performed there)

Dmitry Nekhaev

VisionLabs

Ivan Laptev

Mohamed bin Zayed University of Artificial Intelligence

Que problema resolve

DenseFace questiona se as disparidades de falso-positivo racial podem ser reduzidas no momento da comparação, sem alterar ou re-treinar o codificador facial subjacente. Ele também substitui o desvio padrão de precisão por subgrupo por um protocolo voltado para implantação: definir um limiar na taxa de falso-positivo de 0,001 para caucasianos e medir o quanto cada outro grupo se afasta da paridade.

Resultado-chave

Nos modelos CosFace e AdaFace treinados com Glint360K, MS1MV2, WebFace4M, WebFace12M e BUPT-BalancedFace, o mesmo limiar global torna-se substancialmente mais uniforme. No modelo BUPT, o múltiplo de falso-positivo do grupo africano cai de 6,15 para 1,43 e o grupo indiano de 4,01 para 1,03 em relação à referência caucasiana. A precisão convencional da verificação é preservada: para um modelo CosFace Glint360K, a precisão média do RFW sobe de 98,61% para 98,68%, enquanto o desvio padrão por subgrupo cai de 0,53 para 0,44. O regressor adiciona cerca de 0,2% de memória e 1,75% de latência de ponta a ponta no teste em GPU dos autores; seu cálculo otimizado em CPU custa cerca de 1,5 vezes o custo do cosseno bruto. Os resultados ainda dependem de um conjunto de referência representativo ou população de treinamento do regressor.

Resumo

Apesar do progresso constante no reconhecimento facial, os modelos atuais de reconhecimento facial ainda sofrem de vieses demográficos significativos. Embora tenham sido propostas abordagens para mitigar o viés, os métodos existentes frequentemente impõem restrições ao procedimento de treinamento e resultam na degradação da precisão do reconhecimento. Para abordar essa questão, apresentamos aqui um método que reduz o viés racial em modelos de reconhecimento facial pré-treinados sem comprometer sua precisão. Para tanto, modelamos as embeddings faciais de cada pessoa usando a distribuição von Mises-Fisher (MF). Em seguida, observamos a dependência entre os atributos demográficos e a densidade das distribuições MF, e propomos o DenseFace, um procedimento probabilístico de correspondência facial que leva em conta as diferenças nas distribuições MF. Nossos extensos experimentos demonstram que o DenseFace reduz consistentemente o viés racial em modelos de reconhecimento facial avançados, variando nas arquiteturas de rede, conjuntos de dados de treinamento e funções de perda. Notavelmente, o DenseFace preserva a precisão do reconhecimento e não requer re-treinamento do modelo de reconhecimento facial subjacente. Nosso trabalho também investiga medidas de viés previamente adotadas e faz sugestões.

Ponto de partida da pesquisa

Sistemas de reconhecimento facial frequentemente usam um único limiar de decisão global, mas as distribuições de pontuação de impostores diferem entre grupos demográficos. Um modelo, portanto, pode parecer preciso no RFW quando cada grupo recebe seu próprio limiar validado cruzadamente, enquanto produz taxas de falso-positivo muito diferentes em um serviço real. A maioria dos métodos de mitigação também requer dados de retrainamento balanceados, mudanças na arquitetura ou perdas de equidade que podem reduzir o desempenho do reconhecimento e são difíceis de implementar em um modelo aprovado.

Método

Para cada embeddin facial, o método encontra as identidades mais próximas em um conjunto de referência demograficamente equilibrado e estima a densidade interclasse local. Representa o embedding com uma distribuição von Mises-Fisher cuja concentração reflete essa densidade, e em seguida avalia um par pela probabilidade mútua em vez da similaridade cosseno bruta. Uma margem separa as identidades de vizinhos próximos, e uma variante leve de regressor prevê a densidade diretamente para que a comparação em produção não precise de uma pesquisa em grande conjunto de referência. O codificador, a dimensão do embedding e os dados de cadastro permanecem inalterados.

Síntese do artigo

Um controle de justiça na camada de comparação pode melhorar a paridade de coorte sem reabrir o treinamento do modelo, mas não elimina a necessidade de dados de calibração representativos e monitoramento de subgrupos no limiar operacional real.

Artigo 022026-09-09cs.CV

SynThermFace: Amplificação de Dados Pareados Limitados para Reconhecimento Facial Visível-Térmico via Geração de Dados Sintéticos

Autores e instituições

Anjith George

Idiap Research Institute, Switzerland

Adam Unal

Idiap Research Institute, Switzerland

Sebastien Marcel

Idiap Research Institute, Switzerland

University of Lausanne, Switzerland

Que problema resolve

O SynThermFace amplifica a supervisão limitada em pares para reconhecimento do visível para térmico e testa se pares térmicos sintéticos melhoram tanto a precisão no banco de dados quanto a transferência para um sensor/banco de dados que nunca foi usado para treinamento. Ele separa o benefício do objetivo de adaptação do benefício de escalar identidades sintéticas.

Resultado-chave

Na divisão de desenvolvimento do MCXFace de forma disjunta, o PACT de pares reais atinge 3,04% EER e 96,49% Rank-1, superando as referências de adaptação de pares reais comparadas. Com 1.000 identidades sintéticas derivadas do CASIA, o EER cai para 0,99%, o Rank-1 atinge 99,75% e a verificação em 0,1% FAR atinge 93,48%; a linha de base não adaptada do EdgeFace tem 23,06% EER e 40,10% Rank-1. Em dados Tufts não vistos, o treinamento derivado do Digi2Real melhora o EdgeFace de 43,41% para 13,91% EER e de 12,03% para 56,37% no Rank-1. A diferença restante MCXFace-Tufts é grande, e o gerador ainda depende de pares reais de MCXFace, então o método reduz, em vez de eliminar, a coleta cruzada real de espectros.

Resumo

O reconhecimento facial (FR) é uma modalidade amplamente utilizada para autenticação biométrica, mas modelos convencionais dependem de imagens do espectro visível e se degradam quando imagens RGB de alta qualidade não podem ser capturadas. O reconhecimento facial cross-spectral resolve essa limitação ao combinar imagens visíveis com outras modalidades, como imagens térmicas, permitindo desempenho mais confiável em condições de pouca luz, noturnas e sem restrições. No entanto, o progresso é limitado pela escassez de dados visível-térmicos pareados, que é difícil e custosa de coletar em larga escala. Propomos o SynThermFace, uma estrutura que amplifica a supervisão visível-térmica real limitada em conjuntos de dados maiores de adaptação pareada para reconhecimento facial cross-espectral. Um modelo de difusão é primeiro adaptado usando um conjunto limitado de imagens visíveis pareadas — térmicas — e depois usado para gerar dados térmicos sintéticos em grande escala pareados de conjuntos de dados reais ou sintéticos de rostos visíveis existentes. Os pares gerados são usados para adaptar um modelo pré-treinado de reconhecimento facial visível em um modelo CFR. Diferentemente das abordagens baseadas em síntese, que exigem tradução de imagem no momento do teste, o método proposto desloca a geração para a etapa de treinamento e realiza inferência com uma única passagem direta pelo modelo de reconhecimento adaptado. Sob o mesmo protocolo MCXFace de par real, o PACT melhora em relação às linhas de base avaliadas da adaptação do CFR, isolando o efeito do objetivo proposto de adaptação. Treinar o PACT em conjuntos de dados gerados maiores oferece melhorias adicionais tanto em relação ao modelo não adaptado quanto à configuração PACT de par real. A avaliação entre bancos de dados no conjunto de dados Tufts fornece evidências de que a representação aprendida é transferida para um banco de dados não visível. O código-fonte e os modelos treinados serão disponibilizados publicamente.

Ponto de partida da pesquisa

Câmeras térmicas podem suportar autenticação e vigilância quando a captura de luz visível falha, mas a maioria das galerias de identidade são RGB e faces visíveis-térmicas pareadas são caras de coletar. Traduzir diretamente cada sonda térmica em tempo de execução adiciona um gerador ao caminho crítico e pode alterar a identidade. A questão prática é se um pequeno conjunto real pareado pode supervisionar um conjunto de treinamento muito maior enquanto deixa a implantação como uma busca normal de embedding.

Método

Um gerador de difusão é primeiro adaptado na divisão de treinamento MCXFace pareada, depois converte imagens reais CASIA-WebFace ou identidades sintéticas Digi2Real em vistas térmicas correspondentes. O Ajuste Cross-Spectral Consciente de Preservação parte de um modelo EdgeFace pré-treinado e combina aprendizado contrastivo simétrico térmico-para-visível e visível-térmico com uma perda que mantém embeddings visíveis próximos a uma cópia congelada do modelo original. A geração ocorre apenas durante a construção do conjunto de adaptação; a inferência é uma passagem direta pelo reconhecor sintonizado.

Síntese do artigo

A geração térmica sintética offline pode transformar uma pequena coleção pareada em supervisão útil de reconhecimento sem tradução em tempo de execução, mas novos sensores e populações ainda precisam de seus próprios testes de transferência e equidade.

Artigo 032026-09-01cs.CV

Revisitando o Reconhecimento Facial de Gêmeos Monozigóticos: O Conjunto de Teste Celeb Twins

Autores e instituições

Michael Zang

Department of Computer Science and Engineering, University of Notre Dame

Haiyu Wu

Department of Computer Science and Engineering, University of Notre Dame

Mrinal Sharma

Department of Computer Science and Engineering, University of Notre Dame

Kevin W. Bowyer

Department of Computer Science and Engineering, University of Notre Dame

Que problema resolve

O artigo cria um benchmark no estilo verificação que é grande o suficiente para validação cruzada de dêmeas disjuntas e anotado para marcas distintivas locais e possível assimetria de espelhos. Em seguida, testa se os deep face matchers modernos exploram essas pistas e se a remoção de suposições de flip horizontal ou a geração de gêmeos sintéticos fornece um caminho plausível para o futuro.

Resultado-chave

As doze configurações de matchers alcançam apenas 73,14-76,50% de precisão média CTTS, contra aproximadamente 97,00-97,69% de média em cinco conjuntos convencionais de verificação. Apagar marcas visíveis deixa os embeddings e distribuições de distância de pares essencialmente inalterados, indicando que os modelos atuais ignoram pistas que os humanos podem usar. O retreinamento consciente da assimetria atinge 78,58% mais ou menos 3,7 e não é estatisticamente diferente do modelo original; ele ajuda alguns conjuntos de gêmeos espelho e prejudica outros. Gêmeos gerados não preservam uma estrutura realista de distância dentro da pessoa e entre gêmeos, então ainda não são substitutos validados do treinamento.

Resumo

Literatura anterior sobre reconhecimento facial para gêmeos monozigóticos ("idênticos") aponta para marcas faciais e assimetria de espelhos como possíveis direções para melhorar a precisão do reconhecimento de gêmeos. O Conjunto de Teste de Gêmeos Celebridades (CTTS) contém pares de imagens raspadas na web para 80 pares de gêmeos celebridades. É o único conjunto de teste de gêmeos com meta-dados para gêmeos com marcas de pele distintas e possível assimetria de espelhos. O CTTS é organizado da forma de conjuntos de testes de verificação facial, como LFW, CALFW, CPLFW, CFP-FP e AgeDB-30. Os atuais comparadores profundos de CNN conseguem alcançar mais de 76% de precisão na classificação de pares de imagens CTTS entre pessoas e pessoas diferentes. Mostramos que os correspondentes atuais não utilizam marcas de pele ou assimetria, e discutimos as razões para isso. Por fim, discutimos a viabilidade de usar ferramentas de IA generativa como Grok, ChatGPT e Gemini para criar imagens de gêmeos monozigóticos imaginados como forma de aumentar a representação de gêmeos em conjuntos de treinamento de reconhecimento facial.

Ponto de partida da pesquisa

Gêmeos monozigóticos expõem uma fronteira de identidade que os benchmarks comuns de rosto mal representam. O NIST já relatou que, em um limiar escolhido para uma taxa de falsa correspondência não-gêmea de 0,0001, muitos algoritmos aceitavam um gêmeo como o outro 98-99% das vezes. Conjuntos de dados existentes de gêmeos são pequenos, antigos ou carecem de metadados sobre sardas, pintas, cicatrizes e status de gêmeo espelho, tornando difícil aprender quais pistas as embeddings modernas realmente usam.

Método

O CTTS-80 coleta imagens web para 80 pares de gêmeos famosos e constrói 21.120 pares equilibrados de pessoas da mesma pessoa e de impostores gêmeos em dez dobras, mantendo cada conjunto de gêmeos inteiramente dentro de uma dobra. Os autores avaliam modelos ArcFace, AdaFace, UniFace e MagFace ResNet-100 treinados com três conjuntos de dados comuns. Eles apagam marcas de pele visíveis em identidades selecionadas, comparam distribuições de embedding originais e editadas, retreinam o ArcFace sem aumento de flip horizontal e inspecionam conjuntos de gêmeos sintéticos solicitados a três sistemas generativos.

Síntese do artigo

A verificação por gêmeos permanece uma classe de risco distinta: a precisão padrão diz pouco sobre isso, e as incorporações atuais parecem não usar marcas locais óbvias. Implantações de alta garantia deveriam testar impostores gêmeos explicitamente, em vez de inferir desempenho a partir de benchmarks gerais.