← Volver al Blog
Radar de investigaciónDetección facialDetección de ataques de presentaciónarXivAgosto de 2026

Radar mensual de arXiv

Artículos de detección facial de agosto de 2026: puntos de referencia dinámicos, anti-spoofing sin rostros y modelos fundacionales

La pila de detección de rostros se está ampliando de una caja delimitadora fija a geometría configurable y captura fiable. Los artículos de este mes unifican plantillas de hitmark incompatibles, preguntan si los artefactos de impresión/reproducción pueden aprenderse completamente de objetos no faciales, y prueban treinta codificadores de visión más dieciséis modelos multimodales en conjuntos de datos de presentación y ataques de morfos.

Lo que señala este mes

Unified Dynamic FLD reemplaza cabezas de referencia específicas de plantilla por consultas semánticas de contorno y puede devolver un diseño solicitado en tiempo de ejecución. TPO desafía una suposición aún más profunda al mostrar que la evidencia de impresión y reproducción aprendida de las verduras se transfiere fuertemente para enfrentarse a la antisuplantación, haciendo plausible que los datos suplementarios conscientes de la privacidad sean plausibles. El estudio del modelo fundacional proporciona la condición de contorno: el preentrenamiento general ayuda, pero el acceso MLLM sin disparos sigue siendo débil y PAD suele necesitar adaptación por codificador visual. La dirección práctica es un servicio de geometría consolidado respaldado por una captura explícita entre dominios, en lugar de una colección de modelos específicos de conjuntos de datos.

Artículo 012026-08-11cs.CV

Hacia la Detección Dinámica Unificada de Hitos de Caras

Autores e instituciones

Sebastian Regalado

University of Toronto, Canada

ModiFace, Canada

Varshanth R. Rao

ModiFace, Canada

Ruowei Jiang

ModiFace, Canada

Parham Aarabi

University of Toronto, Canada

Igor Gilitschenski

University of Toronto, Canada

Qué problema resuelve

El artículo define un sistema de coordenadas semánticas común para diseños de puntos heterogéneos y lo utiliza para entrenar un detector único a través de múltiples conjuntos de datos. En tiempo de inferencia, la misma red puede responder a una colección arbitraria de consultas de puntos de referencia, incluidos puntos no solicitados explícitamente durante su entrenamiento en el conjunto de datos de origen.

Resultado clave

El modelo unificado ViT-B con adaptadores registra un NME de 4.02 y una tasa de falla del 2.19% en WFLW, 2.43/4.19 NME en las divisiones comunes/desafío 300W y 2.76 NME en AFLW-19, al tiempo que soporta entrenamiento fusionado y salida dinámica. Cuando se entrena solo en 300W, alcanza un NME de 6.08 en la prueba de transferencia desafiante WFLW68, frente a 7.23 para DTLD y 8.09 para PIPNet. En puntos de referencia nativos reservados, las consultas aprendidas mejoran sobre la interpolación por splines en un 19.0% en 300W y en 15.7-16.3% en las divisiones de WFLW, lo que indica que el modelo aprende semánticas de contorno reutilizables en lugar de solo memorizar índices fijos.

Resumen

Aunque los avances en los métodos de detección de puntos de referencia facial (FLD) siguen empujando los límites del rendimiento, pasan por alto dos limitaciones funcionales principales: (1) es necesario entrenar de forma independiente diferentes parámetros de red para cada conjunto de datos de referencia de ''$N$-point'', y (2) un modelo entrenado con un conjunto de datos ''$N$-point'' que solo genera de forma fiable los hitos de $N$. En nuestro trabajo, primero conceptualizamos las Posiciones de Hitos Ancladas por Parte de la Cara (FPALPs), en las que cada punto de referencia se trata como un valor de progresión entre cero (inicio) y uno (extremo) a lo largo del contorno de una parte de la cara. Cada punto de referencia puede expresarse en formato FPALP, independientemente de su conjunto de datos de origen, desbloqueando así la capacidad de unificar todos los conjuntos de datos ''$N$-point'' en un solo conjunto de datos. En segundo lugar, representamos cada punto de referencia con una consulta basada en FPALP, la refinamos progresivamente con un decodificador de modalidad cruzada y predecimos sus coordenadas basándonos en la representación final. Nuestro enfoque, llamado Unified Dynamic FLD, incorpora estas dos opciones de diseño y agiliza la canalización de detección de hitos al permitir (1) que un único modelo aprenda sobre cualquier número de conjuntos de datos de ''$N$-point'', y (2) generar cualquier número de predicciones específicas de hitmark cargando las consultas designadas en tiempo de ejecución. Experimentos extensos con múltiples conjuntos de datos de referencia demuestran que nuestro método ofrece estos beneficios mientras sigue siendo competitivo y, en varios casos, supera a los métodos de vanguardia existentes.

Punto de partida

Los conjuntos de datos de puntos faciales no coinciden en si un rostro tiene 19, 68, 98 u otro número de puntos anotados. Los modelos convencionales vinculan su cabeza de regresión a una plantilla, obligando a los equipos a entrenar y mantener parámetros separados para cada conjunto de datos e impidiendo que un modelo desplegado devuelva un subconjunto nuevo o un diseño más denso bajo demanda. Esa fragmentación es costosa para los procesos de alineación, reconstrucción, maquillaje y expresión que consumen diferentes convenciones de puntos de referencia.

Método

Cada punto de referencia se convierte en una Posición de Punto de Referencia Anclado a Parte Facial (FPALP, por sus siglas en inglés): una progresión normalizada de cero a uno a lo largo de un contorno semántico como una ceja, ojo, nariz, boca o límite facial. Las plantillas de los conjuntos de datos se alinean en este espacio de contorno, y cada punto solicitado se codifica como una consulta FPALP. Un decodificador de modalidad cruzada combina progresivamente los tokens de la imagen y las consultas antes de regredir coordenadas. El modelo ViT-B se entrena conjuntamente en AFLW-19, 300W y WFLW; los adaptadores opcionales livianos de conjuntos de datos recuperan desfases sistemáticos de anotación sin renunciar a la columna vertebral unificada ni al diseño de salida configurable en tiempo de ejecución.

Conclusión del artículo

Un único servicio de puntos de referencia impulsado por consultas puede reemplazar varios modelos específicos de plantillas mientras mantiene una precisión competitiva. El enfoque es especialmente atractivo cuando los productos necesitan múltiples formatos de alineación o anticipan agregar nuevas definiciones de puntos de referencia, aunque los equipos aún deberían probar adaptadores de desfase de anotación para cada conjunto de datos de producción.

Artículo 022026-08-20cs.CV

Tomates, Papas y Cebollas: Cuestionando la Necesidad de Rostros en la Detección de Ataques de Presentación Facial

Autores e instituciones

Guray Ozgur

Fraunhofer Institute for Computer Graphics Research IGD, Germany

Department of Computer Science, Technical University of Darmstadt, Germany

Fadi Boutros

Fraunhofer Institute for Computer Graphics Research IGD, Germany

Naser Damer

Fraunhofer Institute for Computer Graphics Research IGD, Germany

Department of Computer Science, Technical University of Darmstadt, Germany

Qué problema resuelve

El trabajo aísla las señales del proceso de presentación de la semántica facial a través de un conjunto de datos controlado sin caras y pregunta si esas señales se transfieren de vuelta a puntos de referencia estándar de PAD facial. También prueba si reemplazar algunas muestras de rostros con ataques sin cara agrega información bajo un presupuesto de entrenamiento fijo, en lugar de simplemente aumentar el tamaño del conjunto de datos.

Resultado clave

El entrenamiento solo con verduras alcanza un AUC medio del 92,70% y un 14,15% HTER en los cuatro benchmarks faciales, frente al 81,02% AUC para el entrenamiento facial sintético y el 67,81% para el control inicializado por ImageNet. Reemplazar parte de un presupuesto facial fijo de fuente única por TPO eleva la media AUC entre conjuntos de datos del 89,33% al 92,55% y reduce el HTER del 17,54% al 13,97%; en el entrenamiento multifuente, el AUC sube del 92,11% al 96,96% y el HTER cae del 14,72% al 7,84%. La diversidad de ataques importa más que los fotogramas redundantes: usar solo el 10% de los fotogramas TPO sigue dando un 92,97% AUC, mientras que el entrenamiento solo en impresión o solo repetición cae al 86,14% y 83,97%.

Resumen

La detección de ataques de presentación facial (PAD) se formula tradicionalmente como un problema específico de la cara, aunque muchos de los artefactos visuales introducidos por procesos de impresión, reproducción y recaptura no están inherentemente ligados a la apariencia facial. En este trabajo, investigamos si se pueden aprender representaciones de PAD transferibles sin usar rostros durante el entrenamiento posterior de PAD. Con este fin, presentamos TPO, un conjunto de datos de ataques de presentación sin cara controlados, compuesto por grabaciones auténticas, impresas y de reproducción de tomates, papas y cebollas, elegidos casi al azar, adquiridos bajo protocolos que reflejan de manera cercana a los conjuntos de datos convencionales de PAD facial. Usando una arquitectura PAD basada en un modelo fundacional, demostramos que un detector entrenado en TPO alcanza un AUC promedio del 92,70 % en cuatro puntos de referencia estándar de PAD facial entre conjuntos de datos, superando el entrenamiento en caras sintéticas y manteniéndose competitivo con modelos entrenados en conjuntos de datos faciales reales. Por el contrario, los modelos entrenados en conjuntos de datos de PAD facial transfieren consistentemente por encima del azar a TPO, lo que sugiere que las representaciones aprendidas capturan características del proceso de presentación en lugar de la semántica del objeto. Además, incorporar TPO en el entrenamiento convencional de PAD facial mejora consistentemente el rendimiento entre conjuntos de datos bajo presupuestos de optimización fijos, indicando que los datos sin cara proporcionan información complementaria en lugar de simplemente muestras adicionales de entrenamiento. Finalmente, los análisis de representación y frecuencia proporcionan más evidencia de que las representaciones de PAD transferibles no pueden explicarse por un solo artefacto espectral, sino que codifican señales de presentación más completas compartidas entre categorías de objetos. En conjunto, estos resultados proporcionan evidencia empírica de que se pueden aprender representaciones de ataques de presentación transferibles independientemente del contenido facial, abriendo nuevas oportunidades para el desarrollo de PAD que preserve la privacidad y sea independiente de la identidad.

Punto de partida

Los ataques de impresión y reproducción introducen patrones moiré, subpíxeles de pantalla, textura del papel, cambios de gamma, reflejos y ruido de recaptura, que son propiedades del instrumento de presentación en lugar de la identidad representada. Sin embargo, la investigación anti-spoofing casi siempre recopila más rostros humanos, aumentando preocupaciones de consentimiento y demográficas, mientras que anima a los detectores a absorber atajos relacionados con la cara o el conjunto de datos. Los autores prueban la hipótesis deliberadamente fuerte de que se puede aprender evidencia de ataque transferible sin rostros en absoluto.

Método

TPO contiene 12,480 presentaciones auténticas, impresas y de reproducción de tomates, papas y cebollas capturadas con protocolos modelados según los conjuntos de datos de PAD facial. Un modelo CLIP ViT-B/16 FoundPAD se adapta con LoRA usando solo TPO, y luego se evalúa a través de MSU-MFSD, CASIA-FASD, Replay-Attack y OULU-NPU. Los controles incluyen CLIP zero-shot, una coincidencia de arquitectura inicializada con ImageNet, SynthASpoof, entrenamiento con caras reales de fuente única y múltiple, transferencia inversa desde conjuntos de datos faciales a TPO, experimentos de reemplazo bajo presupuesto fijo, análisis de frecuencia y ablaciones sobre clase de objeto, tipo de ataque y número de fotogramas.

Conclusión del artículo

Para la antisuplantación de impresión/reproducción, la diversidad realista de recaptura puede importar más que recopilar otro conjunto de identidades. Los datos suplementarios sin rostro ofrecen una forma consciente de la privacidad para mejorar la transferencia entre sensores, pero la evidencia se aplica a los procesos probados de impresión y visualización y no debe generalizarse automáticamente a máscaras o ataques físicos novedosos.

Artículo 032026-08-30cs.CV

Modelos de Lenguaje Grandes y Fundación Multimodales para la Presentación de Caras y la Detección de Ataques de Morfo

Autores e instituciones

Hatef Otroshi Shahreza

Idiap Research Institute, Switzerland

Asif Hussain Khan

Idiap Research Institute, Switzerland

Peter Lorenz

Idiap Research Institute, Switzerland

Alain Komaty

Idiap Research Institute, Switzerland

Sébastien Marcel

Idiap Research Institute, Switzerland

University of Lausanne, Switzerland

Qué problema resuelve

Este estudio ofrece una comparación única y amplia de estrategias de acceso tanto para la detección de ataques de presentación facial como para la detección de ataques de morfos. Distingue el valor de salidas de lenguaje sin disparo, logitos de salida, rasgos visuales congelados, ajuste MLLM específico por tarea y adaptación LoRA en lugar de atribuir todas las ganancias a una etiqueta genérica de modelo fundación.

Resultado clave

El simulado comercial no es un detector creíble: los mejores promedios de disparo cero son 31,1% ACER para PAD y 19,4% para MAD. Un codificador congelado y un cabezal lineal mejoran esas cifras hasta un 24,4% y 5,0%; PADLLM y MADLLM específicos de tarea alcanzan el 13,6% y el 2,9% mientras producen explicaciones. Los mejores codificadores adaptados a LoRA logran un ACER medio del 14,9% para PAD frente al 17,3% del especialista citado más fuerte, y un 3,7% para MAD frente al 11,3%. El MAD se transfiere más fácilmente que el PAD: el mejor ACER cross-dataset es del 4,9% frente al 19,8%, y el objetivo previo al entrenamiento predice la transferencia mejor que el número de parámetros.

Resumen

Los sistemas de reconocimiento facial se despliegan cada vez más en aplicaciones críticas para la seguridad, pero siguen siendo vulnerables a ataques de presentación y morph. La detección de ataques de presentación (PAD) y la detección de ataques por morfo (MAD) son, por tanto, componentes esenciales de la biometría facial fiable. A pesar de los avances en los métodos PAD y MAD, los detectores existentes sufren de generalizaciones limitadas y se degradan en la evaluación cruzada de conjuntos de datos. En este artículo, investigamos sistemáticamente si los modelos de fundación de propósito general (FM) y los modelos multimodales de lenguaje grande (MLLM) codifican información relevante para PAD y MAD, y cómo estos modelos pueden desplegarse mejor para ambas tareas. Estudiamos cinco enfoques con acceso creciente a la información interna del modelo: (i) prompting zero-shot de MLLMs estándar; (ii) entrenar un modelo superficial sobre las probabilidades logit del siguiente token en la salida del MLLM; (iii) ajuste fino eficiente en parámetros sobre datos específicos de preguntas y respuestas, que produce dos MLLM especializados, llamados PADLLM y MADLLM, que además proporcionan razonamiento textual para sus decisiones; (iv) sondeo lineal de codificadores de visión congelada; y (v) ajuste fino de codificadores de visión de FM y MLLM. Comparamos 16 MLLMs de peso abierto y 30 backbones de codificadores de visión en cuatro conjuntos de datos PAD (MSU-MFSD, CASIA-FASD, Replay-Attack y OULU-NPU) y cuatro conjuntos de datos MAD (FFHQ, FRGC, FRLL y FERET). Nuestros experimentos muestran que los FM y MLLMs pueden alcanzar un rendimiento significativo para PAD y MAD. Además, los modelos ajustados logran un rendimiento de detección de última generación en la evaluación cruzada de conjuntos de datos, lo que indica que las representaciones preentrenadas de propósito general contienen información relevante para ataques. El código fuente de todos nuestros experimentos será hecho público.

Punto de partida

Los modelos de visión de propósito general y multimodales pueden ya codificar pistas de textura, geometría y semánticas útiles para ataques de presentación y morfos, pero el tamaño del modelo por sí solo no revela cómo extraer esa evidencia. Los equipos de seguridad necesitan saber si un prompt comercial es suficiente, si las explicaciones requieren un MLLM especializado y cuándo el codificador visual debe adaptarse para sobrevivir a desplazamientos de sensores y ataques entre conjuntos de datos.

Método

Se evalúan dieciséis MLLM de peso abierto y treinta codificadores de visión en cuatro conjuntos de datos PAD (MSU-MFSD, CASIA-FASD, Replay-Attack, OULU-NPU) y cuatro conjuntos de datos MAD (FFHQ, FRGC, FRLL, FERET). Cinco modos de despliegue exponen progresivamente más de cada modelo: prompting sin disparos, un clasificador superficial sobre probabilidades next-token, ajuste eficiente en parámetro en preguntas y respuestas en PADLLM o MADLLM con razonamiento textual, sondeo lineal de codificadores de visión congelada y adaptación LoRA de los codificadores. Los umbrales EER establecidos por desarrollo se aplican tanto a pruebas ACER intra como cruzadas de conjuntos de datos.

Conclusión del artículo

No despliegue un MLLM solicitado como detector biométrico de ataques. Las características visuales congeladas son una referencia útil, pero el PAD generalmente necesita adaptación del codificador, mientras que un MLLM ajustado es valioso cuando se requiere razonamiento legible por humanos; la elección del modelo debe validarse por separado para ataques de presentación y morph.