← Volver al Blog
Radar de investigaciónDetección facialDetección de ataques de presentaciónarXivJulio de 2026

Radar mensual de arXiv

Artículos sobre detección facial de julio de 2026: parches multiespectrales, detección asistida por computadora guiada por conceptos y desafíos oculares.

En julio, la publicación de artículos sobre detectores faciales directos fue escasa, pero la capa de seguridad de captura se mantuvo activa. Por lo tanto, este resumen sigue el proceso de detección desde el exterior: si un detector combinado visual-infrarrojo puede ocultarse físicamente, si un modelo anti-suplantación facial puede generalizarse a materiales y sensores invisibles, y si la detección de vitalidad ocular puede forzar una respuesta biológica en tiempo real que una reproducción o un generador no puedan reproducir.

Lo que señala este mes

VIPatch demuestra que la combinación de sensores visibles e infrarrojos no elimina automáticamente el riesgo de ataques físicos, ya que una máscara coordinada y una pegatina térmica pueden suprimir ambos canales. CPG-PAD ataca una vulnerabilidad diferente: las indicaciones anti-suplantación que se basan en artefactos del conjunto de datos en lugar de conceptos visuales reutilizables. El protocolo ocular pasa de la clasificación pasiva a un desafío activo, combinando el seguimiento de la mirada y la respuesta pupilar. En conjunto, los artículos abogan por defensas de captura por capas, pruebas explícitas entre dominios y una separación cuidadosa entre la evidencia de seguridad simulada y las afirmaciones de despliegue validadas por humanos.

Artículo 012026-07-25cs.CR

Ocultándose a plena vista: un ataque físico adversario eficaz contra la detección facial fusionada visual-infrarroja.

Autores e instituciones

Qiucheng Yu

City University of Hong Kong, Hong Kong, China

Tao Ni

King Abdullah University of Science and Technology, Saudi Arabia

Yihe Zhou

City University of Hong Kong, Hong Kong, China

Jiayimei Wang

City University of Hong Kong, Hong Kong, China

Qingchuan Zhao

City University of Hong Kong, Hong Kong, China

Qué problema resuelve

Los parches anteriores se transfieren mal a los detectores fusionados porque la optimización para la imagen visible puede entrar en conflicto con la respuesta infrarroja, y los patrones llamativos son más fáciles de detectar para las personas o los sistemas secundarios. VIPatch busca un ataque físicamente realizable, conjunto y visualmente discreto.

Resultado clave

El ataque de caja negra digital alcanza un promedio de 94,59 % de ASR en detectores visibles y de 97,40 % en detectores infrarrojos. En la configuración física fusionada, VIPatch alcanza un 97,27 % de ASR en YOLOv8-Face y MTCNN, y un 100 % en TFW y OpenCV. Su ASR físico visible se mantiene en un 80,29 % con una iluminación de 12 000 lux y varía entre el 92,51 % y el 100 % en las distancias probadas de uno a tres metros.

Resumen

Los modelos de detección facial fusionados visual-infrarrojo basados ​​en aprendizaje profundo se implementan cada vez más en una amplia gama de aplicaciones, pero siguen siendo vulnerables a ataques de parches adversarios. La mayoría de los ataques anteriores se dirigen únicamente a la imagen visual o infrarroja en el dominio digital, lo que los hace ineficaces contra los modelos fusionados en el mundo físico. Además, muchos de estos métodos son fácilmente detectables, ya que sus patrones de parches se desvían sustancialmente de los que se ven en el mundo real. En este artículo, presentamos VIPatch (Visual-Infrared Patch), un novedoso ataque de parche adversario físico que produce parches discretos, realistas y de aspecto natural para imágenes faciales. Específicamente, VIPatch crea una máscara de color degradado junto con una etiqueta adhesiva sobre las imágenes visual e infrarroja, y optimiza conjuntamente estos dos elementos; los parches digitales resultantes guían la fabricación de sus contrapartes físicas. Los resultados experimentales muestran que VIPatch logra tasas de éxito de ataque competitivas (superiores al 90%) tanto en el dominio digital como en el físico, manteniendo los parches imperceptibles para los observadores humanos.

Punto de partida

La fusión visual-infrarroja se utiliza para mantener la detección facial en entornos con poca luz y controles de temperatura, pero la mayoría de las investigaciones adversarias atacan solo una modalidad o se mantienen en formato digital. Un sistema de producción necesita saber si un objeto de apariencia común puede suprimir ambos canales tras la impresión, la colocación, los cambios de iluminación y el movimiento de la cámara.

Método

VIPatch optimiza conjuntamente una mascarilla facial con degradado de color para el canal visible y una pegatina térmica tipo vendaje para el canal infrarrojo, para luego fabricar sus contrapartes físicas. La evaluación combina múltiples detectores visibles e infrarrojos, transferencia de datos en cajas blancas y negras, y pruebas físicas con diferentes ángulos de visión, iluminación de 200 a 12 000 lux y distancias de uno a tres metros.

Conclusión del artículo

La detección multiespectral debe modelarse como un sistema acoplado, no como dos defensas independientes. El ataque es un resultado de un ejercicio de simulación de ataques (red team) y no una medida de mitigación, pero proporciona a los fabricantes de detectores condiciones físicas concretas, modelos de transferencia y objetivos de éxito del ataque para evaluar la detección de parches, las comprobaciones de coherencia del sensor y la política de respaldo.

Artículo 022026-07-01cs.CV

CPG-PAD: Detección de ataques mediante indicaciones basadas en conceptos

Autores e instituciones

Haoyuan Zhang

School of Artificial Intelligence, University of Chinese Academy of Sciences, China

State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, China

Xiangyu Zhu

State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, China

School of Artificial Intelligence, University of Chinese Academy of Sciences, China

Li Gao

China Mobile Financial Technology Co., Ltd., China

Ajian Liu

State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, China

School of Artificial Intelligence, University of Chinese Academy of Sciences, China

Siran Peng

State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, China

School of Artificial Intelligence, University of Chinese Academy of Sciences, China

Zhen Lei

State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, China

School of Artificial Intelligence, University of Chinese Academy of Sciences, China

Centre for Artificial Intelligence and Robotics, Hong Kong Institute of Science and Innovation, Chinese Academy of Sciences, Hong Kong, China

School of Computer Science and Engineering, Macau University of Science and Technology, Macau, China

Qué problema resuelve

El objetivo del artículo es alinear las indicaciones aprendidas con evidencia visual detallada y relevante para el ataque, suprimiendo al mismo tiempo los atajos específicos del dominio. Además, pone a prueba esta misma idea en protocolos de instrumentos de ataque de presentación de múltiples fuentes, fuentes limitadas, fuentes únicas y no vistos, en lugar de basarse en una única división entre conjuntos de datos.

Resultado clave

Sin datos complementarios, CPG-PAD alcanza un HTER promedio del 2,08 % en el protocolo multisource de cuatro vías, mejorando la línea base de CLIP del 5,43 %; con CelebA-Spoof alcanza el 1,19 %. Presenta un HTER promedio del 5,33 % en la transferencia de una sola fuente y del 1,02 % en instrumentos de ataque no vistos, donde la línea base de CLIP es del 3,03 %. El uso de un umbral de conjunto de validación en lugar de un umbral derivado de la prueba produce un HTER promedio del 2,28 %, lo que pone de manifiesto la limitación del umbral.

Resumen

La detección de ataques de presentación (PAD) constituye una salvaguarda crucial para los sistemas de reconocimiento facial frente a ataques de presentación como fotografías impresas, vídeos reproducidos y máscaras 3D. A pesar de los importantes avances, los modelos PAD existentes aún presentan dificultades para generalizar en dominios desconocidos debido a las variaciones en los sensores, la iluminación y los materiales de ataque. Los modelos recientes de visión-lenguaje (VLM) han demostrado una gran capacidad de generalización, pero sus aplicaciones en PAD siguen siendo limitadas, ya que las indicaciones aprendidas, generalmente optimizadas bajo supervisión de etiquetas de clase, no se alinean explícitamente con la semántica visual detallada relevante para el ataque. Como resultado, las representaciones aprendidas suelen sobreajustarse a artefactos específicos del dominio en lugar de capturar señales de ataque transferibles. Para abordar este problema, proponemos la detección de ataques de presentación guiada por indicaciones con información conceptual (CPG-PAD), un marco que introduce la guía conceptual a nivel de modelo en el proceso de aprendizaje de indicaciones. En concreto, diseñamos un módulo de Mejora Impulsada por Conceptos Visuales (VCE) que emplea técnicas de IA Explicable (XAI) para descubrir automáticamente conceptos visuales relevantes para PAD y generar mapas de calor asociados a conceptos, proporcionando una guía localizada y precisa. Guiado por estos mapas de calor, un mecanismo de Inyección de Conceptos Basada en Indicaciones (PCI) integra estos conceptos en el espacio de indicaciones mediante un Decodificador de Indicaciones Visuales (VPD) y una función de pérdida de mapeo de conceptos, lo que permite que las indicaciones se alineen con el espacio conceptual interno del modelo. Este diseño permite a CPG-PAD capturar señales de ataque generalizables e invariantes al dominio, al tiempo que suprime eficazmente los sesgos específicos del conjunto de datos. Experimentos exhaustivos en nueve conjuntos de datos de referencia demuestran que CPG-PAD logra de forma consistente un rendimiento de vanguardia entre dominios en configuraciones de múltiples fuentes, fuentes limitadas y fuentes únicas.

Punto de partida

Los modelos anti-suplantación facial suelen funcionar bien con los sensores y los medios de ataque vistos durante el entrenamiento, pero fallan cuando cambian la iluminación, las cámaras, los procesos de impresión, las máscaras o el maquillaje. Los modelos de visión-lenguaje ofrecen información previa amplia, pero el aprendizaje basado únicamente en etiquetas puede seguir centrándose en artefactos del conjunto de datos local en lugar de conceptos que describan un ataque de presentación real.

Método

CPG-PAD utiliza primero métodos de explicabilidad en su módulo de Mejora Impulsada por Conceptos Visuales para descubrir conceptos y generar mapas de calor de conceptos localizados. Un decodificador de indicaciones visuales y una función de pérdida de mapeo de conceptos inyectan estos mapas en el espacio de indicaciones, conectando las características visuales de CLIP con múltiples indicaciones reales/falsas que se pueden aprender. El modelo basado únicamente en visión se evalúa en nueve conjuntos de datos y reporta tanto métricas convencionales HTER/AUC como métricas de punto operativo alineadas con la norma ISO.

Conclusión del artículo

Las indicaciones basadas en conceptos resultan prometedoras cuando un dispositivo PAD debe atravesar sensores y materiales de ataque, sobre todo porque ocupan menos espacio visual que los modelos de lenguaje multimodal. No obstante, los compradores deben comparar los resultados con umbrales calibrados para su uso en entornos reales: el documento señala explícitamente que los umbrales EER comunes derivados de pruebas pueden sobreestimar la preparación para el uso en campo.

Artículo 032026-07-10cs.CV

Protocolo de desafío-respuesta de doble flujo para la verificación de la vitalidad ocular

Autores e instituciones

Ismail Kably

Konelia Inc., Austin, Texas, USA

Qué problema resuelve

El protocolo propuesto aborda las amenazas a los sistemas oculares y del iris que representan la repetición, la creación de deepfakes y las prótesis, mediante la combinación de la mirada de seguimiento suave voluntaria con el reflejo pupilar a la luz involuntario. La cuestión central es si el retraso en la renderización crea una brecha de sincronización medible en desafíos aleatorios repetidos.

Resultado clave

La simulación reporta un AUC de 0,502 cuando la generación del generador no agrega latencia, 0,717 a 25 ms, 0,948 a 50 ms y al menos 0,997 después de 75 ms para una sola ronda. A 25 ms, diez rondas elevan el AUC a 0,966, y cinco o más rondas reducen el umbral de detección simulado de 0,90-AUC de 50 ms a 25 ms. Estos son resultados in silico; no se midieron sujetos humanos ni ataques generativos reales.

Resumen

Los sistemas biométricos oculares se enfrentan a sofisticados ataques de presentación, incluyendo reproducciones de vídeo de alta resolución y deepfakes generativos en tiempo real, que eluden fácilmente las comprobaciones estáticas de vitalidad. Los marcos actuales de detección de ataques de presentación (PAD) suelen basarse en métricas fisiológicas aisladas, como el seguimiento de la mirada o el reflejo pupilar a la luz (PLR), que pueden falsificarse de forma independiente. Este artículo propone un protocolo de fusión de sensores de espacio-luminancia, que introduce un marco de desafío-respuesta de doble flujo para la verificación de vitalidad ocular mediante la unión de estas métricas en un desafío de autenticación simultáneo. Al generar un estímulo visual aleatorio y variable en el tiempo que fluctúa tanto en trayectoria espacial como en intensidad de luminancia, construimos un modelo de probabilidad de espacio de estados acoplado matemáticamente, denominado Matriz de Sincronización, para evaluar la correlación cruzada continua entre las latencias biológicas esperadas del seguimiento de seguimiento suave y la constricción pupilar. Mediante simulación Monte Carlo basada en distribuciones de latencia derivadas de la literatura, demostramos la separabilidad teórica entre condiciones de ataque genuinas y simuladas, y mostramos que un diseño de desafío de múltiples rondas mejora la detección de deepfakes generativos cuando existe una brecha de latencia de renderizado distinta de cero. Este trabajo proporciona un marco teórico respaldado por simulación para la defensa dinámica de suplantación de identidad de próxima generación en biometría ocular y del iris; se identifica la validación con sujetos humanos como trabajo futuro necesario antes de poder afirmar su implementación.

Punto de partida

Las comprobaciones estáticas de la mirada o las pupilas pueden reproducirse de forma independiente, y los sistemas generativos en tiempo real reproducen cada vez con mayor precisión movimientos oculares plausibles. Una prueba de vivacidad más rigurosa debería exigir dos respuestas biológicamente limitadas ante un nuevo estímulo y verificar su relación temporal, en lugar de clasificar un único fotograma capturado.

Método

Una pantalla varía simultáneamente la posición del objetivo y la luminancia. El sistema estima la latencia de la mirada, la latencia de la constricción pupilar y su correlación cruzada en una matriz de sincronización, para luego combinarlas en una puntuación conjunta. Un estudio de Monte Carlo ejecuta 10 000 ensayos por condición utilizando distribuciones de latencia extraídas de la literatura previa y evalúa una, tres, cinco o diez rondas independientes con retrasos de generador supuestos.

Conclusión del artículo

El diseño ofrece un modelo útil para la transmisión en tiempo real y explicita su relación entre seguridad y latencia, pero aún no garantiza una precisión implementable. Para evaluar el producto, se requeriría calibración humana, mediciones de la temporización de los sensores, pruebas de latencia correlacionada y ensayos de simulación de ataques contra renderizadores en tiempo real reales.