← Volver al Blog
Radar de investigaciónReconocimiento facialarXivAgosto de 2026

Radar mensual de arXiv

Artículos de reconocimiento facial de agosto de 2026: despliegue a baja resolución, compresión inferior a 1 kB y equidad en Brasil

Los artículos de agosto sobre reconocimiento facial se centran en restricciones que solo se hacen visibles después de que un modelo deja un benchmark limpio. Los estudios seleccionados prueban sondas nativas de baja resolución en lugar de confiar en la degradación sintética, cuantifican qué códecs preservan la identidad en 1.024 y 512 bytes, y auditan vídeo público comprimido con categorías demográficas brasileñas y estratos explícitos de dificultad.

Lo que señala este mes

El estudio de baja resolución advierte que la degradación sintética que prevalece en pruebas de estilo LFW puede ser la opción equivocada para las sondas nativas de TinyFace. El benchmark de compresión muestra un cambio de régimen igualmente brusco: varios códecs conocidos funcionan cerca de 1 KB pero colapsan en 512 B, donde un códec aprendido con presupuesto de bytes se vuelve valioso. UFPR-PE demuestra entonces que las brechas demográficas crecen drásticamente en el subconjunto visual duro y pueden cambiar el orden entre protocolos de identificación. En los tres, la calidad de producción depende de probar el régimen real de captura y almacenamiento en lugar de extrapolar desde un proxy conveniente.

Artículo 012026-08-06cs.CV

Mejorando el reconocimiento facial de baja resolución bajo datos limitados: cómo la generación de datos sintéticos puede cerrar la brecha de dominio

Autores e instituciones

Luis S. Luevano

Idiap Research Institute, Switzerland

Ünsal Öztürk

Idiap Research Institute, Switzerland

Hatef Otroshi Shahreza

Idiap Research Institute, Switzerland

Anjith George

Idiap Research Institute, Switzerland

Sébastien Marcel

Idiap Research Institute, Switzerland

Qué problema resuelve

El estudio pregunta qué estrategia sintética de baja resolución realmente ayuda a un reconocedor de caras compacto cuando los datos nativos etiquetados son limitados, y si las conclusiones extraídas de pruebas artificialmente muestreadas a la baja al estilo LFW se mantienen en sondas reales de TinyFace. También establece una línea base de entrada directa para que los módulos de superresolución y traducción demuestren que preservan la identidad en lugar de simplemente mejorar la apariencia visual.

Resultado clave

Las pruebas sintéticas favorecieron una degradación de 28 píxeles, pero esa misma configuración quedó por debajo de la línea base entrenada con alta resolución en TinyFace real. Un aumento de interpolación más suave de 56 píxeles fue la mejor configuración compacta, elevando el mAP de TinyFace de 52,55 a 54,68 y la identificación de rango 1 de 59,66% a 61,40%. El pipeline de superresolución RRDB aprendido más traducción de dominio alcanzó solo 57,53 mAP con EdgeFace-base, frente a 65,12 con entrada directa. La destilación de conocimiento produjo las mayores ganancias sintéticas, pero no se transfirió a baja resolución nativa, mostrando que la fidelidad de la síntesis, no la complejidad de la síntesis, es el factor limitante.

Resumen

Los sistemas de Reconocimiento Facial (FR) en entornos de vigilancia suelen encontrarse con rostros de baja resolución (LR), aquellos cuya región facial está por debajo del tamaño estándar de entrada de 112 $\vezes 112 $. Aunque los datos de entrenamiento etiquetados en alta resolución (HR) abundan, los datos nativos LR etiquetados, y sobre todo los datos nativos LR/HR emparejados, son escasos. Una solución alternativa es sintetizar datos LR a partir de los rostros HR disponibles, pero cuánto esfuerzo de síntesis se compensa en precisión de reconocimiento sigue sin estar claro. Presentamos un estudio de estrategias simples de generación sintética para un sistema compacto orientado a dispositivos de periferia, que abarcan degradación basada en interpolación, destilación de conocimiento, un Transformador de Dominio Prepended (PDT), degradación al estilo Real ESRGAN y un front-end de Super Resolución (SR) aprendido con pérdida consciente de identidad. Evaluamos estas estrategias en benchmarks faciales sintéticos de resolución cruzada (LFW, CFP-FP, AgeDB-30) y en TinyFace, un conjunto de datos nativo de LR del mundo real, y exponemos una brecha sintético-real: el ajuste de degradación que es óptimo en benchmarks sintéticos no es el óptimo en LR real. Encontramos que un mayor esfuerzo de síntesis no ayuda de forma monótona: el front-end de SR aprendido no supera una alimentación directa de la imagen LR alineada hacia una columna vertebral fuerte, mientras que la simple ampliación por interpolación de una columna vertebral compacta es la única síntesis que mejora respecto a su propia línea base. Concluimos que los métodos generativos para el reconocimiento facial LR deben validarse en LR real y frente a una línea base de alimentación directa, y liberamos nuestra pipeline a https://idiap.ch/paper/synth-lrfr

Punto de partida

Los sistemas de vigilancia y listas de control comparan rutinariamente una imagen de inscripción de alta calidad con una sonda cuya cara alineada es mucho más pequeña que la entrada estándar de 112 por 112. Las identidades nativas de baja resolución, especialmente las capturas de baja y alta resolución de la misma persona, son escasas, por lo que los equipos comúnmente fabrican datos de entrenamiento de baja resolución a partir de caras de alta resolución abundantes. El riesgo práctico es que una receta de degradación puede obtener buenos resultados en benchmarks sintéticos mientras enseña al reconocedor pistas que no se parecen a desenfoque, ruido, compresión y errores de alineación de cámaras reales.

Método

Los autores utilizan la red EdgeFace-S con 3,65 millones de parámetros y comparan cinco niveles de esfuerzo de adaptación: aumento mediante interpolación con muestreo a baja y alta resolución, destilación de conocimiento de un maestro de alta resolución, un transformador de dominio prepended, un tallo nativo de 32 píxeles entrenado con degradaciones estilo Real-ESRGAN, y un front-end de superresolución aprendido y consciente de la identidad. Evalúan la verificación de alta a baja y de baja a baja en LFW, CFP-FP y AgeDB-30, luego repiten la comparación en TinyFace de baja resolución nativa bajo dos pipelines de alineación. Un modelo EdgeFace-base más grande y congelado proporciona la referencia para probar si un front-end generativo supera la alimentación directa de la sonda alineada a un reconocedor potente.

Conclusión del artículo

Para un despliegue en los bordes o de vigilancia, valide cada receta de baja resolución en caras de baja resolución capturadas genuinamente y mantenga una línea base de alimentación directa fuerte. Un aumento simple y suave mediante interpolación puede ser una mejor inversión que una pila de superresolución; las ganancias únicamente sintéticas a resoluciones agresivas no son evidencia confiable del rendimiento en el campo.

Artículo 022026-08-24cs.CV

Hacia la compresión facial con preservación de identidad por debajo de 1 kB: evaluación de códecs, un códec aprendido y estudios de resolución, equidad demográfica, recompresión y robustez adversarial

Autores e instituciones

Petr Hurtik

Innovatrics, Slovakia

Jakub Sochor

Innovatrics, Slovakia

Qué problema resuelve

Este trabajo convierte el almacenamiento de caras por debajo de kilobytes en un benchmark de despliegue controlado en lugar de una comparación de códec único. Identifica puntos operativos específicos de presupuesto, prueba si las métricas de calidad de imagen predicen la utilidad biométrica y construye un códec aprendido cuya salida garantiza mantenerse dentro del límite de bytes solicitado.

Resultado clave

Con 1.024 bytes y 112 píxeles, los códecs modernos están cerca de estar resueltos operativamente en Color FERET: WebP y AVIF alcanzan un 0,09% de EER con ArcFace. Sin embargo, con 512 bytes, AVIF, HEIF, JPEG XL y JPEG heredado suben al 28-98% de FNMR en FMR 1e-4, mientras que el códec aprendido preciso alcanza el 1,83% en Color FERET y 6,9% en AI-Solutions-KK, frente al 2,86% para JPEG-AI y 24,3% para WebP respectivamente. El orden de los códecs es en gran medida invariante a la columna vertebral (W=0,85 de Kendall). La mayoría de los códecs no añaden más de 1,7 puntos porcentuales de brecha demográfica en EER, pero JPEG 2000 añade entre 3,4 y 5,0 puntos y también preserva mal la identidad.

Resumen

Almacenar imágenes de rostros bajo un presupuesto rígido de menos de kilobytes, como se requiere en documentos de identidad, biometría de tarjetas inteligentes y verificación con límites de ancho de banda, obliga a un códec a descartar la mayor parte de la señal manteniendo lo que realmente lee un emparejador de rostros: identidad. Los códecs genéricos optimizan la fidelidad de los píxeles, no las distancias de incrustación que impulsan la verificación, por lo que no está claro qué códec, resolución y configuración preservan mejor la identidad a 1024 bytes o menos, y cómo se degrada a 512. Comparamos diez códecs generales y específicos de caras en resoluciones, presupuestos de bytes, dos conjuntos de datos (Color FERRET controlado, in-the-wild AI-Solutions-KK) y cuatro emparejadores de rostros ancla, con un roster de catorce modelos ViT y CNN que confirma que la clasificación es invariante a la columna vertebral. Luego entrenamos un códec personalizado que preserva la identidad y que alcanza el presupuesto de bytes exactamente mediante búsqueda binaria sobre una tabla de ganancia congelada, y ejecutamos cuatro estudios: resolución, equidad demográfica, recompresión y robustez adversarial sin cajas. La preservación de identidad por debajo de kilobytes es factible, pero qué códec desplegar depende totalmente del presupuesto. Con 1024 bytes y resolución de funcionamiento de 112 px, el problema está cerca de resuelto: los códecs modernos mantienen la tasa de error igual de Color FERET por debajo del 0,35 por ciento en el ancla ArcFace. A 512 bytes el campo se reordena: AVIF, HEIF, JPEG XL y JPEG antiguo colapsan a una tasa de falsa no coincidencia entre el 28 y el 98 por ciento en FMR 1e-4, mientras que WebP, JPEG-AI y nuestros códecs aprendidos con presupuesto de bytes permanecen fuera de esa banda, con un 24,3 por ciento para WebP frente al 6,9 por ciento para nuestra variante precisa en la naturaleza. Ese reordenado, no la clasificación de 1024 bytes, es el resultado operativo: un códec elegido a 1 kB no es el códec que debe desplegarse a la mitad de esa capacidad.

Punto de partida

Los documentos de identidad, las tarjetas inteligentes y los servicios de verificación con límites de ancho de banda pueden tener solo 1.024 o incluso 512 bytes para un recorte de cara alineado. Los códecs genéricos optimizan la distorsión de píxeles en lugar de las distancias de incrustación usadas por un emparejador, y un códec que se ve mejor en un presupuesto puede fallar abruptamente en otro. Los compradores también necesitan saber si la elección se transfiere entre reconocedores, afecta a grupos demográficos, sobrevive a la recompresión e interactúa con perturbaciones adversariales.

Método

Se prueban diez códecs de propósito general y orientados a rostros con cinco resoluciones y dos presupuestos duros en Color FERET controlado y AI-Solutions-KK en la naturaleza. Cuatro emparejadores de presentadores llevan las métricas principales de verificación, mientras que un roster de catorce modelos ViT/CNN verifica si las clasificaciones de códecs dependen de la columna vertebral. Los autores también entrenan códecs precisos y rápidos que preservan la identidad con 18,7 millones de parámetros con una tabla de ganancia congelada de 64 entradas y búsqueda binaria para el cumplimiento exacto del presupuesto. Estudios separados cubren la disparidad de tono de piel y etnia, recompresión entre iguales y cruzados códecs, perturbaciones adversariales sin caja, latencia y significación estadística.

Conclusión del artículo

Trata 1 KB y 512 B como diferentes niveles de producto, no como configuraciones de calidad vecinas. WebP o AVIF son opciones sensatas y ampliamente desplegables alrededor de 1 KB, mientras que un códec aprendido con presupuesto de bytes se vuelve sustancialmente más seguro en 512 B; las pruebas biométricas, no solo la PSNR o la inspección visual, deberían guiar la decisión.

Artículo 032026-08-31cs.CV

UFPR-PEs: Un referente brasileño de reconocimiento facial con etiquetas autodeclaradas de raza/color

Autores e instituciones

Alexandre Diano

Department of Informatics, Federal University of Paraná, Curitiba, Brazil

Bernardo Biesseck

Department of Informatics, Federal University of Paraná, Curitiba, Brazil

Federal Institute of Mato Grosso (IFMT), Pontes e Lacerda, Mato Grosso, Brazil

Gabriel Polo

Department of Informatics, Federal University of Paraná, Curitiba, Brazil

Vinicius Gregorio

Department of Informatics, Federal University of Paraná, Curitiba, Brazil

Laura Lopes

Department of Informatics, Federal University of Paraná, Curitiba, Brazil

Diego Addan

Department of Informatics, Federal University of Paraná, Curitiba, Brazil

David Menotti

Department of Informatics, Federal University of Paraná, Curitiba, Brazil

Qué problema resuelve

UFPR-PEs proporciona un punto de referencia brasileño reproducible para la verificación, identificación en conjunto cerrado e identificación en conjunto abierto utilizando registros oficiales autodeclarados de raza/color. Está diseñado para separar los efectos demográficos de la dificultad visual en lugar de presentar una brecha agregada de subgrupos sin contexto.

Resultado clave

La dificultad domina el resultado agregado. La AUC de verificación es de 1,000 con 0,0% de EER en sondas fáciles y 0,999 con 2,2% EER en sondas medias, pero colapsa a 0,440 AUC y 51,7% EER en sondas duras. La precisión de rango 1 en conjuntos cerrados cae de forma similar del 99,97% y 98,97% al 19,10%; incluso el rango 5 alcanza solo el 41,49% para muestras duras. Las brechas de raza/color se amplían dentro del subconjunto duro, aunque su orden cambia entre pruebas cerradas y abiertas. El artículo limita explícitamente su afirmación a una sola familia de reconocimiento y señala sesgos de selección residual de rostros que el detector nunca localizó.

Resumen

Aunque los sistemas de reconocimiento facial están ampliamente desplegados, garantizar su fiabilidad demográfica y robustez bajo condiciones visuales no controladas sigue siendo un desafío crítico. Para cerrar esta brecha, presentamos UFPR-PEs, un punto de referencia para la evaluación de sesgos de reconocimiento facial utilizando vídeos públicos de políticos brasileños electos anotados con categorías oficiales autodeclaradas de raza/color. El conjunto adopta la taxonomía del censo brasileño, incluyendo la categoría parda, que no tiene equivalente directo en los esquemas centrados en EE. UU. o Europa comúnmente usados en benchmarks anteriores. Nuestro benchmark se construye a partir de vídeo público comprimido y preserva muestras difíciles para que el rendimiento pueda analizarse bajo condiciones realistas. Describimos la línea de construcción, informamos estadísticas del conjunto de datos y evaluamos el rendimiento del reconocimiento facial mediante verificación e identificación (cerrada y abierta), incluyendo análisis de subgrupos por raza/color y nivel de dificultad. Los resultados muestran que el rendimiento en reconocimiento varía sustancialmente con la calidad de la imagen, y que las brechas de subgrupos deben interpretarse conjuntamente con la dificultad visual y no de forma aislada. En general, UFPR-PE proporciona un entorno reproducible y demográficamente fundamentado para estudiar el sesgo de reconocimiento facial bajo condiciones de vídeo público desafiantes.

Punto de partida

Muchas auditorías demográficas del reconocimiento facial utilizan imágenes fijas seleccionadas y taxonomías raciales centradas en EE. UU. o Europa asignadas por terceros. Estas opciones no representan las categorías censales autodeclaradas de Brasil, especialmente el parda, y a menudo eliminan los fotogramas difíciles comprimidos, de perfil, ocluidos y de baja resolución que dominan los errores operativos. Una auditoría realista necesita analizar conjuntamente la procedencia demográfica y la dificultad de la imagen.

Método

El conjunto de datos vincula vídeos públicos de 5.103 políticos brasileños electos con registros electorales oficiales y contiene 547.519 imágenes de sonda con metadatos de raza/color, edad y género. Preserva muestras de compresión y desafío incontroladas, anonimiza rostros incidentales y rastrea sondas en subconjuntos fáciles, medios y difíciles tras una exhaustiva revisión humana. Un R50 preentrenado con WebFace260M y ArcFace se evalúa en aproximadamente 11,5 millones de pares de verificación genuinos y de impostores, emparejamiento acumulativo cerrado y protocolos FNIR/FPIR de conjunto abierto, con resultados desglosados entre grupos blancos, negros, parda, amarillos e indígenas.

Conclusión del artículo

Los paneles de equidad deben estratificarse por dificultad de captura y usar etiquetas demográficas localmente significativas. UFPR-PEs ofrece una prueba de estrés brasileña sólida, pero su hallazgo más importante es metodológico: las brechas en subgrupos pueden interpretarse erróneamente cuando un desequilibrio severo de calidad de imagen está oculto dentro de una sola media.