Mejorando el reconocimiento facial de baja resolución bajo datos limitados: cómo la generación de datos sintéticos puede cerrar la brecha de dominio
Autores e instituciones
Luis S. Luevano
Idiap Research Institute, Switzerland
Ünsal Öztürk
Idiap Research Institute, Switzerland
Hatef Otroshi Shahreza
Idiap Research Institute, Switzerland
Anjith George
Idiap Research Institute, Switzerland
Sébastien Marcel
Idiap Research Institute, Switzerland
Qué problema resuelve
El estudio pregunta qué estrategia sintética de baja resolución realmente ayuda a un reconocedor de caras compacto cuando los datos nativos etiquetados son limitados, y si las conclusiones extraídas de pruebas artificialmente muestreadas a la baja al estilo LFW se mantienen en sondas reales de TinyFace. También establece una línea base de entrada directa para que los módulos de superresolución y traducción demuestren que preservan la identidad en lugar de simplemente mejorar la apariencia visual.
Resultado clave
Las pruebas sintéticas favorecieron una degradación de 28 píxeles, pero esa misma configuración quedó por debajo de la línea base entrenada con alta resolución en TinyFace real. Un aumento de interpolación más suave de 56 píxeles fue la mejor configuración compacta, elevando el mAP de TinyFace de 52,55 a 54,68 y la identificación de rango 1 de 59,66% a 61,40%. El pipeline de superresolución RRDB aprendido más traducción de dominio alcanzó solo 57,53 mAP con EdgeFace-base, frente a 65,12 con entrada directa. La destilación de conocimiento produjo las mayores ganancias sintéticas, pero no se transfirió a baja resolución nativa, mostrando que la fidelidad de la síntesis, no la complejidad de la síntesis, es el factor limitante.
Resumen
Los sistemas de Reconocimiento Facial (FR) en entornos de vigilancia suelen encontrarse con rostros de baja resolución (LR), aquellos cuya región facial está por debajo del tamaño estándar de entrada de 112 $\vezes 112 $. Aunque los datos de entrenamiento etiquetados en alta resolución (HR) abundan, los datos nativos LR etiquetados, y sobre todo los datos nativos LR/HR emparejados, son escasos. Una solución alternativa es sintetizar datos LR a partir de los rostros HR disponibles, pero cuánto esfuerzo de síntesis se compensa en precisión de reconocimiento sigue sin estar claro. Presentamos un estudio de estrategias simples de generación sintética para un sistema compacto orientado a dispositivos de periferia, que abarcan degradación basada en interpolación, destilación de conocimiento, un Transformador de Dominio Prepended (PDT), degradación al estilo Real ESRGAN y un front-end de Super Resolución (SR) aprendido con pérdida consciente de identidad. Evaluamos estas estrategias en benchmarks faciales sintéticos de resolución cruzada (LFW, CFP-FP, AgeDB-30) y en TinyFace, un conjunto de datos nativo de LR del mundo real, y exponemos una brecha sintético-real: el ajuste de degradación que es óptimo en benchmarks sintéticos no es el óptimo en LR real. Encontramos que un mayor esfuerzo de síntesis no ayuda de forma monótona: el front-end de SR aprendido no supera una alimentación directa de la imagen LR alineada hacia una columna vertebral fuerte, mientras que la simple ampliación por interpolación de una columna vertebral compacta es la única síntesis que mejora respecto a su propia línea base. Concluimos que los métodos generativos para el reconocimiento facial LR deben validarse en LR real y frente a una línea base de alimentación directa, y liberamos nuestra pipeline a https://idiap.ch/paper/synth-lrfr
Punto de partida
Los sistemas de vigilancia y listas de control comparan rutinariamente una imagen de inscripción de alta calidad con una sonda cuya cara alineada es mucho más pequeña que la entrada estándar de 112 por 112. Las identidades nativas de baja resolución, especialmente las capturas de baja y alta resolución de la misma persona, son escasas, por lo que los equipos comúnmente fabrican datos de entrenamiento de baja resolución a partir de caras de alta resolución abundantes. El riesgo práctico es que una receta de degradación puede obtener buenos resultados en benchmarks sintéticos mientras enseña al reconocedor pistas que no se parecen a desenfoque, ruido, compresión y errores de alineación de cámaras reales.
Método
Los autores utilizan la red EdgeFace-S con 3,65 millones de parámetros y comparan cinco niveles de esfuerzo de adaptación: aumento mediante interpolación con muestreo a baja y alta resolución, destilación de conocimiento de un maestro de alta resolución, un transformador de dominio prepended, un tallo nativo de 32 píxeles entrenado con degradaciones estilo Real-ESRGAN, y un front-end de superresolución aprendido y consciente de la identidad. Evalúan la verificación de alta a baja y de baja a baja en LFW, CFP-FP y AgeDB-30, luego repiten la comparación en TinyFace de baja resolución nativa bajo dos pipelines de alineación. Un modelo EdgeFace-base más grande y congelado proporciona la referencia para probar si un front-end generativo supera la alimentación directa de la sonda alineada a un reconocedor potente.
Conclusión del artículo
Para un despliegue en los bordes o de vigilancia, valide cada receta de baja resolución en caras de baja resolución capturadas genuinamente y mantenga una línea base de alimentación directa fuerte. Un aumento simple y suave mediante interpolación puede ser una mejor inversión que una pila de superresolución; las ganancias únicamente sintéticas a resoluciones agresivas no son evidencia confiable del rendimiento en el campo.