← Volver al Blog
Radar de InvestigaciónDetección de rostrosPuntos de referencia facialesarXivSeptiembre 2026

Radar arXiv Mensual

Artículos sobre detección de rostros de septiembre de 2026: Puntos de referencia unificados, alineación por difusión y despliegue en aulas

Los artículos de detección directa de rostros fueron escasos en septiembre, por lo que este resumen sigue el stack de localización adyacente que los sistemas de producción necesitan después de encontrar una caja. FreqFLD entrena un modelo de puntos de referencia consciente de la frecuencia a través de cuatro conjuntos de datos. FAHCD-Net trata los mapas de calor de puntos de referencia como un problema de denoising condicional bajo cambios de pose, oclusión, desenfoque e iluminación. El estudio Visage vuelve a unir detección y reconocimiento en imágenes de aula abarrotadas, donde el rendimiento y los rostros perdidos importan tanto como la precisión de identidad máxima.

Lo que señala este mes

FreqFLD equilibra la estructura global y el detalle local al dividir los componentes de frecuencia y dirigir las muestras a través de expertos condicionados por frecuencia; un modelo entrenado conjuntamente alcanza un NME de 4.50 en WFLW y un NME de 4.80 con una tasa de fallos del 0.39% en COFW con oclusiones. FAHCD-Net, en cambio, encadena etapas de difusión condicional y suprime el ruido de mapas de calor de alta frecuencia redundante, reduciendo el NME del conjunto desafiante 300W de 4.48 en la etapa uno a 4.29 en la etapa tres. El estudio Visage informa que un YOLOv8n de 3.2 millones de parámetros alcanza 0.935 mAP@0.5, mientras que detectores mucho más grandes ganan precisión a un costo sustancial de parámetros; varios reconocedores alcanzan un Top-1 del 99.75% en su conjunto de reconocimiento de 100 clases. Estos resultados son prometedores, pero los dos artículos fundamentales siguen siendo estudios de referencia y los datos de aula provienen de un entorno institucional limitado, por lo que aún se requiere validación cruzada entre cámaras.

Artículo 012026-09-09cs.CV

FreqFLD: Hacia la detección todo-en-uno de puntos de referencia faciales mediante modulación de frecuencia

Autores e instituciones

Shun Ren

College of Computer and Information Technology, China Three Gorges University

Kaijie Jin

College of Computer and Information Technology, China Three Gorges University

Shengkai Hu

School of Information Engineering, Zhongnan University of Economics and Law

Beihang Song

National Institute of Natural Hazards, Ministry of Emergency Management of China

Hang Sun

College of Computer and Information Technology, China Three Gorges University

Wenwen Min

School of Information Science and Engineering, Yunnan University

Youfa Liu

School of Computer Science, Wuhan University

Jun Wan

School of Information Engineering, Zhongnan University of Economics and Law

School of Computer Science and Engineering, Nanyang Technological University

Qué problema resuelve

FreqFLD apunta a un detector de referencia todo en uno que puede entrenarse conjuntamente en 300W, AFLW, COFW y WFLW, manteniéndose competitivo en cada benchmark y robusto en sus subconjuntos difíciles. El artículo pregunta si los priors explícitos de frecuencia pueden guiar la especialización de expertos de forma más fiable que el enrutamiento de mezcla de expertos sin restricciones.

Resultado clave

El modelo unificado alcanza 2,72 NME en 300W Común, 4,52 en 300W desafiante y 4,50 en el conjunto de pruebas WFLW; WFLW obtienen una puntuación de 7,54, 4,55, 5,53 y 5,15. En COFW fuertemente ocluido reporta 4,80 NME y una tasa de fallo del 0,39%. Los módulos de frecuencia completa y la pérdida de enrutamiento mejoran la línea base desafiante de 300W de 4,71 a 4,52, mientras que sumando los cuatro conjuntos de datos de entrenamiento se mejora un resultado de 4,97 en un solo conjunto de datos a 4,52. El rendimiento es competitivo más que uniformemente mejor, incluyendo 1,69 NME en AFLW donde los métodos especializados antiguos reportan menor error.

Resumen

Los avances recientes en aprendizaje profundo han avanzado significativamente la detección de puntos de referencia faciales. Sin embargo, la mayoría de los métodos existentes procesan características en el dominio espacial bajo un paradigma de entrenamiento específico para cada conjunto de datos, lo que pasa por alto el hecho de que la detección de puntos de referencia faciales es inherentemente impulsada por la geometría y sensible a las variaciones de frecuencia, limitando así la generalización entre distintos conjuntos de datos en escenarios complejos y obstaculizando el desarrollo de un modelo de detección de puntos de referencia faciales. Para abordar este problema, proponemos \textbf{FreqFLD}, un marco \textbf{modulado por \textit{freq}uencia} dirigido hacia la detección \textbf{todo-en-uno de puntos de referencia faciales (f\textit{l}d)}. Específicamente, FreqFLD introduce un Módulo de Modulación de Frecuencia (FreqMoM) para inducir explícitamente el prior de frecuencia mediante la desacoplación y modulación de componentes de baja y alta frecuencia, que luego se inyecta en el modelado posterior de características para permitir un modelado equilibrado de la estructura facial global y los detalles locales de los puntos de referencia. Además, FreqFLD emplea una Mezcla de Expertos Modulada por Frecuencia (FreqMoE), con selección de expertos adaptativamente condicionada por priors modulados por frecuencia, lo que permite un modelado flexible de patrones heterogéneos de puntos de referencia faciales en escenarios diversos y desafiantes. Para regular el modelado consistente en frecuencia bajo el paradigma Todo-en-uno, introducimos además una pérdida de Enrutamiento Consistente en Frecuencia (FreqCR), que restringe el enrutamiento y asignación de expertos conscientes de la frecuencia para promover una utilización equilibrada de expertos a través de diversos escenarios faciales, habilitando así la especialización estable de expertos y logrando una detección robusta de puntos de referencia faciales. Experimentos extensivos demuestran que el FreqFLD propuesto alcanza un rendimiento comparable en conjuntos de datos populares. El código está disponible en: https://github.com/jkj1059657014/FreqFLD.

Punto de partida

Los modelos de puntos de referencia faciales generalmente se entrenan por conjunto de datos, aunque las entradas de producción mezclan convenciones de puntos de referencia, poses, oclusiones, desenfoque e iluminación. Las características espaciales puras pueden sobreajustarse a un régimen de anotación y no distinguir entre la estructura facial de baja frecuencia y el detalle de los puntos de alta frecuencia. Un modelo unificado también crea conflictos de enrutamiento cuando se espera que un experto maneje todos los regímenes de geometría y calidad de imagen.

Método

El Módulo de Modulación de Frecuencia descompone las características en componentes de baja y alta frecuencia, las modela por separado e inyecta el prior resultante en capas posteriores. Una mezcla modulada en frecuencia de expertos utiliza ese prior para enrutar patrones faciales heterogéneos, mientras que la pérdida de enrutamiento consistente en frecuencia equilibra la utilización y fomenta una especialización estable. El entrenamiento conjunto iguala los cuatro conjuntos de datos fuente a 20.000 muestras cada uno, dando lugar a un pool de entrenamiento de 80.000 imágenes evaluado bajo el protocolo nativo de referencia y normalización de cada conjunto de datos.

Conclusión del artículo

El enrutamiento con conciencia de frecuencia presenta un argumento creíble para consolidar varios modelos de referencia en uno solo, pero los equipos deberían comparar errores por cámara y por esquema de hitos porque el entrenamiento unificado no gana todos los benchmarks individuales.

Artículo 022026-09-15cs.CV

FAHCD-Net: Redes de difusión condicionales guiadas por mapas de calor adaptativos en frecuencia para la detección robusta de puntos de referencia faciales

Autores e instituciones

Jun Wan

School of Information Engineering, Zhongnan University of Economics and Law

Jiwei Hu

School of Information Engineering, Zhongnan University of Economics and Law

Shengkai Hu

School of Information Engineering, Zhongnan University of Economics and Law

Qilu Zhu

School of Information Engineering, Zhongnan University of Economics and Law

Qué problema resuelve

FAHCD-Net busca una localización robusta de hitos bajo pose, oclusión, iluminación y desenfoque haciendo que un proceso de difusión condicionado por mapa de calor sea explícitamente consciente de la frecuencia. También prueba si una cascada puede mejorar progresivamente una condición inicial de forma media en lugar de depender de un mapa de calor inicial generado por detector de alta calidad.

Resultado clave

FAHCD-Net reporta 2,51 NME en 300W Común, 2,99 en el conjunto completo, 1,17 en AFLW frontal y 2,08 en AFLW completo. En 300W Desafiante, las etapas sucesivas de difusión reducen NME de 4,48 a 4,33 y luego 4,29, en comparación con 4,81, 4,73 y 4,69 al condicionar sobre una forma media. Sumar datos de entrenamiento COFW, WFLW y AFLW mejora el resultado de desafío reportado de 300W de 4,76 a 4,49 en la ablación multiconjunto. El artículo demuestra la robustez de los benchmarks pero no informa de latencia detector-más landmark, por lo que el coste de la difusión iterativa sigue siendo una cuestión de despliegue.

Resumen

La Detección de Puntos de Referencia Faciales (FLD) es una tarea crucial en diversas aplicaciones y ha logrado avances significativos en los últimos años. Sin embargo, los métodos FLD actuales siguen teniendo dificultades en condiciones difíciles, donde las variaciones estructurales faciales, la pérdida de información y la interferencia acústica comprometen gravemente la integridad y precisión de los rasgos faciales aprendidos. Para abordar estos problemas, proponemos Frequency-Adaptive Heatmap-Conditional Diffusion Network (FAHCD-Net), que integra un modelo de Mapa de Calor Adaptativo de Frecuencia (FAHCD) con una pérdida de Regularización de Suavidad (SR) en un marco en cascada. Específicamente, el modelo FAHCD incorpora un módulo de Adaptación Jerárquica de Frecuencia (HFA) diseñado para suprimir ruido redundante de alta frecuencia mediante descomposición de frecuencias multicapa y reconstrucción adaptativa, preservando así las estructuras faciales esenciales. Además, la pérdida SR se propone para mitigar aún más la interferencia del ruido de alta frecuencia y mejorar la suavidad de los mapas de calor emblemáticos generados. Al encadenar el modelo FAHCD con la pérdida de SR, FAHCD-Net aprovecha eficazmente tanto las características estadísticas como las de distribución basadas en frecuencia de los datos para generar mapas de calor de referencia más precisos a partir de entradas ruidosas. Experimentos extensos en benchmarks populares demuestran la efectividad y robustez del método propuesto, logrando un rendimiento de vanguardia en tareas FLD bajo escenarios desafiantes. El código fuente está disponible en https://github.com/HJWKryptonite/FAHCD-Net.

Punto de partida

Los mapas de calor emblemáticos se deterioran cuando la pose o expresión cambia la estructura facial, cuando la oclusión elimina evidencia y cuando el desenfoque o la iluminación inyectan ruido de alta frecuencia. La regresión estándar trata esos efectos como errores directos de predicción. La difusión ofrece recuperación iterativa de evidencia ruidosa o incompleta, pero la eliminación de ruido sin restricciones puede producir energía espuria de mapa de calor de alta frecuencia y picos inestables.

Método

Cada etapa en cascada utiliza un modelo de difusión condicional adaptativa a la frecuencia para refinar las distribuciones de hitos. La adaptación jerárquica de frecuencia descompone y reconstruye repetidamente características para que la estructura facial de baja frecuencia se mantenga mientras se suprime el ruido redundante de alta frecuencia. Un término de regularización de suavidad alinea el comportamiento de frecuencias de mapas de calor generados con la verdad real. El entrenamiento multi-conjunto de datos añade COFW, WFLW y AFLW a 300W, y tres etapas pasan sus mapas de calor predichos como la siguiente condición.

Conclusión del artículo

La difusión condicional puede recuperar mapas de calor de hitos más limpios en imágenes difíciles, pero su coste iterativo debe medirse en función del presupuesto de latencia de la cámara y de una base fuerte de alineación no difusión.

Artículo 032026-09-19cs.CV

Hacia un control robusto de asistencia en el aula: una evaluación integral de modelos de detección y reconocimiento facial

Autores e instituciones

Himani Trivedi

Computer Engineering Department, LDRP Institute of Technology and Research, Kadi Sarva Vishwavidyalaya

Hiren Patel

Vidush Somany Institute of Technology and Research, Kadi Sarva Vishwavidyalaya

Ridham Patel

Information Technology Department, LDRP Institute of Technology and Research, Kadi Sarva Vishwavidyalaya

Krutika Patel

Information Technology Department, LDRP Institute of Technology and Research, Kadi Sarva Vishwavidyalaya

Nancy Patel

Information Technology Department, LDRP Institute of Technology and Research, Kadi Sarva Vishwavidyalaya

Qué problema resuelve

El estudio introduce conjuntos de datos de detección y reconocimiento emparejados para las condiciones del aula y compara una familia de tamaños de detectores con siete arquitecturas actuales de reconocimiento facial. Su objetivo es identificar un punto operativo práctico de precisión y eficiencia en lugar de asumir que el mayor detector o reconocedor es el mejor componente de asistencia.

Resultado clave

YOLOv8n utiliza 3,2 millones de parámetros y alcanza una precisión de 0,932, 0,886 de recuerdo, 0,91 F1 y 0,935 mAP@0,5; las variantes más grandes se acercan aproximadamente a 0,97 mAP@0,5 pero usan entre 43,7 y 68,2 millones de parámetros. En reconocimiento, FaceLiVTv2-L, EdgeFace Base, LVFace ViT-B y TransFace ViT-B alcanzan cada uno el 99,75% de Top-1 en la tabla reportada. EdgeFace Base lo hace en 4,029 ms, más rápido que FaceLiVTv2-L con 6,081 ms, mientras que los tamaños de los modelos varían ampliamente. Estos son resultados cerrados de un conjunto limitado de instituciones educativas, por lo que no establecen resistencia a la suplantación, generalización entre escuelas ni adecuación política para la asistencia automatizada.

Resumen

Los métodos manuales de asistencia, como los en papel o en registro, requieren mucho tiempo, pueden provocar errores y son fáciles de falsificar. El reconocimiento facial es más fiable, pero con frecuencia tiene dificultades en las aulas porque la iluminación y otras condiciones pueden variar. Los conjuntos de datos de reconocimiento facial están diseñados para entornos regulados y no capturan los desafíos reales que se encuentran en las aulas. Para abordar esto, se propone un nuevo conjunto de datos de detección y reconocimiento facial, el conjunto de datos Visage Face, que comprende 16.234 muestras faciales, para la tarea de detección y reconocimiento facial. Las fotos se toman desde diferentes ángulos y bajo condiciones de iluminación variables, con los estudiantes mostrando una variedad de expresiones y algunos rostros parcialmente cubiertos para reflejar situaciones reales. Se utiliza un sistema basado en YOLO para detectar rostros y probó siete modelos avanzados de reconocimiento facial con trece configuraciones: LVFace, QCFace, FaceLiVTv2, TopoFR, EdgeFace, TransFace y GhostFaceNets. De estos, FaceLiVTv2-M fue el mejor, con un 99,75% de precisión en el Top 1/Top 5 y un tiempo de inferencia de 6,459 ms. Estos resultados muestran que el Visage Face Dataset es un referente realista y desafiante para el reconocimiento facial en la asistencia al aula.

Punto de partida

La asistencia al aula combina muchas caras pequeñas, poses y luces variables, oclusión parcial y la necesidad de procesar fotogramas de vídeo repetidos en hardware asequible. Los conjuntos de datos generales de rostros no reproducen ese entorno operativo, mientras que por sí solo informar de la precisión del reconocimiento oculta detecciones fallidas y costes computacionales. Las instituciones también necesitan datos recogidos con consentimiento en lugar de imágenes de identidad reutilizadas.

Método

Los autores recopilan 801 imágenes de aula, anotan manualmente rostros y utilizan rotación, escala, traslación, ruido y volteo para construir el conjunto de detección; el artículo informa de 3.635 imágenes de detección y 96.409 anotaciones faciales tras la ampliación. El conjunto de reconocimiento contiene 3.500 imágenes distribuidas en 100 clases, alineadas a partir de cinco hitos de RetinaFace y normalizadas a 112 por 112. Se evalúan variantes YOLOv8 n/s/m/l/x para su detección, y se comparan trece configuraciones de LVFace, QCFace, FaceLiVTv2, TopoFR, EdgeFace, TransFace y GhostFaceNets para su reconocimiento.

Conclusión del artículo

El resultado útil es el equilibrio medido entre detector y reconocedor, no la puntuación casi perfecta en conjuntos cerrados. Un piloto debe reproducir el recall, la latencia, el consentimiento, la suplantación y el comportamiento de la persona desconocida en las propias cámaras de la institución.