← 返回博客
研究雷达人脸检测面部标记点arXiv2026年9月

每月 arXiv 雷达

2026年9月人脸检测论文:统一关键点、扩散对齐与课堂部署

9月直接研究人脸边界框的论文很少,因此本次总结关注在找到边界框后生产系统所需的相邻定位堆栈。FreqFLD在四个数据集上训练一个频率感知的地标模型。FAHCD-Net将地标热图视为在姿态、遮挡、模糊和光照变化下的条件去噪问题。Visage研究在拥挤的课堂图像中将检测和识别重新结合在一起,在这里吞吐量和漏检面孔与顶级身份准确率同样重要。

本月趋势判断

FreqFLD 通过分离频率成分并将样本引导至频率条件专家,在平衡全局结构和局部细节方面表现出色;一个联合训练的模型在 WFLW 上达到 4.50 NME,在遮挡的 COFW 上达到 4.80 NME,失败率为 0.39%。FAHCD-Net 则通过级联条件扩散阶段并抑制冗余的高频热图噪声,将 300W 难集的 NME 从第一阶段的 4.48 降至第三阶段的 4.29。Visage 研究报告称,一个拥有 320 万参数的 YOLOv8n 在 mAP@0.5 上达到 0.935,而更大型的检测器虽然准确率更高,但参数成本也显著增加;若干识别器在其 100 类识别集上的 Top-1 精度达 99.75%。这些结果令人鼓舞,但这两篇具有里程碑意义的论文仍然是基准研究,课堂数据来源于有限的机构环境,因此仍需要跨摄像头验证。

论文 012026-09-09cs.CV

FreqFLD:通过频率调制实现一体化人脸关键点检测

作者与机构

Shun Ren

College of Computer and Information Technology, China Three Gorges University

Kaijie Jin

College of Computer and Information Technology, China Three Gorges University

Shengkai Hu

School of Information Engineering, Zhongnan University of Economics and Law

Beihang Song

National Institute of Natural Hazards, Ministry of Emergency Management of China

Hang Sun

College of Computer and Information Technology, China Three Gorges University

Wenwen Min

School of Information Science and Engineering, Yunnan University

Youfa Liu

School of Computer Science, Wuhan University

Jun Wan

School of Information Engineering, Zhongnan University of Economics and Law

School of Computer Science and Engineering, Nanyang Technological University

解决了什么问题

FreqFLD 以一体化的面部关键点检测器为目标,该检测器可以联合训练于 300W、AFLW、COFW 和 WFLW 数据集,同时在每个基准数据集上保持竞争力,并在其困难子集上具有鲁棒性。文章探讨了显式频率先验是否能比无约束的专家混合路由更可靠地引导专家特化。

关键结果

该统一模型在 300W Common 上达到 2.72 NME,在 300W Challenging 上为 4.52,在 WFLW 测试集上为 4.50;WFLW 的姿态、光照、遮挡和模糊子集分别为 7.54、4.55、5.53 和 5.15。在严重遮挡的 COFW 上,其报告 4.80 NME 和 0.39% 失败率。完整的频率模块和路由损失将 300W 挑战基线从 4.71 提升至 4.52,而加入所有四个训练数据集则将单数据集 4.97 的结果提升至 4.52。性能具有竞争力,而非始终最好,包括在 AFLW 上的 1.69 NME,而老的专用方法报告的误差更低。

摘要

深度学习的最新进展显著推动了面部地标检测。然而,大多数现有方法在数据集特定训练范式下以空间域方式处理特征,忽视了面部地标检测本质上由几何驱动且对频率变化敏感的事实,从而限制了复杂场景下的跨数据集泛化,阻碍了面部地标检测模型的发展。为解决这一问题,我们提出了 \textbf{FreqFLD},这是一个基于 \textbf{freq}uency modulation 的框架,旨在实现全能化 \textbf{f}acial \textbf{l}andmark \textbf{d}etection。具体来说,FreqFLD 引入了一个频率调制模块(FreqMoM),通过解耦和调制低频和高频成分,明确诱导频率提前,然后注入后续特征建模,实现全球面部结构和局部地标细节的平衡建模。此外,FreqFLD采用频率调制专家混合(FreqMoE),专家选择基于频率调制先验自适应,实现在多样且具挑战性场景下的异构面部标志模式的灵活建模。为规范全合一范式下的频率一致性建模,我们进一步引入了频率一致性路由(FreqCR)损耗,限制频率感知专家的路由和分配,促进专家在多样面部场景中的均衡利用,从而实现稳定的专家专业化并实现稳健的面部标志检测。大量实验表明,所提的FreqFLD在流行数据集上实现了相当的性能。代码可在:https://github.com/jkj1059657014/FreqFLD 获取。

研究出发点

面部地标模型通常按数据集训练,尽管生产投入混合了地标惯例、姿势、遮挡、模糊和照明。纯粹的空间特征可能过度拟合单一注释区,错过低频人脸结构与高频地标细节的区别。统一模型在需要一位专家处理所有几何和图像质量时,还会产生路由冲突。

方法概述

频率调制模块将特征分解为低频和高频分量,分别进行建模,并将生成的先验注入下游层。频率调制的专家混合利用该先验来路由异质面部模式,而频率一致路由损失则平衡利用率并鼓励稳定的特化。联合训练将四个源数据集均衡到每个 20,000 个样本,生成 80,000 张图像的训练池,在每个数据集的原生关键点和归一化协议下进行评估。

论文总结

频率感知路由为将多个关键点模型整合为一个提供了可信依据,但团队应比较每个摄像头和每个关键点方案的误差,因为统一训练并未在每一个单独的基准中获胜。

论文 022026-09-15cs.CV

FAHCD-Net:用于鲁棒人脸关键点检测的频率自适应热图条件扩散网络

作者与机构

Jun Wan

School of Information Engineering, Zhongnan University of Economics and Law

Jiwei Hu

School of Information Engineering, Zhongnan University of Economics and Law

Shengkai Hu

School of Information Engineering, Zhongnan University of Economics and Law

Qilu Zhu

School of Information Engineering, Zhongnan University of Economics and Law

解决了什么问题

FAHCD-Net 旨在通过使热图条件扩散过程显式具备频率感知,在姿势、遮挡、光照和模糊情况下实现稳健的关键点定位。它还测试级联是否可以逐步改善初始的平均形状条件,而不是依赖高质量检测器生成的初始热图。

关键结果

FAHCD-Net 在 300W Common 上报告的 NME 为 2.51,在完整数据集上为 2.99,在 AFLW frontal 上为 1.17,在 AFLW full 上为 2.08。在 300W Challenging 上,连续扩散阶段将 NME 从 4.48 降至 4.33,再降至 4.29,而在以平均形状为条件时则分别为 4.81、4.73 和 4.69。添加 COFW、WFLW 和 AFLW 的训练数据,在多数据集消融实验中将报告的 300W Challenging 结果从 4.76 提升到 4.49。论文展示了基准的稳健性,但未报告检测器加关键点预测的延迟,因此迭代扩散的成本仍是部署问题。

摘要

面部关键点检测(FLD)是各种应用中的关键任务,并在近年来取得了显著进展。然而,当前的 FLD 方法在具有挑战性的条件下仍然困难重重,其中面部结构变化、信息丢失和噪声干扰严重影响学习到的面部特征的完整性和准确性。为解决这些问题,我们提出频率自适应热图条件扩散网络(FAHCD-Net),将频率自适应热图条件扩散(FAHCD)模型与平滑正则化(SR)损失整合在级联框架中。具体而言,FAHCD 模型融合了层次频率适应(HFA)模块,通过多层频率分解和自适应重建抑制冗余高频噪声,从而保留重要的面部结构。此外,提出 SR 损失以进一步减轻高频噪声的干扰并增强生成的关键点热图的平滑性。通过将 FAHCD 模型与 SR 损失级联,FAHCD-Net 有效利用数据的统计和频率分布特性,从嘈杂的输入中逐步生成更准确的关键点热图。在流行基准上的广泛实验证明了所提方法的有效性和鲁棒性,在具有挑战性的场景下的 FLD 任务中实现了最先进的性能。源代码可在 https://github.com/HJWKryptonite/FAHCD-Net 获取。

研究出发点

当面部姿势或表情改变面部结构、遮挡移除证据以及模糊或光照引入高频噪声时,关键点热图的质量会下降。标准回归将这些影响视为直接预测误差。扩散方法则提供了从嘈杂或不完整证据中迭代恢复的能力,但无约束的去噪可能会产生虚假的高频热图能量和不稳定的峰值。

方法概述

每个级联阶段使用频率自适应热图条件扩散模型来细化关键点分布。层次频率自适应会反复分解和重建特征,以保留低频面部结构,同时抑制冗余的高频噪声。平滑正则项将生成的热图频率行为与真实情况对齐。多数据集训练将 COFW、WFLW 和 AFLW 加入 300W,三个阶段将其预测热图传递作为下一个阶段的条件。

论文总结

条件扩散可以在困难的图像中恢复更清晰的地标热图,但其迭代成本应与相机的延迟预算以及强大的非扩散对齐基线进行权衡。

论文 032026-09-19cs.CV

迈向鲁棒的课堂考勤:人脸检测与识别模型的综合评估

作者与机构

Himani Trivedi

Computer Engineering Department, LDRP Institute of Technology and Research, Kadi Sarva Vishwavidyalaya

Hiren Patel

Vidush Somany Institute of Technology and Research, Kadi Sarva Vishwavidyalaya

Ridham Patel

Information Technology Department, LDRP Institute of Technology and Research, Kadi Sarva Vishwavidyalaya

Krutika Patel

Information Technology Department, LDRP Institute of Technology and Research, Kadi Sarva Vishwavidyalaya

Nancy Patel

Information Technology Department, LDRP Institute of Technology and Research, Kadi Sarva Vishwavidyalaya

解决了什么问题

该研究介绍了适用于课堂条件的配对检测和识别数据集,并比较了一系列检测器大小与七种当前的人脸识别架构。其目标是确定实际的准确性-效率运行点,而不是假设最大的检测器或识别器是最佳出勤组件。

关键结果

YOLOv8n使用3.2百万参数,并达到0.932精度、0.886召回率、0.91 F1值和0.935 mAP@0.5;较大的变体接近0.97 mAP@0.5,但使用43.7百万至68.2百万参数。在识别方面,FaceLiVTv2-L、EdgeFace Base、LVFace ViT-B和TransFace ViT-B在报告表中均达到99.75% Top-1。EdgeFace Base耗时4.029毫秒,比FaceLiVTv2-L的6.081毫秒更快,而模型大小差异很大。这些是来自有限教育机构的闭集结果,因此不能确定防伪能力、跨校泛化性或自动考勤的政策适用性。

摘要

手动考勤方法,如纸质或登记簿系统,耗时较长,容易出错,并且容易被伪造。面部识别更加可靠,但在课堂上经常遇到困难,因为光照和其他条件可能变化。面部识别数据集是为受控环境设计的,并未捕捉课堂中实际存在的挑战。为解决这一问题,提出了一个新的面部检测与识别数据集——Visage Face数据集,该数据集包含16,234张面部样本,用于面部检测与识别任务。照片从不同角度拍摄,光照条件各异,学生表现出各种表情,并且有些面部部分遮挡,以反映真实场景。采用基于YOLO的系统进行面部检测,并测试了七种先进的面部识别模型及十三种配置:LVFace、QCFace、FaceLiVTv2、TopoFR、EdgeFace、TransFace和GhostFaceNets。其中,FaceLiVTv2-M表现最佳,Top-1/Top-5准确率为99.75%,推理时间为6.459毫秒。这些结果表明,Visage Face数据集是课堂考勤面部识别的真实且具有挑战性的基准。

研究出发点

课堂出勤涉及许多小脸孔、不同的姿态和光照、部分遮挡,以及在可负担硬件上处理重复视频帧的需求。通用人脸数据集无法复现那个操作环境,仅报告识别准确率会掩盖漏检和计算成本。机构还需要收集经过同意的数据,而不是重新利用身份图像。

方法概述

作者收集了801张课堂图像,手动标注人脸,并使用旋转、缩放、平移、噪声和翻转来构建检测集;论文报告增强后共有3,635张检测图像和96,409个人脸标注。识别集包含3,500张图像,分为100个类别,通过五个RetinaFace关键点对齐并归一化为112×112。检测方面评估了YOLOv8 n/s/m/l/x 变体,识别方面比较了LVFace、QCFace、FaceLiVTv2、TopoFR、EdgeFace、TransFace和GhostFaceNets的十三种配置。

论文总结

有用的结果是测得的检测器-识别器权衡,不是接近完美的闭集分数。试点应在机构自己的摄像头上复现召回率、延迟、同意、欺骗和未知人员行为。