作者与机构
Shun Ren
College of Computer and Information Technology, China Three Gorges University
Kaijie Jin
College of Computer and Information Technology, China Three Gorges University
Shengkai Hu
School of Information Engineering, Zhongnan University of Economics and Law
Beihang Song
National Institute of Natural Hazards, Ministry of Emergency Management of China
Hang Sun
College of Computer and Information Technology, China Three Gorges University
Wenwen Min
School of Information Science and Engineering, Yunnan University
Youfa Liu
School of Computer Science, Wuhan University
Jun Wan
School of Information Engineering, Zhongnan University of Economics and Law
School of Computer Science and Engineering, Nanyang Technological University
解决了什么问题
FreqFLD 以一体化的面部关键点检测器为目标,该检测器可以联合训练于 300W、AFLW、COFW 和 WFLW 数据集,同时在每个基准数据集上保持竞争力,并在其困难子集上具有鲁棒性。文章探讨了显式频率先验是否能比无约束的专家混合路由更可靠地引导专家特化。
关键结果
该统一模型在 300W Common 上达到 2.72 NME,在 300W Challenging 上为 4.52,在 WFLW 测试集上为 4.50;WFLW 的姿态、光照、遮挡和模糊子集分别为 7.54、4.55、5.53 和 5.15。在严重遮挡的 COFW 上,其报告 4.80 NME 和 0.39% 失败率。完整的频率模块和路由损失将 300W 挑战基线从 4.71 提升至 4.52,而加入所有四个训练数据集则将单数据集 4.97 的结果提升至 4.52。性能具有竞争力,而非始终最好,包括在 AFLW 上的 1.69 NME,而老的专用方法报告的误差更低。
摘要
深度学习的最新进展显著推动了面部地标检测。然而,大多数现有方法在数据集特定训练范式下以空间域方式处理特征,忽视了面部地标检测本质上由几何驱动且对频率变化敏感的事实,从而限制了复杂场景下的跨数据集泛化,阻碍了面部地标检测模型的发展。为解决这一问题,我们提出了 \textbf{FreqFLD},这是一个基于 \textbf{freq}uency modulation 的框架,旨在实现全能化 \textbf{f}acial \textbf{l}andmark \textbf{d}etection。具体来说,FreqFLD 引入了一个频率调制模块(FreqMoM),通过解耦和调制低频和高频成分,明确诱导频率提前,然后注入后续特征建模,实现全球面部结构和局部地标细节的平衡建模。此外,FreqFLD采用频率调制专家混合(FreqMoE),专家选择基于频率调制先验自适应,实现在多样且具挑战性场景下的异构面部标志模式的灵活建模。为规范全合一范式下的频率一致性建模,我们进一步引入了频率一致性路由(FreqCR)损耗,限制频率感知专家的路由和分配,促进专家在多样面部场景中的均衡利用,从而实现稳定的专家专业化并实现稳健的面部标志检测。大量实验表明,所提的FreqFLD在流行数据集上实现了相当的性能。代码可在:https://github.com/jkj1059657014/FreqFLD 获取。
研究出发点
面部地标模型通常按数据集训练,尽管生产投入混合了地标惯例、姿势、遮挡、模糊和照明。纯粹的空间特征可能过度拟合单一注释区,错过低频人脸结构与高频地标细节的区别。统一模型在需要一位专家处理所有几何和图像质量时,还会产生路由冲突。
方法概述
频率调制模块将特征分解为低频和高频分量,分别进行建模,并将生成的先验注入下游层。频率调制的专家混合利用该先验来路由异质面部模式,而频率一致路由损失则平衡利用率并鼓励稳定的特化。联合训练将四个源数据集均衡到每个 20,000 个样本,生成 80,000 张图像的训练池,在每个数据集的原生关键点和归一化协议下进行评估。
论文总结
频率感知路由为将多个关键点模型整合为一个提供了可信依据,但团队应比较每个摄像头和每个关键点方案的误差,因为统一训练并未在每一个单独的基准中获胜。