作者与机构
Sebastian Regalado
University of Toronto, Canada
ModiFace, Canada
Varshanth R. Rao
ModiFace, Canada
Ruowei Jiang
ModiFace, Canada
Parham Aarabi
University of Toronto, Canada
Igor Gilitschenski
University of Toronto, Canada
解决了什么问题
本文为异构地标布局定义了一个通用的语义坐标系统,并利用它在多个数据集上训练一个检测器。在推理时,同一网络可以回答任意集合的地标查询,包括在其源数据集训练期间未显式请求的点。
关键结果
使用适配器的统一 ViT-B 模型在 WFLW 上记录了 4.02 的 NME 和 2.19% 的失败率,在 300W 的普通/挑战集上分别为 2.43/4.19 NME,在 AFLW-19 上为 2.76 NME,同时支持融合训练和动态输出。当仅在 300W 上训练时,其在具有挑战性的 WFLW68 迁移测试上达到 6.08 NME,而 DTLD 和 PIPNet 分别为 7.23 和 8.09。在未见的本地图标上,学习到的查询相比样条插值在 300W 上提升了 19.0%,在 WFLW 各分割上提升了 15.7-16.3%,表明该模型学习的是可复用的轮廓语义,而不仅仅是记住固定索引。
摘要
尽管面部关键点检测(FLD)方法的进展不断推动性能边界,但它们忽视了两个主要功能限制:(1)不同的网络参数需要针对每个“$N$点”基准数据集独立训练;(2)在“$N$点”数据集上训练的模型只能可靠地输出$N$个关键点。在我们的工作中,我们首先构想了面部部位锚定关键点位置(FPALPs),其中每一个关键点被视为面部部位轮廓上从零(起点)到一(终点)的进展值。每个关键点都可以用FPALP格式表示,无论其来源数据集,因此能够将所有“$N$点”数据集合并为单一数据集。其次,我们使用基于FPALP的查询表示每个关键点,通过跨模态解码器逐步优化,并根据最终表示预测其坐标。我们的方法称为统一动态FLD,体现了这两个设计选择,并通过实现(1)单一模型能够在任意数量的“$N$点”数据集上学习,以及(2)在运行时加载指定的关键点查询即可生成任意数量的特定关键点预测,从而简化了关键点检测流程。在多个基准数据集上的大量实验表明,我们的方法在提供这些优势的同时,仍能与现有最先进方法保持竞争力,并在若干情况下表现更优。
研究出发点
面部标志点数据集对于面部是否拥有19个、68个、98个或其他数量的标注点存在分歧。传统模型将其回归头绑定到一个模板,迫使团队为每个数据集训练和维护单独的参数,并阻止已部署的模型按需返回新的子集或更密集的布局。这种分散对于使用不同标志点规范的对齐、重建、化妆和表情处理流程来说成本很高。
方法概述
每个关键点都变成一个面部部分锚定的关键点位置:沿着如眉毛、眼睛、鼻子、嘴巴或面部边界的语义轮廓,从零到一的归一化进程。数据集模板在该轮廓空间中对齐,每一个请求的点都被编码为 FPALP 查询。跨模态解码器在回归坐标前,逐步结合图像标记和查询。ViT-B 模型在 AFLW-19、300W 和 WFLW 上联合训练;可选的轻量级数据集适配器可以恢复系统性的标注偏差,而不放弃统一的主干网络或运行时可配置的输出布局。
论文总结
单一的查询驱动地标服务可以取代多个特定模板的模型,同时保持竞争性的准确性。当产品需要多种对齐格式或预计添加新的地标定义时,这种方法尤其有吸引力,不过团队仍应对每个生产数据集测试标注偏移适配器。