FreqFLD: к универсальному обнаружению лицевых ориентиров с помощью частотной модуляции
Авторы и организации
Shun Ren
College of Computer and Information Technology, China Three Gorges University
Kaijie Jin
College of Computer and Information Technology, China Three Gorges University
Shengkai Hu
School of Information Engineering, Zhongnan University of Economics and Law
Beihang Song
National Institute of Natural Hazards, Ministry of Emergency Management of China
Hang Sun
College of Computer and Information Technology, China Three Gorges University
Wenwen Min
School of Information Science and Engineering, Yunnan University
Youfa Liu
School of Computer Science, Wuhan University
Jun Wan
School of Information Engineering, Zhongnan University of Economics and Law
School of Computer Science and Engineering, Nanyang Technological University
Какую задачу решает
FreqFLD нацелена на один универсальный детектор ориентиров, который можно совместно обучать на 300W, AFLW, Cofw и WFLW, оставаясь конкурентоспособным на каждом бенчмарке и надёжным на сложных подмножествах. В статье ставится вопрос, могут ли явные частотные априоры более надёжно направлять экспертную специализацию, чем неограниченное смешение экспертов.
Ключевой результат
Унифицированная модель достигает 2,72 NME на 300 Вт Common, 4,52 на 300W Challenging и 4,50 на тестовом наборе WFLW; Подмножества WFLW по позе, освещению, окклюзии и размытию оценивают 7,54, 4,55, 5,53 и 5,15. На сильно окклюзионном COFW он показывает 4,80 NME и 0,39% уровень отказов. Модули полной частоты и потери маршрутизации улучшают сложностную базовую высоту 300 Вт с 4,71 до 4,52, а добавление всех четырёх обучающих наборов данных улучшает результат с 4,97 до 4,52. Производительность конкурентоспособна, а не единообразно высокая, включая 1,69 NME на AFLW, где старые специализированные методы показывают меньшую ошибку.
Аннотация
Недавние успехи в области глубокого обучения существенно продвинули обнаружение лицевых ключевых точек. Однако большинство существующих методов обрабатывают признаки в пространственной области в рамках специфической для датасета схемы обучения, что упускает из виду тот факт, что обнаружение лицевых ключевых точек по своей сути управляется геометрией и чувствительно к частотным вариациям, что ограничивает обобщение между разными датасетами в сложных сценариях и препятствует развитию модели обнаружения лицевых ключевых точек. Для решения этой проблемы мы предлагаем extbf{FreqFLD}, структуру для обнаружения всех лицевых ключевых точек с модуляцией частоты ( extbf{freq}uency-modulated framework towards All-in-One extbf{f}acial extbf{l}andmark extbf{d}etection). Конкретно, FreqFLD вводит Модуль Модуляции Частоты (FreqMoM), чтобы явно внедрить частотный приоритет путем разъединения и модуляции низко- и высокочастотных компонентов, который затем внедряется в последующее моделирование признаков для обеспечения сбалансированного моделирования глобальной структуры лица и локальных деталей ключевых точек. Более того, FreqFLD использует Частотно-Модулированную Смесь Экспертов (FreqMoE), при этом выбор эксперта адаптивно зависит от частотно-модулированных приоритетов, что позволяет гибко моделировать гетерогенные шаблоны лицевых ключевых точек в разнообразных и сложных сценариях. Чтобы регуляризовать согласованное по частоте моделирование в рамках All-in-One парадигмы, мы дополнительно вводим функцию потерь Frequency-Consistent Routing (FreqCR), которая ограничивает маршрутизацию и назначение экспертов учитывающих частоту для содействия сбалансированному использованию экспертов в различных лицевых сценариях, тем самым обеспечивая стабильную специализацию экспертов и достигая надежного обнаружения лицевых ключевых точек. Широкие эксперименты показывают, что предложенный FreqFLD достигает сопоставимых результатов на популярных датасетах. Код доступен по ссылке: https://github.com/jkj1059657014/FreqFLD.
Отправная точка исследования
Модели лицевых ориентиров обычно обучаются для каждого набора данных, даже несмотря на то, что производственные входные данные смешивают соглашения об ориентировках, позы, блокировки, размытие и освещённость. Чисто пространственные признаки могут переобучиться под одну схему аннотаций и не различать низкочастотную структуру лица и высокочастотные детали ориентиров. Единая модель также создаёт конфликты маршрутизации, когда от одного эксперта ожидается обработка всех режимов геометрии и качества изображения.
Метод
Модуль частотной модуляции разбивает признаки на низкочастотные и высокочастотные компоненты, моделирует их отдельно и вводит полученный априор в нижние слои. Частотно-модулированная смесь экспертов использует это перед маршрутизацией гетерогенных лицевых паттернов, в то время как частотно-согласованное маршрутизирование потерь балансирует использование и способствует стабильной специализации. Совместное обучение уравнивает четыре исходных набора данных до 20 000 образцов каждый, получая обучающий пул из 80 000 изображений, оцениваемый по нативному протоколу стандарта и нормализации каждого набора данных.
Вывод по статье
Маршрутизация с учётом частоты — это достоверный аргумент в пользу объединения нескольких ключевых моделей в одну, но команды должны сравнивать ошибки по камере и схеме ориентиров, потому что унифицированное обучение не выигрывает каждый отдельный ориентир.