Авторы и организации
Sebastian Regalado
University of Toronto, Canada
ModiFace, Canada
Varshanth R. Rao
ModiFace, Canada
Ruowei Jiang
ModiFace, Canada
Parham Aarabi
University of Toronto, Canada
Igor Gilitschenski
University of Toronto, Canada
Какую задачу решает
В статье определяется общая семантическая система координат для разнородных расположений ориентиров и используется для обучения одного детектора на нескольких наборах данных. Во время инференса та же сеть может отвечать на произвольный набор запросов по ориентирам, включая точки, явно не запрашиваемые во время обучения на исходном наборе данных.
Ключевой результат
Объединенная модель ViT-B с адаптерами фиксирует 4,02 NME и 2,19% уровень ошибок на WFLW, 2,43/4,19 NME на общих/сложных разбиениях 300W и 2,76 NME на AFLW-19, поддерживая объединенное обучение и динамический вывод. Когда модель обучается только на 300W, она достигает 6,08 NME в сложном тесте передачи WFLW68, против 7,23 у DTLD и 8,09 у PIPNet. По удержанным нативным ориентирам обученные запросы улучшают результаты по сравнению со сплайновой интерполяцией на 19,0% на 300W и на 15,7-16,3% на разбиениях WFLW, что указывает на то, что модель изучает повторно используемую семантику контура, а не просто запоминает фиксированные индексы.
Аннотация
Хотя достижения в методах обнаружения ориентиров лиц (FLD) продолжают расширять границы производительности, они упускают из виду два основных функциональных ограничения: (1) различные сетевые параметры необходимо обучать независимо для каждого бенчмарна ''$N$-point'', и (2) модель, обученная на наборе данных '''$N$-point'', надёжно выводит только $N$ ориентиры. В нашей работе мы сначала концептуализируем позиции ориентиров, закреплённых на частях лиц (FPALP), где каждый ориентир рассматривается как значение прогрессии между нулём (начало) и одной (конец) вдоль контура части лица. Каждый ориентир может быть выражен в формате FPALP, независимо от исходного набора данных, что открывает возможность объединять все наборы данных ''$N$-point'' в единый набор данных. Во-вторых, мы представляем каждую ориентировую точку с помощью запроса на основе FPALP, постепенно уточняем его с помощью декодера кросс-модальности и прогнозируем его координаты на основе окончательного представления. Наш подход, называемый Unified Dynamic FLD, включает эти два варианта проектирования и упрощает конвейер обнаружения ориентиров, позволяя (1) одной модели учиться на любом числе наборов данных $N$-point, и (2) даёт любое количество конкретных прогнозов ориентиров, загружая соответствующие запросы во время выполнения. Обширные эксперименты с несколькими эталонными наборами показывают, что наш метод обеспечивает эти преимущества, оставаясь при этом конкурентоспособным и в ряде случаев превосходя существующие современные методы.
Отправная точка исследования
Наборы данных с лицевыми ориентирами расходятся во мнениях относительно того, содержит ли лицо 19, 68, 98 или другое количество аннотированных точек. Обычные модели привязывают свою регрессионную головку к одному шаблону, заставляя команды обучать и поддерживать отдельные параметры для каждого набора данных и не позволяя развернутой модели возвращать новый поднабор или более плотное расположение по запросу. Такая фрагментация обходится дорого для конвейеров выравнивания, реконструкции, макияжа и анализа выражений, которые используют разные соглашения о ориентирах.
Метод
Каждый ориентир становится Позициями Ориентира, Закрепленного за Частью Лица (FPALP): нормализованное продвижение от нуля до единицы вдоль семантического контура, такого как бровь, глаз, нос, рот или граница лица. Шаблоны наборов данных выровнены в этом контурном пространстве, и каждая запрошенная точка кодируется как FPALP-запрос. Декодер кросс-модальности постепенно объединяет токены изображения и запросы перед регрессией координат. Модель ViT-B обучается совместно на AFLW-19, 300W и WFLW; опциональные легкие адаптеры набора данных восстанавливают систематические смещения аннотаций без отказа от единой основы или конфигурируемого во время выполнения расположения вывода.
Вывод по статье
Сервис ориентиров, управляемый одним запросом, может заменить несколько моделей, привязанных к шаблонам, сохранив при этом конкурентоспособную точность. Этот подход особенно привлекателен, когда продуктам требуется несколько форматов выравнивания или предполагается добавление новых определений ориентиров, хотя командам все же следует тестировать адаптеры смещения аннотаций для каждого производственного набора данных.