← Назад в Блог
Исследовательский радарОбнаружение лицЛицевые ориентирыarXivСентябрь 2026

Ежемесячный радар arXiv

Исследования обнаружения лиц за сентябрь 2026 года: единая разметка ключевых точек, диффузионное выравнивание и применение в аудиториях

В сентябре прямых бумаг с лицевой коробкой было мало, поэтому этот обзор следует соседнему стеку локализации, необходимому производственным системам после нахождения коробки. FreqFLD обучает одну модель ориентиров с учётом частоты в четырёх наборах данных. FAHCD-Net рассматривает тепловые карты ориентиров как задачу условного снятия шума при изменениях позы, окклюзии, размытия и освещения. Исследование Visage вновь объединяет обнаружение и распознавание в переполненном классе, где пропускная способность и пропущенные лица важны не меньше, чем точность идентификации на высшем уровне.

Что показывает этот месяц

FreqFLD балансирует глобальную структуру и локальные детали, разделяя частотные компоненты и направляя образцы через экспертов, обусловленных частотой; одна совместно обученная модель достигает 4,50 NME на WFLW и 4,80 NME с уровнем отказа 0,39 % на окклюзированном COFW. FAHCD-Net вместо этого каскадирует условные стадии диффузии и подавляет избыточный высокочастотный шум тепловой карты, снижая NME на сложном наборе 300W с 4,48 на первой стадии до 4,29 на третьей. Исследование Visage сообщает, что YOLOv8n с 3,2 миллиона параметров достигает 0,935 mAP@0,5, в то время как гораздо более крупные детекторы повышают точность за значительную цену параметров; несколько распознавателей достигают 99,75 % Top-1 на наборе распознавания из 100 классов. Эти результаты обнадеживают, но две ключевые статьи остаются эталонными исследованиями, а данные из учебного класса поступают из ограниченной институциональной среды, поэтому все еще требуется проверка кросс-камерной валидации.

Статья 012026-09-09cs.CV

FreqFLD: к универсальному обнаружению лицевых ориентиров с помощью частотной модуляции

Авторы и организации

Shun Ren

College of Computer and Information Technology, China Three Gorges University

Kaijie Jin

College of Computer and Information Technology, China Three Gorges University

Shengkai Hu

School of Information Engineering, Zhongnan University of Economics and Law

Beihang Song

National Institute of Natural Hazards, Ministry of Emergency Management of China

Hang Sun

College of Computer and Information Technology, China Three Gorges University

Wenwen Min

School of Information Science and Engineering, Yunnan University

Youfa Liu

School of Computer Science, Wuhan University

Jun Wan

School of Information Engineering, Zhongnan University of Economics and Law

School of Computer Science and Engineering, Nanyang Technological University

Какую задачу решает

FreqFLD нацелена на один универсальный детектор ориентиров, который можно совместно обучать на 300W, AFLW, Cofw и WFLW, оставаясь конкурентоспособным на каждом бенчмарке и надёжным на сложных подмножествах. В статье ставится вопрос, могут ли явные частотные априоры более надёжно направлять экспертную специализацию, чем неограниченное смешение экспертов.

Ключевой результат

Унифицированная модель достигает 2,72 NME на 300 Вт Common, 4,52 на 300W Challenging и 4,50 на тестовом наборе WFLW; Подмножества WFLW по позе, освещению, окклюзии и размытию оценивают 7,54, 4,55, 5,53 и 5,15. На сильно окклюзионном COFW он показывает 4,80 NME и 0,39% уровень отказов. Модули полной частоты и потери маршрутизации улучшают сложностную базовую высоту 300 Вт с 4,71 до 4,52, а добавление всех четырёх обучающих наборов данных улучшает результат с 4,97 до 4,52. Производительность конкурентоспособна, а не единообразно высокая, включая 1,69 NME на AFLW, где старые специализированные методы показывают меньшую ошибку.

Аннотация

Недавние успехи в области глубокого обучения существенно продвинули обнаружение лицевых ключевых точек. Однако большинство существующих методов обрабатывают признаки в пространственной области в рамках специфической для датасета схемы обучения, что упускает из виду тот факт, что обнаружение лицевых ключевых точек по своей сути управляется геометрией и чувствительно к частотным вариациям, что ограничивает обобщение между разными датасетами в сложных сценариях и препятствует развитию модели обнаружения лицевых ключевых точек. Для решения этой проблемы мы предлагаем extbf{FreqFLD}, структуру для обнаружения всех лицевых ключевых точек с модуляцией частоты ( extbf{freq}uency-modulated framework towards All-in-One extbf{f}acial extbf{l}andmark extbf{d}etection). Конкретно, FreqFLD вводит Модуль Модуляции Частоты (FreqMoM), чтобы явно внедрить частотный приоритет путем разъединения и модуляции низко- и высокочастотных компонентов, который затем внедряется в последующее моделирование признаков для обеспечения сбалансированного моделирования глобальной структуры лица и локальных деталей ключевых точек. Более того, FreqFLD использует Частотно-Модулированную Смесь Экспертов (FreqMoE), при этом выбор эксперта адаптивно зависит от частотно-модулированных приоритетов, что позволяет гибко моделировать гетерогенные шаблоны лицевых ключевых точек в разнообразных и сложных сценариях. Чтобы регуляризовать согласованное по частоте моделирование в рамках All-in-One парадигмы, мы дополнительно вводим функцию потерь Frequency-Consistent Routing (FreqCR), которая ограничивает маршрутизацию и назначение экспертов учитывающих частоту для содействия сбалансированному использованию экспертов в различных лицевых сценариях, тем самым обеспечивая стабильную специализацию экспертов и достигая надежного обнаружения лицевых ключевых точек. Широкие эксперименты показывают, что предложенный FreqFLD достигает сопоставимых результатов на популярных датасетах. Код доступен по ссылке: https://github.com/jkj1059657014/FreqFLD.

Отправная точка исследования

Модели лицевых ориентиров обычно обучаются для каждого набора данных, даже несмотря на то, что производственные входные данные смешивают соглашения об ориентировках, позы, блокировки, размытие и освещённость. Чисто пространственные признаки могут переобучиться под одну схему аннотаций и не различать низкочастотную структуру лица и высокочастотные детали ориентиров. Единая модель также создаёт конфликты маршрутизации, когда от одного эксперта ожидается обработка всех режимов геометрии и качества изображения.

Метод

Модуль частотной модуляции разбивает признаки на низкочастотные и высокочастотные компоненты, моделирует их отдельно и вводит полученный априор в нижние слои. Частотно-модулированная смесь экспертов использует это перед маршрутизацией гетерогенных лицевых паттернов, в то время как частотно-согласованное маршрутизирование потерь балансирует использование и способствует стабильной специализации. Совместное обучение уравнивает четыре исходных набора данных до 20 000 образцов каждый, получая обучающий пул из 80 000 изображений, оцениваемый по нативному протоколу стандарта и нормализации каждого набора данных.

Вывод по статье

Маршрутизация с учётом частоты — это достоверный аргумент в пользу объединения нескольких ключевых моделей в одну, но команды должны сравнивать ошибки по камере и схеме ориентиров, потому что унифицированное обучение не выигрывает каждый отдельный ориентир.

Статья 022026-09-15cs.CV

FAHCD-Net: Частотно-адаптивные тепловые карты — условные диффузионные сети для надёжного обнаружения лицевых ориентиров

Авторы и организации

Jun Wan

School of Information Engineering, Zhongnan University of Economics and Law

Jiwei Hu

School of Information Engineering, Zhongnan University of Economics and Law

Shengkai Hu

School of Information Engineering, Zhongnan University of Economics and Law

Qilu Zhu

School of Information Engineering, Zhongnan University of Economics and Law

Какую задачу решает

FAHCD-Net стремится к надёжной локализации ориентиров в условиях позы, окклюзии, освещения и размытия, делая процесс диффузии, обусловленный тепловой картой, явно учитывающий частоту. Он также проверяет, может ли каскад постепенно улучшать начальное среднее состояние, вместо того чтобы полагаться на высококачественную исходную тепловую карту, сгенерированную детектором.

Ключевой результат

FAHCD-Net сообщает о 2,51 NME на 300W Common, 2,99 на полном наборе, 1,17 по фронтальном AFLW и 2,08 на полном AFLW. На 300W Challenging последовательные диффузионные ступени снижают NME с 4,48 до 4,33, а затем до 4,29, по сравнению с 4,81, 4,73 и 4,69 при обусловлении по средней форме. Добавление обучающих данных COFW, WFLW и AFLW улучшает заявленный результат сложности 300 Вт с 4,76 до 4,49 в абляции мультинасетов. Статья демонстрирует устойчивость эталонного уровня, но не сообщает о задержке детектора плюс ориентиров, поэтому стоимость итеративной диффузии остаётся вопросом развертывания.

Аннотация

Обнаружение лицевых ориентиров (FLD) является ключевой задачей в различных приложениях и достигло значительных успехов в последние годы. Однако современные методы FLD по-прежнему испытывают трудности в сложных условиях, когда структурные вариации лица, потеря информации и помехи шума серьёзно подрывают целостность и точность изученных черт лица. Для решения этих проблем мы предлагаем Frequency Adaptive Heatmap — Conditional Diffusion Network (FAHCD-Net), которая интегрирует модель Frequency-Adaptive Heatmap Conditional Diffusion (FAHCD) с потерей Smoothness Regularization (SR) в каскадной структуре. В частности, модель FAHCD включает модуль Hierarchical Frequency Adaptation (HFA), предназначенный для подавления избыточных высокочастотных шумов посредством многослойного разложения частот и адаптивной реконструкции, сохраняя тем самым важные структуры лица. Кроме того, потери SR предлагаются для дальнейшего снижения помех высокочастотного шума и повышения плавности сгенерированных тепловых карт ориентиров. Путём каскадирования модели FAHCD с потерями SR, FAHCD-Net эффективно использует как статистические, так и частотно-ориентированные характеристики распределения данных для постепенного создания более точных тепловых карт ориентиров на основе шумных входных данных. Обширные эксперименты на популярных бенчмарках демонстрируют эффективность и надёжность предлагаемого метода, обеспечивая передовые результаты в задачах FLD в сложных ситуациях. Исходный код доступен по адресу https://github.com/HJWKryptonite/FAHCD-Net.

Отправная точка исследования

Символические тепловые карты ухудшаются, когда поза или выражение лица меняют структуру лица, когда окклюзия удаляет улики, а также когда размытие или освещение создают высокочастотный шум. Стандартная регрессия рассматривает эти эффекты как прямые ошибки прогноза. Диффузия обеспечивает итеративное восстановление после шумных или неполных доказательств, но неограниченное удаление шума может само по себе создавать ложную энергию высокочастотной тепловой карты и нестабильные пики.

Метод

Каждая каскадная стадия использует модель Частотно-адаптивной тепловой карты и условной диффузии для уточнения распределения ориентиров. Иерархическая частотная адаптация неоднократно разлагает и реконструирует особенности, чтобы низкочастотная структура лиц сохранялась, а избыточный высокочастотный шум подавлялся. Термин регуляризации гладкости согласует сгенерированное поведение частоты тепловой карты с реальностью на земле. Обучение мультисетов датасетов добавляет COFW, WFLW и AFLW до 300 Вт, и три этапа передают свои предсказанные тепловые карты вперёд как следующее условие.

Вывод по статье

Условная диффузия может восстановить более чистые тепловые карты ориентиров на сложных изображениях, но её итеративные затраты должны учитываться с бюджетом задержки камеры и сильной базовой линией выравнивания без диффузии.

Статья 032026-09-19cs.CV

На пути к надежному учету посещаемости в классе: комплексная оценка моделей обнаружения и распознавания лиц

Авторы и организации

Himani Trivedi

Computer Engineering Department, LDRP Institute of Technology and Research, Kadi Sarva Vishwavidyalaya

Hiren Patel

Vidush Somany Institute of Technology and Research, Kadi Sarva Vishwavidyalaya

Ridham Patel

Information Technology Department, LDRP Institute of Technology and Research, Kadi Sarva Vishwavidyalaya

Krutika Patel

Information Technology Department, LDRP Institute of Technology and Research, Kadi Sarva Vishwavidyalaya

Nancy Patel

Information Technology Department, LDRP Institute of Technology and Research, Kadi Sarva Vishwavidyalaya

Какую задачу решает

В исследовании представлены парные наборы данных обнаружения и распознавания для условий в классе, а также сравнивается семейство размеров детекторов с семью современными архитектурами распознавания лиц. Его цель — определить практическую точку работы с точки точности и эффективности, а не предполагать, что самый крупный детектор или распознаватель является лучшим компонентом посещаемости.

Ключевой результат

YOLOv8n использует 3,2 миллиона параметров и достигает точности 0,932, отзыва 0,886, 0,91 F1 и 0,935 mAP@0,5; более крупные варианты достигают примерно 0,97 mAP@0,5, но используют от 43,7 до 68,2 миллиона параметров. По распознаванию FaceLiVTv2-L, EdgeFace Base, LVFace ViT-B и TransFace ViT-B достигают 99,75% Топ-1 в таблице. EdgeFace Base достигает 4,029 мс, что быстрее, чем FaceLiVTv2-L — 6,081 мс, при этом размеры моделей сильно различаются. Это закрытые результаты ограниченного набора образовательных учреждений, поэтому они не устанавливают устойчивость к подделке, межшкольной обобщению или пригодности политики для автоматизированного посещения.

Аннотация

Ручные методы посещаемости, такие как бумажные или кассирные системы, занимают много времени, могут приводить к ошибкам и легко поддаются фальсификации. Распознавание лиц надёжнее, но часто испытывает трудности в классах из-за разного освещения и других условий. Наборы данных по распознаванию лиц разработаны для регулируемых сред и не отражают реальные трудности, возникающие в классах. Для решения этой проблемы предлагается новый набор данных по распознаванию и распознаванию лиц — Visage Face, включающий 16 234 образца лиц, для задачи распознавания и распознавания лиц. Фотографии сделаны с разных ракурсов и при различных условиях освещения, при этом ученики демонстрируют различные выражения лица, а некоторые лица частично скрыты, чтобы отразить реальные ситуации. Система на базе YOLO используется для обнаружения лиц и протестировала семь продвинутых моделей распознавания лиц с тринадцатью конфигурациями: LVFace, QCFace, FaceLiVTv2, TopoFR, EdgeFace, TransFace и GhostFaceNets. Из них FaceLiVTv2-M показал лучшие результаты с точностью 99,75% в топ-1/топ-5 и временем вывода 6,459 мс. Эти результаты показывают, что набор данных Visage Face является реалистичным и сложным ориентиром для распознавания лиц при посещаемости класса.

Отправная точка исследования

Посещаемость классов сочетает множество маленьких лиц, разную позу и освещение, частичную окклюзию и необходимость обрабатывать повторяющиеся видеокадры на доступном оборудовании. Общие наборы данных лиц не воспроизводят эту операционную среду, а точность распознавания только по себе скрывает пропущенные обнаружения и вычислительные затраты. Учреждениям также нужны данные, собираемые с согласия, а не перепрофилированные изображения личности.

Метод

Авторы собирают 801 изображение из класса, вручную аннотируют лица и используют вращение, масштабирование, трансляцию, шум и переворот для создания набора обнаружения; в статье сообщается 3 635 изображений обнаружения и 96 409 аннотаций лиц после дополнения. Набор распознавания содержит 3 500 изображений по 100 классам, выровненных от пяти ориентиров RetinaFace и нормализованных до 112 на 112. Для обнаружения оцениваются варианты YOLOv8 n/s/m/l/x, а для распознавания сравниваются тринадцать конфигураций LVFace, QCFace, FaceLiVTv2, TopoFR, EdgeFace, TransFace и GhostFaceNets.

Вывод по статье

Полезным результатом является измеренный компромисс между детектором и распознавателем, а не почти идеальный балл в закрытом наборе. Пилот должен воспроизводить отзыв, задержку, согласие, подделку и поведение неизвестных лиц на камерах учреждения.