← Назад в Блог
Исследовательский радарОбнаружение лицОбнаружение атак предъявленияarXivАвгуст 2026 г.

Ежемесячный радар arXiv

Статьи об обнаружении лиц за август 2026 года: динамические ориентиры, антиспуфинг без лиц и фундаментальные модели

Стек обнаружения лиц расширяется от фиксированного ограничивающего рамки до настраиваемой геометрии и надёжного захвата. В статьях этого месяца объединяются несовместимые шаблоны ориентиров, спрашивается, можно ли полностью изучить артефакты печати/воспроизведения из объектов, не связанных с лицами, и протестировать тридцать кодировщиков видения плюс шестнадцать мультимодальных моделей в наборах данных для презентации и морф-атак.

Что показывает этот месяц

Unified Dynamic FLD заменяет шаблонно-специфические головки ориентиров на семантические контурные запросы и может возвращать запрошенную структуру во время выполнения. TPO оспаривает ещё более глубокое предположение, показывая, что доказательства печати и воспроизведения, полученные из овощей, сильно переносятся против подделки, делая дополнительные данные, заботящиеся о конфиденциальности, правдоподобными. Исследование фундаментальной модели даёт граничное условие: общее предварительное обучение помогает, но нулевое MLLM-подсказывание остаётся слабым, и PAD обычно требует адаптации визуального кодера. Практическое направление — консолидированный геометрический сервис, подкреплённый явной, междоменной безопасностью захвата, а не набором моделей, специфичных для набора данных.

Статья 012026-08-11cs.CV

К унифицированному динамическому обнаружению ориентиров лиц

Авторы и организации

Sebastian Regalado

University of Toronto, Canada

ModiFace, Canada

Varshanth R. Rao

ModiFace, Canada

Ruowei Jiang

ModiFace, Canada

Parham Aarabi

University of Toronto, Canada

Igor Gilitschenski

University of Toronto, Canada

Какую задачу решает

В статье определяется общая семантическая система координат для разнородных расположений ориентиров и используется для обучения одного детектора на нескольких наборах данных. Во время инференса та же сеть может отвечать на произвольный набор запросов по ориентирам, включая точки, явно не запрашиваемые во время обучения на исходном наборе данных.

Ключевой результат

Объединенная модель ViT-B с адаптерами фиксирует 4,02 NME и 2,19% уровень ошибок на WFLW, 2,43/4,19 NME на общих/сложных разбиениях 300W и 2,76 NME на AFLW-19, поддерживая объединенное обучение и динамический вывод. Когда модель обучается только на 300W, она достигает 6,08 NME в сложном тесте передачи WFLW68, против 7,23 у DTLD и 8,09 у PIPNet. По удержанным нативным ориентирам обученные запросы улучшают результаты по сравнению со сплайновой интерполяцией на 19,0% на 300W и на 15,7-16,3% на разбиениях WFLW, что указывает на то, что модель изучает повторно используемую семантику контура, а не просто запоминает фиксированные индексы.

Аннотация

Хотя достижения в методах обнаружения ориентиров лиц (FLD) продолжают расширять границы производительности, они упускают из виду два основных функциональных ограничения: (1) различные сетевые параметры необходимо обучать независимо для каждого бенчмарна ''$N$-point'', и (2) модель, обученная на наборе данных '''$N$-point'', надёжно выводит только $N$ ориентиры. В нашей работе мы сначала концептуализируем позиции ориентиров, закреплённых на частях лиц (FPALP), где каждый ориентир рассматривается как значение прогрессии между нулём (начало) и одной (конец) вдоль контура части лица. Каждый ориентир может быть выражен в формате FPALP, независимо от исходного набора данных, что открывает возможность объединять все наборы данных ''$N$-point'' в единый набор данных. Во-вторых, мы представляем каждую ориентировую точку с помощью запроса на основе FPALP, постепенно уточняем его с помощью декодера кросс-модальности и прогнозируем его координаты на основе окончательного представления. Наш подход, называемый Unified Dynamic FLD, включает эти два варианта проектирования и упрощает конвейер обнаружения ориентиров, позволяя (1) одной модели учиться на любом числе наборов данных $N$-point, и (2) даёт любое количество конкретных прогнозов ориентиров, загружая соответствующие запросы во время выполнения. Обширные эксперименты с несколькими эталонными наборами показывают, что наш метод обеспечивает эти преимущества, оставаясь при этом конкурентоспособным и в ряде случаев превосходя существующие современные методы.

Отправная точка исследования

Наборы данных с лицевыми ориентирами расходятся во мнениях относительно того, содержит ли лицо 19, 68, 98 или другое количество аннотированных точек. Обычные модели привязывают свою регрессионную головку к одному шаблону, заставляя команды обучать и поддерживать отдельные параметры для каждого набора данных и не позволяя развернутой модели возвращать новый поднабор или более плотное расположение по запросу. Такая фрагментация обходится дорого для конвейеров выравнивания, реконструкции, макияжа и анализа выражений, которые используют разные соглашения о ориентирах.

Метод

Каждый ориентир становится Позициями Ориентира, Закрепленного за Частью Лица (FPALP): нормализованное продвижение от нуля до единицы вдоль семантического контура, такого как бровь, глаз, нос, рот или граница лица. Шаблоны наборов данных выровнены в этом контурном пространстве, и каждая запрошенная точка кодируется как FPALP-запрос. Декодер кросс-модальности постепенно объединяет токены изображения и запросы перед регрессией координат. Модель ViT-B обучается совместно на AFLW-19, 300W и WFLW; опциональные легкие адаптеры набора данных восстанавливают систематические смещения аннотаций без отказа от единой основы или конфигурируемого во время выполнения расположения вывода.

Вывод по статье

Сервис ориентиров, управляемый одним запросом, может заменить несколько моделей, привязанных к шаблонам, сохранив при этом конкурентоспособную точность. Этот подход особенно привлекателен, когда продуктам требуется несколько форматов выравнивания или предполагается добавление новых определений ориентиров, хотя командам все же следует тестировать адаптеры смещения аннотаций для каждого производственного набора данных.

Статья 022026-08-20cs.CV

Помидоры, картофель и лук: сомнения в необходимости лиц для обнаружения атак на представление лица

Авторы и организации

Guray Ozgur

Fraunhofer Institute for Computer Graphics Research IGD, Germany

Department of Computer Science, Technical University of Darmstadt, Germany

Fadi Boutros

Fraunhofer Institute for Computer Graphics Research IGD, Germany

Naser Damer

Fraunhofer Institute for Computer Graphics Research IGD, Germany

Department of Computer Science, Technical University of Darmstadt, Germany

Какую задачу решает

В работе выделены сигналы процесса презентации из семантики лица через контролируемый набор данных без лиц и спрашивается, переносятся ли эти сигналы обратно в стандартные бенчмарки face PAD. Также проверяется, добавляет ли замена некоторых образцов лиц на атаки без лиц информацию в рамках фиксированного бюджета на обучение, а не просто увеличивает размер набора данных.

Ключевой результат

Обучение только на овощах достигает 92,70% среднего AUC и 14,15% HTER по четырём бенчмаркам лиц, по сравнению с 81,02% AUC для синтетической гри и 67,81% для инициализованного контроля ImageNet. Замена части фиксированного бюджета на одну поверхность на TPO увеличивает средний AUC по кросс-набору данных с 89,33% до 92,55% и снижает HTER с 17,54% до 13,97%; в многоисточникном обучении AUC увеличивается с 92,11% до 96,96%, а HTER падает с 14,72% до 7,84%. Разнообразие атак важнее дублирования кадров: использование всего 10% кадров TPO всё ещё даёт 92,97% AUC, а обучение только печати или повторов падает до 86,14% и 83,97%.

Аннотация

Обнаружение атак на презентации лица (PAD) традиционно формулируется как специфическая для лица проблема, хотя многие визуальные артефакты, возникающие при процессах печати, воспроизведения и повторного захвата, не связаны непосредственно с внешним видом лица. В этой работе мы изучаем, можно ли изучать переносимые представления PAD без использования лиц во время последующих тренировок PAD. С этой целью мы вводим TPO — налет данных для контролируемых атак без лиц, состоящий из подлинных, печатных и повторных записей почти случайно выбранных помидоров, картофеля и лука, полученных по протоколам, близким к традиционным наборам PAD лица. Используя архитектуру PAD на основе базовой модели, мы демонстрируем, что детектор, обученный на TPO, достигает среднего AUC 92,70% по четырём стандартным кросс-датасетам face PAD, превосходя обучение на синтетических лицах и оставаясь конкурентоспособным с моделями, обученными на реальных наборах лиц. В то же время модели, обученные на наборах данных face PAD стабильно передаются в TPO, что говорит о постепенном отражении характеристик процесса презентации, а не семантики объектов. Кроме того, включение TPO в традиционное обучение face PAD стабильно улучшает производительность межсетов данных при фиксированных бюджетах оптимизации, что указывает на то, что данные без лиц предоставляют дополнительную информацию, а не просто дополнительные обучающие образцы. Наконец, анализ представлений и частот предоставляет дополнительные доказательства того, что переносимые представления PAD нельзя объяснить одним спектральным артефактом, а кодируют более богатые сигналы презентации, общие между категориями объектов. Вместе эти результаты дают эмпирические доказательства того, что переносимые представления на атаке презентации можно изучать независимо от содержания лица, открывая новые возможности для разработки PAD, сохраняющей конфиденциальность и независимой от идентичности.

Отправная точка исследования

Атаки на печать и воспроизведение вводят узоры муара, субпиксели отображения, текстуру бумаги, гамма-сдвиги, отражения и шум повторного захвата — это свойства инструмента презентации, а не изображенной идентичности. Тем не менее, исследования против подделки почти всегда собирают больше человеческих лиц, увеличивая согласие и демографические проблемы, одновременно стимулируя детекторы поглощать ярлыки лиц или наборов данных. Авторы проверяют намеренно сильную гипотезу о том, что переносимые доказательства атак можно получить вовсе без лиц.

Метод

TPO содержит 12 480 достоверных, печатных и повторных представлений помидоров, картофеля и лука, зафиксированных с помощью протоколов, смоделированных на наборах данных face PAD. Модель CLIP ViT-B/16 FoundPAD адаптируется с LoRA с использованием только TPO, затем оценивается между MSU-MFSD, CASIA-FASD, Replay-Attack и OULU-NPU. Элементы управления включают zero-shot CLIP, архитектурное совпадение с инициализированным ImageNet, SynthASpoof, одно- и многоисточниковое обучение реального лица, обратный перенос из наборов лиц в TPO, эксперименты по замене с фиксированным бюджетом, частотный анализ и абляции по классу объекта, типу атаки и количеству кадров.

Вывод по статье

Для анти-спуфинга от печати/повтора реалистичное разнообразие при повторном захвате может иметь большее значение, чем сбор новых идентификаций. Дополнительные данные без лица предоставляют заботливый способ улучшить передачу между сенсорами, но доказательства применимы к тестируемым процессам печати и отображения и не должны автоматически обобщаться на маски или новые физические атаки.

Статья 032026-08-30cs.CV

Основные и мультимодальные большие языковые модели для представления лиц и обнаружения морф-атак

Авторы и организации

Hatef Otroshi Shahreza

Idiap Research Institute, Switzerland

Asif Hussain Khan

Idiap Research Institute, Switzerland

Peter Lorenz

Idiap Research Institute, Switzerland

Alain Komaty

Idiap Research Institute, Switzerland

Sébastien Marcel

Idiap Research Institute, Switzerland

University of Lausanne, Switzerland

Какую задачу решает

В данном исследовании представлено единое, большое сравнение стратегий доступа для обнаружения атак на презентации лиц и морф-атак. Оно различает значение нулевых выходов языка, логитов, замороженных визуальных признаков, настройки MLLM, специфичной для задачи и адаптации LoRA, вместо того чтобы приписывать все преимущества универсальной метке базовой модели.

Ключевой результат

Готовые подсказки не являются надёжным детектором: лучшие средние значения нулевых выстрелов — 31,1% ACER для PAD и 19,4% для MAD. Замороженный энкодер и линейная головка улучшают эти показатели до 24,4% и 5,0%; специфические задачи PADLLM и MADLLM достигают 13,6% и 2,9% при выдаче объяснений. Лучшие адаптированные для LoRA-кодировщики достигают среднего ACER 14,9% для PAD против 17,3% для сильнейшего цитируемого специалиста и 3,7% для MAD против 11,3%. MAD переносится легче, чем PAD: лучший средний показатель для кросс-датасета ACER составляет 4,9% против 19,8%, а предтренинговая цель прогнозирует перенос лучше, чем количество параметров.

Аннотация

Системы распознавания лиц всё чаще внедряются в критически важных для безопасности приложениях, но остаются уязвимыми к атакам на презентации и морфинг. Обнаружение атак презентации (PAD) и обнаружение морфинговых атак (MAD) являются необходимыми компонентами надёжной биометрии лица. Несмотря на достижения в методах PAD и MAD, существующие детекторы страдают от ограниченной обобщённости и ухудшения при кросс-датасетовой оценке. В этой статье мы систематически изучаем, кодируют ли универсальные фундаментальные модели (FM) и мультимодальные крупные языковые модели (MLLM) релевантную PAD и MAD информацию, и как такие модели можно лучше использовать для обеих задач. Мы изучаем пять подходов с расширением доступа к внутренней информации модели: (i) нулевое подсказывание готовых MLLM; (ii) обучение поверхностной модели на основе логитных вероятностей следующего токена на выходе MLLM; (iii) параметрически эффективная настройка данных вопросов и ответов, специфичных для задач, что даёт два специализированных MLLM — PADLLM и MADLLM, которые дополнительно обеспечивают текстовое обоснование их решений; (iv) линейное зондирование замороженных кодировщиков зрения; и (v) тонкая настройка кодировщиков видения для FM и MLLM. Мы проводим бенчмарк 16 открытых MLLM и 30 основ кодировщиков видения на четырёх наборах данных PAD (MSU-MFSD, CASIA-FASD, Replay-Attack и OULU-NPU) и четырёх наборах данных MAD (FFHQ, FRGC, FRLL и FERET). Наши эксперименты показывают, что FM и MLLM могут достигать значительной производительности для PAD и MAD. Кроме того, тонко настроенные модели обеспечивают передовые результаты обнаружения при кросс-датасетовой оценке, что свидетельствует о том, что универсальные предобученные представления несут значительную информацию, связанную с атаками. Исходный код всех наших экспериментов будет опубликован публично.

Отправная точка исследования

Универсальные видения и мультимодальные модели уже могут кодировать текстуры, геометрию и семантические сигналы, полезные для презентации и морф-атак, но сам по размеру модели не раскрывает, как извлечь эти доказательства. Команды безопасности должны знать, достаточно ли готового запроса, требуется ли для объяснения специализированный MLLM, и когда визуальный кодировщик должен быть адаптирован для выживания при пересечении датчиков и атак между наборами данных.

Метод

Шестнадцать открытых MLLM и тридцать кодировщиков видения оцениваются на четырёх наборах данных PAD (MSU-MFSD, CASIA-FASD, Replay-Attack, OULU-NPU) и четырёх наборах данных MAD (FFHQ, FRGC, FRLL, FERET). Пять режимов развертывания постепенно открывают всё больше от каждой модели: нулевое подсказывание, поверхностный классификатор по вероятностям следующего токена, параметрически эффективная настройка вопросов-ответов на PADLLM или MADLLM с текстовым мышлением, линейное исследование энкодеров замороженного зрения и адаптация кодировщиков с помощью LoRA. Пороги EER в наборах разработки переносятся как в внутри, так и в межсетовые тесты ACER.

Вывод по статье

Не развёртывайте подспрашиваемый MLLM в качестве детектора биометрических атак. Замороженные визуальные признаки — полезная база, но PAD обычно требует адаптации энкодера, тогда как настроенный MLLM полезен, когда требуется читаемое человеком рассуждение; выбор модели должен проверяться отдельно для презентации и морф-атак.