← Назад в Блог
Исследовательский радарРаспознавание лицОбнаружение атак на презентацииarXivИюль 2026 г.

Ежемесячный радар arXiv

Статьи по распознаванию лиц, июль 2026 г.: мультиспектральные патчи, PAD, основанный на концепции, и проблемы, связанные с глазами.

В июле было немного работ, посвященных прямым детекторам лиц, но уровень защиты от подделки оставался активным. Поэтому данный обзор рассматривает структуру детектора в целом: можно ли физически скрыть объединенный визуально-инфракрасный детектор, может ли модель защиты от подделки лица быть применима к невидимым материалам и датчикам, и может ли «живость глаз» вызвать биологическую реакцию в реальном времени, которую невозможно воспроизвести с помощью воспроизведения или генератора.

Что показывает этот месяц

VIPatch демонстрирует, что сочетание видимых и инфракрасных датчиков не устраняет автоматически риск физического противодействия, поскольку скоординированная маска и тепловизионная наклейка могут подавлять оба канала. CPG-PAD атакует другую уязвимость: подсказки по защите от подделки, которые цепляются за артефакты набора данных, а не за многократно используемые визуальные концепции. Окулярный протокол переходит от пассивной классификации к активной проверке, сочетая отслеживание взгляда и реакцию зрачков. В совокупности эти работы обосновывают необходимость многоуровневой защиты от перехвата, явного междоменного тестирования и тщательного разделения между смоделированными доказательствами безопасности и подтвержденными человеком заявлениями о развертывании.

Статья 012026-07-25cs.CR

Скрываясь на виду: эффективная физическая атака с использованием фрагментов кода против системы распознавания лиц, использующей сочетание визуального и инфракрасного излучения.

Авторы и организации

Qiucheng Yu

City University of Hong Kong, Hong Kong, China

Tao Ni

King Abdullah University of Science and Technology, Saudi Arabia

Yihe Zhou

City University of Hong Kong, Hong Kong, China

Jiayimei Wang

City University of Hong Kong, Hong Kong, China

Qingchuan Zhao

City University of Hong Kong, Hong Kong, China

Какую задачу решает

Предыдущие версии патчей плохо переносятся на объединенные детекторы, поскольку оптимизация для видимого изображения может конфликтовать с откликом в инфракрасном диапазоне, а заметные паттерны легче заметить людям или вторичным системам. VIPatch стремится к физически осуществимой, совместной и визуально незаметной атаке.

Ключевой результат

В цифровой атаке методом «черного ящика» средний показатель распознавания речи (ASR) составляет 94,59% для видимых детекторов и 97,40% для инфракрасных детекторов. В физической конфигурации VIPatch достигает 97,27% ASR на YOLOv8-Face и MTCNN и 100% на TFW и OpenCV. Его показатель ASR для видимых физических детекторов остается на уровне 80,29% при освещенности 12 000 люкс и колеблется от 92,51% до 100% на протестированных расстояниях от одного до трех метров.

Аннотация

Модели обнаружения лиц на основе глубокого обучения, использующие визуально-инфракрасное изображение в качестве основы для обработки данных, все чаще применяются в самых разных областях, однако они по-прежнему уязвимы для атак с использованием состязательных фрагментов. Большинство предыдущих атак нацелены либо только на визуальное, либо только на инфракрасное изображение в цифровой области, что делает их неэффективными против моделей, созданных на основе состязательных фрагментов в физическом мире. Более того, многие из этих методов легко заметить, поскольку их паттерны фрагментов существенно отличаются от тех, которые наблюдаются в реальном мире. В этой статье мы представляем VIPatch (Visual-Infrared Patch) — новую физическую атаку с использованием состязательных фрагментов, которая создает незаметные, реалистичные и естественно выглядящие фрагменты для изображений лиц. В частности, VIPatch создает градиентную цветовую маску вместе с пластырем на визуальном и инфракрасном изображениях и совместно оптимизирует эти два элемента; полученные цифровые фрагменты дополнительно направляют создание их физических аналогов. Экспериментальные результаты показывают, что VIPatch достигает конкурентоспособных показателей успешности атак (более 90%) как в цифровой, так и в физической областях, при этом фрагменты остаются незаметными для наблюдателей.

Отправная точка исследования

Визуально-инфракрасное слияние используется для обеспечения работы распознавания лиц в условиях низкой освещенности и температурного режима, однако большинство исследований в области противодействия атакам направлены только на один канал или остаются цифровыми. Производственная система должна знать, может ли обычный на вид объект подавлять оба канала после печати, размещения, изменения освещения и движения камеры.

Метод

Компания VIPatch совместно оптимизирует лицевую маску с градиентным цветом для видимого канала и термонаклейку, похожую на пластырь, для инфракрасного канала, а затем изготавливает их физические аналоги. Оценка включает в себя использование нескольких детекторов видимого и инфракрасного света, перенос данных в «белый ящик» и «черный ящик», а также физические испытания при различных углах обзора, освещенности от 200 до 12 000 люкс и расстояниях от одного до трех метров.

Вывод по статье

Многоспектральное зондирование следует рассматривать как взаимосвязанную систему, а не как две независимые системы защиты. Атака представляет собой результат работы «красной команды», а не меру противодействия, но она предоставляет производителям детекторов конкретные физические условия, модели переноса и целевые показатели успешности атаки для оценки обнаружения уязвимостей, проверок согласованности датчиков и политики резервного копирования.

Статья 022026-07-01cs.CV

CPG-PAD: Обнаружение атак с помощью управляемых презентаций на основе концептуальных подсказок

Авторы и организации

Haoyuan Zhang

School of Artificial Intelligence, University of Chinese Academy of Sciences, China

State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, China

Xiangyu Zhu

State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, China

School of Artificial Intelligence, University of Chinese Academy of Sciences, China

Li Gao

China Mobile Financial Technology Co., Ltd., China

Ajian Liu

State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, China

School of Artificial Intelligence, University of Chinese Academy of Sciences, China

Siran Peng

State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, China

School of Artificial Intelligence, University of Chinese Academy of Sciences, China

Zhen Lei

State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, China

School of Artificial Intelligence, University of Chinese Academy of Sciences, China

Centre for Artificial Intelligence and Robotics, Hong Kong Institute of Science and Innovation, Chinese Academy of Sciences, Hong Kong, China

School of Computer Science and Engineering, Macau University of Science and Technology, Macau, China

Какую задачу решает

Цель данной работы — согласовать полученные подсказки с детальными визуальными данными, имеющими отношение к атаке, одновременно подавляя специфические для предметной области упрощения. Также проверяется та же идея в протоколах с несколькими источниками, ограниченным количеством источников, одним источником и невидимыми инструментами для презентаций и атак, а не на основе одного разделения данных на разные наборы.

Ключевой результат

Без дополнительных данных CPG-PAD достигает среднего показателя HTER в 2,08% в четырехстороннем многоисточниковом протоколе, улучшая базовый показатель CLIP с 5,43%; с CelebA-Spoof он достигает 1,19%. Он сообщает о среднем показателе HTER в 5,33% при передаче из одного источника и 1,02% на инструментах атаки, не встречавшихся ранее, где базовый показатель CLIP составляет 3,03%. Использование порогового значения, полученного на валидационном наборе данных, вместо порогового значения, полученного на тестовом наборе, дает средний показатель HTER в 2,28%, что делает очевидным ограничение, связанное с пороговым значением.

Аннотация

Обнаружение атак с использованием презентаций (Presentation Attack Detection, PAD) служит важнейшей защитой систем распознавания лиц от атак с использованием презентаций, таких как печатные фотографии, воспроизведенные видео и 3D-маски. Несмотря на значительный прогресс, существующие модели PAD по-прежнему испытывают трудности с обобщением на неизвестные ранее области из-за вариаций в датчиках, освещении и материалах для атак. Недавние модели визуально-языковых моделей (Vision-Language Models, VLM) продемонстрировали высокую обобщающую способность, однако их применение в PAD остается ограниченным, поскольку обучаемые подсказки, как правило, оптимизированные с использованием контроля по меткам классов, не могут явно соответствовать детальной визуальной семантике, релевантной атаке. В результате обучаемые представления часто переобучаются на артефактах, специфичных для данной области, вместо того, чтобы улавливать переносимые признаки атаки. Для решения этой проблемы мы предлагаем метод обнаружения атак с использованием презентаций, основанный на концептуальном анализе подсказок (Concept-Informed Prompts Guided Presentation Attack Detection, CPG-PAD), который вводит концептуальное руководство на уровне модели в процесс обучения подсказок. В частности, мы разработали модуль визуального улучшения на основе концепций (Visual Concept-driven Enhancement, VCE), который использует методы объяснимого искусственного интеллекта (eXplainable AI, XAI) для автоматического обнаружения визуальных концепций, релевантных PAD, и генерации связанных с концепциями тепловых карт, обеспечивающих локализованное детальное руководство. Руководствуясь этими тепловыми картами, механизм внедрения концепций на основе подсказок (Prompt-based Concept Injection, PCI) интегрирует эти концепции в пространство подсказок с помощью декодера визуальных подсказок (Visual-Prompt Decoder, VPD) и функции потерь отображения концепций, позволяя подсказкам соответствовать внутреннему пространству концепций модели. Такая конструкция позволяет CPG-PAD улавливать обобщаемые и инвариантные к предметной области сигналы атаки, эффективно подавляя при этом смещения, специфичные для набора данных. Обширные эксперименты на девяти эталонных наборах данных демонстрируют, что CPG-PAD стабильно достигает лучших результатов в различных предметных областях при использовании нескольких источников, ограниченного количества источников и одного источника.

Отправная точка исследования

Модели защиты от подделки лиц часто хорошо работают с датчиками и атакующими медиафайлами, используемыми во время обучения, но терпят неудачу при изменении освещения, камер, процессов печати, масок или макияжа. Модели обработки изображений и языка предлагают широкие априорные знания, однако обучение на основе только меток может по-прежнему фокусироваться на локальных артефактах набора данных, а не на концепциях, описывающих реальную атаку на презентацию.

Метод

В модуле визуального улучшения на основе концепций CPG-PAD сначала используются методы объяснимости для обнаружения концепций и создания локализованных тепловых карт концепций. Затем декодер визуальных подсказок и функция потерь для построения концептуальных карт внедряют эти карты в пространство подсказок, связывая визуальные признаки CLIP с множеством обучаемых реальных/поддельных подсказок. Модель, основанная только на визуальном анализе, оценивается на девяти наборах данных и предоставляет как традиционные метрики HTER/AUC, так и метрики рабочих точек, соответствующие стандарту ISO.

Вывод по статье

Подсказки, основанные на концепции, перспективны, когда продукту PAD необходимо преодолевать препятствия, создаваемые датчиками, и атаковать различные материалы, особенно потому, что они занимают меньше места, предназначенного только для визуального восприятия, чем многомодальные языковые модели. Покупателям все же следует сравнивать результаты при пороговых значениях, откалиброванных для развертывания: в статье прямо отмечается, что общепринятые пороговые значения EER, полученные в результате испытаний, могут завышать уровень готовности к полевым условиям.

Статья 032026-07-10cs.CV

Протокол «запрос-ответ» с двумя потоками для проверки жизнеспособности глазного яблока

Авторы и организации

Ismail Kably

Konelia Inc., Austin, Texas, USA

Какую задачу решает

Предложенный протокол решает проблемы, связанные с повторным воспроизведением, созданием дипфейков и протезированием, угрожающими глазной и радужной оболочкам глаза, путем объединения произвольного плавного слежения за объектом с непроизвольным зрачковым световым рефлексом. Центральный вопрос заключается в том, создает ли задержка рендеринга измеримый разрыв синхронизации при повторных рандомизированных испытаниях.

Ключевой результат

Результаты моделирования показывают AUC 0,502, когда рендеринг генератора не добавляет задержки, 0,717 при 25 мс, 0,948 при 50 мс и не менее 0,997 после 75 мс для одного раунда. При 25 мс десять раундов повышают AUC до 0,966, а пять или более раундов снижают смоделированный порог обнаружения AUC 0,90 с 50 мс до 25 мс. Это результаты моделирования; измерения не проводились на людях и не проводились при реальных атаках с использованием генератора.

Аннотация

Системы оптической биометрии сталкиваются со сложными атаками с использованием поддельных изображений, включая воспроизведение видео высокого разрешения и создание дипфейков в реальном времени, которые легко обходят статические проверки на живость. Существующие системы обнаружения атак с использованием поддельных изображений (PAD) обычно полагаются на изолированные физиологические показатели, такие как отслеживание взгляда или зрачковый световой рефлекс (PLR), которые могут быть подделаны независимо друг от друга. В данной статье предлагается протокол слияния данных с датчиков пространственной яркости, который представляет собой двухпотоковую систему «запрос-ответ» для проверки живости глаз путем объединения этих показателей в одновременный запрос на аутентификацию. Генерируя случайный, изменяющийся во времени визуальный стимул, который колеблется как по пространственной траектории, так и по интенсивности яркости, мы создаем математически связанную модель вероятности в пространстве состояний, называемую матрицей синхронизации, для оценки непрерывной взаимной корреляции между ожидаемыми биологическими задержками плавного слежения и сужения зрачка. Используя моделирование методом Монте-Карло, основанное на распределениях задержек, полученных из литературных источников, мы демонстрируем теоретическую различимость между подлинными и смоделированными условиями атаки и показываем, что многораундовая схема проверки улучшает обнаружение генеративных дипфейков при наличии ненулевого разрыва между задержкой рендеринга и исходным изображением. Эта работа предоставляет теоретическую основу, подкрепленную моделированием, для защиты от динамической подделки следующего поколения в области биометрии глаз и радужной оболочки глаза; валидация на людях определяется как необходимая дальнейшая работа, прежде чем можно будет заявлять о возможности внедрения.

Отправная точка исследования

Статические проверки взгляда или зрачков можно воспроизводить независимо друг от друга, а системы генерации в реальном времени все чаще воспроизводят правдоподобные движения глаз. Более строгий тест на живость должен требовать двух биологически обусловленных ответов на новый стимул и проверять их временную взаимосвязь, а не классифицировать один захваченный кадр.

Метод

На дисплее одновременно изменяются положение цели и яркость. Система оценивает задержку взгляда, задержку сужения зрачка и их взаимную корреляцию в матрице синхронизации, а затем объединяет их в общий показатель. В исследовании методом Монте-Карло проводится 10 000 испытаний для каждого условия с использованием распределений задержек, взятых из предыдущих исследований, и оцениваются один, три, пять или десять независимых раундов при предполагаемых задержках генератора.

Вывод по статье

Предложенная конструкция представляет собой полезную модель для активного мониторинга в реальном времени и явно демонстрирует компромисс между безопасностью и задержкой, но пока не является гарантией высокой точности. Для оценки продукта по-прежнему потребуются калибровка человеком, измерения времени работы датчиков, атаки с коррелированной задержкой и тестирование «красной командой» на реальных системах рендеринга в реальном времени.