← Назад в Блог
Исследовательский радарРаспознавание лицarXivИюль 2026 г.

Ежемесячный радар arXiv

Доклады по распознаванию лиц, июль 2026 г.: синтетические базовые модели, ИК-диапазон для распознавания лиц в условиях движения автомобиля и безлинзовые камеры.

В июльских статьях, посвященных распознаванию лиц, дискуссия смещается от оценки точности только на уровне эталонных показателей к анализу данных и систем сбора информации, определяющих качество внедрения. В отобранных работах тестируется синтетическое обучение с учетом конфиденциальности на двух масштабах данных, представлен кросс-спектральный набор данных для пограничного контроля с зондами, проходящими сквозь стекло, и измерено, что происходит, когда сама камера заменяется оптическим кодировщиком без линз.

Что показывает этот месяц

Адаптация только на основе синтетических данных может сделать универсальную модель распознавания лиц конкурентоспособной, но выигрышная стратегия резко меняется с увеличением объема данных. DriveFace затем показывает, что даже сильная модель встраивания по-прежнему сталкивается со значительными ошибками, когда видимые изображения для регистрации сопоставляются с движущимися ИК-зондами, проходящими через автомобильное стекло. LFD расширяет возможности захвата данных, рассматривая безлинзовую оптику, реконструкцию, обнаружение и распознавание как взаимосвязанные компоненты. Общий вывод заключается в том, что производительность развертывания зависит от всего конвейера сбора данных и встраивания, а не только от ошибки распознавания.

Статья 012026-07-27cs.CV

IJCB-AFMFR 2026: Конкурс по адаптации базовых моделей для распознавания лиц с использованием синтетических обучающих данных.

Авторы и организации

Tahar Chettaoui

Fraunhofer Institute for Computer Graphics Research IGD, Germany

Guray Ozgur

Fraunhofer Institute for Computer Graphics Research IGD, Germany

Technical University of Darmstadt, Germany

Eduarda Caldeira

Fraunhofer Institute for Computer Graphics Research IGD, Germany

Technical University of Darmstadt, Germany

Arturas Nakvosas

Vilnius University, Lithuania

Hatef Otroshi Shahreza

Idiap Research Institute, Switzerland

Sébastien Marcel

Idiap Research Institute, Switzerland

Rishabh Shukla

Indian Institute of Technology Jammu, India

Aditya Takkar

Indian Institute of Technology Jammu, India

Rushil Khullar

Indian Institute of Technology Jammu, India

Lalak Yadav

Indian Institute of Technology Jammu, India

Gourav Gupta

ArogyaPandit Private Limited, India

Anant Gupta

ArogyaPandit Private Limited, India

Shiqi Yu

Southern University of Science and Technology, China

Vitomir Struc

University of Ljubljana, Slovenia

Naser Damer

Fraunhofer Institute for Computer Graphics Research IGD, Germany

Technical University of Darmstadt, Germany

Fadi Boutros

Fraunhofer Institute for Computer Graphics Research IGD, Germany

Какую задачу решает

В предыдущих задачах на синтетических данных смешивались качество генератора, выбор базовой архитектуры и алгоритмы обучения. В этом бенчмарке исправлены ошибки в CLIP ViT-L/14 и генераторе IDPERTURB, так что полную тонкую настройку, LoRA, рангово-стабилизированную LoRA и адаптацию только с проекцией можно сравнивать на одних и тех же данных и с использованием одного и того же набора оценочных инструментов.

Ключевой результат

Полная тонкая настройка с использованием Sub-Center ArcFace лидирует в треке с полными данными со средней точностью 95,51% на небольших тестовых наборах и 87,42% TAR при FAR 1e-5 на IJB-C, против 76,71% для базового варианта FRoundation. При ограниченном объеме данных rsLoRA демонстрирует более высокую устойчивость: Idiap-BSP достигает средней точности 94,52% и 81,13% TAR IJB-C при FAR 1e-5. Оценка справедливости также меняется в зависимости от режима: победитель в треке с полными данными достигает средней точности RFW 91,70%, а победитель в треке с ограниченным объемом данных — 88,92%.

Аннотация

В данной статье представлен обзор результатов конкурса по адаптации базовых моделей распознавания лиц с использованием синтетических обучающих данных (AFMFR), проведенного в рамках Международной объединенной конференции по биометрии 2026 года (IJCB 2026). В конкурсе приняли участие восемь команд из четырех разных направлений, представивших свои работы в рамках двух взаимодополняющих программ: программа с полным набором данных, в которой участники адаптировали базовую модель CLIP ViT-L/14, используя большие объемы синтетических данных, и программа с ограниченным набором данных, разработанная для отражения более ресурсоемких режимов адаптации. Все обучающие данные были сгенерированы исключительно с помощью IDPERTURB. Представленные решения ранжируются на основе показателей верификации и идентификации по различным наборам эталонных тестов, включая LFW, CFP-FP, AgeDB-30, CALFW, CPLFW, IJB-B, IJB-C и TinyFace, с использованием метода подсчета Борда. Дополнительно проводится оценка справедливости на наборе данных RFW по четырем демографическим группам. Результаты показывают, что адаптация базовой модели CLIP с использованием синтетических обучающих данных существенно улучшает результаты по сравнению со стандартной моделью и в ряде случаев превосходит базовый уровень. Примечательно, что полная тонкая настройка с помощью Sub-Center ArcFace (DMSTI-Neurotechnology) лидирует в исследовании Full Data Track, в то время как адаптация LoRA с ранговой стабилизацией (Idiap-BSP) оказывается наиболее эффективной в условиях ограниченного объема данных.

Отправная точка исследования

Разработчикам систем распознавания лиц все чаще не хватает широких, согласованных наборов данных реальных лиц для обучения, в то время как базовые модели общего компьютерного зрения недостаточно дискриминационны в строгих биометрических условиях без адаптации. В рамках конкурса рассматривается вопрос о том, могут ли синтетические личности обеспечить такую ​​адаптацию и какой объем обучаемой емкости является приемлемым, когда доступный набор синтетических данных изменяется более чем на порядок.

Метод

Конкурс включает в себя два трека: «Полный набор данных» (Full Data Track), содержащий около трех миллионов изображений от 35 000 синтетических личностей, и «Ограниченный набор данных» (Limited Data Track), включающий 250 000 изображений от 5 000 личностей. Восемь действительных работ оцениваются с помощью агрегации Борда по пяти небольшим наборам данных для проверки: IJB-B, IJB-C и TinyFace, а RFW измеряет разброс производительности по четырем демографическим группам. Представленные методы исследуют обновления полной базовой сети, ранги LoRA и rsLoRA, потери на границе, аугментацию и настройку легковесной проекции.

Вывод по статье

Для команд, использующих большую визуальную основу, стратегия настройки должна определяться объемом синтетических данных. Полная тонкая настройка окупается при масштабе в несколько миллионов изображений, в то время как высокоранговый rsLoRA выступает в качестве полезного регуляризатора, когда идентификаторы и изображения ограничены; единый рецепт вряд ли будет оптимальным для обоих случаев.

Статья 022026-07-15cs.CV

DriveFace: кросс-спектральный набор данных о лицах, полученных через стекло, для контроля пограничного контроля транспортных средств в движении.

Авторы и организации

Anjith George

Idiap Research Institute, Switzerland

Luis S. Luevano

Idiap Research Institute, Switzerland

Alain Komaty

Idiap Research Institute, Switzerland

Zeina Al Amine

Idiap Research Institute, Switzerland

Vidit Vidit

Idiap Research Institute, Switzerland

Sebastien Marcel

Idiap Research Institute, Switzerland

University of Lausanne, Switzerland

Какую задачу решает

DriveFace восполняет отсутствие общедоступного эталонного набора данных, связывающего регистрацию RGB-изображений смартфонов с внешним захватом изображения в ближнем инфракрасном диапазоне в автомобиле. Он также включает в себя подмножество данных для атак с использованием поддельных изображений, что позволяет изучать безопасность распознавания и захвата в одних и тех же условиях эксплуатации.

Ключевой результат

Сопоставление изображений на открытом воздухе демонстрирует относительно высокую точность: AdaFace показывает AUC 99,45%, EER 2,69% и Rank-1 97,42%. С имитацией оттенка ситуация сложнее: лучший показатель AUC составляет 96,23%, а xEdgeFace демонстрирует EER 8,09% и проверку 88,63% при FAR 1%. Базовые показатели PAD также ухудшаются при атаках, не встречавшихся ранее; лучший показатель ACER для масок, не встречавшихся ранее, составляет 26,20%, несмотря на низкие ошибки в протоколе с известными атаками.

Аннотация

Непрерывный рост трансграничной мобильности оказывает все большее давление на существующую инфраструктуру пограничного контроля, что стимулирует внедрение биометрической аутентификации в движении, при которой путешественники идентифицируются непосредственно внутри своих транспортных средств на контрольно-пропускных пунктах. Распознавание лиц хорошо подходит для этой задачи, поскольку его можно получить пассивно и на расстоянии. Однако его развитию препятствует отсутствие репрезентативных наборов данных: существующие эталонные наборы данных собираются в контролируемых условиях и не учитывают проблемы, присущие съемке в транспортных средствах, включая размытие изображения при движении, переменное освещение, перекрытия и перекрестную спектральную регистрацию. Для решения этой проблемы мы представляем набор данных для распознавания лиц в движении в сценариях пограничного контроля, включающий видеозаписи пересечения границы транспортными средствами в ближнем инфракрасном диапазоне в сочетании с данными предварительной регистрации, полученными с помощью смартфонов. Базовые оценки с использованием современных моделей показывают явные ограничения производительности в этих реалистичных условиях, подчеркивая необходимость в специализированных методах для развития этой области.

Отправная точка исследования

Контрольно-пропускные пункты для транспортных средств выиграли бы от возможности идентификации предварительно зарегистрированных путешественников без необходимости покидать автомобиль, но датчик фиксируется через отражающее или тонированное стекло, часто во время движения транспортного средства или испытуемого. Существующие наборы данных VIS-NIR для помещений не учитывают это оптическое ухудшение, а также положение профиля, погодные условия, скорость и регистрацию участников в разных сессиях.

Метод

Набор данных охватывает данные 70 добровольцев, давших согласие на участие, в течение двух сессий и включает регистрацию смартфонов, а также данные ИК-зондов, полученных на улице, в помещении (в автомобиле) и при имитации тонировки стекла. Метаданные содержат информацию о тонировке стекла, освещенности, положении головы, погоде и скорости транспортного средства. Протоколы обучения и тестирования с разделением по идентификаторам оценивают AdaFace, LVFace, EdgeFace и адаптированный кросс-спектрально xEdgeFace с использованием показателей AUC, EER, коэффициента верификации при 1% FAR и идентификации Rank-1; отдельные протоколы PAD охватывают известные и неизвестные атаки с использованием отпечатков или масок.

Вывод по статье

DriveFace ценен как набор данных для приемочных испытаний при развертывании систем распознавания лиц на транспортных средствах и границах, поскольку он объединяет регистрацию, спектр датчиков, данные об остеклении, движении и подмене лиц в одном протоколе. Его базовые показатели предупреждают о том, что хорошие результаты распознавания лиц без ограничений не гарантируют достаточного запаса безопасности при использовании цветного кросс-спектрального захвата.

Статья 032026-07-11cs.CV

LFD: Обеспечение распознавания лиц без линз в реальных условиях с использованием крупномасштабного набора данных

Авторы и организации

Junho Kim

Department of Electrical and Computer Engineering, Rice University, Houston, Texas, USA

Salman S. Khan

Department of Electrical and Computer Engineering, Rice University, Houston, Texas, USA

Sara Wan

Department of Electrical and Computer Engineering, Rice University, Houston, Texas, USA

Tomi Kuye

Department of Electrical and Computer Engineering, Rice University, Houston, Texas, USA

Ashok Veeraraghavan

Department of Electrical and Computer Engineering, Rice University, Houston, Texas, USA

Какую задачу решает

В данной области отсутствовал значительный набор данных, объединяющий реальные измерения без линз, реконструированные изображения и обычные изображения лиц в условиях помещений и улицы. Этот пробел затруднял разграничение качества реконструкции и сбоев детектора и распознавателя, а также проверку возможности переноса модели между различными оптическими энкодерами.

Ключевой результат

На первом прототипе распознаватель, обученный с помощью LFD, достигает AUC 0,946 на наборе данных Indoor Easy, 0,808 на открытом воздухе, 0,851 на полном наборе данных и 0,778 на сложном наборе данных. Соответствующая модель для стандартных изображений показывает результаты 0,884, 0,625, 0,763 и 0,599. При уровне ложноположительных результатов 0,05% при кросс-модальном сопоставлении реконструкции LFD достигают 77,30% TPR против 66,02% для более ранних данных FCFD FlatNet, и это преимущество сохраняется на втором оптическом прототипе.

Аннотация

Распознавание лиц — это повсеместно используемая задача компьютерного зрения, имеющая широкий спектр применений, от повседневной биометрии смартфонов до систем безопасности высокого уровня. Большинство систем распознавания лиц основаны на традиционных камерах, которые часто страдают от таких ограничений, как громоздкость, высокая стоимость и ограниченная защита конфиденциальности. Для решения этих проблем в качестве альтернативы появились безлинзовые камеры. Безлинзовые камеры используют тонкие оптические энкодеры, что позволяет уменьшить их размер, снизить стоимость и обеспечить большую гибкость в проектировании. Эти камеры обычно используются в паре с алгоритмами реконструкции, которые преобразуют необработанные снимки в распознаваемые изображения. Однако реконструированные изображения часто содержат артефакты, и методы реконструкции с трудом поддаются обобщению на реальные условия. Кроме того, существующие наборы данных лиц не учитывают артефакты, присутствующие в безлинзовых изображениях. Для решения этой проблемы мы представляем набор данных безлинзовых лиц (LFD). LFD включает 21 080 необработанных измерений, реконструкций и стандартных изображений лиц, полученных без линз при различном освещении, угле обзора и расстоянии. Наши ключевые достижения: (1) Данные о лицах, полученные без использования линз: LFD фокусируется на сборе разнообразного набора данных о лицах с различным уровнем артефактов, возникающих в разных условиях; (2) Съемка в естественных условиях: 4976 изображений были получены на открытом воздухе с различной интенсивностью естественного освещения и различными фоновыми узорами; (3) Использование нескольких безлинзовых устройств: LFD включает изображения лиц, полученные с помощью трех различных типов безлинзовых камер, каждая из которых имеет уникальный оптический кодер. Мы используем это аппаратное разнообразие для демонстрации обобщающей способности на разных безлинзовых камерах. Благодаря всесторонней оценке и анализу мы показываем, что LFD эффективно улавливает общие признаки и артефакты на разных безлинзовых устройствах визуализации, что делает его ценным набором данных для развития распознавания лиц без использования линз.

Отправная точка исследования

В безлинзовых камерах громоздкие линзы заменены тонкими кодированными оптическими элементами, что позволяет уменьшить размер и получать на сенсоре менее читаемые человеком изображения. Однако при их реконструкции возникают специфические для устройства размытия, искажения цвета и виньетирование, поэтому модели распознавания, обученные на обычных фотографиях или смоделированных измерениях, не могут быть надежно перенесены на физические снимки.

Метод

LFD собирает 21 080 необработанных измерений, реконструкций и стандартных изображений без линз, включая 4976 изображений, полученных на открытом воздухе, и снимки, сделанные с помощью трех типов камер без линз. Авторы обучают компоненты реконструкции и обнаружения лиц отдельно, а затем сравнивают распознаватели SENet, обученные на стандартных изображениях VGGFace2, смоделированных реконструкциях без линз или физическом наборе данных LFD. Для проверки используются сбалансированные пары положительных и отрицательных результатов в простых, наружных, полных и сложных подмножествах, после чего проводятся кросс-устройственные тесты.

Вывод по статье

LFD показывает, что безлинзовый биометрический продукт должен обучаться на реальных артефактах сенсора, а не рассматривать реконструкцию как прозрачный этап предварительной обработки. Он предоставляет конкретную основу для оценки компактных или ориентированных на конфиденциальность камер, в то время как оставшийся пробел в области наружной съемки показывает, что преимущества аппаратного обеспечения по-прежнему сопряжены со значительными издержками распознавания.