IJCB-AFMFR 2026: Конкурс по адаптации базовых моделей для распознавания лиц с использованием синтетических обучающих данных.
Авторы и организации
Tahar Chettaoui
Fraunhofer Institute for Computer Graphics Research IGD, Germany
Guray Ozgur
Fraunhofer Institute for Computer Graphics Research IGD, Germany
Technical University of Darmstadt, Germany
Eduarda Caldeira
Fraunhofer Institute for Computer Graphics Research IGD, Germany
Technical University of Darmstadt, Germany
Arturas Nakvosas
Vilnius University, Lithuania
Hatef Otroshi Shahreza
Idiap Research Institute, Switzerland
Sébastien Marcel
Idiap Research Institute, Switzerland
Rishabh Shukla
Indian Institute of Technology Jammu, India
Aditya Takkar
Indian Institute of Technology Jammu, India
Rushil Khullar
Indian Institute of Technology Jammu, India
Lalak Yadav
Indian Institute of Technology Jammu, India
Gourav Gupta
ArogyaPandit Private Limited, India
Anant Gupta
ArogyaPandit Private Limited, India
Shiqi Yu
Southern University of Science and Technology, China
Vitomir Struc
University of Ljubljana, Slovenia
Naser Damer
Fraunhofer Institute for Computer Graphics Research IGD, Germany
Technical University of Darmstadt, Germany
Fadi Boutros
Fraunhofer Institute for Computer Graphics Research IGD, Germany
Какую задачу решает
В предыдущих задачах на синтетических данных смешивались качество генератора, выбор базовой архитектуры и алгоритмы обучения. В этом бенчмарке исправлены ошибки в CLIP ViT-L/14 и генераторе IDPERTURB, так что полную тонкую настройку, LoRA, рангово-стабилизированную LoRA и адаптацию только с проекцией можно сравнивать на одних и тех же данных и с использованием одного и того же набора оценочных инструментов.
Ключевой результат
Полная тонкая настройка с использованием Sub-Center ArcFace лидирует в треке с полными данными со средней точностью 95,51% на небольших тестовых наборах и 87,42% TAR при FAR 1e-5 на IJB-C, против 76,71% для базового варианта FRoundation. При ограниченном объеме данных rsLoRA демонстрирует более высокую устойчивость: Idiap-BSP достигает средней точности 94,52% и 81,13% TAR IJB-C при FAR 1e-5. Оценка справедливости также меняется в зависимости от режима: победитель в треке с полными данными достигает средней точности RFW 91,70%, а победитель в треке с ограниченным объемом данных — 88,92%.
Аннотация
В данной статье представлен обзор результатов конкурса по адаптации базовых моделей распознавания лиц с использованием синтетических обучающих данных (AFMFR), проведенного в рамках Международной объединенной конференции по биометрии 2026 года (IJCB 2026). В конкурсе приняли участие восемь команд из четырех разных направлений, представивших свои работы в рамках двух взаимодополняющих программ: программа с полным набором данных, в которой участники адаптировали базовую модель CLIP ViT-L/14, используя большие объемы синтетических данных, и программа с ограниченным набором данных, разработанная для отражения более ресурсоемких режимов адаптации. Все обучающие данные были сгенерированы исключительно с помощью IDPERTURB. Представленные решения ранжируются на основе показателей верификации и идентификации по различным наборам эталонных тестов, включая LFW, CFP-FP, AgeDB-30, CALFW, CPLFW, IJB-B, IJB-C и TinyFace, с использованием метода подсчета Борда. Дополнительно проводится оценка справедливости на наборе данных RFW по четырем демографическим группам. Результаты показывают, что адаптация базовой модели CLIP с использованием синтетических обучающих данных существенно улучшает результаты по сравнению со стандартной моделью и в ряде случаев превосходит базовый уровень. Примечательно, что полная тонкая настройка с помощью Sub-Center ArcFace (DMSTI-Neurotechnology) лидирует в исследовании Full Data Track, в то время как адаптация LoRA с ранговой стабилизацией (Idiap-BSP) оказывается наиболее эффективной в условиях ограниченного объема данных.
Отправная точка исследования
Разработчикам систем распознавания лиц все чаще не хватает широких, согласованных наборов данных реальных лиц для обучения, в то время как базовые модели общего компьютерного зрения недостаточно дискриминационны в строгих биометрических условиях без адаптации. В рамках конкурса рассматривается вопрос о том, могут ли синтетические личности обеспечить такую адаптацию и какой объем обучаемой емкости является приемлемым, когда доступный набор синтетических данных изменяется более чем на порядок.
Метод
Конкурс включает в себя два трека: «Полный набор данных» (Full Data Track), содержащий около трех миллионов изображений от 35 000 синтетических личностей, и «Ограниченный набор данных» (Limited Data Track), включающий 250 000 изображений от 5 000 личностей. Восемь действительных работ оцениваются с помощью агрегации Борда по пяти небольшим наборам данных для проверки: IJB-B, IJB-C и TinyFace, а RFW измеряет разброс производительности по четырем демографическим группам. Представленные методы исследуют обновления полной базовой сети, ранги LoRA и rsLoRA, потери на границе, аугментацию и настройку легковесной проекции.
Вывод по статье
Для команд, использующих большую визуальную основу, стратегия настройки должна определяться объемом синтетических данных. Полная тонкая настройка окупается при масштабе в несколько миллионов изображений, в то время как высокоранговый rsLoRA выступает в качестве полезного регуляризатора, когда идентификаторы и изображения ограничены; единый рецепт вряд ли будет оптимальным для обоих случаев.