← Назад в Блог
Исследовательский радарРаспознавание лицarXivСентябрь 2026

Ежемесячный радар arXiv

Исследования распознавания лиц за сентябрь 2026 года: более справедливое сопоставление, тепловая адаптация и тест на близнецах

Сентябрьские исследования распознавания лиц больше касаются сложных режимов работы не столько о другой расе, сколько о сложных режимах работы. DenseFace меняет правило сопоставления существующей модели, чтобы уменьшить расовые различия в ложных совпадениях. SynThermFace превращает редкие пары видимо-термических пар в более крупный набор адаптаций без добавления трансляции изображения при выводе. Затем Celeb Twins Test Set задаётся вопросом, используют ли современные вложения те самые маленькие локальные сигналы, на которые люди полагаются для различия монозиготных близнецов.

Что показывает этот месяц

DenseFace показывает, что локальная плотность вложения может использоваться как пост-хок вероятностный сигнал сопоставления, приближая несколько некавказских показателей ложного совпадения к кавказской точке при сохранении точности верификации. SynThermFace использует диффузионную модель только во время обучения, затем внедряет один адаптированный прямой проход EdgeFace; его модель синтетической пары достигает 0,99% EER на MCXFace и 14,70% на непредставленных данных Tufts, поэтому перенос датчиков остаётся материалом. CTTS вносит 21 120 пар с фокусом на близнецы и показывает, что двенадцать современных вариантов сопоставления остаются точностью около 73-77%, хотя их обычный эталонный средний показатель составляет около 97%. Общий урок заключается в отдельной валидации правила сопоставления, спектра захвата и популяции жёсткой идентичности, а не рассматривать одну совокупную оценку как готовность к производству.

Статья 012026-09-14cs.CV

DenseFace: смягчение предвзятости при распознавании лиц с помощью вероятностного сопоставления с учётом плотности

Авторы и организации

Mansur Bultygov

VisionLabs

Vadim Seliutin

Amazon Web Services

VisionLabs (work performed there)

Dmitry Nekhaev

VisionLabs

Ivan Laptev

Mohamed bin Zayed University of Artificial Intelligence

Какую задачу решает

DenseFace спрашивает, можно ли уменьшить расовые ложные совпадения при сравнении без изменения или переобучения базового кодировщика лиц. Он также заменяет стандартное отклонение точности подгрупп протоколом, ориентированным на развертывание: установить один порог на белом уровне ложноположительных результатов 0,001 и измерить, насколько далеко все остальные группы отходят от паритета.

Ключевой результат

В моделях CosFace и AdaFace, обученных на Glint360K, MS1MV2, WebFace4M, WebFace12M и BUPT-BalancedFace, одинаковый глобальный порог становится значительно более равномерным. В модели BUPT ложноположительный мультипликатор африканской когорты падает с 6,15 до 1,43, а индийской — с 4,01 до 1,03 относительно кавказского эталонного. Сохранена традиционная точность верификации: для модели CosFace Glint360K средняя точность RFW увеличивается с 98,61% до 98,68%, а стандартное отклонение подгрупп снижается с 0,53 до 0,44. Регрессор добавляет около 0,2% памяти и 1,75% сквозной задержки в тесте GPU авторов; его оптимизированный расчет баллов ЦПУ примерно в 1,5 раза превышает чистую стоимость косинуса. Результаты всё ещё зависят от репрезентативного якорного или регрессорного обучающего популяция.

Аннотация

Несмотря на устойчивый прогресс в распознавании лиц, современные модели распознавания лиц всё ещё страдают от значительных демографических искажений. Хотя были предложены подходы к снижению предвзятости, существующие методы часто накладывают ограничения на процедуру обучения и приводят к снижению точности распознавания. Для решения этой проблемы мы предлагаем метод, который снижает расовую предвзятость в предварительно обученных моделях распознавания лиц без ущерба их точности. Для этого мы моделируем вложения лиц каждого человека по распределению фон Мизеса-Фишера (MF). Далее мы наблюдаем зависимость между демографическими атрибутами и плотностью распределений MF и предлагаем DenseFace — вероятностную процедуру сопоставления лиц, учитывающую различия в распределениях MF. Наши обширные эксперименты демонстрируют стабильное снижение расовой предвзятости в сильных моделях распознавания лиц с разными сетевыми архитектурами, обучающими наборами данных и функциями потерь. В частности, DenseFace сохраняет точность распознавания и не требует переобучения базовой модели распознавания лиц. Наша работа также исследует ранее принятые меры предвзятости и предлагает предложения.

Отправная точка исследования

Системы распознавания лиц часто используют один глобальный порог принятия решения, однако распределение баллов самозванца различается в разных демографических группах. Модель может выглядеть точной на RFW, когда каждая группа получает свой собственный кросс-валидированный порог и при этом даёт очень разные показатели ложного сопоставления в реальном сервисе. Большинство методов смягчения также требуют сбалансированных данных переобучения, изменений архитектуры или потерь справедливости, что может снизить производительность распознавания и трудно адаптировать их в утверждённую модель.

Метод

Для каждого вложения граней метод находит ближайшие тождества в демографически сбалансированном анкорном наборе и оценивает локальную межклассовую плотность. Он представляет вложение с распределением фон Мизеса-Фишера, концентрация которого отражает эту плотность, затем оценивает пару по взаимной вероятности, а не по чистому косинусному сходству. Запас разделяет идентичности близких соседей, а лёгкий вариант регрессора напрямую предсказывает плотность, поэтому сопоставление производства не требует большого поиска якорей. Данные энкодера, размера вложения и регистрации остаются без изменений.

Вывод по статье

Контроль справедливости на уровне сравнения может улучшить паритет когорты без повторного обучения модели, но это не отменяет необходимость в репрезентативных калибровочных данных и мониторинге подгрупп на фактическом рабочем пороге.

Статья 022026-09-09cs.CV

SynThermFace: Усиление ограниченных парных данных для видимого-теплового распознавания лиц с помощью генерации синтетических данных

Авторы и организации

Anjith George

Idiap Research Institute, Switzerland

Adam Unal

Idiap Research Institute, Switzerland

Sebastien Marcel

Idiap Research Institute, Switzerland

University of Lausanne, Switzerland

Какую задачу решает

SynThermFace усиливает ограниченное парное наблюдение для распознавания видимого в тепловое и проверяет, улучшают ли синтетические тепловые пары точность внутри базы данных и переносимость на сенсор/базу данных, которая никогда не использовалась для обучения. Она отделяет пользу своего адаптационного критерия от пользы масштабирования синтетических идентичностей.

Ключевой результат

В разделе разработки MCXFace PACT с реальной парой достигает 3,04% EER и 96,49% Rank-1, превзойдя сравнительные базовые показатели адаптации к реальной паре. При 1000 синтетических идентичностях, полученных от CASIA, EER падает до 0,99%, Rank-1 достигает 99,75%, а верификация на 0,1% FAR достигает 93,48%; неадаптированный базовый уровень EdgeFace имеет 23,06% EER и 40,10% Rank-1. На основе невидимых данных Tufts обучение на основе Digi2Real улучшает EdgeFace с 43,41% до 13,91% EER и с 12,03% до 56,37% Rank-1. Оставшийся разрыв между MCXFace и Tufts велик, и генератор всё ещё зависит от вещественных пар MCXFace, поэтому метод уменьшает, а не исключает реальное кросс-спектральное собирание.

Аннотация

Распознавание лиц (FR) является широко используемой модальностью для биометрической аутентификации, но традиционные модели опираются на изображения в видимом спектре и теряют качество, когда невозможно получить высококачественные RGB-изображения. Распознавание лиц в разных спектрах решает это ограничение, сопоставляя видимые изображения с другими модальностями, такими как тепловое изображение, обеспечивая более надежную работу в условиях низкой освещенности, ночью и в неконтролируемых условиях. Однако прогресс ограничен нехваткой парных видимых и тепловых данных, которые трудно и дорого собрать в больших масштабах. Мы предлагаем SynThermFace, структуру, которая усиливает ограниченное реальное видимо-тепловое наблюдение и превращает его в более крупные адаптационные наборы данных для распознавания лиц в разных спектрах. Сначала модель диффузии адаптируется с использованием ограниченного набора пар видимых и тепловых изображений, а затем используется для генерации крупномасштабных пар видимых и синтетических тепловых данных из существующих реальных или синтетических наборов данных видимых лиц. Сгенерированные пары используются для адаптации заранее обученной модели распознавания лиц в видимом спектре в модель CFR. В отличие от подходов на основе синтеза, которые требуют перевода изображений во время тестирования, предлагаемый метод переносит генерацию на этап обучения и выполняет вывод с одной прямой передачей через адаптированную модель распознавания. В рамках того же протокола MCXFace для реальных пар, PACT показывает улучшение по сравнению с оцененными базовыми линиями CFR, выделяя эффект предложенного адаптационного критерия. Обучение PACT на более крупных сгенерированных парных наборах данных дает дополнительные улучшения как по сравнению с неадаптированной моделью, так и по сравнению с конфигурацией PACT для реальных пар. Оценка на другом наборе данных Tufts предоставляет доказательства того, что изученное представление переносится на ранее неиспользуемую базу данных. Исходный код и обученные модели будут доступны публично.

Отправная точка исследования

Тепловые камеры могут поддерживать аутентификацию и наблюдение, когда съемка в видимом свете невозможна, но большинство галерей личностей RGB, а парные видимые-тепловые изображения лиц дорого собрать. Прямой перевод каждого теплового изображения во время выполнения добавляет генератор в критический путь и может изменить идентичность. Практический вопрос заключается в том, может ли небольшой реальный парный набор контролировать гораздо больший обучающий набор, оставляя развертывание обычным поиском в embedding.

Метод

Диффузионный генератор сначала адаптируется на парный MCXFace обучающий раздел, затем преобразует либо реальные изображения CASIA-WebFace, либо синтетические идентичности Digi2Real в соответствующие тепловые виды. Preservation-Aware Cross-Spectral Tuning начинается с предварительно обученной модели EdgeFace и сочетает симметричное тепловое обучение видимому и видимому к тепловому контрасту с потерей, при которой видимые вложения остаются рядом с замороженной копией оригинальной модели. Генерация происходит только при создании адаптационного набора (adjustment set); вывод — это один прямой проход через настроенный распознаватель.

Вывод по статье

Офлайн-синтетическая тепловая генерация может превратить небольшую парную коллекцию в полезный контроль распознавания без трансляции во время выполнения, но новые датчики и популяции всё ещё нуждаются в собственных тестах передачи и справедливости.

Статья 032026-09-01cs.CV

Возвращение к распознаванию лиц для монозиготных близнецов: тестовый набор знаменитых близнецов

Авторы и организации

Michael Zang

Department of Computer Science and Engineering, University of Notre Dame

Haiyu Wu

Department of Computer Science and Engineering, University of Notre Dame

Mrinal Sharma

Department of Computer Science and Engineering, University of Notre Dame

Kevin W. Bowyer

Department of Computer Science and Engineering, University of Notre Dame

Какую задачу решает

В статье создаётся ориентир в стиле верификации, достаточно большой для перекрёстной валидации с двойными двойными перекрестными проверками и аннотированным для локальных отличительных отметок и возможной асимметрии зеркала. Затем проверяется, используют ли современные глубокие сопоставления эти сигналы, и предоставляет ли устранение предположений о горизонтальном перевороте или создание синтетических близнецов реалистичный путь вперёд.

Ключевой результат

Двенадцать конфигураций сопоставления достигают средней точности CTTS только 73,14–76,50%, тогда как в среднем по пяти обычным наборам верификации приблизительно 97,00–97,69%. Удаление видимых меток оставляет вложения и распределение расстояний пар практически неизменными, что указывает на то, что текущие модели игнорируют подсказки, которые могут использовать люди. Переобучение с учетом асимметрии достигает 78,58% плюс-минус 3,7% и статистически не отличается от исходной модели; это помогает некоторым наборам зеркальных близнецов и вредит другим. Сгенерированные близнецы не сохраняют реалистичную структуру расстояния внутри лица и между близнецами, поэтому они пока не являются валидированной заменой для обучения.

Аннотация

В прошлой литературе по распознаванию лиц для монозиготных (("идентичных") близнецов указывают на отметки лица и асимметрию зеркала как на возможные направления для повышения точности распознавания близнецов. Тестовый набор близнецов (CTTS) содержит пары изображений, отработанные в интернете, для 80 наборов знаменитых близнецов. Это единственный набор тестов для близнецов с метаданными для близнецов с отличительными кожными отметинами и возможной асимметрией зеркал. CTTS организован по принципу тестов для проверки лица, таких как LFW, CALFW, CPLFW, CFP-FP и AgeDB-30. Современные глубокие совпадения CNN могут достигать более 76% точности при классификации пар изображений одного и другого человека CTTS. Мы показываем, что текущие совпадения не используют кожные отметки или асимметрию, и обсуждаем причины этого. Наконец, мы обсуждаем возможность использования генеративных инструментов ИИ, таких как Grok, ChatGPT и Gemini, для создания изображений воображаемых монозиготных близнецов с целью увеличения их представления в тренировочных наборах по распознаванию лиц.

Отправная точка исследования

Монозиготные близнецы обнажают границу идентичности, которую обычные бенчмарки лиц едва ли представляют. NIST ранее сообщал, что при пороге, выбранном для 0,0001 не-близнецов ложного совпадения, многие алгоритмы принимали одного близнеца за другого 98-99% случаев. Существующие наборы данных близнецов малы, стары или не содержат метаданных о веснушках, родинках, рубцах и статусе зеркальных близнецов, что затрудняет изучение, какие сигналы современные эмбеддинги действительно используют.

Метод

CTTS-80 собирает веб-изображения для 80 множеств близнецов знаменитостей и строит 21 120 сбалансированных пар одного и того же человека и близнеца-самозванца в десяти сгибах, полностью сохраняя каждый набор близнецов в одной складке. Авторы оценивают модели ArcFace, AdaFace, UniFace и MagFace ResNet-100, обученные на трёх общих наборах данных. Они стирают видимые кожные метки в выбранных идентичностях, сравнивают исходные и отредактированные распределения вложения, переучивают ArcFace без горизонтального переворота и инспектируют синтетические близнецы, запрошенные от трёх генеративных систем.

Вывод по статье

Двойная верификация остаётся отдельным классом риска: стандартная точность мало что об этом говорит, а современные встраивания, похоже, не используют очевидные локальные отметки. Внедрения с высокой надёжностью должны явно проверять двойных самозванцев, а не выводить производительность из общих бенчмарков.