DenseFace: смягчение предвзятости при распознавании лиц с помощью вероятностного сопоставления с учётом плотности
Авторы и организации
Mansur Bultygov
VisionLabs
Vadim Seliutin
Amazon Web Services
VisionLabs (work performed there)
Dmitry Nekhaev
VisionLabs
Ivan Laptev
Mohamed bin Zayed University of Artificial Intelligence
Какую задачу решает
DenseFace спрашивает, можно ли уменьшить расовые ложные совпадения при сравнении без изменения или переобучения базового кодировщика лиц. Он также заменяет стандартное отклонение точности подгрупп протоколом, ориентированным на развертывание: установить один порог на белом уровне ложноположительных результатов 0,001 и измерить, насколько далеко все остальные группы отходят от паритета.
Ключевой результат
В моделях CosFace и AdaFace, обученных на Glint360K, MS1MV2, WebFace4M, WebFace12M и BUPT-BalancedFace, одинаковый глобальный порог становится значительно более равномерным. В модели BUPT ложноположительный мультипликатор африканской когорты падает с 6,15 до 1,43, а индийской — с 4,01 до 1,03 относительно кавказского эталонного. Сохранена традиционная точность верификации: для модели CosFace Glint360K средняя точность RFW увеличивается с 98,61% до 98,68%, а стандартное отклонение подгрупп снижается с 0,53 до 0,44. Регрессор добавляет около 0,2% памяти и 1,75% сквозной задержки в тесте GPU авторов; его оптимизированный расчет баллов ЦПУ примерно в 1,5 раза превышает чистую стоимость косинуса. Результаты всё ещё зависят от репрезентативного якорного или регрессорного обучающего популяция.
Аннотация
Несмотря на устойчивый прогресс в распознавании лиц, современные модели распознавания лиц всё ещё страдают от значительных демографических искажений. Хотя были предложены подходы к снижению предвзятости, существующие методы часто накладывают ограничения на процедуру обучения и приводят к снижению точности распознавания. Для решения этой проблемы мы предлагаем метод, который снижает расовую предвзятость в предварительно обученных моделях распознавания лиц без ущерба их точности. Для этого мы моделируем вложения лиц каждого человека по распределению фон Мизеса-Фишера (MF). Далее мы наблюдаем зависимость между демографическими атрибутами и плотностью распределений MF и предлагаем DenseFace — вероятностную процедуру сопоставления лиц, учитывающую различия в распределениях MF. Наши обширные эксперименты демонстрируют стабильное снижение расовой предвзятости в сильных моделях распознавания лиц с разными сетевыми архитектурами, обучающими наборами данных и функциями потерь. В частности, DenseFace сохраняет точность распознавания и не требует переобучения базовой модели распознавания лиц. Наша работа также исследует ранее принятые меры предвзятости и предлагает предложения.
Отправная точка исследования
Системы распознавания лиц часто используют один глобальный порог принятия решения, однако распределение баллов самозванца различается в разных демографических группах. Модель может выглядеть точной на RFW, когда каждая группа получает свой собственный кросс-валидированный порог и при этом даёт очень разные показатели ложного сопоставления в реальном сервисе. Большинство методов смягчения также требуют сбалансированных данных переобучения, изменений архитектуры или потерь справедливости, что может снизить производительность распознавания и трудно адаптировать их в утверждённую модель.
Метод
Для каждого вложения граней метод находит ближайшие тождества в демографически сбалансированном анкорном наборе и оценивает локальную межклассовую плотность. Он представляет вложение с распределением фон Мизеса-Фишера, концентрация которого отражает эту плотность, затем оценивает пару по взаимной вероятности, а не по чистому косинусному сходству. Запас разделяет идентичности близких соседей, а лёгкий вариант регрессора напрямую предсказывает плотность, поэтому сопоставление производства не требует большого поиска якорей. Данные энкодера, размера вложения и регистрации остаются без изменений.
Вывод по статье
Контроль справедливости на уровне сравнения может улучшить паритет когорты без повторного обучения модели, но это не отменяет необходимость в репрезентативных калибровочных данных и мониторинге подгрупп на фактическом рабочем пороге.