Улучшение распознавания лиц с низким разрешением при ограниченных данных: как синтетическая генерация данных может сократить разрыв в доменах
Авторы и организации
Luis S. Luevano
Idiap Research Institute, Switzerland
Ünsal Öztürk
Idiap Research Institute, Switzerland
Hatef Otroshi Shahreza
Idiap Research Institute, Switzerland
Anjith George
Idiap Research Institute, Switzerland
Sébastien Marcel
Idiap Research Institute, Switzerland
Какую задачу решает
Исследование задаёт вопрос, какая синтетическая стратегия низкого разрешения действительно помогает компактному распознавателю лиц, когда маркированные нативные данные ограничены, и сохраняются ли выводы, сделанные из искусственно уменьшенных тестов в стиле LFW, на реальных зондах TinyFace. Также устанавливается базовая линия прямого ввода, чтобы модули сверхразрешения и трансляции должны доказать, что сохраняют идентичность, а не просто улучшают визуальный вид.
Ключевой результат
Синтетические тесты отдавали предпочтение деградации на 28 пикселей, но эта же настройка оказалась ниже базового уровня обучения с высоким разрешением в реальном TinyFace. Более мягкая интерполяция на 56 пикселей была лучшей компактной конфигурацией, подняв mAP TinyFace с 52,55 до 54,68 и идентификацию ранга 1 с 59,66% до 61,40%. Изученный конвейер RRDB с суперразрешением и трансляцией доменов достиг всего 57,53 mAP с EdgeFace-base, против 65,12 для прямого входа. Дистилляция знаний дала наибольшие синтетические усиления, но не перешла к нативному низкому разрешению, что показывает, что ограничивающим фактором является точность синтеза, а не сложность синтеза.
Аннотация
Системы распознавания лиц (FR) в условиях наблюдения часто сталкиваются с лицами низкого разрешения (LR), чья область лица ниже стандартного размера входа 112 $\умножить на $112. Хотя обучающие данные высокого разрешения (HR) в изобилии, маркированные нативные данные LR, а главное — парные нативные данные LR/HR — редки. Одним из решений является синтез данных LR из доступных лиц HR, но сколько усилий по синтезу окупается в точности распознавания остаётся неясным. Мы представляем исследование простых стратегий генерации синтетической генерации для компактной, ориентированной на периферию системы распознавания лиц, охватывающих интерполяционную деградацию, дистилляцию знаний, Prepended Domain Transformer (PDT), реальную деградацию в стиле ESRGAN и освоенный интерфейс Super Resolution (SR) с потерей идентичности. Мы оцениваем эти стратегии на синтетических бенчмарках лиц с перекрестным разрешением (LFW, CFP-FP, AgeDB-30) и на TinyFace, реальных нативных LR-данных, и выявляем пробел между синтетическими и реальными параметрами: оптимальная настройка деградации на синтетических бенчмарках не является оптимальной для реальных LR. Мы обнаружили, что дополнительные усилия по синтезу не помогают монотонно: выученный интерфейс SR не превосходит прямой подачи выровненного LR-изображения в прочный каркас, а простая интерполяционная дополнение компактного магистрали — единственный синтез, который превосходит свой базовый уровень. Мы приходим к выводу, что генеративные методы распознавания лиц LR должны быть проверены на реальной LR и с прямой подачей базы, а конвейер должен быть освобождён на https://idiap.ch/paper/synth-lrfr
Отправная точка исследования
Системы наблюдения и списков наблюдения регулярно сравнивают высококачественное изображение регистрации с зондом, чья выровненная поверхность значительно меньше стандартного входа 112 на 112. Родные идентификации низкого разрешения, особенно парные низко- и высокоразрешающие снимки одного и того же человека, редки, поэтому команды обычно производят обучающие данные низкого разрешения на основе множества высококачественных лиц. Практический риск заключается в том, что рецепт деградации может хорошо показать синтетические тесты, одновременно обучая распознавательные сигналы, не похожие на ошибки размытия, шума, сжатия и выравнивания реальных камер.
Метод
Авторы используют магистраль EdgeFace-S с 3,65 миллионами параметров и сравнивают пять уровней адаптационных усилий: дополнение на основе интерполяции с понижением и апсэмплингом, высококачественная дистилляция знаний учителя, трансформатор препедированного домена, нативный 32-пиксельный стебель с обучающимися деградациями в стиле Real-ESRGAN, и интерфейс с учётом идентичности с учётом обученного суперразрешения. Они оценивают верификацию от высокого к низкому и от низкого уровня на LFW, CFP-FP и AgeDB-30, затем повторяют сравнение на нативном низкоразрешённом TinyFace в двух конвейерах выравнивания. Более крупная замороженная базовая модель EdgeFace служит эталоном для проверки, опережает ли генеративный фронтенд прямую передачу выровненного зонд к сильному распознавающему.
Вывод по статье
Для развертывания edge или наблюдения проверяйте каждый рецепт низкого разрешения на действительно захваченных лицах низкого разрешения и поддерживайте сильную базовую линию. Простое, слабое усиление интерполяции может быть лучшим вложением, чем стек с суперразрешением; усиления только синтетического разрешения при агрессивном разрешении не являются надёжным доказательством полевой работы.