← Назад в Блог
Исследовательский радарРаспознавание лицarXivАвгуст 2026 г.

Ежемесячный радар arXiv

Статьи о распознавании лиц за август 2026 года: низкое разрешение, сжатие менее 1 КБ и справедливость в Бразилии

Статьи по распознаванию лиц в августе сосредоточены на ограничениях, которые становятся видимыми только после того, как модель оставит чистый ориентир. Избранные исследования тестируют нативные низкоразрешённые зонды, а не доверяют синтетической деградации, количественно определяют, какие кодеки сохраняют идентичность на уровне 1 024 и 512 байт, а также проверяют сжатое публичное видео с бразильскими демографическими категориями и явными уровнями сложности.

Что показывает этот месяц

Исследование низкого разрешения предупреждает, что синтетическая деградация, побеждающая в тестах в стиле LFW, может быть неправильным выбором для нативных зондов TinyFace. Бенчмарк сжатия показывает аналогичное резкое изменение режима: несколько знакомых кодеков работают около 1 КБ, но сжимаются на 512 Б, где ценен байтовый-бюджетный обученный кодек. UFPR-PE затем демонстрируют, что демографические разрывы резко увеличиваются в жёстком визуальном подмножестве и могут менять порядок между протоколами идентификации. Во всех трёх процессах качество производства зависит от тестирования фактического режима захвата и хранения, а не от экстраполяции из удобного прокси.

Статья 012026-08-06cs.CV

Улучшение распознавания лиц с низким разрешением при ограниченных данных: как синтетическая генерация данных может сократить разрыв в доменах

Авторы и организации

Luis S. Luevano

Idiap Research Institute, Switzerland

Ünsal Öztürk

Idiap Research Institute, Switzerland

Hatef Otroshi Shahreza

Idiap Research Institute, Switzerland

Anjith George

Idiap Research Institute, Switzerland

Sébastien Marcel

Idiap Research Institute, Switzerland

Какую задачу решает

Исследование задаёт вопрос, какая синтетическая стратегия низкого разрешения действительно помогает компактному распознавателю лиц, когда маркированные нативные данные ограничены, и сохраняются ли выводы, сделанные из искусственно уменьшенных тестов в стиле LFW, на реальных зондах TinyFace. Также устанавливается базовая линия прямого ввода, чтобы модули сверхразрешения и трансляции должны доказать, что сохраняют идентичность, а не просто улучшают визуальный вид.

Ключевой результат

Синтетические тесты отдавали предпочтение деградации на 28 пикселей, но эта же настройка оказалась ниже базового уровня обучения с высоким разрешением в реальном TinyFace. Более мягкая интерполяция на 56 пикселей была лучшей компактной конфигурацией, подняв mAP TinyFace с 52,55 до 54,68 и идентификацию ранга 1 с 59,66% до 61,40%. Изученный конвейер RRDB с суперразрешением и трансляцией доменов достиг всего 57,53 mAP с EdgeFace-base, против 65,12 для прямого входа. Дистилляция знаний дала наибольшие синтетические усиления, но не перешла к нативному низкому разрешению, что показывает, что ограничивающим фактором является точность синтеза, а не сложность синтеза.

Аннотация

Системы распознавания лиц (FR) в условиях наблюдения часто сталкиваются с лицами низкого разрешения (LR), чья область лица ниже стандартного размера входа 112 $\умножить на $112. Хотя обучающие данные высокого разрешения (HR) в изобилии, маркированные нативные данные LR, а главное — парные нативные данные LR/HR — редки. Одним из решений является синтез данных LR из доступных лиц HR, но сколько усилий по синтезу окупается в точности распознавания остаётся неясным. Мы представляем исследование простых стратегий генерации синтетической генерации для компактной, ориентированной на периферию системы распознавания лиц, охватывающих интерполяционную деградацию, дистилляцию знаний, Prepended Domain Transformer (PDT), реальную деградацию в стиле ESRGAN и освоенный интерфейс Super Resolution (SR) с потерей идентичности. Мы оцениваем эти стратегии на синтетических бенчмарках лиц с перекрестным разрешением (LFW, CFP-FP, AgeDB-30) и на TinyFace, реальных нативных LR-данных, и выявляем пробел между синтетическими и реальными параметрами: оптимальная настройка деградации на синтетических бенчмарках не является оптимальной для реальных LR. Мы обнаружили, что дополнительные усилия по синтезу не помогают монотонно: выученный интерфейс SR не превосходит прямой подачи выровненного LR-изображения в прочный каркас, а простая интерполяционная дополнение компактного магистрали — единственный синтез, который превосходит свой базовый уровень. Мы приходим к выводу, что генеративные методы распознавания лиц LR должны быть проверены на реальной LR и с прямой подачей базы, а конвейер должен быть освобождён на https://idiap.ch/paper/synth-lrfr

Отправная точка исследования

Системы наблюдения и списков наблюдения регулярно сравнивают высококачественное изображение регистрации с зондом, чья выровненная поверхность значительно меньше стандартного входа 112 на 112. Родные идентификации низкого разрешения, особенно парные низко- и высокоразрешающие снимки одного и того же человека, редки, поэтому команды обычно производят обучающие данные низкого разрешения на основе множества высококачественных лиц. Практический риск заключается в том, что рецепт деградации может хорошо показать синтетические тесты, одновременно обучая распознавательные сигналы, не похожие на ошибки размытия, шума, сжатия и выравнивания реальных камер.

Метод

Авторы используют магистраль EdgeFace-S с 3,65 миллионами параметров и сравнивают пять уровней адаптационных усилий: дополнение на основе интерполяции с понижением и апсэмплингом, высококачественная дистилляция знаний учителя, трансформатор препедированного домена, нативный 32-пиксельный стебель с обучающимися деградациями в стиле Real-ESRGAN, и интерфейс с учётом идентичности с учётом обученного суперразрешения. Они оценивают верификацию от высокого к низкому и от низкого уровня на LFW, CFP-FP и AgeDB-30, затем повторяют сравнение на нативном низкоразрешённом TinyFace в двух конвейерах выравнивания. Более крупная замороженная базовая модель EdgeFace служит эталоном для проверки, опережает ли генеративный фронтенд прямую передачу выровненного зонд к сильному распознавающему.

Вывод по статье

Для развертывания edge или наблюдения проверяйте каждый рецепт низкого разрешения на действительно захваченных лицах низкого разрешения и поддерживайте сильную базовую линию. Простое, слабое усиление интерполяции может быть лучшим вложением, чем стек с суперразрешением; усиления только синтетического разрешения при агрессивном разрешении не являются надёжным доказательством полевой работы.

Статья 022026-08-24cs.CV

К сжатию лиц с сохранением идентичности менее 1 кБ: эталон кодеков, кастомный обученный кодек, а также исследования разрешения, демографической справедливости, рекомпрессии и устойчивости противника

Авторы и организации

Petr Hurtik

Innovatrics, Slovakia

Jakub Sochor

Innovatrics, Slovakia

Какую задачу решает

Эта работа превращает субкилобайтное хранилище лиц в контролируемый бенчмарк развертывания вместо единого сравнения кодеков. Он выявляет специфические для бюджета операционные точки, проверяет, предсказывают ли показатели качества изображения биометрическую полезность, и создаётся изученный кодек, выход которого гарантированно остаётся в пределах запрашиваемого лимита байтов.

Ключевой результат

При 1 024 байтах и 112 пикселях современные кодеки почти готовы к операционному решению на Color FERET: WebP и AVIF достигают 0,09% EER с ArcFace. Однако при 512 байтах AVIF, HEIF, JPEG XL и устаревший JPEG достигают 28-98% FNMR на FMR 1e-4, тогда как точный изученный кодек достигает 1,83% на Color FERET и 6,9% на AI-Solutions-KK, по сравнению с 2,86% для JPEG-AI и 24,3% для WebP соответственно. Порядок кодеков в основном инвариантен по основной основной системе (W=0,85 по Кендалла). Большинство кодеков добавляют не более 1,7 процентных пункта демографического разрыва в EER, но JPEG 2000 добавляет 3,4-5,0 пункта и плохо сохраняет идентичность.

Аннотация

Хранение изображений лиц в пределах жёсткого бюджета субкилобата, как требуется для документов с идентификацией, биометрии смарт-карт и проверки с ограниченной пропускной способностью, заставляет кодек отбрасывать большую часть сигнала, сохраняя при этом то, что на самом деле читает сопоставитель лиц: идентичность. Универсальные кодеки оптимизируют точность пикселей, а не расстояния встраивания, обеспечивающие верификацию, поэтому какой кодек, разрешение и настройка лучше всего сохраняют идентичность на уровне 1024 байтов или меньше, и как это ухудшается при 512 байтах — неясно. Мы сравниваем десять общих и специфичных для лиц кодеков по разрешениям, бюджетам байтов, двум наборам данных (управляемый Color FERET, in-the-wild AI-Solutions-KK) и четырём якорными сопоставлениями лиц, при этом список из четырнадцати моделей ViT и CNN подтверждает, что рейтинг инвариантен по магистрали. Затем мы обучаем пользовательский кодек, сохраняющий идентичность, который точно достигает бюджета байтов с помощью бинарного поиска по замороженной таблице усиления, и запускаем четыре исследования: разрешение, демографическая справедливость, рекомпрессия и устойчивость противника без коробок. Сохранение идентичности субкилобайта возможно, но какой кодек развернуть полностью зависит от бюджета. При 1024 байтах и рабочем разрешении 112 пикселей проблема почти решена: современные кодеки держат Color FERET равную ошибку менее 0,35 процента на якоре ArcFace. При 512 байтах поле пересортируется: AVIF, HEIF, JPEG XL и устаревший JPEG сжимаются до 28–98 процентов ложного несовпадения при FMR 1e-4, в то время как WebP, JPEG-AI и наши байт-бюджетированные кодеки остаются вне этого диапазона: 24,3 процента у WebP против 6,9 процента у нашего точный вариант в реальной природе. Именно пересортировка, а не 1024-байтный рейтинг, является операционным результатом: кодек, выбранный с 1 кБ, не подходит для развертывания при половине этого значения.

Отправная точка исследования

Документы по идентификации, смарт-карты и сервисы проверки с ограниченной пропускной способностью могут содержать всего 1 024 или даже 512 байт для выровненной обрезки лиц. Универсальные кодеки оптимизируют искажение пикселей, а не используемые в матчере, и кодек, который лучше всего выглядит при одном бюджете, может внезапно выйти из строя в другом. Покупателям также необходимо знать, передаётся ли выбор между распознавателями, влияет ли на демографические группы, переживает ли повторное сжатие и взаимодействует ли с возмущениями противника.

Метод

Десять универсальных и ориентированных на лицевые кодеки тестируются с пятью разрешениями и двумя жесткими бюджетами на контролируемых цветных FERET и интерактивных AI-Solutions-KK. Четыре якорных сопоставления содержат основные метрики верификации, а четырнадцать моделей ViT/CNN проверяет, зависят ли рейтинги кодеков от основы. Авторы также обучают кодеки с точностью и быстрыми сохранением идентичности с 18,7 миллиона параметров с замороженной таблицей усиления из 64 записей и бинарным поиском для точного соответствия бюджету. Отдельные исследования охватывают разницу в оттенках кожи и этнической принадлежности, рекомпрессии одно- и кросс-кодеков, возмущения противников без коробок, задержку и статистическую значимость.

Вывод по статье

Рассматривайте 1 КБ и 512 Б как разные уровни продукта, а не соседние настройки качества. WebP или AVIF — разумные варианты для широкого развертывания около 1 КБ, тогда как байтовый-бюджетный обученный кодек становится существенно безопаснее при 512 Б; биометрические тесты, а не только PSNR или визуальный осмотр, должны определять решение.

Статья 032026-08-31cs.CV

UFPR-PEs: бразильский бенчмарк распознавания лиц с самоопределяемыми категориями расы/цвета кожи

Авторы и организации

Alexandre Diano

Department of Informatics, Federal University of Paraná, Curitiba, Brazil

Bernardo Biesseck

Department of Informatics, Federal University of Paraná, Curitiba, Brazil

Federal Institute of Mato Grosso (IFMT), Pontes e Lacerda, Mato Grosso, Brazil

Gabriel Polo

Department of Informatics, Federal University of Paraná, Curitiba, Brazil

Vinicius Gregorio

Department of Informatics, Federal University of Paraná, Curitiba, Brazil

Laura Lopes

Department of Informatics, Federal University of Paraná, Curitiba, Brazil

Diego Addan

Department of Informatics, Federal University of Paraná, Curitiba, Brazil

David Menotti

Department of Informatics, Federal University of Paraná, Curitiba, Brazil

Какую задачу решает

UFPR-PE предоставляет воспроизводимый бразильский ориентир для верификации, идентификации с закрытыми наборами и открытой идентификации с использованием официальных самопровозглашённых расовых и цветовых записей. Он предназначен для разделения демографических эффектов от визуальных проблем, а не для создания агрегированного разрыва в подгруппах без контекста.

Ключевой результат

Сложность доминирует в совокупном результате. Верификационный AUC составляет 1.000, при этом 0.0% EER на простых зондах и 0.999 с 2.2% EER на средних зондах, но снижается до 0.440 AUC и 51.7% EER на жёстких зондах. Точность ранга 1 в закрытом наборе также падает с 99.97% и 98.97% до 19.10%; даже ранг 5 достигает лишь 41.49% для жёстких выборок. Разрывы между расой и цветом расширяются внутри жёсткого подмножества, хотя их порядок меняется между закрытыми и открытыми тестами. Статья явно ограничивает своё утверждение одной семьёй распознавания и отмечает остаточное смещение выбора от лицей, которые детектор так и не локализовал.

Аннотация

Хотя системы распознавания лиц широко распространены, обеспечение их демографической надёжности и надёжности в неконтролируемых визуальных условиях остаётся критической задачей. Чтобы преодолеть этот разрыв, мы представляем UFPR-PE — эталон оценки предвзятости расы с использованием публичных видео избранных бразильских политиков с официальными признаками расы/цвета кожи. Набор данных использует таксономию переписи населения Бразилии, включая категорию parda, которая не имеет прямого аналога в американских или европейских схемах, широко применявшихся в предыдущих тестах. Наш бенчмарк построен на основе сжатого публичного видео и сохраняет сложные выборки для анализа производительности в реалистичных условиях. Мы описываем строительный конвейер, отражаем статистику наборов данных и оцениваем эффективность распознавания лиц в условиях проверки и (закрытой и открытой) идентификации, включая анализ подгрупп по расе/цвету и уровню сложности. Результаты показывают, что производительность распознавания существенно зависит от качества изображения, и что разрывы в подгруппах должны интерпретироваться совместно с визуальными трудностями, а не изолированно. В целом, UFPR-PEs предоставляют воспроизводимую и демографически обоснованную среду для изучения предвзятости распознавания лиц в сложных условиях публичного видео.

Отправная точка исследования

Многие демографические аудиты распознавания лиц используют отобранные статичные изображения и американские или европейские расовые таксономии, назначенные третьими лицами. Эти варианты не отражают категории самопровозглашённой переписи населения Бразилии, особенно парда, и часто убирают сложные сжатые кадры, профильные, закрытые и низкокачественные кадры, которые доминируют в операционных ошибках. Реалистичный аудит требует совместного анализа демографического происхождения и сложности изображения.

Метод

Набор данных связывает публичные видео 5 103 избранных бразильских политиков с официальными избирательными записями и содержит 547 519 изображений зонда с метаданными о расе/цвете, возрасте и гендере. Он сохраняет неконтролируемое сжатие и сложные образцы, анонимизирует случайные лица и стратифицирует зонды на простые, средние и жёсткие подмножества после тщательного человеческого обзора. Предварительно обученный WebFace260M R50 с ArcFace оценивается примерно на 11,5 миллионах пар подлинной и самозванцевой верификации, закрытых наборов кумулятивного сопоставления и протоколах открытого FNIR/FPIR, с результатами, разбитыми по белым, чёрным, парда, жёлтым и коренным группам.

Вывод по статье

Панели справедливости должны стратифицироваться по сложности захвата и использовать локально значимые демографические метки. UFPR-PE предлагает сильный бразильский стресс-тест, но его самое важное открытие — методологическое: пробелы в подгруппах могут быть неправильно истолкованы, если серьёзный дисбаланс качества изображения скрыт внутри одного среднего.