← Назад в Блог
Исследовательский радарЗамена лицГоворящие лицаarXivИюль 2026 г.

Ежемесячный радар arXiv

Документы по замене лиц, июль 2026 г.: якоря идентификации, конфиденциальность пешеходов и реагирующие на действия пользователя говорящие лица.

Работа по синтезу лиц, проделанная в июле, охватывает три различных применения переноса идентичности. В одной статье предлагается адаптивное размещение опорных точек для поддержания стабильности замененной идентичности на протяжении длинного видео, в другой используется замена как деидентификация с сохранением поведенческих признаков, а в третьей масштабируется задача создания синтетических диалогов, выходящих за рамки одной говорящей головы и реагирующих друг на друга.

Что показывает этот месяц

Адаптивное привязывание идентичности рассматривает размещение ключевых кадров как проблему обратной связи и примечательно тем, что предлагает проверяемые тесты, хотя результаты этих экспериментов пока не приводятся. Конвейер обеспечения конфиденциальности пешеходов представляет собой небольшое эмпирическое исследование того, что сохраняет обмен и где полный перенос головы терпит неудачу, особенно в случае окклюзии и завуалирования. CHAT демонстрирует масштаб и сложность генерации двух реагирующих идентичностей с помощью речи, реакций слушателя и структуры реплик, а также признает, что его оценка пока не измеряет семантику на уровне диалога. Три статьи вместе показывают, почему сходство идентичностей само по себе не является адекватным показателем качества для синтеза лиц.

Статья 012026-07-23cs.CV

Адаптивное закрепление идентичности: размещение ключевых кадров с замкнутым циклом для синтетического парного обучения при замене лиц в видео.

Авторы и организации

Logan Robbins

Independent researcher

Какую задачу решает

В статье основное внимание уделяется фабрике данных, лежащей в основе модели обмена, а не добавлению еще одной архитектуры для учащихся. В ней рассматривается вопрос о том, сколько идентификационных якорей необходимо синтетической паре, где их следует размещать и как следует фильтровать клипы, которые не могут поддерживать идентификацию, прежде чем они станут обучающими.

Ключевой результат

Это исследовательское предложение, а не завершенный эмпирический результат. В нем указаны кривые зависимости дрейфа от зазора между опорными точками, равномерное и адаптивное размещение при одинаковых бюджетах, последующее обучение студентов, удаление текстур и исследование «фильтра красоты человека» в качестве проверяемых тестов, но пока не сообщается о каких-либо измеренных улучшениях в отношении идентичности, времени, спектра или результатов пользовательского исследования.

Аннотация

Замена лиц в видео не имеет естественного парного контроля: не существует реальных видеозаписей, на которых лицо одного человека воспроизводит видео другого человека. Самое эффективное из существующих решений, SyncID-Pipe от DreamID-V, создает пары, заменяя идентификатор ровно в двух кадрах реального клипа — первом и последнем — и восстанавливая остальное только из последовательности поз. Поза не содержит никаких внешних признаков замененного идентификатора, поэтому на протяжении длинных клипов, при частичном перекрытии и экстремальных изменениях позы синтезированный идентификатор имеет большой нефиксированный диапазон, в пределах которого он может изменяться; ни в одном опубликованном исследовании не рассматривается количество или расположение якорей. Мы предлагаем адаптивное закрепление идентификаторов (AIA): (i) обобщить синтезатор на произвольные наборы якорей, что архитектурно естественно для трансформеров с диффузионным принуждением, где обусловливание кадра заключается в фиксации его токенов на нулевом уровне шума; (ii) размещать якоря с помощью замкнутого контура обратной связи, который оценивает каждый сгенерированный кадр по отношению к реальному эталонному изображению и вставляет якорь с изображением, в котором лицо заменено, в кадр с наихудшей оценкой, пока пара не превысит пороговое значение или не исчерпает бюджет; (iii) повторно использовать вердикт контура в качестве автоматического фильтра данных. Вторая патология, эффект «фильтра красоты» в виде чрезмерно сглаженной кожи, имеет ту же первопричину: микротекстура, как и идентичность, не учитывается ни одной из целей конвейера обработки. Поэтому мы объединяем AIA с восстановлением текстуры, привязанной к реальности: согласованное перезернистое изменение из областей, не относящихся к лицу, каждого реального кадра, разделение полос для переноса микротекстуры суб-идентичности из реального видеоматериала и второй, спектральный канал приема, определяемый собственным спектром видеоматериала. Мы утверждаем, что плотность опорных точек является контролируемым параметром качества, и приводим примеры экспериментов, которые можно опровергнуть — кривые зависимости дрейфа от зазора, равномерное и адаптивное размещение при одинаковых бюджетах, обучение студентов на данных, созданных AIA, и анализ текстур с помощью исследования «фильтра красоты человека», — которые могли бы подтвердить или опровергнуть это предположение.

Отправная точка исследования

В видеомонтаже с заменой лиц отсутствует естественная эталонная информация: целевой персонаж фактически никогда не участвовал в съемках исходного видео. Существующие методы синтетического контроля могут привязываться только к граничным кадрам, оставляя большие интервалы, движение профиля и частичное перекрытие без прямых доказательств внешнего вида и позволяя личности или текстуре кожи изменяться.

Метод

Адаптивное привязывание идентичности обобщает видеосинтезатор с диффузионным принуждением на произвольные кадры с заданными параметрами. Замкнутый цикл оценивает каждый сгенерированный кадр по отношению к реальной целевой идентичности, вставляет якорь с заменой изображения в худший кадр и повторяет процесс до достижения порогового значения или бюджета якорей. Восстановление текстур с привязкой к реальности отдельно переносит неидентичную микротекстуру и зернистость из реального видеоматериала и добавляет спектральный тест на приемлемость для уменьшения чрезмерного сглаживания кожи.

Вывод по статье

AIA полезен в качестве контрольного списка для команд, создающих синтетические парные видеоданные: отслеживание идентичности каждого кадра, размещение опорных точек там, где дрейф наиболее выражен, отбрасывание несовпадающих клипов и отдельная оценка текстуры. Его ценность в настоящее время носит методологический характер; прежде чем выбрать его вместо существующего конвейера обработки данных, по-прежнему необходимы данные о реализации и результатах сравнительных тестов.

Статья 022026-07-09cs.CV

Замена лиц, сохранение характеристик: многоцелевой механизм обеспечения конфиденциальности пешеходов в интеллектуальных транспортных системах.

Авторы и организации

Roba H. Farouk

C-DRiVeS Lab: Cognitive Driving Research in Vehicular Systems, Cairo, Egypt

Computer Science and Engineering Department, Faculty of Media Engineering and Technology, German University in Cairo, Egypt

Catherine M. Elias

C-DRiVeS Lab: Cognitive Driving Research in Vehicular Systems, Cairo, Egypt

Computer Science and Engineering Department, Faculty of Media Engineering and Technology, German University in Cairo, Egypt

Какую задачу решает

В данной работе рассматривается практичный алгоритм деидентификации для набора данных Egy-DRiVeS, который заменяет идентификационные данные, сохраняя при этом позу, выражение лица, взгляд и достаточное качество изображения для последующего обучения. Также анализируются случаи ошибок, характерные для пешеходов, находящихся на расстоянии, частично скрытых или завуалированных, а не только для портретных снимков крупным планом.

Ключевой результат

На изображениях крупным планом Roop демонстрирует меньшую разницу в форме блендшейпа (1,898 против 2,0478) и разницу в ориентирах (0,00596 против 0,00710), в то время как Ghost-v2 показывает меньшее сходство идентичности (0,1393 против 0,1997), что указывает на более сильное маскирование по этому показателю. Оба алгоритма хорошо сохраняют взгляд, примерно на уровне 0,94 косинусного сходства. Roop выигрывает по трем из четырех количественных показателей и более устойчив к низкокачественным или частично скрытым лицам на улице, в то время как Ghost-v2 может некорректно заменять вуали исходными волосами.

Аннотация

Для обучения моделей искусственного интеллекта, способных принимать решения в реальном времени для автономных транспортных средств (АТС), необходимы крупномасштабные и разнообразные наборы данных. Прогнозирование намерений и траектории движения пешеходов является критически важным для моделей, используемых в АТС, и требует наборов данных, содержащих разнообразные изображения пешеходов. Неограниченный доступ к этим наборам данных создает серьезные риски для безопасности, такие как кража личных данных и отслеживание пешеходов. Задача состоит в применении процедур сохранения конфиденциальности при сохранении атрибутов изображения, необходимых для обучения моделей. Существующие методы обеспечения конфиденциальности могут сохранять конфиденциальность пешеходов, но ухудшают удобство использования изображений, что снижает эффективность моделей. В данной работе основное внимание уделяется реализации пятиэтапного конвейера для защиты конфиденциальности пешеходов путем замены лиц при сохранении основных атрибутов лица. Он должен быть адаптирован для удовлетворения потребностей в обеспечении конфиденциальности набора данных Egy-DRiVeS. Кроме того, оцениваются модели замены лиц Roop и Ghost-v2. Доказано, что Roop превосходит Ghost-v2 по ряду параметров, что будет обсуждаться далее. Следовательно, Roop — это модель замены лиц, которая будет использоваться в процессе обработки данных для достижения баланса между конфиденциальностью пешеходов за счет сокрытия личности и удобством использования данных за счет сохранения атрибутов лица.

Отправная точка исследования

Для построения моделей намерений или траектории движения пешеходов необходимы данные о лицах и поведении тела, однако изображения без ограничений могут обеспечить идентификацию и отслеживание. Размытие защищает личность за счет потери информации о взгляде, выражении лица и других признаках, которые могут потребоваться в дальнейших исследованиях в области автономного вождения.

Метод

Пятиэтапный конвейер обработки данных обнаруживает пешеходов с помощью YOLOv11, локализует лица с помощью SCRFD, при необходимости улучшает фрагменты изображения с низким разрешением с помощью CodeFormer, меняет местами идентификаторы и смешивает результат с изображением улицы. Roop и Ghost-v2 сравниваются визуально, а также по разнице форм смешивания, разнице ориентиров, сходству исходных и замененных идентификаторов и сходству векторов взгляда.

Вывод по статье

Замена лиц может сохранить больше поведенческой полезности, чем размытие, но конфиденциальность и полезность движутся в разных направлениях в зависимости от метрик. При внедрении следует тщательно выбирать исходные идентификаторы, тестировать крайние случаи, связанные с демографическими данными и одеждой, и измерять, продолжают ли работать последующие модели пешеходов; в данной статье пока не приводится оценка последующей полезности или повторной идентификации.

Статья 032026-07-02cs.CV

Генерация аудиовизуального диалога между людьми в процессе разговора

Авторы и организации

Junhao Song

Department of Computing, Imperial College London, United Kingdom

Lluis Guasch

Department of Earth Science and Engineering, Imperial College London, United Kingdom

Xilin He

Mohamed bin Zayed University of Artificial Intelligence, United Arab Emirates

Zhongyu Yang

Department of Computer Science, Heriot-Watt University, United Kingdom

Yingfang Yuan

School of Computer Science, Northumbria University, United Kingdom

Weicheng Xie

College of Computer Science and Software Engineering, Shenzhen University, China

Linlin Shen

School of Artificial Intelligence, Shenzhen University, China

Guangdong Provincial Key Laboratory of Intelligent Information Processing, Shenzhen University, China

Haijun Lin

School of Engineering and Design, Hunan Normal University, China

Shizhe Liu

Department of Computer Science, University of Oxford, United Kingdom

Wei Pang

Department of Computer Science, Heriot-Watt University, United Kingdom

Siyang Song

Department of Computer Science, University of Exeter, United Kingdom

Какую задачу решает

CHAT определяет генерацию диадического интерактивного аудиовизуального диалога как единую задачу: создать два согласованных по идентичности, вербально и невербально реагирующих клипа на основе текстовой подсказки без необходимости предварительной записи видео или аудио. Он также проверяет, могут ли сгенерированные данные предварительно обучить отдельные модели генерации реакций.

Ключевой результат

CHAT демонстрирует лучшие показатели FID (17,33), уверенности синхронизации губ (6,89), корреляции реакций (50,02 x 1e-2) и сходства идентичности (0,85) среди сравниваемых систем, занимая второе место по FVD и LPIPS. Пользователи оценивают его на 4,6/5 за визуальное качество и синхронизацию и на 4,8/5 за звук и интерактивность. Предварительное обучение CHAT-AVD-50k повышает корреляцию реакций PerFRDiff с 37,21 до 40,11 и ReactDiff с 24,19 до 26,12 на REACT 2024.

Аннотация

Крупномасштабные наборы данных для диадического интерактивного аудиовизуального диалога (DIAD) предоставляют фундаментальные ресурсы данных для разработки человекоподобных интерактивных виртуальных агентов и цифровых людей. Однако сбор таких данных трудоемок, дорог и этически некорректен. Для решения этой проблемы мы предлагаем CHAT, новую структуру для генерации диадического интерактивного аудиовизуального диалога (DIADG), которая генерирует разнообразные, парные и взаимодействующие фрагменты диалога «речь-лицо» из одного текстового запроса. CHAT объединяет большие языковые модели и модели говорящих лиц с интерактивными аудиомодулями и модулями уточнения мимического поведения, что позволяет генерировать согласованные диадические фрагменты диалога с разнообразным содержанием и мимическими особенностями. Эксперименты показывают, что CHAT превосходит существующие аналогичные методы, разработанные для схожих задач, как по объективным, так и по субъективным оценкам. Более того, наш синтезированный набор данных CHAT-AVD-50k служит эффективными данными для предварительного обучения при последующей генерации интерактивных моделей поведения, что позволяет стабильно улучшать показатели PerFRDiff и ReactDiff на REACT 2024. CHAT предлагает масштабируемую альтернативу дорогостоящему и этически некорректному сбору данных о реальном диадическом взаимодействии.

Отправная точка исследования

Для обучения интерактивных цифровых людей необходимы парные речи, движения лица, реакции на слух и поочередное взаимодействие двух человек. Запись больших, разнообразных наборов данных, полученных от двух человек, является дорогостоящим и этически некорректным процессом, в то время как большинство систем «говорящей головы» анимируют одного говорящего изолированно и не моделируют реакцию лица другого человека.

Метод

Данная платформа объединяет языковые модели для диалога и планирования аудио с синтезом говорящих лиц, генерацией поведения в тишине, уточнением реакций и временной согласованностью. Она создает набор данных CHAT-AVD-50k, содержащий 50 000 примеров. Оценка охватывает 1000 сгенерированных диалогов с использованием FID/FVD, синхронизации губ, корреляции и разнообразия реакций, сходства идентичностей ArcFace, LPIPS, исследование с участием 60 человек, а также последующее предварительное обучение для PerFRDiff и ReactDiff.

Вывод по статье

CHAT актуален для масштабируемых данных о цифровых людях и синтеза парных взаимодействий, а не для традиционного обмена лицами. Его метрики оценивают визуальное качество, идентификацию и реакцию, но временные параметры диалога и семантическая уместность остаются открытыми, а последующее тестирование не является полностью независимым, поскольку компонент CHAT сам был предварительно обучен на REACT 2024.