← Назад в Блог
Исследовательский радарСмена лицВизуальное редактированиеarXivСентябрь 2026

Ежемесячный радар arXiv

Исследования замены лиц за сентябрь 2026 года: согласование освещения, внимание к референсу и дубляж в реальном времени

Сентябрь предлагает один метод прямого композитинга лиц и две соседние системы редактирования идентичности. Конвейер гармонизации теней намеренно ограничивает возможности изменений, чтобы плохая оценка не могла перекрасить или осветлить одобренное лицо. Инструменты RefGAP ориентируются на внимание между семью диффузионными редакторами и корректируют его в момент вывода. TBDub адаптирует модель визуального дубляжа к производственным материалам, затем сводит тридцать шагов с шумозаносящего до двух, измеряя идентичность, синхронизацию губ, качество визуального изображения и сквозную пропускную способность.

Что показывает этот месяц

Геометрический гармонизатор применяет только ограниченное, равномерное по каналу поле затемнения; на аналитическом прокси 56,5% пикселей лиц меняются, среднее усиление составляет 0,938, и ни один пиксель не осветлен, хотя статья не утверждает о победе в перцепции реального изображения. RefGAP калибрует два коэффициента один раз, затем улучшает идентичность между семью редакторами изображений и видео на 1040 клипах смены голов и 1000 парах смены лиц; успех замены достигает не менее 86% и 82% соответственно, с измеряемыми компромиссами между позами и сохранением. Двухшаговый ученик TBDub достигает 7,13 FPS при 512 на 512 на H20, что в 13,93 раза больше ускоренного ускорения по сравнению с учителем, а человеческие оценки сохраняют качество идентичности учителя и немного улучшают синхронизацию губ и качество изображения. Для покупателей важное различие — это риск: детерминированные границы, контроли времени вывода и дистиллированная генерация имеют разные режимы отказа и потребности в валидации.

Статья 012026-09-15cs.CV

Геометрическая гармонизация теней для композитных лиц: мультипликативный, сохраняющий альбедо конвейер повторного освещения

Авторы и организации

Vijesh KP

Independent researcher (no institutional affiliation stated in the paper)

Какую задачу решает

Статья нацелена на узкий случай, когда цвет донора и идентичность допустимы, но отсутствуют тени формы. В ней задаётся вопрос, как ввести тени в нос, глазницу, губу и полости из приблизительной геометрии лица без осветления пикселей, изменения хроматичности или синтеза нового лица.

Ключевой результат

На аналитическом поле высоты поверхности с известным светом стандартная настройка изменяет 56,5% пикселей лиц, даёт средний коэффициент усиления 0,938 в целом и 0,890 на модифицированных пикселях, а 3,4% пикселей отправляется на уровень 0,82. Гарантирует отсутствие ярких пикселей и отсутствие математического смещения угла оттенка за пределами шума с плавающей точкой. Эти показатели характеризуют ограниченный оператор, а не перцептивное качество: статья не предоставляет парного реального и композитного бенчмарка или базового сравнения. Она не может добавлять выделения, корректировать уже тёмный донор, убирать противоположный источник света или избегать двойного затенения остаточного донорского затенения.

Аннотация

Конвейеры замены лиц и композитинга лиц обычно создают грань с геометрически точным выравниванием, но фотометрически неправдоподобным: донорное лицо несёт плоское, почти фронтальное студийное освещение, а тело хозяина и фон — направленный свет сцены. Большинство существующих методов ресинтезируют лицо с помощью цветопереноса, нейронного переосвещения или обратного рендеринга, что может привести к изменению идентичности, тона кожи и текстуры. Мы предлагаем консервативную альтернативу: геометрическую инъекцию формы-тени. Конвейер никогда не перекрашивает лицо. Он оценивает поле усиления на пиксель $g\in[g_{\min},1]$ из растризованного 3D-прокси лиц и равномерно умножает его по линейному RGB, чтобы оператор мог только затемнять и не мог сдвигать хроматичность. Плотная сетка ориентира растрируется в буфер глубины, из которой получаются нормали поверхности, член полости и отбрасываются тени. Направление ключевого света оценивается по сигналам со стороны хозяина (тело, фон, ореол волос); сигналы на лице уменьшаются, потому что восстанавливают освещение донора. Величина тени не совпадает с носителем: она задаётся трехпараметрическим переносом $(τ,σ,g_{\min})$. Поле затенения делится на 75-й процентиль по коже, затем фиксируется, масштабируется, зажимается, сглаживается и заново закрепляется внутри пернатой, покрытой кожей маски лица. В аналитическом поле высоты лица по умолчанию $(τ,σ,g_{\min})=(0,90,0.45,0.82)$ изменяет 56,5% пикселей лиц со средним приростом 0,938 (0,890 на модифицированных пикселях) и направляет 3,4% пикселей к полу. Инвариантность оттенков является следствием оператора. Мы анализируем перенос в закрытом виде, аблюируем его параметры и обсуждаем способы отказа монотонной, только затеняющей формулировки, включая двойное затемнение неплоских доноров.

Отправная точка исследования

Поменённое лицо может быть геометрически выровнено и правильно по идентичности, но при этом выглядеть наклеенным, потому что донор несёт плоский студийный свет, а у ведущей сцены есть направленный ключ. Генеративное переосвещение может восстановить больше эффектов, но также может менять оттенок кожи, поры, текстуру или идентичность после того, как лицо уже одобрено. Производственным командам иногда нужен намеренно ограниченный оператор, чьи худшие фотометрические изменения известны.

Метод

Детектор лиц и 468-точечная сетка создают растеризованный буфер глубины, поверхностные нормали, прокси полости и отбрасывающие тени в пространстве экрана в обрезке на 512 пикселей. Сигналы тела со стороны хозяина, фона, шеи и ореола волос голосуют за направление ключевого света, в то время как сигналы лица донора уменьшаются. Нормализованная карта затенения проходит через трёхпараметрический порог, передачу силы и минимального усиления, затем направляемое сглаживание и пернатую маску кожи. Тот же скалярный коэффициент усиления умножается на все линейные RGB-каналы и обрезается в диапазоне от 0,82 до 1,0.

Вывод по статье

Это консервативный контроль после композитинга с понятным ограничением повреждений, а не полная система переосвещения. Это привлекательно, когда сохранение идентичности превосходит драматический реализм, если реальные кадры проверяются на неправильное направление света и двойные тени.

Статья 022026-09-28cs.CV

Mind the RefGAP : коррекция внимания к референсному изображению при диффузионном визуальном редактировании

Авторы и организации

Yanan Wang

Mohamed bin Zayed University of Artificial Intelligence

Institute of Foundation Models

Shengcai Liao

United Arab Emirates University

Guangyi Liu

Mohamed bin Zayed University of Artificial Intelligence

Institute of Foundation Models

Xiaodan Liang

Mohamed bin Zayed University of Artificial Intelligence

Какую задачу решает

RefGAP направлен на улучшение точности идентичности эталона в различных редакторах изображений и видео без дополнительного обучения и без подбора отдельной силы коррекции для каждой модели. Он явно балансирует более интенсивное использование эталона внутри маски редактирования с подавлением в областях, которые должны быть сохранены.

Ключевой результат

На 1,040 клипах HeadSwapBench сходство идентичности улучшается для всех семи универсальных редакторов, а успешность замены достигает не менее 86% там, где это определено; сходство всего лица также увеличивается для всех семи. На 1,000 парах для замены лиц FaceForensics сходство идентичности улучшается для каждого редактора, при этом успешность замены и корректного извлечения составляет не менее 82% и 75% соответственно. Применение к специализированной модели DirectSwap повышает сходство идентичности с 0,7019 до 0,7450, при этом LPIPS всего кадра остается почти неизменным. Прирост сопровождается большей ошибкой ключевых точек для нескольких систем и смешанным сохранением не редактируемых областей; замена фона передается ненадежно. Нефьюзированная реализация внимания также может увеличивать потребление памяти или задержку, поэтому качество интеграции имеет значение.

Аннотация

Редакторы диффузии, ориентированные на ссылки, испытывают трудности с точным воспроизведением пользовательских ссылок. Мы выявляем потенциальное узкое место в диффузионных редакторах: многие методы обеспечивают ограниченное распределение внимания. Например, в LoomVideo запросы в области редактирования присваивают менее 1% массы внимания ссылке на ссылку. Мы вводим RefGAP — коррекцию без обучения, которая определяет величины логит-смещения онлайн на каждом уровне по массе внимания, измеряемой при переходе вперёд. Положительные смещения для референсных логитов усиливают использование ссылки запросами по региону редактирования, а отрицательные смещения для запросов по региону уменьшают изменения, вызванные ссылками, вне редактирования. Два глобальных коэффициента управляют исправлением; они выбираются один раз на данных валидации из четырёх редакторов диффузии и сохраняются фиксированными. В семи редакторах изображений и видео на основе диффузии RefGAP улучшает точность идентификации при смене голов и лиц. RefGAP достигает компромисса между сохранением точности и сохранением, сопоставимым с отдельно настроенными постоянными смещениями на стороне редактирования, без размахов силы по подходу. Дополнительные эксперименты с виртуальной примеркой и заменой фона оценивают перенос за пределами редактирования идентичности.

Отправная точка исследования

Редакторы диффузии с использованием эталона могут получать правильное исходное лицо, но практически не уделять ему внимания; запросы редактируемых областей LoomVideo распределяют менее 1% массы внимания на эталон по измерениям авторов. Фиксированное усиление внимания может укрепить идентичность, но требует настройки для каждой модели и может привести к переносу внешности эталона на волосы, одежду, фон, позу или выражение, которые должны оставаться неизменными.

Метод

На каждом слое внимания RefGAP измеряет долю внимания, выделяемого токенам эталона, отдельно для запросов редактирования и сохранения. Он вычисляет онлайн-смещение логитов на основе наблюдаемой массы: положительные смещения усиливают ключи эталона в области редактирования, а отрицательные ограничивают их в сохраняемой области. Два глобальных коэффициента и правило выбора слоя калибруются один раз на 40 клипах HeadSwap с использованием четырех редакторов для разработки, затем фиксируются для семи редакторов, трех отложенных систем, замены лиц, виртуальной примерки и замены фона.

Вывод по статье

Измерение фактического внимания к эталону является полезным сигналом управления, независимым от модели, для редактирования идентичности, но более сильная передача идентичности может изменить геометрию и сохраняемые области. Командам нужен специфический для задачи контроль качества, а не только сходство идентичности.

Статья 032026-09-05cs.CV

TBDub: Визуальный дубляж, ориентированный на производство

Авторы и организации

Bihan Li

TaoLive AIGC, Taobao & Tmall Group, Alibaba

Xinyang Li

TaoLive AIGC, Taobao & Tmall Group, Alibaba

Zeran Xu

TaoLive AIGC, Taobao & Tmall Group, Alibaba

Meiguang Jin

TaoLive AIGC, Taobao & Tmall Group, Alibaba

Junfeng Ma

TaoLive AIGC, Taobao & Tmall Group, Alibaba

Какую задачу решает

TBDub адаптирует существующий стек озвучивания по диффузии видео к производственным материалам и спрашивает, может ли ученик двухшагового режима сохранить воспринимаемую идентичность учителя, синхронизацию и качество визуального вида. Он оценивает реконструкцию, аудиоотклик, человеческие оценки и полный путь генерации от VAE к VAE, а не только по скорости дешумера.

Ключевой результат

В 38 клипах TalkVid учитель улучшает все восемь зарегистрированных показателей реконструкции, восприятия, идентичности и синхронизации по сравнению с X-Dub. В 114 оценках на метод значения MOS по синхронизации губ, идентичности и визуального качества X-Dub — 3,57, 2,83 и 2,88 — повышаются до 3,71, 3,78 и 3,78 у учителя. Ученик получает 3,85, 3,72 и 3,80, сохраняя идентичность близко, при этом лидируя в синхронизации губ и визуальном качестве. При 512 на 512 на одном H20 ученик достигает 7,13 эффективного FPS против 0,51 у учителя, что составляет 13,93-кратное ускорение от начала до конца; один этап DiT в 42,49 раза быстрее. Бенчмарк небольшой, исключает несколько этапов предварительной обработки и кодирования, а входы с очень низким разрешением остаются неудачными.

Аннотация

Визуальный дубляж должен синхронизировать движение рта с заменяющей речью, сохраняя идентичность, внешний вид и временную согласованность. Хотя X-Dub обеспечивает сильную базовую базу для видеомонтажа без масок, его применение для прямых трансляций и генерируемого видеоконтента выявляет ограничения в устойчивости производственной области, стабильности времени и движения, сохранении идентичности и устной детализации, а также эффективности вывода. Мы представляем \textbf{TBDub} — ориентированное на производство расширение X-Dub, которое сочетает адаптивное к задаче посттренинг с осознанной задачей и несколькошаговой дистилляцией. Посттренинг адаптирует видео DiT, используя производственные данные, специфичную для производства обусловлению и фильтрацию, а также улучшенные аудиофункции для получения 30-шагового Учителя. Дистилляция адаптирует DMD/DMD2 к условному видеомонтажу и сжимает Учителя в двухшагового Ученика. В 38 клипах TalkVid Учитель улучшает все восемь зарегистрированных метрик реконструкции, восприятия, идентичности и синхронизации по сравнению с X-Dub. В оценке MOS он улучшает согласованность синхронизации губ, идентичности и качество изображения по сравнению с X-Dub на 0,14, 0,95 и 0,90 пункта, при этом Ученик достигает самых высоких баллов по синхронизации губ и визуального качества и остаётся близко к Учителю по согласованности идентичности. При парном сквозном тайминге генерации от первого кодирования VAE до финального декодирования VAE на одной видеокарте NVIDIA H20 по $512\x512$ Ученик достигает эффективного FPS 7,13 и снижает общую задержку на $13,93\умноженно $; один этап DiT ускоряется на $42,49\умножено $. Ученик в основном сохраняет качество генерации и аудиовизуальную синхронизацию Учителя. Код доступен на GitHub по адресу \https://github.com/TaoLiveAIGC/TBDub, а 30-ступенчатые и двухшаговые весы для учеников доступны на Hugging Face по адресу https://huggingface.co/TaoLiveAIGC/TBDub.

Отправная точка исследования

Визуальный дубляж должен менять движение рта настолько, чтобы выразить заменяющую речь, сохраняя при этом стабильной идентичность, зубы, текстуру губ, позу, освещение, окклюзию и все неречевые области. X-Dub предоставляет функциональный видеоредактор без масок, но потоки в прямом эфире и сгенерированные видео выявляют смещение домена, мерцание, смещение устной детализации и задержку тридцати шагов снятия шума.

Метод

Адаптивное к задаче посттренинг смешивает данные производственной области с наследственным распределением обучения, усиливает аудиофункции с помощью слоёв HuBERT, асимметрично ухудшает условия и использует перепадение движения плюс пространственное и временное согласование потока для создания 30-шагового учителя. Условная процедура DMD/DMD2 превращает этого учителя в дифференцируемого двухшагового ученика с помощью динамического обучения по фальшивому результату, поэтапному регионально-селективному надзору, каузальной первой латентной обработке, выборке полного шага, арифметики руководства FP32 и весам FP32 EMA.

Вывод по статье

Двухступенчатый визуальный дубляж может обеспечить гораздо более высокий показатель качества и пропускной способности, но заявленный FPS 7,13 ограничен ядром поколения. Производственный размер должен включать аудио, трекинг лиц, композитинг, кодирование и стабильность длительного видео.