← Назад в Блог
Исследовательский радарЗамена лицГоворящее лицоarXivАвгуст 2026 г.

Ежемесячный радар arXiv

Статьи о замене лиц за август 2026 года: портреты в реальном времени, минутные аватары и управление эмоциями

Обмен лиц и цифрово-человеческие исследования Августа — это не столько один трюк с передачей личности, сколько устойчивое, контролируемое взаимодействие. Выбранные системы отделяют многократное движение от внешнего вида, превращают офлайн-аудио-видео в миниатюрный стример и сочетают семантику скрытых эмоций с явной геометрией смешива.

Что показывает этот месяц

Proxy Avatar Meets Low-Ranking Cacheing достигает 32 FPS на RTX 4090, отделяя повторно используемого эмоционального исполнителя от однократного ретаргетирования идентичности и кэширования статического внешнего вида. Omni-LiveAvatar работает с точки зрения дата-центра, используя авторегрессивную дистилляцию и ограниченную длинно-короткую память для поддержания согласованности совместного аудио и видео в течение целой минуты. GemTalk сосредоточен на интерфейсе управления, позволяя явной геометрии blendshape масштабировать силу неявных эмоциональных особенностей. Вместе они отображают три различных варианта продуктов: персонализированное повторное использование движения, непрерывную потоковую инфраструктуру и тонко продуманную выразительную режиссуру.

Статья 012026-08-03cs.CV

Proxy Avatar встречается с низкоранговым кэшированием: портретная анимация в реальном времени с управлением эмоций в режиме one-shot

Авторы и организации

Haijie Yang

Nanjing University of Science and Technology, China

Jindi Bao

Nanjing University of Science and Technology, China

Yixuan Dong

Tsientang Institute for Advanced Study, China

Hongliang Zhang

Nanjing University of Science and Technology, China

Jian Bi

Nanjing University of Science and Technology, China

Hao Tang

Peking University, China

Zhenyu Zhang

Nanjing University, China

Jianjun Qian

Nanjing University of Science and Technology, China

Jian Yang

Nanjing University of Science and Technology, China

Какую задачу решает

Статья разделяет повторно используемое эмоциональное движение, перетаргетинг кросс-идентичности и рендеринг внешнего вида, чтобы один референс-портрет мог быть анимирован в реальном времени от аудио и эмоциональной метки. Он специально удаляет повторные вычисления референс-признаков без переобучения кэша для каждой целевой идентичности.

Ключевой результат

На RTX 4090 полная система работает на 32 FPS. При самореконструкции она достигает 31,24 PSNR, 0,018 LPIPS, 0,883 SSIM и 6,314 балла синхронизации губ, что лидирует в большинстве показателей качества и движения, несмотря на более высокую частоту кадров EmoTag. При кросс-идентификационном вождении он фиксирует 29,64 FID, 0,745 сходства идентичности, 75,4% точности эмоций и 6,096 синхронизации губ. Участники предпочитали его за эмоциональную выразительность в 70% сравнений, синхронизацию губ в 60% и визуальный реализм в 65%; длинные клипы не показывали явной идентичности или дрейфа синхронизации.

Аннотация

Аудио-ориентированная портретная анимация быстро развивается с помощью генеративных моделей на основе диффузии, однако генерация однокадровых кадров в реальном времени с помощью выразительного контроля эмоций остаётся сложной. Существующие методы часто страдают от недостатка эмоционально-осознанных априоров движения и дорогостоящих вычислений внешности при многоступенчатом снятии шума. Чтобы решить эти проблемы, мы предлагаем Proxy Avatar Meets Low-Rank Caching — каскадную структуру для однократной анимации с управлением эмоций в реальном времени. Вместо прямой генерации портрета цели из аудио наш метод использует гауссовский прокси-аватар в качестве многократного генератора движения, который обучается один раз на одной идентичности для создания выразительных драйверных видео с аудио- и эмоциональных меток. Поскольку прокси-аватар предоставляет только движение, а не внешний вид цели или геометрию, крупномасштабная одноразовая модель ретаргетирования дополнительно извлекает идентично-независимое движение из производительности прокси и адаптирует его к произвольным портретам целей. Для повышения эффективности вывода мы вводим повторное использование внешнего вида с нулевой выстрелом с низкоранговым кэшированием, которое кэширует эталонные признаки на начальном этапе снятия шума и моделирует последующие вариации с помощью лёгких низкоранговых адаптеров. Обширные эксперименты показывают, что наш метод достигает более сильной эмоциональной выразительности, лучшей анимации для сохранения идентичности и существенно снижает стоимость вывода, позволяя реализовывать портретную анимацию в реальном времени.

Отправная точка исследования

Монокадровые говорящие портреты должны сохранять внешний вид невидимого персонажа, следовать за речью, выражать запрошенную эмоцию и работать интерактивно на доступном оборудовании. Диффузионные системы неоднократно пересчитывают почти статичные внешние черты при снятии шума, а эмоциональные элементы часто переплетают идентичность и движение или требуют референсного видео для каждого стиля. В результате получается либо выразительная, но медленная генерация, либо быстрая анимация с слабым эмоциональным диапазоном.

Метод

Прокси-аватар на основе гаусса обучается один раз на одном исполнителе и служит только генератором движения с обусловленными аудио и эмоциями. Крупномасштабная сеть однокадрового ретаргетирования извлекает движение, независимое от идентичности, из этого прокси-видео и применяет его к произвольным портретам целей. Во время диффузии с несколькими шагами кэши повторного использования появления с нулевой кадром ссылаются на особенности на первом этапе, тогда как лёгкие низкоранговые адаптеры моделируют только их более поздние варианты. Это каскадное разделение обязанностей оценивается в самореконструкции, кросс-идентичности в одноразовом вождении, стабильности длинного видео, абляциях и слепом исследовании с двадцатью участниками.

Вывод по статье

Дизайн многократного прокси плюс ретаргетинг делает эмоциональные аватары в реальном времени практичными без обучения диффузии на каждого пользователя. Сообщаемые 32 FPS на потребительском RTX 4090 выглядят многообещающе, но размер развертывания должен включать одноразовое обучение прокси и компромисс между качеством и затратами при большой модели ретаргетинга, а не только стабильной частотой кадров.

Статья 022026-08-07cs.MM

Omni-LiveAvatar: Совместная генерация аудио-видео аватаров на уровне минуты в реальном времени

Авторы и организации

Lunjie Zhu

iComAI Lab, Hong Kong University of Science and Technology, Hong Kong

Vivix Group Limited, Hong Kong

Xingtong Ge

iComAI Lab, Hong Kong University of Science and Technology, Hong Kong

Vivix Group Limited, Hong Kong

Fangyu Lin

iComAI Lab, Hong Kong University of Science and Technology, Hong Kong

Vivix Group Limited, Hong Kong

Yi Zhang

Vivix Group Limited, Hong Kong

Zhening Liu

iComAI Lab, Hong Kong University of Science and Technology, Hong Kong

Mengfei Li

iComAI Lab, Hong Kong University of Science and Technology, Hong Kong

Vivix Group Limited, Hong Kong

Yumeng Zhang

iComAI Lab, Hong Kong University of Science and Technology, Hong Kong

Guanglu Song

Vivix Group Limited, Hong Kong

Yu Liu

Vivix Group Limited, Hong Kong

Jun Zhang

iComAI Lab, Hong Kong University of Science and Technology, Hong Kong

Какую задачу решает

Omni-LiveAvatar преобразует крупный совместный аудио-видео преподаватель в генератор причинно-следственной потоковой передачи и решает отдельные проблемы стабильности длинного контекста и изменяющихся подсказок. Его цель — непрерывная генерация в минутном масштабе, а не последовательность независимо сгенерированных коротких клипов.

Ключевой результат

Для пятисекундных клипов модель генерирует 19,57 FPS, что примерно в 33 раза быстрее, чем у учителя с 0,60 FPS, при этом показывает самый высокий общий балл качества среди протестированных систем (81,72) и идеальные показатели качества человеческой идентичности и одежды. На шестидесят втором поколении она достигает 21,99 FPS против 16,18 для следующего по скорости базового значения. Её минутный показатель человеческой идентичности — 98,61 против 67,60 и 50,19, Sync-C — 6,76 против 0,72 и 0,28, а выравнивание текста и видео — 9,82 против 6,68 и 5,46, с заметно уменьшенным дрейфом аватара и фона.

Аннотация

Совместные генеративные модели аудио-видео служат основой для иммерсивной и интерактивной цифрово-человеческой генерации. Тем не менее, большинство существующих моделей опираются на двунаправленное внимание и многоступенчатое снятие шума и могут генерировать только короткие клипы, что делает их непригодными для взаимодействия в реальном времени на длительном времени. Мы представляем Omni-LiveAvatar — первую фреймворк для совместной генерации аудио-видео в реальном времени на уровне минуты в реальном времени. В частности, мы предлагаем (1) прогрессивный авторегрессионный конвейер дистилляции, который переносит большую двунаправленную совместную модель диффузии аудио-видео в несколькоступенчатый авторегрессионный генератор без вспомогательных механизмов стабилизации; (2) синхронизированную аудио-видео долгосрочную кратковременную память, которая сохраняет глобальную согласованность при ограниченном бюджете памяти; и (3) иерархическую стратегию планирования подсказок, обеспечивающую согласованную семантическую эволюцию и бесшовные переходы подсказок. Обширные эксперименты показывают, что Omni-LiveAvatar генерирует высококачественные синхронизированные аватары на минутном уровне в реальном времени. По скорости он достигает 33$ по ускорению генерации по сравнению с учителем LTX-2 на одной видеокарте NVIDIA H200; по качеству генерации он превосходит ускоренные базовые показатели по визуальному качеству, звуку, кросс-модальной синхронизации и человеческой точности. Наш код доступен в https://github.com/Aoko955/Omni-LiveAvatar.

Отправная точка исследования

Совместные аудио-видеогенераторы могут синтезировать убедительные короткие клипы, но двустороннее внимание и многоступенчатая диффузия препятствуют живому взаимодействию, в то время как ускоренные авторегрессивные варианты изменяют идентичность, фон, качество звука или синхронизацию губ на протяжении долгих сессий. Полезный цифровой человек должен сохранять оба режима в течение нескольких минут в ограниченной памяти и принимать меняющиеся подсказки без резких семантических или акустических переходов.

Метод

Трёхступенчатый прогрессивный авторегрессионный конвейер передаёт LTX-2 в четырёхступенчатый генератор причинно-следственных факторов без внешних моделей вознаграждения и стабилизации по модальности. Синхронизированная аудио-видео с долговременной краткосрочной памятью сочетает периодически перезаново закрепляемый первый макроблок с кэшами ключевых значений, сохраняя глобальную идентичность и недавний контекст в рамках фиксированного бюджета. Иерархическое планирование скользящих подсказок разделяет инструкции постоянного внешнего вида/фона от локальных действий на уровне блоков, поэтому запросы продвигаются вместе с скользящим окном. Оценка охватывает как пятисекундный, так и шестидесят-секундный выход на 512 на 768 на одном NVIDIA H200.

Вывод по статье

В статье стабильность аудио и видео на долгосрочной горизонте — это первоклассная задача систем, а не второстепенная задача. Это сильная эталонная архитектура для живых цифровых людей, но заявление в реальном времени измеряется на H200 в 512 на 768, поэтому покупатели должны воспроизводить задержку, память и параллелизм на собственном оборудовании.

Статья 032026-08-01cs.CV

Геометрическая модуляция эмоций для управляемой и фотореалистичной генерации эмоциональных говорящих лиц

Авторы и организации

Chenggong Hu

School of Software Technology, Zhejiang University, Ningbo, China

Shaoyin Ma

School of Software Technology, Zhejiang University, Ningbo, China

Yi Wang

College of Computer Science and Technology, Zhejiang University, Hangzhou, China

Li Sun

Ningbo Global Innovation Center, Zhejiang University, Ningbo, China

Mingli Song

College of Computer Science and Technology, Zhejiang University, Hangzhou, China

Jie Song

School of Software Technology, Zhejiang University, Ningbo, China

Какую задачу решает

GemTalk связывает аудио-полученную эмоциональную семантику с геометрией лица, осознанной идентичностью, и использует эту геометрию для контроля силы скрытых признаков выражения. Это делает категорию и интенсивность эмоций непрерывно редактируемыми, сохраняя при этом фотореализм и синхронизацию губ.

Ключевой результат

В комбинированном эмоциональном тесте MEAD-фронт и RAVDESS-речи GemTalk достигает 334,937 FVD, 31,625 FID, 7,027 Sync-C, 8,283 Sync-D, 2,392 FID экспрессии и 59,258% точности эмоций. Он улучшает точность эмоций на 3,33 процентных пункта по сравнению с следующим лучшим методом и снижает FVD на 20,84. На нейтральном HDTF сохраняется сильная синхронизация и лучший зарегистрированный FID экспрессии 1,386, а редактирование коэффициентов обеспечивает плавные переходы эмоций от слабого к сильному без очевидной потери идентичности.

Аннотация

Генерация эмоциональных говорящих лиц на основе аудио направлена на синтез реалистичных видео с выразительной динамикой лица. Однако существующие методы испытывают трудности с балансом между управляемостью и визуальной точностью. Хотя неявные представления отражают богатую семантику, им не хватает структурного руководства, что часто приводит к усредненным эмоциональным выражениям. В отличие от этого, явные геометрические методы обеспечивают лучший контроль над мимикой, но склонны жертвовать высокочастотными деталями текстур. Для решения этой проблемы мы предлагаем GemTalk — фреймворк на основе диффузии, который сочетает семантическое богатство неявных представлений с структурной точностью явных геометрических априоров. Мы вводим модуль Vision-guided Audio Emotion Projection (V-AEP) для извлечения неявных эмоциональных признаков губ и выражения. В то же время генератор геометрических приоров на основе диффузии (D-GPG) генерирует коэффициенты blendshape, осознанные идентичностью, как явные структурные априоры. Ключевым является то, что наш модуль модуляции эмоций, управляемых геометрией (GEM), использует эти геометрические априоры для перенастройки величины неявных признаков, обеспечивая точный и непрерывный контроль над эмоциональными выражениями, особенно интенсивностью эмоций, без ущерба для визуального качества. Обширные эксперименты показывают, что GemTalk достигает превосходных результатов в фотореализме и эмоциональной динамике лица.

Отправная точка исследования

Неявные диффузионные признаки обеспечивают богатую текстуру лица, но склонны к усреднению эмоциональных выражений и плохом контроле интенсивности. Явные ориентиры или blendshapes обеспечивают интерпретируемую структуру, однако системы, управляемые только геометрией, часто теряют высокочастотный вид и могут создавать рот или верхнюю часть лица, конфликтующие со звуком. Эмоциональная анимация требует как семантического насыщения, так и контролируемого физического движения без утечки выражения, уже присутствующего в референсном портрете.

Метод

Обучение начинается с эмоционально-нейтрального опоры для синхронизации губ на широком неэмоциональном видео. Проекция аудиоэмоций, управляемая зрением, изучает отдельные, но скоординированные пространства эмоций губ и верхней части лица, используя визуальные эмоциональные представления для контроля аудиофункций. Генератор геометрических приоров на основе диффузии предсказывает коэффициенты формы слияния Apple ARKit. Модуляция эмоций, управляемая геометрией, затем сохраняет латентное направление признака, представляющее категорию эмоций, при этом перекалибровывает её величину по blendshapes; сэмплирование с учётом конфликта связывает референсные изображения и аудио с разными эмоциями, чтобы модель не могла скопировать исходное выражение.

Вывод по статье

Сочетание латентной семантики эмоций с явной величиной blendshape предоставляет полезную поверхность управления для творческих инструментов и цифрово-человеческих API. GemTalk наиболее сильен, когда важна непрерывная эмоциональная интенсивность, хотя командам стоит проверить, охватывают ли его эмоциональные метки и предположения коэффициентов ARKit их языки, стили речи и целевые риги.