Proxy Avatar встречается с низкоранговым кэшированием: портретная анимация в реальном времени с управлением эмоций в режиме one-shot
Авторы и организации
Haijie Yang
Nanjing University of Science and Technology, China
Jindi Bao
Nanjing University of Science and Technology, China
Yixuan Dong
Tsientang Institute for Advanced Study, China
Hongliang Zhang
Nanjing University of Science and Technology, China
Jian Bi
Nanjing University of Science and Technology, China
Hao Tang
Peking University, China
Zhenyu Zhang
Nanjing University, China
Jianjun Qian
Nanjing University of Science and Technology, China
Jian Yang
Nanjing University of Science and Technology, China
Какую задачу решает
Статья разделяет повторно используемое эмоциональное движение, перетаргетинг кросс-идентичности и рендеринг внешнего вида, чтобы один референс-портрет мог быть анимирован в реальном времени от аудио и эмоциональной метки. Он специально удаляет повторные вычисления референс-признаков без переобучения кэша для каждой целевой идентичности.
Ключевой результат
На RTX 4090 полная система работает на 32 FPS. При самореконструкции она достигает 31,24 PSNR, 0,018 LPIPS, 0,883 SSIM и 6,314 балла синхронизации губ, что лидирует в большинстве показателей качества и движения, несмотря на более высокую частоту кадров EmoTag. При кросс-идентификационном вождении он фиксирует 29,64 FID, 0,745 сходства идентичности, 75,4% точности эмоций и 6,096 синхронизации губ. Участники предпочитали его за эмоциональную выразительность в 70% сравнений, синхронизацию губ в 60% и визуальный реализм в 65%; длинные клипы не показывали явной идентичности или дрейфа синхронизации.
Аннотация
Аудио-ориентированная портретная анимация быстро развивается с помощью генеративных моделей на основе диффузии, однако генерация однокадровых кадров в реальном времени с помощью выразительного контроля эмоций остаётся сложной. Существующие методы часто страдают от недостатка эмоционально-осознанных априоров движения и дорогостоящих вычислений внешности при многоступенчатом снятии шума. Чтобы решить эти проблемы, мы предлагаем Proxy Avatar Meets Low-Rank Caching — каскадную структуру для однократной анимации с управлением эмоций в реальном времени. Вместо прямой генерации портрета цели из аудио наш метод использует гауссовский прокси-аватар в качестве многократного генератора движения, который обучается один раз на одной идентичности для создания выразительных драйверных видео с аудио- и эмоциональных меток. Поскольку прокси-аватар предоставляет только движение, а не внешний вид цели или геометрию, крупномасштабная одноразовая модель ретаргетирования дополнительно извлекает идентично-независимое движение из производительности прокси и адаптирует его к произвольным портретам целей. Для повышения эффективности вывода мы вводим повторное использование внешнего вида с нулевой выстрелом с низкоранговым кэшированием, которое кэширует эталонные признаки на начальном этапе снятия шума и моделирует последующие вариации с помощью лёгких низкоранговых адаптеров. Обширные эксперименты показывают, что наш метод достигает более сильной эмоциональной выразительности, лучшей анимации для сохранения идентичности и существенно снижает стоимость вывода, позволяя реализовывать портретную анимацию в реальном времени.
Отправная точка исследования
Монокадровые говорящие портреты должны сохранять внешний вид невидимого персонажа, следовать за речью, выражать запрошенную эмоцию и работать интерактивно на доступном оборудовании. Диффузионные системы неоднократно пересчитывают почти статичные внешние черты при снятии шума, а эмоциональные элементы часто переплетают идентичность и движение или требуют референсного видео для каждого стиля. В результате получается либо выразительная, но медленная генерация, либо быстрая анимация с слабым эмоциональным диапазоном.
Метод
Прокси-аватар на основе гаусса обучается один раз на одном исполнителе и служит только генератором движения с обусловленными аудио и эмоциями. Крупномасштабная сеть однокадрового ретаргетирования извлекает движение, независимое от идентичности, из этого прокси-видео и применяет его к произвольным портретам целей. Во время диффузии с несколькими шагами кэши повторного использования появления с нулевой кадром ссылаются на особенности на первом этапе, тогда как лёгкие низкоранговые адаптеры моделируют только их более поздние варианты. Это каскадное разделение обязанностей оценивается в самореконструкции, кросс-идентичности в одноразовом вождении, стабильности длинного видео, абляциях и слепом исследовании с двадцатью участниками.
Вывод по статье
Дизайн многократного прокси плюс ретаргетинг делает эмоциональные аватары в реальном времени практичными без обучения диффузии на каждого пользователя. Сообщаемые 32 FPS на потребительском RTX 4090 выглядят многообещающе, но размер развертывания должен включать одноразовое обучение прокси и компромисс между качеством и затратами при большой модели ретаргетинга, а не только стабильной частотой кадров.