作者与机构
Haijie Yang
Nanjing University of Science and Technology, China
Jindi Bao
Nanjing University of Science and Technology, China
Yixuan Dong
Tsientang Institute for Advanced Study, China
Hongliang Zhang
Nanjing University of Science and Technology, China
Jian Bi
Nanjing University of Science and Technology, China
Hao Tang
Peking University, China
Zhenyu Zhang
Nanjing University, China
Jianjun Qian
Nanjing University of Science and Technology, China
Jian Yang
Nanjing University of Science and Technology, China
解决了什么问题
论文将可重复使用的情感运动、跨身份重定向和外观渲染分离,使单个参考肖像能够实时通过音频和情感标签动画化。它专门去除了重复的参考特征计算,而无需为每个目标身份重新训练缓存。
关键结果
在RTX 4090上,完整系统运行时为32 FPS。自我重建时,PSNR达到31.24,LPIPS为0.018,SSIM为0.883,口型同步评分为6.314,尽管EmoTag的原始帧率更高,这些数据在大多数画质和动作指标中领先。在跨身份驾驶中,它记录了29.64 FID、0.745的身份相似度、75.4%的情感准确率和6.096的口型同步。参与者在70%的比较中更喜欢其情感表达,60%的口型同步,65%的视觉真实性;延长片段没有明显的身份或同步漂移。
摘要
基于扩散的生成模型推动音频驱动的肖像动画迅速发展,但带有表现性情感控制的实时一次性生成仍具挑战性。现有方法常常存在情感感知运动先验不足和多步去噪时的昂贵外观计算问题。为解决这些问题,我们提出了“代理头像遇低阶缓存”,这是一个实时一次性情感可控人像动画的级联框架。我们不直接从音频生成目标头像,而是使用基于高斯的情感代理头像作为可重复使用的运动生成器,该头像在单一身份上训练一次,通过音频和情感标签生成富有表现力的驾驶视频。由于代理头像仅提供运动而非目标外观或几何体,大规模一次性重定向模型进一步从代理表现中提取身份无关的运动,并将其适配于任意目标肖像。为提高推理效率,我们引入了零帧外观重用,低秩缓存,在初始去噪步骤缓存参考外观特征,并使用轻量级低秩适配器建模后续特征变体。大量实验表明,我们的方法实现了更强的情感表现力、更佳的身份保护动画,并大幅降低推理成本,实现了实时一次性肖像动画。
研究出发点
一次性对话肖像需要保留未被看见人物的外貌,跟随语音,表达请求的情感,并在现有硬件上进行交互运行。扩散系统在去噪时会反复计算几乎静态的外观特征,而情感控制则常常纠缠身份与运动,或每种风格都需要参考视频。结果要么是表现力强但生成缓慢,要么动画快速且情感范围薄弱。
方法概述
基于高斯的代理头像仅对一名表演者进行一次训练,仅作为音频和情感条件的运动发生器。一个大规模的一次性重定向网络从该代理视频中提取身份无关的运动,并将其应用于任意目标肖像。在少步扩散过程中,零镜头外观重用缓存在第一步缓存参考特征,而轻量级低秩适配器仅模拟其后期变异。这种层叠的工作分工通过自我重建、跨身份单次驱动、长视频稳定性、消融以及一项包含20名参与者的盲测研究进行评估。
论文总结
可重复使用的代理加重定向设计使得实时情感化身变得实用,无需逐用户扩散训练。据报道,消费级RTX 4090的32帧每秒表现令人期待,但部署规模应包括一次性代理训练以及大规模重定向模型的质量/成本权衡,而不仅仅是稳态帧率。