← 返回博客
研究雷达人脸交换说话人脸arXiv2026年8月

每月 arXiv 雷达

2026年8月人脸交换论文:实时肖像、分钟级数字人与情绪控制

August 的面部交换和数字人研究,不仅仅是一个单一的身份转换技巧,更注重持续的、可控的交互。所选系统将可重复使用的动作与外观分离,将离线音视频模型提炼成分钟级的流式器,并将潜在的情绪语义与显式的混合形状几何结合起来。

本月趋势判断

《Proxy Avatar Meets Low-Rank Caching》通过将可重复使用的情绪表现者与一次性身份重定向分离,并缓存静态外观,在 RTX 4090 上达到了 32 FPS。《Omni-LiveAvatar》则处理数据中心端,使用自回归蒸馏和有界长短时记忆,使音频和视频在整整一分钟内保持一致。《GemTalk》专注于控制界面,让显式混合形状几何能够调整隐式情绪特征的强度。它们共同描绘了三种不同的产品选择:个性化动作重用、连续流式基础设施以及精细的情感表达指导。

论文 012026-08-03cs.CV

代理头像结合低秩缓存:实时单样本情绪可控肖像动画

作者与机构

Haijie Yang

Nanjing University of Science and Technology, China

Jindi Bao

Nanjing University of Science and Technology, China

Yixuan Dong

Tsientang Institute for Advanced Study, China

Hongliang Zhang

Nanjing University of Science and Technology, China

Jian Bi

Nanjing University of Science and Technology, China

Hao Tang

Peking University, China

Zhenyu Zhang

Nanjing University, China

Jianjun Qian

Nanjing University of Science and Technology, China

Jian Yang

Nanjing University of Science and Technology, China

解决了什么问题

论文将可重复使用的情感运动、跨身份重定向和外观渲染分离,使单个参考肖像能够实时通过音频和情感标签动画化。它专门去除了重复的参考特征计算,而无需为每个目标身份重新训练缓存。

关键结果

在RTX 4090上,完整系统运行时为32 FPS。自我重建时,PSNR达到31.24,LPIPS为0.018,SSIM为0.883,口型同步评分为6.314,尽管EmoTag的原始帧率更高,这些数据在大多数画质和动作指标中领先。在跨身份驾驶中,它记录了29.64 FID、0.745的身份相似度、75.4%的情感准确率和6.096的口型同步。参与者在70%的比较中更喜欢其情感表达,60%的口型同步,65%的视觉真实性;延长片段没有明显的身份或同步漂移。

摘要

基于扩散的生成模型推动音频驱动的肖像动画迅速发展,但带有表现性情感控制的实时一次性生成仍具挑战性。现有方法常常存在情感感知运动先验不足和多步去噪时的昂贵外观计算问题。为解决这些问题,我们提出了“代理头像遇低阶缓存”,这是一个实时一次性情感可控人像动画的级联框架。我们不直接从音频生成目标头像,而是使用基于高斯的情感代理头像作为可重复使用的运动生成器,该头像在单一身份上训练一次,通过音频和情感标签生成富有表现力的驾驶视频。由于代理头像仅提供运动而非目标外观或几何体,大规模一次性重定向模型进一步从代理表现中提取身份无关的运动,并将其适配于任意目标肖像。为提高推理效率,我们引入了零帧外观重用,低秩缓存,在初始去噪步骤缓存参考外观特征,并使用轻量级低秩适配器建模后续特征变体。大量实验表明,我们的方法实现了更强的情感表现力、更佳的身份保护动画,并大幅降低推理成本,实现了实时一次性肖像动画。

研究出发点

一次性对话肖像需要保留未被看见人物的外貌,跟随语音,表达请求的情感,并在现有硬件上进行交互运行。扩散系统在去噪时会反复计算几乎静态的外观特征,而情感控制则常常纠缠身份与运动,或每种风格都需要参考视频。结果要么是表现力强但生成缓慢,要么动画快速且情感范围薄弱。

方法概述

基于高斯的代理头像仅对一名表演者进行一次训练,仅作为音频和情感条件的运动发生器。一个大规模的一次性重定向网络从该代理视频中提取身份无关的运动,并将其应用于任意目标肖像。在少步扩散过程中,零镜头外观重用缓存在第一步缓存参考特征,而轻量级低秩适配器仅模拟其后期变异。这种层叠的工作分工通过自我重建、跨身份单次驱动、长视频稳定性、消融以及一项包含20名参与者的盲测研究进行评估。

论文总结

可重复使用的代理加重定向设计使得实时情感化身变得实用,无需逐用户扩散训练。据报道,消费级RTX 4090的32帧每秒表现令人期待,但部署规模应包括一次性代理训练以及大规模重定向模型的质量/成本权衡,而不仅仅是稳态帧率。

论文 022026-08-07cs.MM

Omni-LiveAvatar:分钟级实时流式音视频数字人生成

作者与机构

Lunjie Zhu

iComAI Lab, Hong Kong University of Science and Technology, Hong Kong

Vivix Group Limited, Hong Kong

Xingtong Ge

iComAI Lab, Hong Kong University of Science and Technology, Hong Kong

Vivix Group Limited, Hong Kong

Fangyu Lin

iComAI Lab, Hong Kong University of Science and Technology, Hong Kong

Vivix Group Limited, Hong Kong

Yi Zhang

Vivix Group Limited, Hong Kong

Zhening Liu

iComAI Lab, Hong Kong University of Science and Technology, Hong Kong

Mengfei Li

iComAI Lab, Hong Kong University of Science and Technology, Hong Kong

Vivix Group Limited, Hong Kong

Yumeng Zhang

iComAI Lab, Hong Kong University of Science and Technology, Hong Kong

Guanglu Song

Vivix Group Limited, Hong Kong

Yu Liu

Vivix Group Limited, Hong Kong

Jun Zhang

iComAI Lab, Hong Kong University of Science and Technology, Hong Kong

解决了什么问题

Omni-LiveAvatar 将大型离线联合音视频教师模型转换为因果流媒体生成器,并解决了长上下文和变化提示的独立稳定性问题。它的目标是连续的分钟级生成,而不是一系列独立生成的短片。

关键结果

对于五秒剪辑,模型生成速度为 19.57 FPS,大约比其 0.60-FPS 的教师模型快 33 倍,同时在测试系统中获得最高整体质量分(81.72)以及完美的人类身份和服装保真度分。在六十秒生成中,其速度达到 21.99 FPS,而下一个最快的基线为 16.18 FPS。其一分钟水平的人类身份分为 98.61,而其他为 67.60 和 50.19,Sync-C 为 6.76,对比 0.72 和 0.28,文本-视频对齐度为 9.82,对比 6.68 和 5.46,可见地减少了头像和背景漂移。

摘要

联合音视频生成模型是沉浸式和互动式数字人生成的基础。然而,大多数现有模型依赖双向注意力和多步去噪,并且只能生成短片段,这使它们不适合长时间的实时交互。我们提出了 Omni-LiveAvatar,这是首个用于分钟级实时流式联合音视频头像生成的框架。具体而言,我们提出了 (1) 一个渐进自回归蒸馏流程,将大型双向联合音视频扩散模型转换为无需辅助稳定机制的少步自回归生成器;(2) 一个同步音视频长短期记忆模块,在有限的内存预算下保持全局一致性;以及 (3) 一个分层滚动提示规划策略,实现连贯的语义演化和无缝的提示过渡。大量实验表明,Omni-LiveAvatar 能够实时生成高质量、同步的分钟级头像。在速度方面,它在单个 NVIDIA H200 GPU 上实现了比其教师模型 LTX-2 高 33 倍的生成速度;在生成质量方面,它在视觉质量、音频质量、跨模态同步性和人体逼真度上均优于加速基线。我们的代码可在 https://github.com/Aoko955/Omni-LiveAvatar 获取。

研究出发点

联合音视频生成器可以合成令人信服的短片,但双向注意力和多步扩散阻碍了实时互动,而加速自回归变体在长时间会话中会在身份、背景、音频质量或唇同步上出现漂移。一个有用的数字人必须在有限内存下保持两种模态数分钟,并接受不断变化的提示而不产生突兀的语义或声音转换。

方法概述

一个三阶段渐进自回归蒸馏管线将 LTX-2 转换为四步去噪的因果生成器,无需外部奖励模型或特定模态稳定化。同步音视频长短期记忆结合了周期性重新锚定的第一个宏块与滚动键值缓存,在固定预算内保留全局身份和近期上下文。分层滚动提示规划将持久外观/背景指令与块级本地动作分开,使提示随滚动窗口推进。评估涵盖了在一块 NVIDIA H200 上以 512x768 生成的五秒和六十秒输出。

论文总结

论文将长时音视频稳定性作为一个一级系统问题,而非事后补充。它是实时数字人系统的强参考架构,但实时性数据是在 H200 上以 512x768 测量的,因此购买者应在自己的服务硬件上复现延迟、内存和并发性能。

论文 032026-08-01cs.CV

面向可控写实情感说话人脸生成的几何引导情绪调制

作者与机构

Chenggong Hu

School of Software Technology, Zhejiang University, Ningbo, China

Shaoyin Ma

School of Software Technology, Zhejiang University, Ningbo, China

Yi Wang

College of Computer Science and Technology, Zhejiang University, Hangzhou, China

Li Sun

Ningbo Global Innovation Center, Zhejiang University, Ningbo, China

Mingli Song

College of Computer Science and Technology, Zhejiang University, Hangzhou, China

Jie Song

School of Software Technology, Zhejiang University, Ningbo, China

解决了什么问题

GemTalk 将音频衍生的情感语义与身份感知的面部几何连接起来,并利用几何体控制潜在表情特征的强度。这使得情感类别和强度可持续编辑,同时保持了照片级真实感和口型同步。

关键结果

在综合 MEAD-front 和 RAVDESS 语音情绪测试中,GemTalk 达到 334.937 FVD、31.625 FID、7.027 Sync-C、8.283 Sync-D、2.392 表情 FID,以及 59.258% 的情绪准确率。它比次佳方法提高了 3.33 个百分点的情绪准确率,并将 FVD 降低了 20.84。在中性 HDTF 上,它保持了强同步性,并获得了已报告的最佳表情 FID 1.386,而系数编辑产生平滑的弱到强情绪过渡且不会明显丢失身份特征。

摘要

音频驱动的情感对话面部生成旨在合成具有表情动态的真实视频。然而,现有方法在控制性和视觉真实度之间存在困难。尽管隐式表征捕捉了丰富的语义,但缺乏结构指导,常导致情感表达平均化。相比之下,显式几何方法能更好地控制面部表情,但往往牺牲高频纹理细节。为此,我们提出了GemTalk,一个基于扩散的框架,结合隐式表现的语义丰富性与显式几何先验的结构精度。我们引入视觉引导音频情感投射(V-AEP)模块,提取隐含的情感唇形和表情特征。同时,基于扩散的几何先验生成器(D-GPG)生成身份感知的混合形系数作为显式结构先验。关键是,我们的几何引导情绪调制(GEM)模块利用这些几何先验重新校准隐性特征的强度,实现对情感表达,尤其是情绪强度的精确、连续控制,同时不牺牲视觉质量。大量实验表明,GemTalk在照片写实和面部情绪动态方面表现出色。

研究出发点

隐式扩散特征提供丰富的面部质感,但情感表达趋于平均,强度控制较差。显性地标或混合形状提供可解读的结构,但仅由几何驱动的系统常常失去高频外观,并可能产生与音频冲突的嘴巴或上半部。情感动画既需要语义丰富度,也需要可控的物理动作,同时不破坏参考肖像中已有的表情。

方法概述

训练从对情感不敏感的口型同步骨干网络开始,使用广泛的非情感视频。视觉引导的音频情感投影通过使用视觉情感表示来监督音频特征,学习独立但协调的口型和上脸情感空间。基于扩散的几何先验生成器预测具有身份感知的 Apple ARKit 融合形状系数。几何引导的情感调制随后保持表示情感类别的潜在特征方向,同时从融合形状重新校准其幅度;冲突感知采样将参考图像和具有不同情感的音频配对,以便模型无法复制源表情。

论文总结

将潜在情绪语义与显性面部表情量结合,为创意工具和数字人接口提供了有用的控制界面。当连续情绪强度很重要时,GemTalk 的表现最出色,不过团队应测试其情绪标签和 ARKit 系数假设是否适用于他们的语言、说话风格和目标装置。