← 返回博客
研究雷达人脸替换视觉编辑arXiv2026年9月

每月 arXiv 雷达

2026年9月人脸替换论文:光照协调、参考注意力与实时视觉配音

9月份提供了一种直接的人脸合成方法和两种相关的身份编辑系统。阴影和谐管道有意限制可以更改的内容,以便错误的估计不会重新上色或提亮已批准的人脸。RefGAP在七个扩散编辑器中引导参考注意力,并在推理时加以修正。TBDub将视觉配音模型适应于制作素材,然后将三十个去噪步骤蒸馏为两个,同时测量身份、唇同步、视觉质量和端到端吞吐量。

本月趋势判断

几何驱动的统一器仅应用有限的、各通道统一的暗化场;在其解析代理上,56.5%的面部像素发生变化,平均增益为0.938,没有像素被变亮,尽管论文并未声称在真实图像上的知觉优势。RefGAP只校准两次系数,然后在7个图像/视频编辑器上改善身份相似性,处理了1,040个头部置换片段和1,000对面部置换资料;替换成功率分别至少达到86%和82%,但有可测的姿势和保真权衡。TBDub 的两步学生模型在 H20 上以 512×512 分辨率达到 7.13 FPS,相比其教师模型实现了13.93倍的端到端速度提升,同时人工评价保持了教师模型的身份质量,并略微改善了唇同步和视觉质量。对于买家而言,重要的区别在于风险:确定性界限、推理时控制以及蒸馏生成具有不同的失败模式和验证需求。

论文 012026-09-15cs.CV

合成人脸的几何驱动阴影协调:保持反照率的乘法重光照流程

作者与机构

Vijesh KP

Independent researcher (no institutional affiliation stated in the paper)

解决了什么问题

本文针对狭窄的情况,即捐赠者的颜色和身份可接受,但形状阴影缺失。它探讨如何在不增加像素亮度、改变色度或合成新脸的情况下,从近似面部几何注入鼻子、眼眶、嘴唇和腔体阴影。

关键结果

在论文的带有已知光照的解析面高度场上,默认设置修改了56.5%的面像素,总体平均增益为0.938,在修改像素上为0.890,并将3.4%的像素发送到0.82的底值。它保证零亮化像素,并且数学色相角变化不会超过浮点噪声。这些数据描述的是有界算子而非感知质量:论文未提供配对的真实复合基准或基线对比。它无法增加高光、纠正已经过暗的源图、移除相反的源光,或避免双重阴影残余源遮挡。

摘要

面部交换和面部合成流程通常会生成几何上对齐良好但光度上不合理的面部:捐赠者面部带有均匀、近正面的工作室光照,而主机身体和背景带有方向性的场景光。大多数现有解决方案通过颜色迁移、神经重光照或反向渲染重新合成面部,因此可能改变身份、肤色和纹理。我们提出了一种保守的替代方法:几何驱动的形态-阴影注入。该流程从不重绘面部。它从栅格化的三维面部代理中估计每像素增益场 $g\in[g_{\min},1]$,并将其统一乘到线性 RGB 上,因此操作只会使图像变暗而不会改变色度。一个密集的关键点网格被栅格化到深度缓冲区,从中我们导出表面法线、凹陷项以及屏幕空间投影阴影。主光方向通过主机侧线索(身体、背景、头发光晕)估计;面部线索被降低权重,因为它们会恢复捐赠者的光照。阴影强度不与主机匹配:它由三个参数的迁移 $(τ,σ,g_{\min})$ 设置。阴影场在皮肤区域按第 75 百分位数除以,然后进行门控、缩放、限制、平滑,并在羽化的皮肤门控面部遮罩内重新裁剪。在解析的面部高度场上,默认 $(τ,σ,g_{\min})=(0.90,0.45,0.82)$ 修改了 56.5% 的面部像素,平均增益为 0.938(修改过的像素为 0.890),并将 3.4% 的像素推至下限。色相不变性是该操作的推论。我们以闭式形式分析该迁移,消融其参数,并讨论单调、仅变暗形式的失败模式,包括对非平面捐赠者的双重阴影现象。

研究出发点

即使替换的脸在几何上对齐且身份正确,它仍然可能看起来像被贴上的,因为捐赠者脸部带有平面摄影棚光,而宿主场景有方向性主光。生成式重光照可以修复更多效果,但它也可能在脸部已被批准后改变肤色、毛孔、纹理或身份。制作团队有时需要一个刻意受限的操作员,其最坏情况的光度变化是已知的。

方法概述

面部检测器和468点网格生成一个光栅化深度缓冲、表面法线、腔体代理以及512像素裁剪中的屏幕空间投影阴影。宿主端的身体、背景、颈部和头发光晕线索投票以确定主光方向,而捐赠者脸部线索的权重被降低。归一化阴影图经过三参数的阈值、强度和最小增益传递,然后进行引导平滑和羽化皮肤掩码处理。同一标量增益被乘以所有线性RGB通道,并被裁剪到0.82到1.0的范围内。

论文总结

这是一个保守的后期合成控制,具有可理解的损伤界限,而不是完整的重新照明系统。当身份保留优先于戏剧性真实感时,它很有吸引力,前提是要检查真实拍摄以防错误光照方向和双重阴影。

论文 022026-09-28cs.CV

关注RefGAP:校正扩散式视觉编辑中的参考注意力

作者与机构

Yanan Wang

Mohamed bin Zayed University of Artificial Intelligence

Institute of Foundation Models

Shengcai Liao

United Arab Emirates University

Guangyi Liu

Mohamed bin Zayed University of Artificial Intelligence

Institute of Foundation Models

Xiaodan Liang

Mohamed bin Zayed University of Artificial Intelligence

解决了什么问题

RefGAP 旨在在无需重新训练且无需对每个模型设置独立校正强度的情况下,提升不同图像和视频编辑器中的参考身份保真度。它明确在编辑掩码内加强参考使用,同时在应保留的区域抑制参考。

关键结果

在 1,040 个 HeadSwapBench 视频片段上,七个通用编辑器的身份相似度均有所提升,并且在定义的范围内替换成功率至少达到 86%;整个头部相似度也在七个编辑器中提升。在 1,000 对 FaceForensics 换脸样本上,每个编辑器的身份相似度均有所提升,替换成功率和正确检索率至少达到 82% 和 75%。应用于专用 DirectSwap 模型时,身份相似度从 0.7019 提升至 0.7450,而整帧 LPIPS 几乎保持不变。提升伴随着几个系统的关键点误差增大,以及非编辑区域保真效果混合不一;背景替换未能可靠转移。未融合注意力实现可能还会增加显著内存或延迟,因此集成质量很重要。

摘要

参考引导的扩散编辑器难以忠实再现用户提供的参考。我们识别出了扩散编辑器中的一个潜在瓶颈:许多方法提供的参考注意力分配有限。例如,在 LoomVideo 中,编辑区域查询将其注意力质量的不到1%分配给参考。我们提出 RefGAP,一种无需训练的校正方法,它根据前向传播过程中测量的参考注意力质量在线确定每一层的对数偏移量。对参考对数进行正偏移可以增强编辑区域查询的参考使用,而对保留区域查询进行负偏移则限制参考引起的编辑外更改。两个全局系数控制校正;它们在四个开发阶段扩散编辑器的验证数据上选择一次并固定。在七个基于扩散的图像/视频编辑器中,RefGAP 提高了换头和换脸的身份保真度。RefGAP 实现的保真度与单独调节的恒定编辑侧偏置相当,无需每个方法进行强度扫描。在虚拟试衣和背景替换上的额外实验评估了其在身份编辑之外的迁移效果。

研究出发点

参考指导的扩散编辑器可能会接收到正确的源人脸,但几乎不会关注它;根据作者的测量,LoomVideo 编辑区域查询将不到 1% 的注意力分配给参考。固定注意力增强可以强化身份,但需要对每个模型进行调优,并且可能会将参考外观泄露到不应更改的头发、衣物、背景、姿势或表情中。

方法概述

在每一层注意力中,RefGAP 分别测量编辑查询和保留查询分配给参考标记的注意力比例。它从观察到的注意力质量中导出在线 logit 偏移:正偏移在编辑区域增强参考键,而负偏移在保留区域约束它们。两个全局系数和一条层选择规则在 40 个换头视频片段上使用四个开发编辑器进行一次校准,然后在七个编辑器、三个未使用系统、换脸、虚拟试穿和背景替换中保持固定。

论文总结

测量实际参考注意力是身份编辑中一种有用的模型无关控制信号,但更强的身份转移可能会改变几何和保留区域。团队需要任务特定的质量检查,而不仅仅是身份相似度。

论文 032026-09-05cs.CV

TBDub:面向生产的视觉配音

作者与机构

Bihan Li

TaoLive AIGC, Taobao & Tmall Group, Alibaba

Xinyang Li

TaoLive AIGC, Taobao & Tmall Group, Alibaba

Zeran Xu

TaoLive AIGC, Taobao & Tmall Group, Alibaba

Meiguang Jin

TaoLive AIGC, Taobao & Tmall Group, Alibaba

Junfeng Ma

TaoLive AIGC, Taobao & Tmall Group, Alibaba

解决了什么问题

TBDub 将现有的视频扩散配音堆栈适应到制作镜头,并询问两步学生是否能够保留教师的感知身份、同步性和视觉质量。它评估重建、音频响应、人工评分,以及完整的 VAE 到 VAE 生成路径,而不仅仅引用去噪器速度。

关键结果

在38个TalkVid剪辑上,教师在所有八个报告的重建、感知、身份和同步指标上都优于X-Dub。在每种方法的114个评分中,X-Dub的唇同步、身份和视觉质量的MOS值分别为3.57、2.83和2.88,而教师的评分提升至3.71、3.78和3.78。学生的评分为3.85、3.72和3.80,在保持身份接近的同时,在唇同步和视觉质量上领先。在512x512分辨率、一台H20上,学生达到7.13有效FPS,而教师仅为0.51,实现了13.93倍的端到端加速;仅DiT阶段的速度提升为42.49倍。该基准较小,排除了若干预处理和编码阶段,且超低分辨率输入仍然是失败案例。

摘要

视觉配音必须在替换语音的同时同步口型运动,并保持身份、外观和时间一致性。尽管 X-Dub 提供了一个强大的无掩码视频编辑基线,但其在直播和生成视频内容中的应用暴露了在制作域稳健性、时间和运动稳定性、身份与口腔细节保留以及推理效率方面的局限性。我们提出了 \textbf{TBDub},这是 X-Dub 的一个面向生产的扩展,它将任务自适应后训练与任务感知的少步蒸馏相结合。后训练使用生产域数据、特定生产条件与过滤、以及增强的音频特征来调整视频 DiT,得到一个 30 步教师模型。蒸馏将 DMD/DMD2 调整为条件视频编辑,并将教师模型压缩为两步学生模型。在 38 个 TalkVid 剪辑上,教师模型在 X-Dub 的基础上提升了所有八项报告的重建、感知、身份和同步指标。在 MOS 评估中,它在口型同步一致性、身份一致性和视觉质量上分别比 X-Dub 提升了 0.14、0.95 和 0.90 分,而学生模型在口型同步和视觉质量得分上达到了最高,并在身份一致性方面接近教师模型。在单个 NVIDIA H20 GPU 上从第一个 VAE 编码到最终 VAE 解码的端到端生成配对计时中,分辨率为 $512\times512$,学生模型达到 7.13 有效 FPS,并将总延迟减少了 $13.93\times$;仅 DiT 阶段加速了 $42.49\times$。学生模型在很大程度上保留了教师的生成质量和视听同步。代码已在 GitHub 上发布,地址为 \https://github.com/TaoLiveAIGC/TBDub,30 步教师模型和两步学生模型的权重可在 Hugging Face 上获取,地址为 https://huggingface.co/TaoLiveAIGC/TBDub。

研究出发点

视觉配音必须改变口型动作,以表达替代语音,同时保持身份、牙齿、唇纹理、姿势、光照、遮挡以及所有非言语区域随时间的稳定性。X-Dub 提供了一个功能强大的免掩码视频编辑器,但生产直播和生成视频输入会暴露出领域偏移、闪烁、口腔细节漂移以及三十步去噪的延迟。

方法概述

任务自适应后训练将制作域数据与继承的训练分布混合,使用 HuBERT-large 层增强音频特征,非对称地降级条件,并使用运动丢弃加上空间和时间加权流匹配来创建一个 30 步教师。条件 DMD/DMD2 过程将该教师蒸馏为一个可微分的两步学生,采用动态假评分训练、分阶段区域选择监督、因果的首潜变量处理、全时间步采样、FP32 指导算术以及 FP32 EMA 权重。

论文总结

两步视觉配音可以提供更好的质量-吞吐量平衡点,但报告的7.13 FPS受限于生成核心。生产规模应包括音频、面部跟踪、合成、编码和长视频稳定性。