← 返回博客
研究雷达换脸会说话的脸arXiv2026年7月

每月 arXiv 雷达

2026年7月换脸论文:身份锚点、行人隐私与响应式说话人脸

七月份的人脸合成研究涵盖了身份转移的三种不同应用。其中一篇论文提出了一种自适应锚点放置方法,以保持交换后的身份在长视频中保持稳定;另一篇论文利用身份交换进行去标识化,同时保留行为线索;第三篇论文则将应用范围从单个说话的头部扩展到可以相互回应的合成对话。

本月趋势判断

自适应身份锚定将关键帧放置视为一个反馈问题,其显著特点是设计了可证伪的测试,尽管尚未公布这些实验结果。行人隐私管道则提供了一项规模较小的实证研究,探讨了身份交换能够保留哪些信息以及全头迁移在哪些情况下会失效,尤其是在遮挡和遮蔽的情况下。CHAT 展示了生成两个包含语音、听者反应和轮次结构的响应式身份的规模和复杂性,同时也承认其评估尚未衡量对话层面的语义。这三篇论文共同表明,仅凭身份相似度不足以作为人脸合成的质量指标。

论文 012026-07-23cs.CV

自适应身份锚定:用于视频换脸中合成配对监督的闭环关键帧放置

作者与机构

Logan Robbins

Independent researcher

解决了什么问题

本文着重探讨交换模型背后的数据工厂,而非添加新的学生架构。文章探讨了合成配对需要多少个身份锚点,这些锚点应该放置在哪里,以及如何在将无法维护身份的片段纳入监管之前对其进行过滤。

关键结果

这是一份研究提案,并非已完成的实证结果。提案中列举了漂移曲线与锚点间隙曲线、预算相同情况下的均匀放置与自适应放置、下游学生训练、纹理消融以及人类美颜滤镜研究等可证伪的测试,但尚未报告任何关于身份、时间、光谱或用户研究方面的测量结果。

摘要

视频换脸技术缺乏自然的配对监督:目前不存在一个人的脸与另一个人的视频进行匹配的真实影像。目前最有效的解决方案是 DreamID-V 的 SyncID-Pipe,它通过替换真实视频片段中恰好两帧(第一帧和最后一帧)的身份信息来生成配对,并仅根据姿态序列重新生成其余帧。姿态信息不包含替换身份的任何外观证据,因此在较长的视频片段、遮挡和极端姿态变化的情况下,合成的身份信息会在一个较长的无锚定范围内漂移;目前尚无已发表的消融实验来检验锚点数量或位置。我们提出自适应身份锚定(AIA):(i)将合成器推广到任意锚点集,这对于扩散强制式 Transformer 来说在架构上是自然的,因为在这种 Transformer 中,对帧的条件化是将其标记钳位到零噪声; (ii) 通过闭环反馈回路放置锚点,该回路将生成的每个帧与真实参考身份进行比对,并在得分最低的帧插入一个图像-人脸互换的锚点,直到该帧与真实身份的匹配度超过阈值或达到预算上限;(iii) 将回路的判定结果作为自动数据过滤器重复使用。第二个问题,即过度平滑皮肤造成的“美颜滤镜”效果,其根本原因相同:微纹理(如同身份识别一样)并未纳入流程的任何目标进行定价。因此,我们将 AIA 与现实参考纹理恢复相结合:从每个真实帧的非人脸区域进行匹配的重新颗粒化,从真实素材中分离子身份微纹理进行带分割传输,以及使用素材自身光谱作为参考的第二个光谱接收通道。我们认为,身份锚密度是一个可控的质量调节器,我们具体提出了可证伪的实验——漂移与间隙曲线、匹配预算下的均匀与自适应放置、AIA 生成的数据的学生培训,以及使用人类美颜滤镜研究的纹理消融——这些实验将验证或反驳该提议。

研究出发点

视频换脸技术缺乏自然配对的真实数据:目标身份实际上从未出现在源视频中。现有的合成监督方法只能锚定边界帧,导致长间隔、侧面移动和遮挡等情况无法提供直接的外观证据,并可能造成身份或皮肤纹理的偏移。

方法概述

自适应身份锚定技术将扩散强制视频合成器推广到任意条件帧。它通过闭环算法对每个生成的帧与真实目标身份进行比对,在最差的帧处插入图像交换锚点,并重复此过程直至达到阈值或锚点预算。真实参考纹理恢复技术则分别从真实素材中提取非身份微纹理和颗粒,并添加光谱验收测试以减少过度平滑的皮肤。

论文总结

AIA 可作为构建合成配对视频数据的团队的设计检查清单:监控每帧的身份,在漂移最严重的位置使用锚点,剔除不收敛的片段,并对纹理进行单独评分。它的价值目前体现在方法论层面;在将其应用于现有流程之前,仍需进行实施和基准测试验证。

论文 022026-07-09cs.CV

换脸,保留特征:智能交通系统中行人隐私的双用途管道

作者与机构

Roba H. Farouk

C-DRiVeS Lab: Cognitive Driving Research in Vehicular Systems, Cairo, Egypt

Computer Science and Engineering Department, Faculty of Media Engineering and Technology, German University in Cairo, Egypt

Catherine M. Elias

C-DRiVeS Lab: Cognitive Driving Research in Vehicular Systems, Cairo, Egypt

Computer Science and Engineering Department, Faculty of Media Engineering and Technology, German University in Cairo, Egypt

解决了什么问题

这项工作旨在为Egy-DRiVeS数据集寻找一种实用的去标识化流程,该流程能够在保留姿态、表情、注视点以及足够图像质量以供后续训练的同时,去除身份信息。此外,它还研究了针对远处、被遮挡或蒙面行人等特定情况的去标识化失败案例,而不仅仅依赖于肖像特写。

关键结果

在近距离图像上,Roop 的混合形状差异(1.898 对比 2.0478)和地标差异(0.00596 对比 0.00710)均较低,而 Ghost-v2 的身份相似度(0.1393 对比 0.1997)较低,表明其在该指标上的遮蔽效果更强。两者在余弦相似度约为 0.94 时都能很好地保留视线方向。Roop 在四项定量指标中的三项上胜出,并且在低质量或被遮挡的街景人脸上表现更稳健,而 Ghost-v2 则可能错误地将面纱替换为原始头发。

摘要

为了训练人工智能模型以对自动驾驶汽车(AV)这一智能交通系统(ITS)应用进行实时决策,需要大规模且多样化的数据集。行人意图和轨迹预测是自动驾驶汽车的关键模型,需要包含各种行人图像的数据集。不受限制地访问这些数据集会带来严重的安全风险,例如身份盗窃和行人追踪。挑战在于如何在保护隐私的同时,保留训练模型所需的图像属性。现有的隐私保护方法虽然可以保护行人的隐私,但会降低图像的可用性,从而影响模型的有效性。本文旨在实现一个五阶段流程,通过人脸替换技术保护行人的隐私,同时保持必要的面部属性完整。该流程应根据Egy-DRiVeS数据集的隐私需求进行定制。此外,本文还评估了Roop和Ghost-v2两种人脸替换模型。结果表明,Roop在多个方面均优于Ghost-v2,具体将在下文中讨论。因此,Roop 是将在流程中使用的换脸模型,以在通过身份隐藏保护行人隐私和通过面部属性保留保护数据可用性之间取得平衡。

研究出发点

街道数据集需要人脸和肢体行为信息来构建行人意图或轨迹模型,但未经限制的图像可以实现身份识别和跟踪。模糊处理虽然可以保护身份,但会丢失视线、表情和其他一些后续自动驾驶研究可能需要的信息。

方法概述

该五阶段流程首先使用 YOLOv11 检测行人,然后使用 SCRFD 定位人脸,并可选择使用 CodeFormer 增强低分辨率裁剪区域,接着进行身份互换,最后将结果融合回街景图像。Roop 和 Ghost-v2 的对比分析包括视觉效果、混合形状差异、地标差异、原始身份与互换身份的相似度以及注视向量相似度。

论文总结

与模糊处理相比,换脸技术能更好地保留行为效用,但隐私和效用在不同指标上呈现不同的变化趋势。部署时应谨慎选择来源身份,测试人口统计和着装等极端情况,并评估下游行人模型是否仍然有效;本文尚未提供下游效用或重新识别的评估。

论文 032026-07-02cs.CV

对话式人类视听对话生成

作者与机构

Junhao Song

Department of Computing, Imperial College London, United Kingdom

Lluis Guasch

Department of Earth Science and Engineering, Imperial College London, United Kingdom

Xilin He

Mohamed bin Zayed University of Artificial Intelligence, United Arab Emirates

Zhongyu Yang

Department of Computer Science, Heriot-Watt University, United Kingdom

Yingfang Yuan

School of Computer Science, Northumbria University, United Kingdom

Weicheng Xie

College of Computer Science and Software Engineering, Shenzhen University, China

Linlin Shen

School of Artificial Intelligence, Shenzhen University, China

Guangdong Provincial Key Laboratory of Intelligent Information Processing, Shenzhen University, China

Haijun Lin

School of Engineering and Design, Hunan Normal University, China

Shizhe Liu

Department of Computer Science, University of Oxford, United Kingdom

Wei Pang

Department of Computer Science, Heriot-Watt University, United Kingdom

Siyang Song

Department of Computer Science, University of Exeter, United Kingdom

解决了什么问题

CHAT 将双向交互式视听对话生成定义为一个统一的任务:根据文本提示创建两个身份一致、包含语言和非语言反应的片段,而无需预先录制视频或音频。它还测试生成的数据是否可以用于预训练独立的反应生成模型。

关键结果

在所有对比系统中,CHAT 的 FID (17.33)、唇音同步置信度 (6.89)、反应相关性 (50.02 x 1e-2) 和身份相似度 (0.85) 均表现最佳,在 FVD 和 LPIPS 指标上排名第二。用户对其视觉质量和同步性评分为 4.6/5,对音频和交互性评分为 4.8/5。CHAT-AVD-50k 预训练将 REACT 2024 测试中的 PerFRDiff 反应相关性从 37.21 提升至 40.11,ReactDiff 指标从 24.19 提升至 26.12。

摘要

大规模的双向交互式视听对话(DIAD)数据集为开发类人交互式虚拟代理和数字人提供了基础数据资源。然而,收集此类数据耗时费力,成本高昂,且涉及伦理问题。为了解决这些问题,我们提出了CHAT,一种新的双向交互式视听对话生成(DIADG)框架,它能够根据单个文本提示生成多样化、成对且相互响应的语音-面部对话片段。CHAT将大型语言模型和说话面部模型与交互式音频和面部行为优化模块相结合,从而能够生成内容和面部特征多样化的对齐双向对话片段。实验表明,在客观和主观评价中,CHAT的性能均优于现有针对类似任务设计的相关方法。此外,我们合成的CHAT-AVD-50k数据集可作为下游交互式头部生成算法的有效预训练数据,并在REACT 2024测试中持续提升PerFRDiff和ReactDiff的性能。CHAT为收集真实双向交互数据提供了一种可扩展的替代方案,避免了成本高昂且涉及伦理问题的问题。

研究出发点

训练交互式数字人需要两个人的语音、面部动作、聆听反应和轮流互动。录制大型、多样化的双人数据集成本高昂且涉及伦理问题,而大多数“会说话的头像”系统仅模拟其中一位说话者的面部表情,并未模拟另一位说话者的面部反应。

方法概述

该框架结合了对话和音频规划的语言模型、说话人脸合成、沉默行为生成、反应优化和时间一致性技术,并生成了包含 50,000 个样本的 CHAT-AVD-50k 数据集。评估内容包括 1,000 个生成的对话(包含 FID/FVD)、唇部同步、反应相关性和多样性、ArcFace 身份相似性、LPIPS、一项 60 人参与的研究,以及 PerFRDiff 和 ReactDiff 的下游预训练。

论文总结

CHAT 适用于可扩展的数字人数据和配对交互合成,而非传统的单脸替换。其指标支持视觉、身份和反应质量,但对话层面的时机把握和语义恰当性仍有待提高,且下游测试并非完全独立,因为 CHAT 组件本身已在 REACT 2024 上进行过预训练。