← 블로그로 돌아가기
리서치 레이더얼굴 바꾸기말하는 얼굴들arXiv2026년 7월

월간 arXiv 레이더

2026년 7월 얼굴 바꾸기 논문: 정체성 기준점, 보행자 개인정보 보호 및 반응형 음성 얼굴

7월의 얼굴 합성 연구는 신원 전송의 세 가지 서로 다른 활용 사례를 다룹니다. 첫 번째 논문은 긴 비디오에서 교체된 신원을 안정적으로 유지하기 위해 적응형 앵커 배치를 제안하고, 두 번째 논문은 행동 단서를 보존하면서 신원 확인을 해제하는 수단으로 교체를 사용하며, 세 번째 논문은 단일 화자에서 상호 반응하는 합성 대화로 확장합니다.

이번 달이 보여주는 신호

적응형 신원 고정(Adaptive Identity Anchoring)은 키프레임 배치를 피드백 문제로 취급하며, 검증 가능한 테스트를 제시한다는 점에서 주목할 만하지만, 아직 해당 실험 결과를 보고하지는 않았습니다. 보행자 개인정보 보호 파이프라인(Pedular-Privacy Pipeline)은 얼굴 교체가 어떤 정보를 보존하는지, 특히 가림이나 베일링 상황에서 전체 얼굴 전송이 실패하는 경우를 보여주는 소규모 실증 연구를 제공합니다. CHAT은 음성, 청취자 반응, 발화 구조를 고려하여 두 개의 반응형 신원을 생성하는 규모와 복잡성을 보여주는 동시에, 평가에서 아직 대화 수준의 의미론적 정보를 측정하지는 않는다는 점을 인정합니다. 이 세 논문을 종합하면 신원 유사성만으로는 얼굴 합성의 품질을 판단하기에 충분하지 않다는 것을 알 수 있습니다.

논문 012026-07-23cs.CV

적응형 신원 고정: 비디오 얼굴 교체에서 합성 쌍 지도 학습을 위한 폐쇄 루프 키프레임 배치

저자 및 소속

Logan Robbins

Independent researcher

해결하는 문제

본 논문은 학생 아키텍처를 추가하는 대신 스왑 모델의 기반이 되는 데이터 팩토리에 초점을 맞춥니다. 합성 쌍에 필요한 아이덴티티 앵커의 수, 배치 위치, 그리고 아이덴티티를 유지할 수 없는 클립을 지도 학습 데이터로 사용하기 전에 어떻게 걸러내야 하는지에 대한 질문을 던집니다.

핵심 결과

본 문서는 연구 제안서이며, 완료된 실증적 연구 결과가 아닙니다. 제안서에서는 드리프트 대 앵커 간격 곡선, 동일 예산에서의 균일 배치 대 적응형 배치, 후속 학생 교육, 텍스처 제거, 그리고 인체 미용 필터 연구를 검증 가능한 테스트로 명시하고 있지만, 아직 측정된 신원, 시간, 스펙트럼 또는 사용자 연구 결과의 향상에 대한 보고는 포함하지 않습니다.

초록

비디오 얼굴 교체에는 자연스러운 쌍을 이루는 감독이 없습니다. 한 사람의 얼굴이 다른 사람의 비디오를 연기하는 실제 영상이 존재하지 않기 때문입니다. 현재 가장 강력한 해결책인 DreamID-V의 SyncID-Pipe는 실제 클립의 정확히 두 프레임(첫 번째와 마지막 프레임)에서 신원을 교체하고 나머지는 포즈 시퀀스만으로 재생성하여 쌍을 생성합니다. 포즈에는 교체된 신원의 외형적 증거가 없으므로 긴 클립, 가림 현상, 극단적인 포즈 변화 시 합성된 신원은 고정되지 않은 상태로 오랫동안 표류하게 됩니다. 앵커 개수나 배치에 대한 연구는 아직 발표되지 않았습니다. 본 논문에서는 적응형 신원 앵커링(AIA)을 제안합니다. (i) 프레임에 대한 조건화가 토큰의 노이즈를 0으로 제한하는 확산 강제 방식 변환기에 적합한 아키텍처를 통해 합성기를 임의의 앵커 세트로 일반화합니다. (ii) 생성된 모든 프레임을 실제 참조 이미지와 비교하여 점수를 매기고, 가장 낮은 점수를 받은 프레임에 얼굴이 바뀐 이미지 앵커를 삽입하는 폐쇄형 피드백 루프를 통해 앵커를 배치합니다. 이 과정은 두 이미지 쌍이 임계값을 넘거나 예산을 소진할 때까지 계속됩니다. (iii) 루프의 결과를 자동 데이터 필터로 재사용합니다. 두 번째 문제점인 과도하게 매끄럽게 처리된 피부의 뷰티 필터 효과 또한 동일한 근본 원인을 가지고 있습니다. 즉, 미세 질감은 이미지 식별과 마찬가지로 파이프라인의 어떤 목표에도 반영되지 않습니다. 따라서 AIA를 실제 참조 텍스처 복원과 결합합니다. 각 실제 프레임의 얼굴이 아닌 영역에서 일치하는 리그레인 처리를 수행하고, 실제 영상에서 하위 식별 미세 질감을 대역 분할 전송하며, 영상 자체의 스펙트럼을 기준으로 하는 두 번째 스펙트럼 수용 채널을 사용합니다. 우리는 아이덴티티 앵커 밀도가 제어 가능한 품질 조절 장치라고 주장하며, 이 제안을 검증하거나 반증할 수 있는 검증 가능한 실험들, 즉 드리프트 대 갭 곡선, 동일한 예산에서의 균일 배치 대 적응 배치, AIA에서 생성한 데이터를 사용한 학생 교육, 그리고 인간 미용 필터 연구를 통한 텍스처 제거 등을 구체적으로 제시합니다.

연구 출발점

비디오 얼굴 교체는 자연스러운 쌍을 이루는 정답 데이터가 부족합니다. 대상 인물이 원본 비디오에 실제로 출연한 적이 없기 때문입니다. 기존의 합성 지도 학습은 경계 프레임만 고정할 수 있어 긴 간격, 측면 움직임, 가려짐 등의 경우 직접적인 외모 증거를 확보할 수 없고, 인물이나 피부 질감이 변할 수 있습니다.

방법

적응형 아이덴티티 앵커링은 확산 강제 비디오 합성기를 임의의 조건부 프레임에 적용할 수 있도록 일반화합니다. 폐쇄 루프는 생성된 모든 프레임을 실제 목표 아이덴티티와 비교하여 점수를 매기고, 가장 품질이 낮은 프레임에 이미지 교환 앵커를 삽입한 후, 임계값 또는 앵커 예산에 도달할 때까지 이 과정을 반복합니다. 현실 참조 텍스처 복원은 실제 영상에서 아이덴티티와 관련 없는 미세 텍스처와 노이즈를 별도로 전송하고, 과도하게 매끄러워진 피부를 줄이기 위해 스펙트럼 수용 테스트를 추가합니다.

논문 요약

AIA는 합성 쌍 비디오 데이터를 구축하는 팀을 위한 설계 체크리스트로 유용합니다. 프레임별 식별자를 모니터링하고, 드리프트가 가장 심한 곳에 앵커를 배치하고, 수렴하지 않는 클립을 제거하고, 텍스처를 별도로 평가하는 등의 작업을 수행할 수 있습니다. 현재 AIA의 가치는 방법론적인 측면에 있으며, 기존 파이프라인보다 AIA를 선택하기 전에 구현 및 벤치마크 검증이 필요합니다.

논문 022026-07-09cs.CV

얼굴 바꾸기, 기능 보존하기: ITS에서 보행자 개인 정보 보호를 위한 이중 목적 파이프라인

저자 및 소속

Roba H. Farouk

C-DRiVeS Lab: Cognitive Driving Research in Vehicular Systems, Cairo, Egypt

Computer Science and Engineering Department, Faculty of Media Engineering and Technology, German University in Cairo, Egypt

Catherine M. Elias

C-DRiVeS Lab: Cognitive Driving Research in Vehicular Systems, Cairo, Egypt

Computer Science and Engineering Department, Faculty of Media Engineering and Technology, German University in Cairo, Egypt

해결하는 문제

본 연구는 Egy-DRiVeS 데이터셋에 대해 인물 식별 정보를 제거하면서 자세, 표정, 시선, 그리고 후속 학습에 필요한 충분한 이미지 품질을 유지하는 실용적인 비식별 파이프라인을 개발하는 것을 목표로 합니다. 또한, 인물 클로즈업 이미지에만 의존하는 것이 아니라, 멀리 있거나, 가려지거나, 베일에 가려진 보행자와 같은 특수한 상황에서의 실패 사례도 검토합니다.

핵심 결과

근접 이미지에서 Roop는 블렌드셰이프 차이(1.898 대 2.0478)와 랜드마크 차이(0.00596 대 0.00710)가 더 낮았고, Ghost-v2는 신원 유사도(0.1393 대 0.1997)가 더 낮아 해당 지표에서 더 강력한 은폐 기능을 보여주었습니다. 두 알고리즘 모두 약 0.94의 코사인 유사도로 시선을 잘 보존했습니다. Roop는 네 가지 정량적 지표 중 세 가지에서 우위를 보였으며, 저품질 또는 가려진 거리 얼굴 이미지에서 더 안정적인 성능을 나타낸 반면, Ghost-v2는 베일을 원본 머리카락으로 잘못 대체하는 오류가 발생할 수 있습니다.

초록

자율주행차(AV)와 같은 지능형 교통 시스템(ITS) 애플리케이션에서 실시간 의사결정을 내리는 AI 모델을 학습시키려면 대규모의 다양한 데이터셋이 필요합니다. 보행자의 의도 및 궤적 예측은 자율주행차에 필수적인 모델이며, 이를 위해서는 다양한 보행자 이미지가 포함된 데이터셋이 요구됩니다. 이러한 데이터셋에 대한 무제한 접근은 신원 도용 및 보행자 추적과 같은 심각한 보안 위험을 초래합니다. 핵심 과제는 모델 학습에 필요한 이미지 속성을 유지하면서 개인정보 보호 절차를 적용하는 것입니다. 기존의 개인정보 보호 방법은 보행자의 개인정보를 보호할 수 있지만, 이미지 활용도를 저하시켜 모델의 효율성을 떨어뜨립니다. 본 연구에서는 필수적인 얼굴 속성을 그대로 유지하면서 얼굴 바꾸기를 통해 보행자의 개인정보를 보호하는 5단계 파이프라인을 구현하는 데 중점을 둡니다. 이 파이프라인은 Egy-DRiVeS 데이터셋의 개인정보 보호 요구사항을 충족하도록 설계되어야 합니다. 또한, Roop와 Ghost-v2 얼굴 바꾸기 모델을 평가합니다. 본 연구에서는 Roop가 Ghost-v2보다 여러 측면에서 우수한 성능을 보임을 입증하며, 이에 대한 자세한 내용은 추후 논의될 것입니다. 따라서 Roop는 신원 은폐를 통한 보행자 개인 정보 보호와 얼굴 특징 보존을 통한 데이터 활용성 사이의 균형을 맞추기 위해 파이프라인에서 사용될 얼굴 교체 모델입니다.

연구 출발점

거리 데이터 세트는 보행자의 의도 또는 궤적 모델을 구축하는 데 얼굴과 신체 행동 정보가 필요하지만, 제한 없는 이미지는 식별 및 추적을 가능하게 합니다. 흐림 처리는 신원을 보호하지만, 시선, 표정 및 자율 주행 연구에 필요한 기타 단서를 잃게 됩니다.

방법

5단계 파이프라인은 YOLOv11을 사용하여 보행자를 감지하고, SCRFD를 사용하여 얼굴을 위치 파악하며, 선택적으로 CodeFormer를 사용하여 저해상도 이미지를 개선하고, 신원을 교환한 후, 결과를 다시 거리 이미지에 합성합니다. Roop와 Ghost-v2는 시각적 비교, 블렌드셰이프 차이, 랜드마크 차이, 원본과 교환된 신원 간의 유사도, 시선 벡터 유사도를 통해 비교됩니다.

논문 요약

얼굴 바꾸기 기술은 흐림 처리보다 행동적 유용성을 더 많이 유지할 수 있지만, 개인 정보 보호와 유용성은 측정 기준에 따라 서로 다른 방향으로 움직입니다. 배포 시에는 소스 신원을 신중하게 선택하고, 인구 통계학적 및 복장 관련 예외 상황을 테스트하며, 후속 보행자 모델이 여전히 제대로 작동하는지 측정해야 합니다. 본 논문에서는 후속 모델의 유용성 또는 재식별 평가에 대한 내용은 아직 다루지 않습니다.

논문 032026-07-02cs.CV

대화형 인간 시청각 대화 생성

저자 및 소속

Junhao Song

Department of Computing, Imperial College London, United Kingdom

Lluis Guasch

Department of Earth Science and Engineering, Imperial College London, United Kingdom

Xilin He

Mohamed bin Zayed University of Artificial Intelligence, United Arab Emirates

Zhongyu Yang

Department of Computer Science, Heriot-Watt University, United Kingdom

Yingfang Yuan

School of Computer Science, Northumbria University, United Kingdom

Weicheng Xie

College of Computer Science and Software Engineering, Shenzhen University, China

Linlin Shen

School of Artificial Intelligence, Shenzhen University, China

Guangdong Provincial Key Laboratory of Intelligent Information Processing, Shenzhen University, China

Haijun Lin

School of Engineering and Design, Hunan Normal University, China

Shizhe Liu

Department of Computer Science, University of Oxford, United Kingdom

Wei Pang

Department of Computer Science, Heriot-Watt University, United Kingdom

Siyang Song

Department of Computer Science, University of Exeter, United Kingdom

해결하는 문제

CHAT는 양방향 상호작용 시청각 대화 생성 작업을 하나의 통합된 작업으로 정의합니다. 즉, 사전 녹화된 비디오나 오디오 없이 텍스트 프롬프트로부터 동일성, 언어적 및 비언어적 반응을 보이는 두 개의 클립을 생성하는 것입니다. 또한 생성된 데이터를 사용하여 별도의 반응 생성 모델을 사전 학습시킬 수 있는지 여부도 테스트합니다.

핵심 결과

CHAT은 비교 대상 시스템 중 FID(17.33), 립싱크 신뢰도(6.89), 반응 상관관계(50.02 x 1e-2), 신원 유사도(0.85)에서 최고 점수를 기록했으며, FVD와 LPIPS에서는 2위를 차지했습니다. 사용자들은 시각적 품질과 동기화에 대해 5점 만점에 4.6점, 오디오 및 상호작용성에 대해 5점 만점에 4.8점을 부여했습니다. CHAT-AVD-50k 사전 학습은 REACT 2024 데이터셋에서 PerFRDiff 반응 상관관계를 37.21에서 40.11로, ReactDiff를 24.19에서 26.12로 향상시켰습니다.

초록

대규모 쌍방향 상호작용 오디오-비주얼 대화(DIAD) 데이터셋은 휴머노이드 상호작용 가상 에이전트 및 디지털 휴먼 개발을 위한 핵심 데이터 자원을 제공합니다. 그러나 이러한 데이터를 수집하는 것은 시간과 비용이 많이 소요되며 윤리적으로도 민감한 문제입니다. 이러한 문제를 해결하기 위해 본 논문에서는 단일 텍스트 프롬프트로부터 다양하고, 쌍을 이루며, 상호 반응하는 음성-얼굴 대화 클립을 생성하는 새로운 쌍방향 상호작용 오디오-비주얼 대화 생성(DIADG) 프레임워크인 CHAT을 제안합니다. CHAT은 대규모 언어 모델과 말하는 얼굴 모델을 상호작용 오디오 및 얼굴 동작 정제 모듈과 통합하여 다양한 내용과 얼굴 정체성을 가진 정렬된 쌍방향 대화 클립 생성을 가능하게 합니다. 실험 결과, CHAT은 객관적 및 주관적 평가 모두에서 유사한 작업을 위해 설계된 기존 관련 방법보다 우수한 성능을 보여줍니다. 또한, 본 연구에서 합성한 CHAT-AVD-50k 데이터셋은 후속 인터랙티브 헤드 생성에 효과적인 사전 학습 데이터로 활용되어 REACT 2024에서 PerFRDiff 및 ReactDiff 값을 지속적으로 향상시켰습니다. CHAT은 비용이 많이 들고 윤리적으로 민감한 실제 양방향 상호작용 데이터 수집에 대한 확장 가능한 대안을 제공합니다.

연구 출발점

상호작용 가능한 디지털 휴먼을 훈련하려면 두 사람의 음성, 얼굴 움직임, 청취 반응 및 차례대로 말하기 등의 데이터가 필요합니다. 대규모의 다양한 2인 데이터 세트를 녹음하는 것은 비용이 많이 들고 윤리적으로 민감한 문제이며, 대부분의 토킹헤드 시스템은 한 화자의 얼굴만 애니메이션화하고 다른 화자의 얼굴 반응은 모델링하지 않습니다.

방법

이 프레임워크는 대화 및 오디오 계획을 위한 언어 모델과 말하는 얼굴 합성, 침묵 동작 생성, 반응 개선 및 시간적 일관성을 결합합니다. 이를 통해 5만 개의 샘플로 구성된 CHAT-AVD-50k 데이터셋을 생성합니다. 평가는 FID/FVD, 립싱크, 반응 상관관계 및 다양성, ArcFace 신원 유사도, LPIPS, 60명 규모의 연구, 그리고 PerFRDiff 및 ReactDiff에 대한 다운스트림 사전 학습을 포함한 1,000개의 생성된 대화를 대상으로 수행되었습니다.

논문 요약

CHAT는 기존의 단일 얼굴 교체 방식이 아닌 확장 가능한 디지털-인간 데이터 및 쌍으로 이루어진 상호작용 합성과 관련이 있습니다. CHAT의 지표는 시각적 품질, 정체성 및 반응 품질을 지원하지만, 대화 수준의 타이밍과 의미적 적절성은 여전히 ​​개선의 여지가 있으며, CHAT 구성 요소 자체가 REACT 2024에서 사전 학습되었기 때문에 하위 테스트는 완전히 독립적이지 않습니다.