← 블로그로 돌아가기
연구 레이더얼굴 교체시각 편집arXiv2026년 9월

월간 arXiv 레이더

2026년 9월 얼굴 교체 논문: 조명 조화, 참조 주의, 실시간 더빙

9월 논문들은 하나의 직접 얼굴 합성(direct face-compositing) 방법과 두 개의 인접 신원 편집(identity-editing) 시스템을 제공합니다. 그림자 조화(shadow-harmonization) 파이프라인은 잘못된 추정치가 승인된 얼굴 색을 바꾸거나 밝게 할 수 없도록 변경 가능한 범위를 의도적으로 제한합니다. RefGAP는 일곱 개의 회귀 편집기 전체에서 참조 주의를 조정하고 추론 시(corrects it at inference time) 이를 수정합니다. TBDub은 시각적 더빙 모델을 제작 영상에 맞게 적용한 후, 30단계 노이즈 제거를 두 단계로 축소하면서 신원(identity), 입술 싱크(lip sync), 시각 품질, 그리고 종단 간 처리량(end-to-end throughput)을 측정합니다.

이번 달이 보여주는 신호

기하학적 기반 하모나이저는 유한하고 채널 균일한 어두운 필드만 적용합니다; 분석 대리 지표에서 얼굴 픽셀의 56.5%가 변하고, 평균 게인은 0.938이며, 픽셀은 밝게 보이지 않지만, 논문은 실제 이미지에서의 지각 승리를 주장하지 않습니다. RefGAP은 두 계수를 한 번 보정한 후, 1,040개의 헤드 스왑 클립과 1,000개의 페이스 스왑 쌍에서 7개의 이미지/비디오 편집기 간 동일성 유사성을 개선합니다; 교체 성공률은 각각 최소 86%와 82%에 도달하며, 포즈와 보존 측면에서 측정 가능한 트레이드오프가 존재합니다. TBDub의 투스텝 학생은 H20에서 512 x 512에서 7.13 FPS에 도달하며, 교사보다 13.93배 빠른 종단 간 속도입니다. 인간 평가는 교사의 정체성을 유지하고 립싱크와 시각적 품질을 약간 향상시킵니다. 구매자에게 중요한 차이점은 위험입니다: 결정론적 경계, 추론 시간 제어, 그리고 정류된 생성은 서로 다른 실패 모드와 검증 요구를 가집니다.

논문 012026-09-15cs.CV

복합 얼굴을 위한 기하학적 기반 그림자 조화: 곱셈적이고 알베도 보존 재조명 파이프라인

저자 및 소속

Vijesh KP

Independent researcher (no institutional affiliation stated in the paper)

해결하는 문제

이 논문은 기증자의 색상과 신원은 허용 가능하지만 형태 그림자가 없는 좁은 경우를 대상으로 합니다. 픽셀을 밝게 하거나 색도를 변경하거나 새로운 얼굴을 합성하지 않고 근사 얼굴 기하학에서 코, 안와, 입술 및 공동 그림자를 주입하는 방법을 묻습니다.

핵심 결과

논문에서 알려진 조명 조건 하에 분석적 얼굴 높이 필드(face heightfield)에서, 기본 설정은 얼굴 픽셀의 56.5%를 수정하고, 전체적으로 평균 게인은 0.938이며 수정된 픽셀에서는 0.890이고, 3.4%의 픽셀을 0.82 바닥값으로 보냅니다. 밝게 된 픽셀은 없으며 부동 소수점 노이즈를 넘어서는 수학적 색상 각도 변화도 없습니다. 이러한 수치는 지각 품질보다는 제한된 연산자를 특징짓는 것이며, 논문에서는 실제 합성 쌍 벤치마크나 기준 비교를 제공하지 않습니다. 하이라이트를 추가하거나 이미 어두운 도너를 보정하고, 반대쪽 소스 조명을 제거하거나 이중 그림자 잔여 도너 음영을 피할 수 없습니다.

초록

얼굴 교환과 얼굴 합성 파이프라인은 기하학적으로 잘 정렬되었지만 광도학적으로는 비현실적인 얼굴을 일상적으로 만들어냅니다: 기증자 얼굴은 평면적이고 거의 전면 스튜디오 조명을 전달하는 반면, 호스트 몸체와 배경은 방향성 장면 조명을 전달합니다. 기존 대부분의 해결책은 색상 전송, 신경 재조명 또는 역렌더링을 통해 얼굴을 재합성하여 정체성, 피부 톤, 질감을 변화시킬 위험이 있습니다. 우리는 보수적인 대안인 기하학 기반 형태-그림자 주입(form-shadow injection)을 제시합니다. 파이프라인은 얼굴을 절대 다시 칠하지 않습니다. 래스터화된 3D 얼굴 프록시에서 픽셀당 게인 필드 $g\in[g_{\min},1]$를 추정하고, 이를 채널 단위로 선형 RGB에 곱하여 연산자는 어둡게만 할 수 있고 색채도 이동할 수 없습니다. 조밀한 랜드마크 메쉬를 래스터화하여 깊이 버퍼로 변환하며, 이를 통해 표면 노멀, 공동체 항, 그리고 화면 공간이 그림자를 드리웁니다. 키 라이트 방향은 호스트 측 단서(몸, 배경, 머리 헤일로)에서 추정됩니다; 얼굴 단서는 기증자의 조명을 회복하기 때문에 가중치가 낮아집니다. 그림자 크기는 호스트와 일치하지 않으며, 세 매개변수 전송 $(τ,σ,g_{\min}))으로 설정됩니다. 음영 영역은 피부 위의 75번째 백분위수로 나누어지고, 그 후 게이트, 스케일링, 클램프, 매끄럽게 처리된 후 깃털 모양의 스킨 게이트 페이스 마스크 안에서 다시 클리핑됩니다. 분석적 면 높이장에서는 기본 $(τ,σ,g_{\min})=(0.90,0.45,0.82)$는 평균 게인 0.938(수정된 픽셀은 0.890)로 56.5%의 얼굴 픽셀을 수정하고, 3.4%의 픽셀을 바닥으로 밀어냅니다. 색조 불변성은 연산자의 수반입니다. 우리는 폐쇄형 전송을 분석하고, 매개변수를 제거하며, 단조 어두움만 적용하는 형태의 실패 모드(비평면 공도체의 이중 그림자 포함)를 논의합니다.

연구 출발점

교체된 얼굴은 기하학적으로 정렬되고 신원이 정확할 수 있지만, 기증자는 스튜디오 조명을 받은 반면 호스트 장면에는 방향성 키 조명이 있기 때문에 여전히 붙여 넣은 것처럼 보일 수 있습니다. 생성 조명(Generative relighting)은 더 많은 효과를 수정할 수 있지만, 얼굴이 이미 승인된 후에는 피부 톤, 모공, 질감 또는 신원이 변경될 수 있습니다. 제작팀은 때때로 최악의 방사광학적 변화가 알려진 의도적으로 제한된 조작자를 필요로 합니다.

방법

얼굴 감지기와 468점 메시는 512픽셀 크롭에서 래스터화된 깊이 버퍼, 표면 법선, 공동 프록시, 화면 공간 드리워진 그림자를 생성합니다. 호스트 측의 몸통, 배경, 목, 헤어-헤일로 신호가 키 조명 방향을 결정하는 동안 기증자 얼굴 신호는 낮게 가중됩니다. 정규화된 음영 맵은 3-매개변수 임계값, 강도, 최소 게인 변환을 거치고, 그 다음에 가이드 스무딩과 깃털링된 피부 마스크가 적용됩니다. 동일한 스칼라 게인은 모든 선형 RGB 채널에 곱해지고 0.82에서 1.0 범위로 클리핑됩니다.

논문 요약

이는 완전한 재조명 시스템이 아니라 합성 후 보수적 제어로, 손상 범위를 이해할 수 있습니다. 실제 촬영본에서 잘못된 조명 방향과 이중 그림자를 검토한다면, 정체성 보존이 극적인 리얼리즘보다 중요할 때 매력적입니다.

논문 022026-09-28cs.CV

RefGAP에 주목: 확산 기반 시각 편집의 참조 어텐션 보정

저자 및 소속

Yanan Wang

Mohamed bin Zayed University of Artificial Intelligence

Institute of Foundation Models

Shengcai Liao

United Arab Emirates University

Guangyi Liu

Mohamed bin Zayed University of Artificial Intelligence

Institute of Foundation Models

Xiaodan Liang

Mohamed bin Zayed University of Artificial Intelligence

해결하는 문제

RefGAP은 재학습 없이, 모델마다 별도의 보정 강도를 전면적으로 설정하지 않고도 다양한 이미지 및 비디오 편집기 전반에서 참조 정체성 충실도를 향상시키는 것을 목표로 합니다. 이는 편집 마스크 내부에서 참조 사용을 강하게 하고, 유지되어야 하는 영역에서는 이를 억제하는 것을 명시적으로 균형 있게 수행합니다.

핵심 결과

1,040개의 HeadSwapBench 클립에서 일곱 개 범용 편집기 모두 정체성 유사성이 향상되었고, 정의된 경우 교체 성공률은 최소 86%에 도달합니다; 전체 머리 유사성 또한 일곱 개 모두에서 증가합니다. 1,000개의 FaceForensics 얼굴 스왑 쌍에서 각 편집기 전반에 걸쳐 정체성 유사성이 향상되었으며, 교체 및 올바른 검색률은 각각 최소 82%와 75%입니다. 전문화된 DirectSwap 모델에 적용하면 정체성 유사성이 0.7019에서 0.7450으로 상승하고 전체 프레임 LPIPS는 거의 변하지 않습니다. 이러한 향상은 여러 시스템에서 주요 점 오류가 증가하고 비편집 유지가 혼합되는 결과를 가져옵니다; 배경 교체는 안정적으로 전송되지 않습니다. 통합되지 않은 주의 구현은 또한 상당한 메모리 또는 지연을 추가할 수 있으므로 통합 품질이 중요합니다.

초록

참고 유도 확산 편집기(reference-guided diffusion editors)는 사용자가 제공한 참고 이미지를 충실히 재현하는 데 어려움을 겪습니다. 우리는 확산 편집기에서 잠재적 병목 현상을 확인했습니다: 많은 방법이 제한된 참고 주의(reference-attention) 할당만 제공합니다. 예를 들어, LoomVideo에서 편집 영역 쿼리는 참고(reference)로의 주의량을 1% 미만으로 할당합니다. 우리는 RefGAP을 도입했습니다. 이는 참조 주의량을 전진 패스(forward pass) 동안 측정하여 각 레이어에서 로그 오프셋(logit-offset) 크기를 온라인으로 결정하는 훈련 없는 보정 방법입니다. 편집 영역 쿼리에 대한 참고 로그에 양의 오프셋을 적용하면 참고 사용이 강화되고, 유지 영역(keep-region) 쿼리에 대한 음의 오프셋은 편집 외부에서 참고로 인한 변화를 제한합니다. 두 개의 전역 계수가 보정을 제어하며, 이는 네 개 개발 확산 편집기(validation data)에서 한 번 선택 후 고정됩니다. 일곱 가지 확산 기반 이미지/영상 편집기에서, RefGAP은 얼굴 변경(head swapping)과 얼굴 교체(face swapping)에서 정체성 충실도를 향상시킵니다. RefGAP은 접근별 강도 조정을 하지 않고도 별도로 조정된 일정 편집측 편향(constant edit-side biases)과 비교 가능한 충실도-보존 균형(fidelity-preservation trade-off)을 달성합니다. 가상 착용(virtual try-on)과 배경 교체 실험은 정체성 편집을 넘어 전이 가능성을 평가합니다.

연구 출발점

참조 기반 확산 편집기는 올바른 소스 얼굴을 받을 수 있지만 거의 주의를 기울이지 않을 수 있습니다. 저자 측정에서 LoomVideo 편집 영역 쿼리는 참조에 대한 관심 질량의 1% 미만을 할당합니다. 고정된 주의력 증가는 정체성을 강화할 수 있지만 모델별 조정이 필요하며 머리카락, 의상, 배경, 자세 또는 변경되지 않아야 하는 표정에 참조 외형이 누출될 수 있습니다.

방법

각 주의 계층 동안 RefGAP은 참조 토큰에 할당된 주의 비율을 편집 쿼리와 유지 쿼리별로 별도로 측정합니다. 관찰된 질량에서 온라인 로짓 오프셋을 도출합니다: 양의 오프셋은 편집 영역에서 참조 키를 강화하고, 음의 오프셋은 유지 영역에서 이를 제한합니다. 두 개의 전역 계수와 계층 선택 규칙은 네 개의 개발 편집기를 사용한 40개의 헤드 스왑 클립에서 한 번 보정되며, 이후 일곱 개 편집기, 세 개의 보류 시스템, 얼굴 스왑, 가상 착용, 배경 교체에 걸쳐 고정됩니다.

논문 요약

실제 참조 주의 측정은 정체성 편집을 위한 유용한 모델 무관 제어 신호이지만, 더 강한 정체성 전송은 기하 구조 및 유지 영역을 변경할 수 있습니다. 팀은 정체성 유사성만으로는 충분하지 않으며, 작업 특화 품질 게이트가 필요합니다.

논문 032026-09-05cs.CV

TBDub: 제작 지향 시각 더빙

저자 및 소속

Bihan Li

TaoLive AIGC, Taobao & Tmall Group, Alibaba

Xinyang Li

TaoLive AIGC, Taobao & Tmall Group, Alibaba

Zeran Xu

TaoLive AIGC, Taobao & Tmall Group, Alibaba

Meiguang Jin

TaoLive AIGC, Taobao & Tmall Group, Alibaba

Junfeng Ma

TaoLive AIGC, Taobao & Tmall Group, Alibaba

해결하는 문제

TBDub는 기존의 비디오 확산 더빙 스택을 제작 영상에 맞게 적용하며, 투스텝 학생이 교사의 인식된 정체성, 동기화, 시각적 품질을 유지할 수 있는지 묻습니다. 재구성, 오디오 응답, 인간 평가, 그리고 전체 VAE-대 VAE 생성 경로를 평가하며, 단지 소음 제거 속도만 인용하는 것이 아닙니다.

핵심 결과

38개의 TalkVid 클립에서 교사는 X-Dub보다 보고된 8가지 재구성, 지각, 동일, 동기화 지표를 모두 향상시켰습니다. 각 방법당 114개의 평가에서 X-Dub의 립싱크, 정체성, 시각 품질 MOS 값 3.57, 2.83, 2.88이 교사의 경우 3.71, 3.78, 3.78로 상승했습니다. 학생은 3.85, 3.72, 3.80 점수를 받아 정체성을 유지하면서 립싱크와 시각적 품질을 선도합니다. 한 H20에서 512 x 512 시 학생은 7.13 유효 FPS에 도달한 반면 교사는 0.51에 비해 13.93배 속도 향상; DiT 단계만 해도 42.49배 더 빠릅니다. 벤치마크는 작고, 여러 전처리 및 인코딩 단계를 제외하며, 매우 낮은 해상도의 입력은 여전히 실패 사례로 남아 있습니다.

초록

시각적 더빙은 입 움직임과 대체 음성을 동기화하면서도 정체성, 외형, 시간적 일관성을 유지해야 합니다. X-Dub은 강력한 마스크 없는 비디오 편집 기준선을 제공하지만, 라이브 스트림 및 생성 비디오 콘텐츠에 적용할 경우 제작 영역의 견고성, 시간 및 동작 안정성, 정체성 및 구두 세부 보존, 추론 효율성 측면에서 한계가 드러납니다. 우리는 작업 적응형 사후 학습과 작업 인식 소수 단계 증류를 결합한 X-Dub 생산 지향 확장인 \textbf{TBDub}를 소개합니다. 후처리 기술은 생산 도메인 데이터, 제작 특화 조건화 및 필터링, 향상된 오디오 기능을 사용하여 비디오 DiT를 조정하여 30단계 교사를 얻습니다. 증류는 DMD/DMD2를 조건부 비디오 편집에 적응시키고 교사를 2단계 학생으로 압축합니다. 38개의 TalkVid 클립에서 교사는 보고된 8가지 재구성, 지각, 정체성, 동기화 지표를 X-Dub보다 모두 향상시켰습니다. MOS 평가에서는 립싱크 일관성, 정체성 일관성, 시각 품질을 X-Dub보다 0.14, 0.95, 0.90점 향상시켰으며, 학생은 립싱크 및 시각 품질 점수가 가장 높고 정체성 일관성에서 교사와 근접한 수준을 유지했습니다. 단일 NVIDIA H20 GPU에서 첫 VAE 인코딩부터 최종 VAE 디코딩까지 쌍으로 종단 간 생성 타이밍을 512달러 또는 시간512달러에 적용할 때, 학생은 7.13 유효 FPS에 도달하고 총 지연 시간을 13.93달러 줄였습니다; DiT 단계만 해도 42.49달러 가속됩니다. 학생은 교사의 생성 품질과 시청각 동기화를 대부분 유지합니다. 코드는 GitHub의 \https://github.com/TaoLiveAIGC/TBDub 에서 볼 수 있으며, 30단계 교사 및 2단계 학생 가중치는 Hugging Face at https://huggingface.co/TaoLiveAIGC/TBDub 에서 확인할 수 있습니다.

연구 출발점

시각적 더빙은 입 움직임을 충분히 변화시켜 대체 음성을 표현하면서도 식별, 치아, 입술 질감, 자세, 조명, 가림, 모든 비음성 영역을 시간에 따라 안정적으로 유지해야 합니다. X-Dub은 마스크 없는 비디오 편집기를 제공하지만, 라이브 및 생성 비디오 입력에서는 도메인 이동, 깜박임, 구두 디테일 드리프트, 30단계 노이즈 제거 지연이 노출됩니다.

방법

작업 적응형 사후 학습은 생산 영역 데이터와 상속된 학습 분포를 혼합하고, HuBERT 대형 레이어로 오디오 기능을 강화하며, 조건을 비대칭적으로 저하시키고, 모션 드롭아웃과 공간 및 시간 가중 흐름 매칭을 사용하여 30단계 교사를 만듭니다. 조건부 DMD/DMD2 절차는 해당 교사를 미분 가능한 2단계 학생으로 정제하며, 동적 가짜 점수 훈련, 단계별 영역 선택 감독, 인과 1차 잠재 처리, 전시간 단계 샘플링, FP32 안내 산술, FP32 EMA 가중치를 제공합니다.

논문 요약

2단계 시각 더빙은 훨씬 더 나은 품질 처리량을 제공할 수 있지만, 보고된 7.13 FPS는 발전 코어에 제한되어 있습니다. 제작 용량에는 오디오, 페이스 트래킹, 합성, 인코딩, 장시간 영상 안정성이 포함되어야 합니다.