← 블로그로 돌아가기
리서치 레이더얼굴 교환말하는 얼굴arXiv2026년 8월

월간 arXiv 레이더

2026년 8월 얼굴 교환 논문: 실시간 초상화, 1분 아바타, 감정 제어

어거스트의 얼굴 교환과 디지털-휴먼 연구는 단일 정체성 이전 기법보다는 지속적이고 통제 가능한 상호작용에 초점을 맞춥니다. 선정된 시스템은 재사용 가능한 움직임과 외형을 분리하고, 오프라인 오디오-비디오 모델을 미분 규모의 스트리머로 추출하며, 잠재적 감정 의미론과 명확한 블렌드셰이프 기하학을 결합합니다.

이번 달이 보여주는 신호

Proxy Avatar가 Low Rank 캐싱을 만나는 게임은 RTX 4090에서 재사용 가능한 감정 퍼포머와 단발성 정적 이미지 재타겟팅 및 캐싱을 분리하여 32 FPS에 도달합니다. Omni-LiveAvatar는 데이터 중심 영역을 다루며, 자기회귀 증류와 경계 장-단메모리를 사용해 1분 동안 공동 오디오와 비디오를 일관성 있게 유지합니다. GemTalk은 제어 인터페이스에 집중하여 명시적인 블렌드셰이프 기하학이 암묵적 감정 기능의 강도를 확장하도록 합니다. 함께 세 가지 제품 선택지를 매핑합니다: 개인화된 모션 재사용, 연속 스트리밍 인프라, 그리고 세밀한 표현 방향.

논문 012026-08-03cs.CV

프록시 아바타와 저랭크 캐싱의 만남: 실시간 원샷 감정 제어 가능한 초상 애니메이션

저자 및 소속

Haijie Yang

Nanjing University of Science and Technology, China

Jindi Bao

Nanjing University of Science and Technology, China

Yixuan Dong

Tsientang Institute for Advanced Study, China

Hongliang Zhang

Nanjing University of Science and Technology, China

Jian Bi

Nanjing University of Science and Technology, China

Hao Tang

Peking University, China

Zhenyu Zhang

Nanjing University, China

Jianjun Qian

Nanjing University of Science and Technology, China

Jian Yang

Nanjing University of Science and Technology, China

해결하는 문제

이 논문은 재사용 가능한 감정 움직임, 교차 정체성 리타겟팅, 외관 렌더링을 분리하여 단일 참조 초상화를 오디오와 감정 라벨로 실시간으로 애니메이션화할 수 있도록 합니다. 각 대상 정체성에 대한 캐시를 재학습하지 않고도 반복적인 참조 특징 계산을 구체적으로 제거합니다.

핵심 결과

RTX 4090에서는 전체 시스템이 32 FPS로 동작합니다. 자가 재구성 시 PSNR 31.24, LPIPS 0.018, SSIM 0.883, 립싱크 점수 6.314를 기록하며, EmoTag의 높은 원시 프레임 레이트에도 불구하고 대부분의 품질 및 모션 지표에서 1위를 차지했습니다. 교차 신원 운전에서는 29.64 FID, 0.745 정체성 유사성, 75.4% 감정 정확도, 6.096 립싱크를 기록했습니다. 참가자들은 감정 표현 70%, 립 싱크가 60%, 시각적 사실성 65%에서 선호했습니다; 확장된 클립에서는 명확한 정체성이나 싱크 드리프트가 없었습니다.

초록

오디오 기반 인물 애니메이션은 확산 기반 생성 모델로 빠르게 발전했지만, 표현적 감정 제어가 가능한 실시간 원샷 생성은 여전히 도전적입니다. 기존 방법들은 감정 인식 동작 사전에 부족하고, 다단계 노이즈 제거 시 비용이 많이 드는 외관 계산이 문제입니다. 이러한 문제를 해결하기 위해 우리는 실시간 원샷 감정 제어 가능한 초상화 애니메이션을 위한 계쇄 프레임워크인 Proxy Avatar Meets Low-Rank Caching을 제안합니다. 우리는 오디오 기반 감정 대리 아바타를 직접 생성하는 대신, 가우시안 기반 감정 대리 아바타를 재사용 가능한 모션 생성기로 사용하며, 단일 정체성에 한 번 학습하여 오디오와 감정 라벨로부터 표현력 있는 주행 영상을 생성합니다. 프록시 아바타는 대상 외형이나 기하학이 아닌 움직임만 제공하기 때문에, 대규모 원샷 리타겟팅 모델은 프록시 성능에서 정체성 독립적 움직임을 추출하여 임의의 대상 초상화에 맞게 조정합니다. 추론 효율을 높이기 위해 우리는 저랭크 캐싱을 통한 제로 샷 외관 재사용(zero-shot appearance reuse)을 도입하는데, 이는 초기 노이즈 제거 단계에서 참조 외관 특징을 캐시하고 경량 저랭크 어댑터를 사용해 이후 특징 변형을 모델링합니다. 광범위한 실험 결과, 이 방법은 더 강한 감정 표현력, 더 나은 정체성 보존 애니메이션, 그리고 추론 비용을 크게 줄여 실시간 원샷 초상화 애니메이션을 가능하게 함을 입증했습니다.

연구 출발점

원샷 토킹 초상화는 보이지 않는 인물의 외모를 보존하고, 대사를 따라가며, 요청된 감정을 표현하고, 사용 가능한 하드웨어에서 인터랙티브하게 실행되어야 합니다. 확산 시스템은 노이즈 제거 과정에서 거의 정적인 외관 특징을 반복적으로 재계산하며, 감정 제어는 종종 정체성과 움직임을 얽히거나 각 스타일에 대한 참조 영상이 필요합니다. 결과적으로 표현력 있지만 느린 생성이거나, 감정 범위가 약한 빠른 애니메이션이 나옵니다.

방법

가우시안 기반 프록시 아바타는 한 명의 연기자에게서 한 번 훈련되며, 오디오 및 감정 조건 동작 생성기로만 사용됩니다. 대규모 원샷 리타게팅 네트워크는 그 프록시 비디오에서 정체성 독립적인 움직임을 추출하여 임의의 대상 초상화에 적용합니다. 적은 단계 확산 동안, 제로 샷 외관 재사용은 첫 단계에서 참조 특징을 캐시하고, 경량 저순위 어댑터는 이후 변형만 모델링합니다. 이러한 연쇄 분담은 자기 재구성, 교차 정체성 원샷 주행, 장기 비디오 안정성, 절제, 그리고 20명의 참가자를 대상으로 한 블라인드 연구에서 평가됩니다.

논문 요약

재사용 가능한 프록시와 리타게이팅 설계는 사용자별 확산 훈련 없이도 실시간 감정 아바타를 실용적으로 만듭니다. 소비자용 RTX 4090에서 보고된 32 FPS는 유망하지만, 배포 규모에는 일회성 프록시 훈련과 대규모 리타겟팅 모델의 품질/비용 균형을 포함해야 하며, 단순한 고정 프레임 속도만이 아닙니다.

논문 022026-08-07cs.MM

Omni-LiveAvatar: 분 단위 실시간 스트리밍 통합 오디오-비디오 아바타 생성

저자 및 소속

Lunjie Zhu

iComAI Lab, Hong Kong University of Science and Technology, Hong Kong

Vivix Group Limited, Hong Kong

Xingtong Ge

iComAI Lab, Hong Kong University of Science and Technology, Hong Kong

Vivix Group Limited, Hong Kong

Fangyu Lin

iComAI Lab, Hong Kong University of Science and Technology, Hong Kong

Vivix Group Limited, Hong Kong

Yi Zhang

Vivix Group Limited, Hong Kong

Zhening Liu

iComAI Lab, Hong Kong University of Science and Technology, Hong Kong

Mengfei Li

iComAI Lab, Hong Kong University of Science and Technology, Hong Kong

Vivix Group Limited, Hong Kong

Yumeng Zhang

iComAI Lab, Hong Kong University of Science and Technology, Hong Kong

Guanglu Song

Vivix Group Limited, Hong Kong

Yu Liu

Vivix Group Limited, Hong Kong

Jun Zhang

iComAI Lab, Hong Kong University of Science and Technology, Hong Kong

해결하는 문제

Omni-LiveAvatar는 대규모 오프라인 공동 오디오-비디오 교사를 인과 스트리밍 생성기로 변환하며, 긴 맥락과 변화하는 프롬프트라는 별도의 안정성 문제를 해결합니다. 이 플랫폼의 목표는 독립적으로 생성된 짧은 클립의 연속이 아닌 연속적인 분 단위 생성입니다.

핵심 결과

5초 클립에서는 19.57 FPS로 0.60 FPS 교사보다 약 33배 빠르며, 테스트 시스템 중 최고 품질 점수(81.72)와 완벽한 인간 신원 및 의상 충도 점수를 기록했습니다. 62세대에서는 21.99 FPS에 도달하며, 두 번째로 빠른 기준선 16.18에 비해 높습니다. 분 단위 인간 정체성 점수는 98.61 대 67.60과 50.19, Sync-C는 6.76 대 0.72 및 0.28, 텍스트-비디오 정렬은 9.82 대 6.68과 5.46이며, 아바타와 배경 드리프트가 눈에 띄게 줄었습니다.

초록

공동 오디오-비디오 생성 모델은 몰입형 상호작용형 디지털-인간 생성의 기초 역할을 합니다. 그럼에도 불구하고 대부분의 기존 모델은 양방향 주의와 다단계 노이즈 제거에 의존하며, 짧은 클립만 생성할 수 있어 장시간 실시간 상호작용에 적합하지 않습니다. 우리는 분 단위의 실시간 스트리밍 공동 오디오-비디오 아바타 생성을 위한 최초의 프레임워크인 Omni-LiveAvatar를 제안합니다. 구체적으로, (1) 보조 안정화 메커니즘 없이 대규모 양방향 공동 오디오-비디오 확산 모델을 몇 단계 자기회귀 생성기로 전송하는 점진적 자기회귀 증류 파이프라인을 제안합니다; (2) 제한된 메모리 예산 내에서 전 지구적 일관성을 유지하는 동기화된 오디오-비디오 장기 기억; 그리고 (3) 일관된 의미 진화와 원활한 프롬프트 전환을 가능하게 하는 계층적 롤링 프롬프트 계획 전략을 제안합니다. 광범위한 실험 결과, Omni-LiveAvatar는 실시간으로 고품질의 동기화된 분 단위 아바타를 생성하는 것으로 나타났습니다. 속도 측면에서는 단일 NVIDIA H200 GPU에서 교사용 LTX-2보다 33$\times$ 발전을 달성합니다; 생성 품질 측면에서는 시각적 품질, 오디오 품질, 교차 모달 동기화, 인간 충실도에서 가속된 베이스라인보다 더 우수합니다. 저희 코드는 https://github.com/Aoko955/Omni-LiveAvatar 에서 이용 가능합니다.

연구 출발점

공동 오디오-비디오 생성기는 설득력 있는 짧은 클립을 합성할 수 있지만, 양방향 주의와 다단계 확산은 실시간 상호작용을 방해하며, 가속된 자기회귀 변형은 긴 세션에서 정체성, 배경, 오디오 품질, 입술 동기화 등이 분산됩니다. 유용한 디지털 인간은 두 모달리티를 몇 분간 제한된 기억 하에 보존하고, 갑작스러운 의미론적 또는 음향적 전환 없이 진화하는 프롬프트를 수용해야 합니다.

방법

3단계 점진적 자기회귀 증류 파이프라인은 LTX-2를 외부 보상 모델이나 모달리티별 안정화 없이 4단계 잡음 제거 인과 발생기로 전송합니다. 동기화된 오디오-비디오 장기 단기 메모리는 주기적으로 재고정되는 첫 번째 매크로 블록과 롤링 키-값 캐시를 결합하여 고정된 예산 내에서 전역 정체성과 최근 맥락을 유지합니다. 계층적 롤링 프롬프트 계획은 지속적인 출현/배경 명령어를 블록 수준의 로컬 행동과 분리하여 롤링 윈도우와 함께 프롬프트를 진행합니다. 평가는 NVIDIA H200 한 대에서 5초 및 60초 출력을 512 x 768 해상도로 포함합니다.

논문 요약

이 논문은 장기 음향-비디오 안정성을 부차적인 문제가 아닌 일류 시스템 문제로 규정하고 있습니다. 실시간 디지털 인간을 위한 강력한 참조 아키텍처이지만, 실시간 주장은 H200에서 512 x 768로 측정되므로 구매자는 자신의 서비스 하드웨어에서 지연, 메모리, 동시성을 재현해야 합니다.

논문 032026-08-01cs.CV

제어 가능하고 사실적인 감정 표현 말하는 얼굴 생성을 위한 기하학 기반 감정 조절

저자 및 소속

Chenggong Hu

School of Software Technology, Zhejiang University, Ningbo, China

Shaoyin Ma

School of Software Technology, Zhejiang University, Ningbo, China

Yi Wang

College of Computer Science and Technology, Zhejiang University, Hangzhou, China

Li Sun

Ningbo Global Innovation Center, Zhejiang University, Ningbo, China

Mingli Song

College of Computer Science and Technology, Zhejiang University, Hangzhou, China

Jie Song

School of Software Technology, Zhejiang University, Ningbo, China

해결하는 문제

GemTalk은 오디오 기반 감정 의미론을 정체성 인식 얼굴 기하학과 연결하고, 기하학을 이용해 잠재적 표정 특징의 강도를 제어합니다. 이로 인해 감정 범주와 강도를 지속적으로 편집할 수 있으면서도 사진적 사실성과 입술 동기화를 유지할 수 있습니다.

핵심 결과

MEAD 전면과 RAVDESS 음성 감정 테스트를 결합한 결과, GemTalk은 334.937 FVD, 31.625 FID, 7.027 Sync-C, 8.283 Sync-D, 2.392 표현 FID, 59.258% 감정 정확도를 기록했습니다. 이 방법은 다음으로 좋은 방법에 비해 감정 정확도를 3.33%포인트 향상시키고 FVD를 20.84% 낮춥니다. 중립 HDTF에서는 강한 동기화와 1.386의 최고 표현 FID를 유지하며, 계수 편집은 명확한 정체성 손실 없이 부드러운 약에서 강한 감정 전환을 생성합니다.

초록

오디오 기반 감정 음성 얼굴 생성은 표현력 있는 얼굴 역학을 가진 현실적인 영상을 합성하는 것을 목표로 합니다. 하지만 기존 방법들은 제어 가능성과 시각적 충실도를 균형 있게 유지하는 데 어려움을 겪고 있습니다. 암시적 표현은 풍부한 의미를 포착하지만 구조적 지침이 부족해 종종 평균화된 감정 표현을 초래합니다. 반면, 명시적 기하학적 방법은 얼굴 표정을 더 잘 제어하지만 고주파 텍스처 세부 사항을 희생하는 경향이 있습니다. 이를 해결하기 위해 우리는 암묵적 표현의 의미적 풍부성과 명시적 기하학적 사전의 구조적 정밀도를 결합한 확산 기반 프레임워크인 GemTalk을 제안합니다. 우리는 암묵적인 감정 입술과 표현 특징을 추출하는 비전 유도 오디오 감정 투사(V-AEP) 모듈을 도입합니다. 동시에 확산 기반 기하학적 프리어스 생성기(D-GPG)는 명시적 구조적 사전으로 정체성 인식 혼합형 계수를 생성합니다. 무엇보다도, 우리의 기하학적 유도 감정 조절(GEM) 모듈은 이러한 기하학적 사전 측정을 활용하여 암시적 특징의 크기를 재조정하여, 특히 감정 강도를 정밀하고 연속적으로 제어하면서도 시각적 품질을 희생하지 않습니다. 광범위한 실험 결과, GemTalk은 사진 사실성과 얼굴 감정 역학에서 우수한 성능을 보입니다.

연구 출발점

암묵적 확산 특징은 풍부한 얼굴 질감을 제공하지만 감정 표현은 평균적이고 강도 조절이 부족합니다. 명시적 랜드마크나 블렌드셰이프는 해석 가능한 구조를 제공하지만, 기하학에만 의해 구동되는 시스템은 고주파 외관을 잃고 입이나 윗얼굴이 오디오와 충돌할 수 있습니다. 감정 애니메이션은 의미론적 풍부함과 제어 가능한 신체 움직임이 필요하며, 참조 초상화에 이미 존재하는 표정을 누설하지 않아야 합니다.

방법

훈련은 감정에 구애받지 않는 립싱크 백본을 넓은 비감정 영상에서 시작합니다. 비전 유도 오디오 감정 투사는 시각적 감정 표현을 사용해 오디오 특징을 감독하여 입술과 윗얼굴의 감정 공간을 분리하지만 조정된 공간으로 학습합니다. 확산 기반 기하학적 사전 생성기는 정체성 인식 Apple ARKit 블렌드셰이프 계수를 예측합니다. 기하학 유도 감정 변조는 감정 범주를 나타내는 잠재적 특징 방향을 보존하면서 블렌드셰이프로부터 그 크기를 재조정합니다; 갈등 인식 샘플링 쌍은 서로 다른 감정을 가진 이미지와 오디오를 참조하여 모델이 원본 표현을 복사하지 못하도록 합니다.

논문 요약

잠재적 감정 의미론과 명시적인 블렌드쉐이프 크기의 결합은 창의적 도구와 디지털-휴먼 API에 유용한 제어 표면을 제공합니다. GemTalk은 지속적인 감정 강도가 중요할 때 가장 강력하지만, 팀은 감정 라벨과 ARKit 계수 가정이 그들의 언어, 말투, 대상 장비를 모두 포함하는지 테스트해야 합니다.