← ブログ一覧へ戻る
リサーチレーダー顔交換ビジュアル編集arXiv2026年9月

月刊arXivレーダー

2026年9月の顔交換論文:照明調和、参照アテンション、リアルタイム吹き替え

9月の論文は、1つの直接的な顔合成手法と2つの隣接するアイデンティティ編集システムを提供する。影の調和パイプラインは、誤った推定が承認された顔を再着色したり明るくしたりできないように、変更できる範囲を意図的に制限している。RefGAPは7つの拡散編集者にリファレンス注意を反映させ、推論時にそれを補正する。TBDubは、視覚的吹き替えモデルを制作映像に適応させ、その後、30ステップのデノイズを2ステップに蒸留しながら、アイデンティティ、リップシンク、視覚品質、およびエンドツーエンドのスループットを測定する。

本月の重要シグナル

幾何学駆動のハーモナイザーは、有界のチャネル均一な暗化場のみを適用します。解析代理では、顔のピクセルの56.5%が変化し、平均ゲインは0.938、明るくはされませんが、論文は実画像の知覚的優位性を主張していません。RefGAPは2つの係数を一度キャリブレーションし、その後1,040件のヘッドスワップクリップと1,000件の顔入れ替えペアで7つの画像/動画編集者間で同一性の類似性を向上させます。置き換え成功率はそれぞれ少なくとも86%と82%に達し、ポーズと保存のトレードオフが測定可能です。TBDubのツーステップスチューデントはH20上で512×512で7.13 FPSに達し、教師より13.93倍のエンドツーエンド速度アップです。一方、人間の評価は教師のアイデンティティの質を維持し、リップシンクや映像品質をわずかに向上させます。買い手にとって重要な違いはリスクです。決定論的境界、推論時間制御、蒸留生成は異なる故障モードと検証の必要性を持っています。

論文 012026-09-15cs.CV

合成人顔の幾何駆動型シャドウ調和:アルベドを保持する乗算型リライティング

著者・所属

Vijesh KP

Independent researcher (no institutional affiliation stated in the paper)

何を解決するか

この論文は、ドナーの色と身元は許容できるが、形状の影が欠けているという狭いケースを対象としています。明るさを増やしたり、色味を変えたり、新しい顔を合成したりせずに、近似顔の幾何から鼻、眼窩、唇、空洞の影をどのように注入するかを問います。

主要結果

紙上の解析的なフェイスハイトフィールドに既知の光源がある場合、デフォルト設定ではフェイスピクセルの56.5%を変更し、全体では平均ゲイン0.938、変更されたピクセルでは0.890を与え、3.4%のピクセルを0.82のフロアに送ります。これにより、明るくされたピクセルはゼロであり、浮動小数点のノイズを超える数学的な色相角の変化もありません。これらの数字は知覚品質ではなく、制限付き演算子の特性を示しています:論文には、ペアになった実際のコンポジットベンチマークやベースライン比較は提供されていません。ハイライトを追加することはできず、すでに暗いドナーを修正することも、反対側の光源を除去することも、二重影残留ドナーシェーディングを避けることもできません。

要旨

フェイススワッピングやフェイスコンポジットパイプラインは、幾何学的によく整列しているものの、光度学的には非現実的な顔を日常的に生成します。つまり、ドナーの顔は平面のほぼ前方のスタジオ照明を受け取り、ホストのボディと背景は指向性のあるシーン光を運びます。既存の多くの対策は、色転送、ニューラルリライティング、逆レンダリングによって顔を再合成するため、アイデンティティ、肌のトーン、質感が変化するリスクがあります。私たちは保守的な代替案として、幾何学駆動型のフォームシャドウ注入を提案します。パイプラインは顔を再塗装しません。ラスタ化された3Dフェイスプロキシからピクセルあたりのゲインフィールド$g\in[g_{\min},1]$を推定し、それをチャネル的に均一に線形RGBに乗算するため、オペレーターは暗くするだけで色度はシフトできません。密なランドマークメッシュをラスタライズして深度バッファにし、そこから表面法線、キャビティ項、スクリーンスペースから影を導き出します。キーライトの方向はホスト側の手がかり(ボディ、背景、ヘアハロー)から推定されます。顔面の手がかりはドナーのライティングを回復するため、重みが下がっています。シャドウの大きさはホストにマッチングせず、3パラメータ転送$(τ,σ,g_{\min}))によって設定されます。シェーディングフィールドは皮膚の上で75パーセンタイルで分割され、その後ゲート、スケーリング、クランプ、スムージ化、再クリップされ、フェザー付きのスキンゲートフェイスマスク内で再クリップされます。解析的な顔高度場では、デフォルトの$(τ,σ,g_{\min})=(0.90,0.45,0.82)$は、平均ゲイン0.938(修正ピクセルでは0.890)で56.5%の顔ピクセルを修正し、3.4%のピクセルを床に押し下げます。色相不変性は演算子の帰結です。私たちは閉形式での転送を解析し、そのパラメータをアブレートし、単調で暗くするのみの定式化の故障モードについて議論します。非フラットドナーの二重影も含まれます。

研究の出発点

交換された顔は、幾何学的に整列され、身元が正確であっても、ドナーの顔がフラットなスタジオ光を持っている一方で、ホストシーンに方向性のあるキーライトがあるため、貼り付けたように見えることがあります。ジェネレーティブリライティングはさらに多くの効果を修復することができますが、顔がすでに承認された後に、肌のトーン、毛穴、質感、または身元を変える可能性もあります。制作チームは時に、最悪の場合の光度変化が既知である意図的に制限されたオペレーターを必要とします。

手法

顔検出器と468ポイントメッシュは、512ピクセルのクロップでラスタライズされた深度バッファ、表面法線、空洞プロキシ、スクリーンスペース投影影を生成します。ホスト側の体、背景、首、髪のハローの手がかりはキーライトの方向に票を投じる一方で、ドナーフェイスの手がかりは抑制されます。正規化されたシェーディングマップは、3パラメータのしきい値、強度、最小ゲイン転送を通過し、次にガイド付き平滑化とフェザリングされた肌マスクを通ります。同じスカラゲインがすべての線形RGBチャンネルに掛けられ、0.82から1.0の範囲でクリップされます。

論文要点

これは、理解可能なダメージ限界を持つ保守的なポストコンポジット制御であり、完全な再ライティングシステムではありません。アイデンティティ保持が劇的なリアリズムよりも重要な場合に魅力的であり、実際のショットが間違った光の方向や二重影を確認する限りにおいて有効です。

論文 022026-09-28cs.CV

RefGAPに注意:拡散ベース画像編集における参照アテンションの補正

著者・所属

Yanan Wang

Mohamed bin Zayed University of Artificial Intelligence

Institute of Foundation Models

Shengcai Liao

United Arab Emirates University

Guangyi Liu

Mohamed bin Zayed University of Artificial Intelligence

Institute of Foundation Models

Xiaodan Liang

Mohamed bin Zayed University of Artificial Intelligence

何を解決するか

RefGAPは、再訓練せずに、またすべてのモデルごとに別個の補正強度を適用せずに、異なる画像および動画編集者における参照のアイデンティティ忠実度を向上させることを目的としている。編集マスク内での参照の使用を強化しながら、保持すべき領域での抑制を明示的にバランスさせる。

主要結果

1,040本のHeadSwapBenchクリップにおいて、すべての7つの汎用エディターでアイデンティティ類似性が向上し、定義されている範囲では置換成功率は少なくとも86%に達する。全頭類似性も7つすべてで向上する。1,000組のFaceForensicsのフェイススワップペアにおいて、エディターごとにアイデンティティ類似性が向上し、置換および正しい取得率は少なくとも82%および75%となる。専門のDirectSwapモデルに適用した場合、アイデンティティ類似性は0.7019から0.7450に上昇する一方で、フレーム全体のLPIPSはほぼ変わらない。いくつかのシステムでは、キー点誤差の増加や非編集部分の保持の状況が混在することと引き換えにこの向上が認められる。背景の置換は確実に転送されない。未融合のアテンション実装は、メモリやレイテンシを大幅に増加させる可能性もあるため、統合品質が重要である。

要旨

参照ガイド付き拡散編集者は、ユーザーが提供した参照を忠実に再現するのに苦労します。我々は拡散編集者における潜在的なボトルネックを特定しました:多くの方法が限定的な参照注意配分しか提供していません。例えば、LoomVideoでは、編集領域クエリは参照に注意の質量の1%未満しか割り当てていません。我々はRefGAPを導入します。これはトレーニング不要の補正で、順伝播中に測定された参照注意質量から各レイヤーでオンラインでロジットオフセットの大きさを決定します。参照ロジットへの正のオフセットは、編集領域クエリによる参照の使用を強化し、キープ領域クエリへの負のオフセットは編集外での参照による変更を制限します。2つのグローバル係数が補正を制御し、4つの開発中の拡散編集者の検証データで一度だけ選択され、固定されます。7つの拡散ベースの画像/ビデオ編集者にわたり、RefGAPはヘッドスワップおよびフェイススワップにおけるアイデンティティ忠実度を向上させます。RefGAPは、別々に調整された一定編集側バイアスと同等の忠実度保持トレードオフを達成し、アプローチごとの強度スイープは必要ありません。バーチャルトライオンや背景置換に関する追加実験により、アイデンティティ編集を超えた転移性能も評価されています。

研究の出発点

参照ガイド付きの拡散編集者は、正しい元の顔を受け取る場合があるが、それにほとんど注意を払わないことがある。LoomVideoの編集領域クエリは、著者の測定によれば、参照に割り当てる注意の質量が1%未満である。固定された注意の増幅はアイデンティティを強化できるが、モデルごとの調整が必要であり、保持すべき髪型、服装、背景、姿勢、表情などに参照の外観が漏れる可能性がある。

手法

各注意層の間で、RefGAPは編集クエリと保持クエリごとに参照トークンに割り当てられた注意の割合を測定する。観測された質量からオンラインロジットオフセットを導き出す:正のオフセットは編集領域での参照キーを強化し、負のオフセットは保持領域での参照キーを制約する。二つのグローバル係数と層選択ルールは、四つの開発編集者を用いた40の頭部入れ替えクリップで一度キャリブレーションされ、その後、七人の編集者、三つの未使用システム、顔の入れ替え、バーチャル試着、背景置換にわたって固定される。

論文要点

実際の参照アテンションを測定することは、アイデンティティ編集に対するモデルに依存しない有用な制御信号だが、より強いアイデンティティ転送はジオメトリや保持される領域を変える可能性がある。チームはアイデンティティ類似性だけでなく、タスク固有の品質ゲートを必要とする。

論文 032026-09-05cs.CV

TBDub:本番運用を重視したビジュアルダビング

著者・所属

Bihan Li

TaoLive AIGC, Taobao & Tmall Group, Alibaba

Xinyang Li

TaoLive AIGC, Taobao & Tmall Group, Alibaba

Zeran Xu

TaoLive AIGC, Taobao & Tmall Group, Alibaba

Meiguang Jin

TaoLive AIGC, Taobao & Tmall Group, Alibaba

Junfeng Ma

TaoLive AIGC, Taobao & Tmall Group, Alibaba

何を解決するか

TBDubは、既存のビデオ拡散吹き替えスタックを制作映像に適応させ、二段階の学生モデルが教師の認識されるアイデンティティ、同期、および視覚的品質を保持できるかどうかを問います。また、デノイザーの速度だけでなく、再構成、オーディオ応答、人間の評価、および完全なVAEからVAEへの生成経路を評価します。

主要結果

38本のTalkVidクリップにおいて、教師モデルはX-Dubに比べて、報告された8つの再構成、知覚、アイデンティティ、および同期の指標すべてで改善を示します。各手法あたり114の評価では、X-Dubのリップシンク、アイデンティティ、ビジュアル品質MOS値は3.57、2.83、2.88ですが、教師モデルではそれぞれ3.71、3.78、3.78に上昇します。学生モデルは3.85、3.72、3.80とスコアを出し、アイデンティティをほぼ維持しつつ、リップシンクとビジュアル品質で優位を示します。512×512の解像度で1台のH20を使用した場合、学生モデルは7.13の有効FPSを達成し、教師モデルの0.51に対して13.93倍のエンドツーエンド高速化を実現します。DiTステージ単体では42.49倍の高速化です。このベンチマークは小規模であり、いくつかの前処理およびエンコーディングステージを除外しており、非常に低解像度の入力は失敗事例として残ります。

要旨

ビジュアルダビングは、顔の動きを置き換えた音声と同期させつつ、個人の特性、外見、および時間的一貫性を維持する必要があります。X-Dubはマスク不要の強力なビデオ編集ベースラインを提供しますが、ライブストリームや生成ビデオコンテンツへの適用では、制作ドメインでの堅牢性、時間的・動作の安定性、個人の特性や口元の詳細の保持、推論効率において限界が明らかになります。そこで、私たちは extbf{TBDub}を提案します。TBDubはX-Dubの制作向け拡張であり、タスク適応型ポストトレーニングとタスク認識型少ステップ蒸留を組み合わせています。ポストトレーニングは、ビデオDiTを制作ドメインのデータ、制作特化の条件付けとフィルタリング、強化された音声特徴を用いて30ステップのTeacherを取得するように適応させます。蒸留はDMD/DMD2を条件付きビデオ編集に適応させ、Teacherを2ステップのStudentに圧縮します。38本のTalkVidクリップにおいて、TeacherはX-Dubに対して8つの報告された再構成、知覚、個人特性、および同期のメトリクスすべてを向上させました。MOS評価では、TeacherはX-Dubよりもリップシンクの一貫性、個人特性の一貫性、視覚品質をそれぞれ0.14、0.95、0.90ポイント向上させ、Studentはリップシンクと視覚品質スコアで最高を達成し、個人特性の一貫性においてもTeacherに近い結果を示します。NVIDIA H20 GPUで$512 imes512$での最初のVAEエンコードから最終VAEデコードまでのペアのエンドツーエンド生成時間では、Studentは有効FPS 7.13に達し、総遅延を$13.93 imes$削減します。DiTステージ単体では$42.49 imes$高速化されます。StudentはほぼTeacherの生成品質と音声・映像の同期を維持します。コードはGitHubで入手可能です(https://github.com/TaoLiveAIGC/TBDub)、30ステップのTeacherおよび2ステップのStudentの重みはHugging Faceで提供されています(https://huggingface.co/TaoLiveAIGC/TBDub)。

研究の出発点

ビジュアル吹き替えは、置き換え音声を表現するために口の動きを十分に変える必要がありますが、同時に人物の特定性、歯、唇の質感、ポーズ、照明、遮蔽、および非音声領域のすべてを時間的に安定させる必要があります。X-Dub はマスク不要の高性能なビデオ編集ツールを提供しますが、制作ライブ配信や生成ビデオの入力では、ドメインシフト、ちらつき、口腔ディテールの変化、および30回のノイズ除去ステップによる遅延が発生します。

手法

タスク適応型のポストトレーニングは、生成ドメインのデータを継承されたトレーニング分布と混合し、HuBERT-large レイヤーで音声特徴を強化し、条件を非対称に劣化させ、モーションドロップアウトおよび空間・時間の重み付きフローマッチングを使用して30ステップの教師を作成します。条件付きDMD/DMD2手法は、その教師を微分可能な2ステップの学生に蒸留し、動的な偽スコア訓練、段階的な領域選択的監督、因果的な第一潜在変数の処理、全タイムステップサンプリング、FP32ガイダンス演算、FP32 EMA重みを使用します。

論文要点

二段階のビジュアルダビングは、はるかに優れた品質とスループットの組み合わせを提供できますが、報告された7.13 FPSは生成コアに限定されます。実運用規模では、音声、顔追跡、コンポジット、エンコーディング、および長尺ビデオの安定性も考慮する必要があります。