← ブログ一覧へ戻る
リサーチレーダー顔交換話す顔arXiv2026年7月

月次 arXiv レーダー

2026年7月の顔入れ替え論文:IDアンカー、歩行者プライバシー、応答型トーキングフェイス

7月に発表された顔合成に関する研究は、アイデンティティ転送の3つの異なる用途に及んでいる。1つの論文では、長時間の動画において交換されたアイデンティティを安定的に維持するために、適応的なアンカー配置を提案している。別の論文では、行動の手がかりを保持しながら、交換を匿名化の手段として利用している。そして3つ目の論文では、単一の話し顔を超えて、相互に反応する合成会話へとスケールアップしている。

本月の重要シグナル

適応型アイデンティティアンカリングは、キーフレームの配置をフィードバック問題として扱い、検証可能なテストを提示している点で注目に値するが、これらの実験結果はまだ報告されていない。歩行者プライバシーパイプラインは、特に遮蔽やベールに関して、スワッピングによって何が維持され、全頭部転送がどこで失敗するのかを、より小規模な実証研究で示している。CHATは、音声、聞き手の反応、ターン構造を備えた2つの応答型アイデンティティを生成する規模と複雑さを示しているが、同時に、その評価では対話レベルの意味論はまだ測定されていないことも認めている。これら3つの論文は、アイデンティティの類似性だけでは顔合成の品質指標として不十分である理由を示している。

論文 012026-07-23cs.CV

適応型IDアンカリング:動画顔入れ替えの合成ペア教師データに向けた閉ループキーフレーム配置

著者・所属

Logan Robbins

Independent researcher

何を解決するか

本論文は、新たな学生アーキテクチャを追加するのではなく、スワップモデルの背後にあるデータファクトリーに焦点を当てています。合成ペアに必要なアイデンティティアンカーの数、それらをどこに配置すべきか、そしてアイデンティティを維持できないクリップを監視データにする前にどのようにフィルタリングすべきか、といった問題を提起しています。

主要結果

これは研究提案であり、完成した実証結果ではありません。検証可能なテストとして、ドリフト対アンカーギャップ曲線、均一配置対適応配置(予算が等しい場合)、下流の学生トレーニング、テクスチャアブレーション、および人間の美的フィルター研究が挙げられていますが、現時点では、測定された識別、時間、スペクトル、またはユーザー調査による改善は報告されていません。

要旨

ビデオ顔交換には自然なペア監視がありません。つまり、ある人の顔が別の人のビデオを演じている実際の映像は存在しません。現在最も強力な解決策である DreamID-V の SyncID-Pipe は、実際のクリップの最初と最後の 2 フレームでアイデンティティを置き換え、ポーズ シーケンスのみから残りの部分を再生成することでペアを作成します。ポーズには交換されたアイデンティティの外観上の証拠がないため、長いクリップ、オクルージョン、極端なポーズの逸脱では、合成されたアイデンティティはアンカーのない長いスパンで漂流します。公開されているアブレーションでは、アンカーの数や配置は調査されていません。私たちは、適応型アイデンティティ アンカリング (AIA) を提案します。(i) シンセサイザーを任意のアンカー セットに一般化します。これは、フレームの条件付けがトークンをゼロ ノイズにクランプする拡散強制スタイルのトランスフォーマーにとって、アーキテクチャ的に自然なものです。 (ii)アンカーを、生成されたすべてのフレームを実際の参照アイデンティティと比較してスコアリングし、ペアが閾値を超えるか予算を使い果たすまで、最もスコアの低いフレームに画像と顔を入れ替えたアンカーを挿入する閉じたフィードバック ループによって配置します。(iii)ループの判定を自動データ フィルタとして再利用します。 2 つ目の病理、過度に滑らかにされた肌のビューティー フィルタのような外観は、同じ根本原因を持っています。つまり、アイデンティティと同様に、マイクロ テクスチャはパイプラインの目的のいずれにも価格付けされていません。そのため、AIA を現実参照テクスチャ復元と組み合わせます。これは、各実際のフレームの非顔領域からの一致する再グレイン、実際の映像からのサブ アイデンティティ マイクロ テクスチャのバンド分割転送、および映像自身のスペクトルによって参照される 2 番目のスペクトル受容チャネルです。アイデンティティアンカーの密度は、制御可能な品質調整要素であると我々は主張し、その提案を検証または反証するための反証可能な実験(ドリフト対ギャップ曲線、予算を合わせた均一配置対適応配置、AIAが作成したデータを用いた学生のトレーニング、人間の美的フィルターを用いたテクスチャ除去実験)を具体的に示す。

研究の出発点

動画顔交換には、自然なペアとなる正解データが存在しない。つまり、対象となる人物が実際に元の動画に出演したことはない。既存の合成監視では境界フレームしか固定できず、長い間隔、横顔の動き、遮蔽物などについては直接的な外見の証拠が得られず、人物や肌の質感がずれてしまう可能性がある。

手法

適応型アイデンティティアンカリングは、拡散強制ビデオシンセサイザーを任意の条件付きフレームに一般化します。閉ループは、生成されたすべてのフレームを実際のターゲットアイデンティティと比較してスコアリングし、最悪のフレームに画像を入れ替えたアンカーを挿入し、しきい値またはアンカーバジェットに達するまで繰り返します。現実参照テクスチャ復元は、実際の映像から非アイデンティティの微細テクスチャとグレインを個別に転送し、過度に平滑化された肌を軽減するためにスペクトル許容テストを追加します。

論文要点

AIAは、合成ペア動画データを作成するチームにとって、設計チェックリストとして有用です。フレームごとの識別情報を監視し、ドリフトが最も大きい箇所にアンカーを配置し、収束しないクリップを除外し、テクスチャを個別に評価します。現時点ではその価値は方法論的なものであり、既存のパイプラインよりも優先して採用するには、実装とベンチマークによる検証がまだ必要です。

論文 022026-07-09cs.CV

顔を入れ替え、特徴を保つ:ITSにおける歩行者プライバシーのための二目的パイプライン

著者・所属

Roba H. Farouk

C-DRiVeS Lab: Cognitive Driving Research in Vehicular Systems, Cairo, Egypt

Computer Science and Engineering Department, Faculty of Media Engineering and Technology, German University in Cairo, Egypt

Catherine M. Elias

C-DRiVeS Lab: Cognitive Driving Research in Vehicular Systems, Cairo, Egypt

Computer Science and Engineering Department, Faculty of Media Engineering and Technology, German University in Cairo, Egypt

何を解決するか

本研究は、Egy-DRiVeSデータセットにおいて、ポーズ、表情、視線、そして後々の学習に十分な画質を維持しながら、個人を特定できないようにする実用的な匿名化パイプラインを開発することを目的としている。また、ポートレートのクローズアップ画像だけに頼るのではなく、遠くにいる歩行者、遮蔽物に隠れている歩行者、ベールで覆われている歩行者など、特定の状況下で発生する失敗事例についても検証する。

主要結果

クローズアップ画像では、Roop はブレンドシェイプの差 (1.898 対 2.0478) とランドマークの差 (0.00596 対 0.00710) が低く、Ghost-v2 は同一性類似度 (0.1393 対 0.1997) が低く、この指標による隠蔽性がより高いことを示しています。どちらも視線は良好に保持され、コサイン類似度は約 0.94 です。Roop は 4 つの定量的指標のうち 3 つで優れており、低品質または遮蔽された街頭の顔に対してより堅牢ですが、Ghost-v2 はベールをソースの髪の毛で誤って置き換える可能性があります。

要旨

高度道路交通システム(ITS)アプリケーションである自動運転車(AV)のリアルタイム意思決定を行うAIモデルを訓練するには、大規模で多様なデータセットが必要です。歩行者の意図と軌跡予測はAVで使用される重要なモデルであり、多様な歩行者画像を含むデータセットが必要です。これらのデータセットへの無制限のアクセスは、個人情報の盗難や歩行者の追跡など、深刻なセキュリティリスクをもたらします。課題は、モデルの訓練に必要な画像属性を維持しながら、プライバシー保護手順を適用することです。既存のプライバシー保護手法は歩行者のプライバシーを保護する可能性がありますが、画像の使いやすさを低下させ、モデルの有効性を妨げます。本研究の焦点は、重要な顔属性をそのままに、顔交換によって歩行者のプライバシーを保護する5段階のパイプラインを実装することです。これは、Egy-DRiVeSデータセットのプライバシー要件を満たすように調整する必要があります。さらに、RoopとGhost-v2の顔交換モデルを評価します。後述するように、Roopはさまざまな面でGhost-v2を上回ることが実証されています。したがって、Roopは、身元を隠すことによる歩行者のプライバシー保護と、顔の特徴を保持することによるデータ利用可能性のバランスを取るために、パイプラインで使用される顔交換モデルである。

研究の出発点

街路データセットでは、歩行者の意図や軌跡モデルを作成するために顔や身体の動きの情報が必要となるが、制限のない画像であれば識別や追跡が可能になる。ぼかし処理は、視線、表情、その他、後の自動運転研究で必要となる可能性のある手がかりを犠牲にして、個人の特定を保護する。

手法

5段階のパイプラインでは、YOLOv11で歩行者を検出し、SCRFDで顔の位置を特定し、オプションでCodeFormerを使用して低解像度の切り抜き画像を強化し、人物を入れ替え、結果を元の街路画像に合成します。RoopとGhost-v2は、視覚的に比較されるほか、ブレンドシェイプの差、ランドマークの差、元の人物と入れ替えた人物の類似性、視線ベクトルの類似性に基づいて比較されます。

論文要点

顔交換はぼかしよりも行動上の有用性を維持できる可能性があるが、プライバシーと有用性は指標によって異なる方向に進む。導入にあたっては、情報源となるIDを慎重に選択し、人口統計学的属性や服装に関する特殊なケースをテストし、下流の歩行者モデルが依然として機能するかどうかを測定する必要がある。本稿では、下流の有用性や再識別に関する評価はまだ提供していない。

論文 032026-07-02cs.CV

対話型ヒューマンの音声・映像会話生成

著者・所属

Junhao Song

Department of Computing, Imperial College London, United Kingdom

Lluis Guasch

Department of Earth Science and Engineering, Imperial College London, United Kingdom

Xilin He

Mohamed bin Zayed University of Artificial Intelligence, United Arab Emirates

Zhongyu Yang

Department of Computer Science, Heriot-Watt University, United Kingdom

Yingfang Yuan

School of Computer Science, Northumbria University, United Kingdom

Weicheng Xie

College of Computer Science and Software Engineering, Shenzhen University, China

Linlin Shen

School of Artificial Intelligence, Shenzhen University, China

Guangdong Provincial Key Laboratory of Intelligent Information Processing, Shenzhen University, China

Haijun Lin

School of Engineering and Design, Hunan Normal University, China

Shizhe Liu

Department of Computer Science, University of Oxford, United Kingdom

Wei Pang

Department of Computer Science, Heriot-Watt University, United Kingdom

Siyang Song

Department of Computer Science, University of Exeter, United Kingdom

何を解決するか

CHATは、双方向の音声・映像対話生成を統一されたタスクとして定義しています。それは、事前に録画されたビデオや音声を必要とせずに、テキストプロンプトから、同一性を保ちつつ、言語的および非言語的に応答する2つのクリップを作成することです。また、生成されたデータを用いて、個別の反応生成モデルを事前学習できるかどうかも検証します。

主要結果

CHAT は、比較対象のシステムの中で、FID (17.33)、リップシンクの信頼度 (6.89)、反応相関 (50.02 x 1e-2)、および同一性類似度 (0.85) において最高値を記録し、FVD および LPIPS では 2 位にランクインしました。ユーザーは、視覚品質と同期について 4.6/5、音声とインタラクティブ性について 4.8/5 と評価しています。CHAT-AVD-50k の事前学習により、REACT 2024 における PerFRDiff 反応相関は 37.21 から 40.11 に、ReactDiff は 24.19 から 26.12 に向上しました。

要旨

大規模な二者間対話型音声・映像対話(DIAD)データセットは、ヒューマノイド型対話型仮想エージェントやデジタルヒューマンの開発における基礎的なデータリソースとなります。しかし、このようなデータの収集は時間とコストがかかり、倫理的にもデリケートな問題があります。そこで、本稿では、単一のテキストプロンプトから多様でペアになった相互応答型の音声・顔対話クリップを生成する、新しい二者間対話型音声・映像対話生成(DIADG)フレームワークであるCHATを提案します。CHATは、大規模な言語モデルと話す顔モデルを、対話型音声および顔動作の洗練モジュールと統合することで、多様なコンテンツと顔のアイデンティティを持つ、整合性の取れた二者間対話クリップの生成を可能にします。実験結果は、CHATが客観的評価と主観的評価の両方において、同様のタスク向けに設計された既存の関連手法を上回る性能を示すことを示しています。さらに、当社が合成したCHAT-AVD-50kデータセットは、下流のインタラクティブなヘッド生成のための効果的な事前学習データとして機能し、REACT 2024におけるPerFRDiffとReactDiffの精度を一貫して向上させています。CHATは、費用がかさみ倫理的に問題のある実際の二者間インタラクションデータの収集に代わる、拡張性の高い代替手段を提供します。

研究の出発点

対話型デジタルヒューマンのトレーニングには、2人による音声、顔の動き、聞き取り反応、そして順番交代といった一連の動作の記録が必要です。大規模で多様な2人組のデータセットを記録することは費用がかさみ、倫理的にもデリケートな問題があります。一方、ほとんどのトーキングヘッドシステムは、一方の話者だけを単独でアニメーション化し、もう一方の顔がどのように反応するかをモデル化していません。

手法

このフレームワークは、対話および音声プランニングのための言語モデルと、話し顔合成、沈黙動作生成、反応の精緻化、および時間的一貫性を組み合わせたものです。これにより、50,000サンプルからなるCHAT-AVD-50kデータセットが生成されます。評価は、FID/FVD、リップシンクロナイゼーション、反応の相関と多様性、ArcFaceの同一性類似性、LPIPS、60人を対象とした調査、およびPerFRDiffとReactDiffの下流事前学習を含む、生成された1,000の会話を対象としています。

論文要点

CHATは、従来の顔認識ではなく、拡張性の高いデジタルヒューマンデータとペアインタラクション合成に関連するものです。その評価指標は、視覚、アイデンティティ、反応の質をサポートしますが、対話レベルのタイミングと意味的な適切性については未解決のままです。また、CHATコンポーネント自体がREACT 2024で事前学習されているため、下流のテストは完全に独立しているとは言えません。