著者・所属
Logan Robbins
Independent researcher
何を解決するか
本論文は、新たな学生アーキテクチャを追加するのではなく、スワップモデルの背後にあるデータファクトリーに焦点を当てています。合成ペアに必要なアイデンティティアンカーの数、それらをどこに配置すべきか、そしてアイデンティティを維持できないクリップを監視データにする前にどのようにフィルタリングすべきか、といった問題を提起しています。
主要結果
これは研究提案であり、完成した実証結果ではありません。検証可能なテストとして、ドリフト対アンカーギャップ曲線、均一配置対適応配置(予算が等しい場合)、下流の学生トレーニング、テクスチャアブレーション、および人間の美的フィルター研究が挙げられていますが、現時点では、測定された識別、時間、スペクトル、またはユーザー調査による改善は報告されていません。
要旨
ビデオ顔交換には自然なペア監視がありません。つまり、ある人の顔が別の人のビデオを演じている実際の映像は存在しません。現在最も強力な解決策である DreamID-V の SyncID-Pipe は、実際のクリップの最初と最後の 2 フレームでアイデンティティを置き換え、ポーズ シーケンスのみから残りの部分を再生成することでペアを作成します。ポーズには交換されたアイデンティティの外観上の証拠がないため、長いクリップ、オクルージョン、極端なポーズの逸脱では、合成されたアイデンティティはアンカーのない長いスパンで漂流します。公開されているアブレーションでは、アンカーの数や配置は調査されていません。私たちは、適応型アイデンティティ アンカリング (AIA) を提案します。(i) シンセサイザーを任意のアンカー セットに一般化します。これは、フレームの条件付けがトークンをゼロ ノイズにクランプする拡散強制スタイルのトランスフォーマーにとって、アーキテクチャ的に自然なものです。 (ii)アンカーを、生成されたすべてのフレームを実際の参照アイデンティティと比較してスコアリングし、ペアが閾値を超えるか予算を使い果たすまで、最もスコアの低いフレームに画像と顔を入れ替えたアンカーを挿入する閉じたフィードバック ループによって配置します。(iii)ループの判定を自動データ フィルタとして再利用します。 2 つ目の病理、過度に滑らかにされた肌のビューティー フィルタのような外観は、同じ根本原因を持っています。つまり、アイデンティティと同様に、マイクロ テクスチャはパイプラインの目的のいずれにも価格付けされていません。そのため、AIA を現実参照テクスチャ復元と組み合わせます。これは、各実際のフレームの非顔領域からの一致する再グレイン、実際の映像からのサブ アイデンティティ マイクロ テクスチャのバンド分割転送、および映像自身のスペクトルによって参照される 2 番目のスペクトル受容チャネルです。アイデンティティアンカーの密度は、制御可能な品質調整要素であると我々は主張し、その提案を検証または反証するための反証可能な実験(ドリフト対ギャップ曲線、予算を合わせた均一配置対適応配置、AIAが作成したデータを用いた学生のトレーニング、人間の美的フィルターを用いたテクスチャ除去実験)を具体的に示す。
研究の出発点
動画顔交換には、自然なペアとなる正解データが存在しない。つまり、対象となる人物が実際に元の動画に出演したことはない。既存の合成監視では境界フレームしか固定できず、長い間隔、横顔の動き、遮蔽物などについては直接的な外見の証拠が得られず、人物や肌の質感がずれてしまう可能性がある。
手法
適応型アイデンティティアンカリングは、拡散強制ビデオシンセサイザーを任意の条件付きフレームに一般化します。閉ループは、生成されたすべてのフレームを実際のターゲットアイデンティティと比較してスコアリングし、最悪のフレームに画像を入れ替えたアンカーを挿入し、しきい値またはアンカーバジェットに達するまで繰り返します。現実参照テクスチャ復元は、実際の映像から非アイデンティティの微細テクスチャとグレインを個別に転送し、過度に平滑化された肌を軽減するためにスペクトル許容テストを追加します。
論文要点
AIAは、合成ペア動画データを作成するチームにとって、設計チェックリストとして有用です。フレームごとの識別情報を監視し、ドリフトが最も大きい箇所にアンカーを配置し、収束しないクリップを除外し、テクスチャを個別に評価します。現時点ではその価値は方法論的なものであり、既存のパイプラインよりも優先して採用するには、実装とベンチマークによる検証がまだ必要です。