著者・所属
Sebastian Regalado
University of Toronto, Canada
ModiFace, Canada
Varshanth R. Rao
ModiFace, Canada
Ruowei Jiang
ModiFace, Canada
Parham Aarabi
University of Toronto, Canada
Igor Gilitschenski
University of Toronto, Canada
何を解決するか
本論文は、異種なランドマークレイアウトのための共通の意味座標系を定義し、それを使って複数のデータセットにわたる1つの検出器を訓練します。推論段階では、同じネットワークが任意のランドマーククエリの集合に答えることができ、ソースデータセットの訓練中に明示的に要求されていないポイントも含まれます。
主要結果
アダプター付きの統一ViT-Bモデルは、WFLWで4.02 NMEと2.19%の失敗率を記録し、共通/チャレンジ300W分割で2.43/4.19 NME、AFLW-19で2.76 NMEを記録し、フューズドトレーニングと動的出力をサポートしています。300Wのみで訓練した場合、難易度の高いWFLW68転送テストでは6.08 NMEに達し、DTLDでは7.23、PIPNetでは8.09となっています。保留されたネイティブランドマークでは、学習済みクエリはスプライン補間に対して300Wで19.0%、WFLW分割で15.7〜16.3%向上し、固定インデックスの暗記だけでなく再利用可能な等高線セマンティクスを学習していることを示しています。
要旨
顔のランドマーク検出(FLD)手法の進歩は性能の限界を押し広げ続けていますが、2つの大きな機能的制約を見落としています。すなわち、(1) 各「$N$点」ベンチマークデータセットごとに異なるネットワークパラメータを独立して訓練する必要があること、(2) 「$N$点」データセットで訓練されたモデルは$N$のランドマークのみを確実に出力するということです。本研究ではまず、Face Part-Anchored Landmark Positions(FPALP)を概念化します。これは、各ランドマークを面パーツの輪郭に沿って0(開始)から1(終了)までの進行値として扱います。すべてのランドマークは、そのソースデータセットに関係なくFPALP形式で表現できるため、すべての「$N$ポイント」データセットを単一のデータセットに統合する能力を解放します。次に、各ランドマークをFPALPベースのクエリで表現し、クロスモーダリティデコーダで段階的に改良し、最終表現に基づいて座標を予測します。私たちのアプローチはUnified Dynamic FLDと呼ばれ、これら二つの設計選択を体現し、(1)単一のモデルが任意の数の「$N$ポイント」データセットで学習可能になり、(2)ランタイム時に指定されたランドマーククエリを読み込み、特定のランドマーク予測を任意数生成することでランドマーク検出パイプラインを効率化します。複数のベンチマークデータセットでの広範な実験により、我々の手法はこれらの利点を発揮しつつ、既存の最先端手法と競合し、場合によってはそれを上回ることが示されています。
研究の出発点
フェイランドマークデータセットは、19、68、98、または他の注釈点数を持つかどうかで意見が分かれています。従来のモデルは回帰ヘッドを1つのテンプレートに割り当てるため、チームは各データセットごとに別々のパラメータを訓練・維持しなければならず、展開したモデルが新しいサブセットやより密度の高いレイアウトを必要に応じて返すことを妨げます。この断片化は、異なるランドマーク慣例を消費するアラインメント、再構築、構成、表現パイプラインにとってコストがかかります。
手法
各ランドマークはFace Part-Anchored Landmark Positionとなり、眉毛、目、鼻、口、顔の境界などの意味輪郭に沿って0から1へ正規化された進行を示します。データセットテンプレートはこの輪郭空間に整列され、要求されたすべてのポイントはFPALPクエリとしてエンコードされます。クロスモーダリティデコーダは画像トークンとクエリを段階的に組み合わせてから座標を回帰させます。ViT-BモデルはAFLW-19、300W、WFLWで共同学習されています。オプションの軽量データセットアダプターは、統一されたバックボーンや実行時に設定可能な出力レイアウトを放棄することなく、体系的な注釈オフセットを回復します。
論文要点
クエリ駆動型の単一ランドマークサービスで、競争力のある精度を保ちながら複数のテンプレート専用モデルを置き換えられます。複数のアライメント形式を必要とする製品や、将来ランドマーク定義を追加する製品に特に有用ですが、本番データセットごとに注釈オフセット用アダプターを検証する必要があります。