著者・所属
Shun Ren
College of Computer and Information Technology, China Three Gorges University
Kaijie Jin
College of Computer and Information Technology, China Three Gorges University
Shengkai Hu
School of Information Engineering, Zhongnan University of Economics and Law
Beihang Song
National Institute of Natural Hazards, Ministry of Emergency Management of China
Hang Sun
College of Computer and Information Technology, China Three Gorges University
Wenwen Min
School of Information Science and Engineering, Yunnan University
Youfa Liu
School of Computer Science, Wuhan University
Jun Wan
School of Information Engineering, Zhongnan University of Economics and Law
School of Computer Science and Engineering, Nanyang Technological University
何を解決するか
FreqFLDは、300W、AFLW、COFW、WFLWで共同訓練可能でありながら、各ベンチマークで競争力を維持し、困難なサブセットに対しても頑健な、オールインワンのランドマーク検出器をターゲットにしています。本論文は、明示的な周波数の先行知識が、制約のないエキスパート混合ルーティングよりも専門家の特化をより信頼性高く導けるかを問います。
主要結果
統一モデルは300W Commonで2.72 NME、300W Challengingで4.52、WFLWテストセットで4.50の精度に達します。WFLWのポーズ、照明、遮蔽、ブラーサブセットはそれぞれ7.54、4.55、5.53、5.15を記録しています。遮蔽の激しいCOFWでは、NME 4.80と失敗率0.39%を報告しています。周波数モジュールとルーティング損失全体を追加することで、300W Challengingのベースラインを4.71から4.52に改善し、さらに4つの訓練データセットをすべて追加することで単一データセットの4.97の結果が4.52に向上します。性能は常に最高というわけではなく、競争力があります。AFLWでは1.69 NMEとなり、以前の専門化手法ではより低い誤差を報告しています。
要旨
深層学習の最近の進展は、顔ランドマーク検出を大幅に進歩させました。しかし、大多数の既存手法は、データセット固有の学習パラダイムの下で空間領域的に特徴を処理しており、顔ランドマーク検出が本質的に幾何学に基づき、周波数変動に敏感であるという点を見落としており、複雑なシナリオでのクロスデータセット一般化を制限し、顔ランドマーク検出モデルの開発を妨げています。この問題に対処するために、我々はAll-in-One顔ランドマーク検出に向けた周波数変調フレームワークである extbf{FreqFLD}を提案します。具体的には、FreqFLDはFrequency Modulation Module(FreqMoM)を導入し、低周波成分と高周波成分を分離して変調することで周波数事前情報を明示的に誘導し、これをその後の特徴モデリングに注入して、顔のグローバル構造と局所ランドマークの詳細のバランスの取れたモデリングを可能にします。さらに、FreqFLDはFrequency-Modulated Mixture-of-Experts(FreqMoE)を採用し、周波数調整された事前情報に基づいて専門家の選択を適応的に行うことで、多様で困難なシナリオにおける異質な顔ランドマークパターンの柔軟なモデリングを可能にします。All-in-Oneパラダイム下で周波数一貫性のあるモデリングを正則化するために、さらにFrequency-Consistent Routing(FreqCR)損失を導入し、周波数認識専門家のルーティングと割り当てを制約して、多様な顔シナリオでの専門家の利用バランスを促進し、安定した専門化を可能にして頑健な顔ランドマーク検出を実現します。広範な実験により、提案するFreqFLDが人気データセットで同等の性能を達成することが示されました。コードはこちらで入手可能です: https://github.com/jkj1059657014/FreqFLD.
研究の出発点
顔のランドマークモデルは、実際の入力がランドマークの規約、ポーズ、遮蔽、ぼかし、照明を混在させる場合でも、通常はデータセットごとにトレーニングされます。純粋な空間的特徴は、あるアノテーション体制に過剰適合し、低周波の顔構造と高周波のランドマークの詳細の違いを見逃す可能性があります。統一モデルは、1つの専門家がすべての形状や画像品質の体制を扱うことを期待される場合に、ルーティングの競合も生み出します。
手法
周波数変調モジュールは特徴を低周波成分と高周波成分に分解し、それぞれを個別にモデル化し、結果得られた先行知識を下流層に注入します。周波数変調されたエキスパート混合は、その先行知識を用いて異質の顔パターンをルーティングし、周波数一貫性ルーティング損失は活用のバランスを取り、安定した特化を促進します。共同訓練では4つのソースデータセットをそれぞれ20,000サンプルに均等化し、80,000枚の画像プールを作成し、各データセットのネイティブなランドマークおよび正規化プロトコルで評価します。
論文要点
周波数認識ルーティングは複数のランドマークモデルを一つに統合する説得力のある理由を提供しますが、統一トレーニングがすべてのベンチマークを勝ち取るわけではないため、チームはカメラごとランドマークスキームごとの誤差を比較すべきです。