← ブログ一覧へ戻る
リサーチレーダー顔検出顔のランドマークarXiv2026年9月

月刊arXivレーダー

2026年9月の顔検出論文:統合ランドマーク、拡散アライメント、教室での展開

9月には直接顔ボックスに関する論文は少なかったため、このまとめでは、ボックスが見つかった後に生産システムが必要とする隣接する局所化スタックに従います。FreqFLDは、4つのデータセットにわたって1つの周波数認識ランドマークモデルを訓練します。FAHCD-Netは、ランドマークヒートマップをポーズ、遮蔽、ぼかし、照明変化下での条件付きノイズ除去問題として扱います。Visageの研究では、教室の混雑した画像で、検出と認識を再び統合し、スループットや見逃された顔がトップラインの身元精度と同じくらい重要であることを示しています。

本月の重要シグナル

FreqFLDは周波数成分を分割し、サンプルを周波数条件付きエキスパートにルーティングすることで、グローバル構造と局所的ディテールのバランスを取ります。共同で学習された1つのモデルは、WFLWで4.50 NME、遮蔽されたCOFWで0.39%の失敗率で4.80 NMEを達成します。FAHCD-Netは代わりに条件付き拡散ステージをカスケードし、冗長な高周波ヒートマップノイズを抑制することで、300WチャレンジセットのNMEをステージ1の4.48からステージ3で4.29に減少させます。Visageの研究によると、320万パラメータのYOLOv8nは0.935 mAP@0.5に達する一方、より大規模な検出器はパラメータコストが大きいながら精度を向上させます。また、いくつかの認識器は100クラス認識セットで99.75%のTop-1精度に達しています。これらの結果は有望ですが、2つのランドマーク論文はいずれもベンチマーク研究であり、教室データは限られた機関環境から取得されているため、クロスカメラでの検証が依然として必要です。

論文 012026-09-09cs.CV

FreqFLD:周波数変調によるオールインワン顔ランドマーク検出

著者・所属

Shun Ren

College of Computer and Information Technology, China Three Gorges University

Kaijie Jin

College of Computer and Information Technology, China Three Gorges University

Shengkai Hu

School of Information Engineering, Zhongnan University of Economics and Law

Beihang Song

National Institute of Natural Hazards, Ministry of Emergency Management of China

Hang Sun

College of Computer and Information Technology, China Three Gorges University

Wenwen Min

School of Information Science and Engineering, Yunnan University

Youfa Liu

School of Computer Science, Wuhan University

Jun Wan

School of Information Engineering, Zhongnan University of Economics and Law

School of Computer Science and Engineering, Nanyang Technological University

何を解決するか

FreqFLDは、300W、AFLW、COFW、WFLWで共同訓練可能でありながら、各ベンチマークで競争力を維持し、困難なサブセットに対しても頑健な、オールインワンのランドマーク検出器をターゲットにしています。本論文は、明示的な周波数の先行知識が、制約のないエキスパート混合ルーティングよりも専門家の特化をより信頼性高く導けるかを問います。

主要結果

統一モデルは300W Commonで2.72 NME、300W Challengingで4.52、WFLWテストセットで4.50の精度に達します。WFLWのポーズ、照明、遮蔽、ブラーサブセットはそれぞれ7.54、4.55、5.53、5.15を記録しています。遮蔽の激しいCOFWでは、NME 4.80と失敗率0.39%を報告しています。周波数モジュールとルーティング損失全体を追加することで、300W Challengingのベースラインを4.71から4.52に改善し、さらに4つの訓練データセットをすべて追加することで単一データセットの4.97の結果が4.52に向上します。性能は常に最高というわけではなく、競争力があります。AFLWでは1.69 NMEとなり、以前の専門化手法ではより低い誤差を報告しています。

要旨

深層学習の最近の進展は、顔ランドマーク検出を大幅に進歩させました。しかし、大多数の既存手法は、データセット固有の学習パラダイムの下で空間領域的に特徴を処理しており、顔ランドマーク検出が本質的に幾何学に基づき、周波数変動に敏感であるという点を見落としており、複雑なシナリオでのクロスデータセット一般化を制限し、顔ランドマーク検出モデルの開発を妨げています。この問題に対処するために、我々はAll-in-One顔ランドマーク検出に向けた周波数変調フレームワークである extbf{FreqFLD}を提案します。具体的には、FreqFLDはFrequency Modulation Module(FreqMoM)を導入し、低周波成分と高周波成分を分離して変調することで周波数事前情報を明示的に誘導し、これをその後の特徴モデリングに注入して、顔のグローバル構造と局所ランドマークの詳細のバランスの取れたモデリングを可能にします。さらに、FreqFLDはFrequency-Modulated Mixture-of-Experts(FreqMoE)を採用し、周波数調整された事前情報に基づいて専門家の選択を適応的に行うことで、多様で困難なシナリオにおける異質な顔ランドマークパターンの柔軟なモデリングを可能にします。All-in-Oneパラダイム下で周波数一貫性のあるモデリングを正則化するために、さらにFrequency-Consistent Routing(FreqCR)損失を導入し、周波数認識専門家のルーティングと割り当てを制約して、多様な顔シナリオでの専門家の利用バランスを促進し、安定した専門化を可能にして頑健な顔ランドマーク検出を実現します。広範な実験により、提案するFreqFLDが人気データセットで同等の性能を達成することが示されました。コードはこちらで入手可能です: https://github.com/jkj1059657014/FreqFLD.

研究の出発点

顔のランドマークモデルは、実際の入力がランドマークの規約、ポーズ、遮蔽、ぼかし、照明を混在させる場合でも、通常はデータセットごとにトレーニングされます。純粋な空間的特徴は、あるアノテーション体制に過剰適合し、低周波の顔構造と高周波のランドマークの詳細の違いを見逃す可能性があります。統一モデルは、1つの専門家がすべての形状や画像品質の体制を扱うことを期待される場合に、ルーティングの競合も生み出します。

手法

周波数変調モジュールは特徴を低周波成分と高周波成分に分解し、それぞれを個別にモデル化し、結果得られた先行知識を下流層に注入します。周波数変調されたエキスパート混合は、その先行知識を用いて異質の顔パターンをルーティングし、周波数一貫性ルーティング損失は活用のバランスを取り、安定した特化を促進します。共同訓練では4つのソースデータセットをそれぞれ20,000サンプルに均等化し、80,000枚の画像プールを作成し、各データセットのネイティブなランドマークおよび正規化プロトコルで評価します。

論文要点

周波数認識ルーティングは複数のランドマークモデルを一つに統合する説得力のある理由を提供しますが、統一トレーニングがすべてのベンチマークを勝ち取るわけではないため、チームはカメラごとランドマークスキームごとの誤差を比較すべきです。

論文 022026-09-15cs.CV

FAHCD-Net:堅牢な顔ランドマーク検出のための周波数適応ヒートマップ条件付き拡散ネットワーク

著者・所属

Jun Wan

School of Information Engineering, Zhongnan University of Economics and Law

Jiwei Hu

School of Information Engineering, Zhongnan University of Economics and Law

Shengkai Hu

School of Information Engineering, Zhongnan University of Economics and Law

Qilu Zhu

School of Information Engineering, Zhongnan University of Economics and Law

何を解決するか

FAHCD-Netは、ヒートマップ条件付き拡散プロセスを明示的に周波数に対応させることで、ポーズ、遮蔽、照明、ぼかしの下でも頑健なランドマーク位置推定を目指す。また、高品質な検出器によって生成された初期ヒートマップに頼るのではなく、カスケードが初期平均形状条件を段階的に改善できるかも検証する。

主要結果

FAHCD-Netは、300W Commonで2.51のNME、全セットで2.99、AFLW frontalで1.17、AFLW fullで2.08を報告している。300W Challengingでは、連続する拡散ステージによりNMEは4.48から4.33、さらに4.29に減少する。平均形状を条件として計算した場合はそれぞれ4.81、4.73、4.69である。COFW、WFLW、およびAFLWのトレーニングデータを追加することで、マルチデータセットのアブレーションにおける300W Challengingの結果は4.76から4.49に改善される。本論文はベンチマークの堅牢性を示しているが、検出器とランドマークの組み合わせによる遅延は報告しておらず、反復拡散のコストは導入時の課題として残る。

要旨

顔面ランドマーク検出(FLD)は、さまざまな分野で重要な課題であり、近年大きな進歩を遂げています。しかし、現在のFLD手法は、顔の構造変動、情報損失、ノイズ干渉など、学習済み顔の特徴の完全性と正確性を著しく損なう厳しい条件下で依然として苦戦しています。これらの課題に対処するため、私たちは周波数適応ヒートマップ条件付き拡散ネットワーク(FAHCD-Net)を提案します。これは、周波数適応ヒートマップ条件付き拡散(FAHCD)モデルと、滑らかさ正則化(SR)損失をカスケード型フレームワークで統合したものです。具体的には、FAHCDモデルには階層的周波数適応(HFA)モジュールが組み込まれており、多層周波数分解と適応再構成を通じて冗長な高周波ノイズを抑制し、本質的な顔構造を保存します。さらに、SR損失は高周波ノイズの干渉をさらに軽減し、生成されるランドマークヒートマップの滑らかさを高めることも提案されています。FAHCDモデルにSR損失をカスケード接続することで、FAHCD-Netはデータの統計的および周波数ベースの分布特性の両方を効果的に活用し、ノイズの多い入力からより正確なランドマークヒートマップを段階的に生成します。人気のあるベンチマークでの広範な実験により、提案された手法の有効性と堅牢性が示され、困難なシナリオ下でのFLDタスクで最先端の性能を達成しています。ソースコードは https://github.com/HJWKryptonite/FAHCD-Net で入手可能です。

研究の出発点

顔のランドマークヒートマップは、ポーズや表情の変化で顔の構造が変わると、遮蔽によって証拠が失われると、またはぼかしや照明によって高周波ノイズが注入されると劣化する。標準的な回帰はこれらの影響を直接の予測誤差として扱う。拡散法はノイズや不完全な証拠からの反復的回復を提供するが、制約のないノイズ除去は自己生成的な高周波ヒートマップエネルギーや不安定なピークを生じることがある。

手法

各カスケードステージは、周波数適応ヒートマップ条件付き拡散モデルを用いてランドマーク分布を精緻化する。階層的な周波数適応は特徴を繰り返し分解・再構築し、低周波の顔構造を保持しつつ冗長な高周波ノイズを抑制する。滑らかさ正則化項により、生成されるヒートマップの周波数挙動がグラウンドトゥルースと整合する。マルチデータセットでの訓練により、300WにCOFW、WFLW、AFLWを追加し、三段階は予測されたヒートマップを次段階の条件として順次渡す。

論文要点

条件付き拡散は困難な画像でもよりクリーンなランドマークヒートマップを回復できますが、その反復コストはカメラのレイテンシ予算や強力な非拡散アライメントのベースラインと比較して評価する必要があります。

論文 032026-09-19cs.CV

堅牢な教室出席管理に向けて:顔検出・顔認識モデルの包括的評価

著者・所属

Himani Trivedi

Computer Engineering Department, LDRP Institute of Technology and Research, Kadi Sarva Vishwavidyalaya

Hiren Patel

Vidush Somany Institute of Technology and Research, Kadi Sarva Vishwavidyalaya

Ridham Patel

Information Technology Department, LDRP Institute of Technology and Research, Kadi Sarva Vishwavidyalaya

Krutika Patel

Information Technology Department, LDRP Institute of Technology and Research, Kadi Sarva Vishwavidyalaya

Nancy Patel

Information Technology Department, LDRP Institute of Technology and Research, Kadi Sarva Vishwavidyalaya

何を解決するか

本研究では、教室環境向けのペア検出・認識データセットを導入し、複数の検出器サイズと7つの最新の顔認識アーキテクチャを比較しています。目的は、最大の検出器や認識器が出席確認の最良構成という前提を置くのではなく、実用的な精度と効率の運用ポイントを特定することです。

主要結果

YOLOv8nは320万パラメータを使用し、精度0.932、再現率0.886、F1スコア0.91、mAP@0.5は0.935に達しています。より大きなバリアントはおおよそmAP@0.5 0.97に近づきますが、パラメータ数は4,370万から6,820万に及びます。認識では、FaceLiVTv2-L、EdgeFace Base、LVFace ViT-B、TransFace ViT-Bがそれぞれ報告表でTop-1 99.75%を達成しています。EdgeFace Baseは4.029 msで実行され、FaceLiVTv2-Lの6.081 msより高速ですが、モデルサイズは大きく異なります。これは限定された教育機関セットによる閉じたセットの結果であり、スプーフィング耐性、学校間の一般化、または自動出席確認の方針適合性を示すものではありません。

要旨

紙や出席簿などの手動出席方法は時間がかかり、エラーが発生しやすく、偽造されやすいです。顔認識はより信頼性がありますが、照明やその他の条件が異なる教室ではしばしば問題が発生します。顔認識のデータセットは規制された環境向けに設計されており、教室で実際に直面する課題を反映していません。これに対応するため、顔検出および認識のタスク向けに16,234の顔サンプルを含む新しい顔検出・認識データセット「Visage Face Dataset」が提案されます。写真は異なる角度やさまざまな照明条件で撮影され、学生はさまざまな表情を見せ、一部の顔は現実の状況を反映するために部分的に隠れています。YOLOベースのシステムを使用して顔を検出し、7種類の先進的な顔認識モデルを13の構成でテストしました:LVFace、QCFace、FaceLiVTv2、TopoFR、EdgeFace、TransFace、GhostFaceNets。これらの中で、FaceLiVTv2-Mが最も優れた性能を示し、Top-1/Top-5精度99.75%、推論時間は6.459ミリ秒でした。これらの結果は、Visage Face Datasetが教室での出席管理における顔認識のリアルで挑戦的なベンチマークであることを示しています。

研究の出発点

教室での出席確認は、多くの小さな顔、さまざまなポーズと照明、部分的な遮蔽、そして手頃なハードウェアで繰り返しビデオフレームを処理する必要性を組み合わせています。一般的な顔データセットはその運用環境を再現しておらず、認識精度だけを報告しても検出漏れや計算コストは隠れてしまいます。また、教育機関は、再利用された身元画像ではなく、同意を得て収集されたデータが必要です。

手法

著者らは801枚の教室画像を収集し、顔を手動で注釈付けし、回転、スケール、平行移動、ノイズ、反転を用いて検出セットを構築しました。本論文では、拡張後の検出画像は3,635枚、顔注釈は96,409件と報告しています。認識セットには100クラスにわたる3,500枚の画像が含まれ、5つのRetinaFaceランドマークに基づいて整列され、112×112に正規化されています。検出にはYOLOv8のn/s/m/l/xバリアントを評価し、認識にはLVFace、QCFace、FaceLiVTv2、TopoFR、EdgeFace、TransFace、GhostFaceNetsの13構成を比較しています。

論文要点

重要な結果は、ほぼ完璧な閉じたセットのスコアではなく、測定された検出器-認識器のトレードオフです。パイロット実施では、機関自身のカメラでの再現性、待ち時間、同意、スプーフィング、未知の人物挙動を確認する必要があります。