← ブログ一覧へ戻る
リサーチレーダー顔検出提示攻撃検出arXiv2026年8月

月次 arXiv レーダー

2026年8月の顔検出論文:動的ランドマーク、顔を使わないなりすまし検出、基盤モデル

顔検出スタックは固定されたバウンディングボックスから、設定可能なジオメトリと信頼できるキャプチャへと拡大しています。今月の論文では、互換性のないランドマークテンプレートを統一し、印刷/再生アーティファクトが顔以外のオブジェクトから完全に学習できるかどうかを問い、プレゼンテーションおよびモーフ攻撃データセットにわたる30の視覚エンコーダーと16のマルチモーダルモデルをテストします。

本月の重要シグナル

統一的動的FLDは、テンプレート固有のランドマークヘッドをセマンティックコントルクエリに置き換え、実行時に要求されたレイアウトを返すことができます。TPOは、Greensから得た印刷・再生の証拠がフェイス・アンチスプーフィングに強く移転することを示し、プライバシー重視の補足データも実現可能であることを示し、さらに深い前提に挑戦します。基盤モデル研究は境界条件を提供します。一般的な事前学習は助けになりますが、ゼロショットMLLMプロンプトは依然として弱く、PADは通常視覚エンコーダーの適応を必要とします。実際の方向性は、データセット固有のモデルの集合ではなく、明示的なクロスドメインキャプチャセキュリティを基盤とした統合されたジオメトリサービスです。

論文 012026-08-11cs.CV

統一動的顔ランドマーク検出に向けて

著者・所属

Sebastian Regalado

University of Toronto, Canada

ModiFace, Canada

Varshanth R. Rao

ModiFace, Canada

Ruowei Jiang

ModiFace, Canada

Parham Aarabi

University of Toronto, Canada

Igor Gilitschenski

University of Toronto, Canada

何を解決するか

本論文は、異種なランドマークレイアウトのための共通の意味座標系を定義し、それを使って複数のデータセットにわたる1つの検出器を訓練します。推論段階では、同じネットワークが任意のランドマーククエリの集合に答えることができ、ソースデータセットの訓練中に明示的に要求されていないポイントも含まれます。

主要結果

アダプター付きの統一ViT-Bモデルは、WFLWで4.02 NMEと2.19%の失敗率を記録し、共通/チャレンジ300W分割で2.43/4.19 NME、AFLW-19で2.76 NMEを記録し、フューズドトレーニングと動的出力をサポートしています。300Wのみで訓練した場合、難易度の高いWFLW68転送テストでは6.08 NMEに達し、DTLDでは7.23、PIPNetでは8.09となっています。保留されたネイティブランドマークでは、学習済みクエリはスプライン補間に対して300Wで19.0%、WFLW分割で15.7〜16.3%向上し、固定インデックスの暗記だけでなく再利用可能な等高線セマンティクスを学習していることを示しています。

要旨

顔のランドマーク検出(FLD)手法の進歩は性能の限界を押し広げ続けていますが、2つの大きな機能的制約を見落としています。すなわち、(1) 各「$N$点」ベンチマークデータセットごとに異なるネットワークパラメータを独立して訓練する必要があること、(2) 「$N$点」データセットで訓練されたモデルは$N$のランドマークのみを確実に出力するということです。本研究ではまず、Face Part-Anchored Landmark Positions(FPALP)を概念化します。これは、各ランドマークを面パーツの輪郭に沿って0(開始)から1(終了)までの進行値として扱います。すべてのランドマークは、そのソースデータセットに関係なくFPALP形式で表現できるため、すべての「$N$ポイント」データセットを単一のデータセットに統合する能力を解放します。次に、各ランドマークをFPALPベースのクエリで表現し、クロスモーダリティデコーダで段階的に改良し、最終表現に基づいて座標を予測します。私たちのアプローチはUnified Dynamic FLDと呼ばれ、これら二つの設計選択を体現し、(1)単一のモデルが任意の数の「$N$ポイント」データセットで学習可能になり、(2)ランタイム時に指定されたランドマーククエリを読み込み、特定のランドマーク予測を任意数生成することでランドマーク検出パイプラインを効率化します。複数のベンチマークデータセットでの広範な実験により、我々の手法はこれらの利点を発揮しつつ、既存の最先端手法と競合し、場合によってはそれを上回ることが示されています。

研究の出発点

フェイランドマークデータセットは、19、68、98、または他の注釈点数を持つかどうかで意見が分かれています。従来のモデルは回帰ヘッドを1つのテンプレートに割り当てるため、チームは各データセットごとに別々のパラメータを訓練・維持しなければならず、展開したモデルが新しいサブセットやより密度の高いレイアウトを必要に応じて返すことを妨げます。この断片化は、異なるランドマーク慣例を消費するアラインメント、再構築、構成、表現パイプラインにとってコストがかかります。

手法

各ランドマークはFace Part-Anchored Landmark Positionとなり、眉毛、目、鼻、口、顔の境界などの意味輪郭に沿って0から1へ正規化された進行を示します。データセットテンプレートはこの輪郭空間に整列され、要求されたすべてのポイントはFPALPクエリとしてエンコードされます。クロスモーダリティデコーダは画像トークンとクエリを段階的に組み合わせてから座標を回帰させます。ViT-BモデルはAFLW-19、300W、WFLWで共同学習されています。オプションの軽量データセットアダプターは、統一されたバックボーンや実行時に設定可能な出力レイアウトを放棄することなく、体系的な注釈オフセットを回復します。

論文要点

クエリ駆動型の単一ランドマークサービスで、競争力のある精度を保ちながら複数のテンプレート専用モデルを置き換えられます。複数のアライメント形式を必要とする製品や、将来ランドマーク定義を追加する製品に特に有用ですが、本番データセットごとに注釈オフセット用アダプターを検証する必要があります。

論文 022026-08-20cs.CV

トマト、ジャガイモ、タマネギ:顔提示攻撃検出に顔は必要か

著者・所属

Guray Ozgur

Fraunhofer Institute for Computer Graphics Research IGD, Germany

Department of Computer Science, Technical University of Darmstadt, Germany

Fadi Boutros

Fraunhofer Institute for Computer Graphics Research IGD, Germany

Naser Damer

Fraunhofer Institute for Computer Graphics Research IGD, Germany

Department of Computer Science, Technical University of Darmstadt, Germany

何を解決するか

この研究は、管理された顔なしデータセットを通じて顔の意味論から提示過程の手がかりを分離し、それらの手がかりが標準的な顔のPADベンチマークに戻るかどうかを探ります。また、一部の顔サンプルを顔なし攻撃に置き換えることで、データセットサイズを単に増やすだけでなく、固定された訓練予算内で情報が追加されるかどうかも検証しています。

主要結果

野菜単独のトレーニングは4つのフェイスベンチマークで平均AUCが92.70%、HTERが14.15%に達し、合成フェイストレーニングではAUCが81.02%、ImageNet初期化コントロールで67.81%となっています。固定された単一ソースフェイス予算の一部をTPOに置き換えると、平均クロスデータセットAUCが89.33%から92.55%に上昇し、HTERが17.54%から13.97%に低下します。マルチソーストレーニングではAUCが92.11%から96.96%に上昇し、HTERは14.72%から7.84%に低下しました。攻撃の多様性は冗長フレームよりも重要です。TPOフレームの10%のみを使用しても92.97%のAUCが得られ、印刷のみまたはリプレイのみのトレーニングは86.14%と83.97%に低下します。

要旨

顔表示攻撃検出(PAD)は従来、顔特異の問題として定式化されていますが、印刷、再生、再キャプチャのプロセスによって生じる多くの視覚的アーティファクトは、顔の外見に本質的に結びついていません。本研究では、下流のPADトレーニング中に顔を使わずに移転可能なPAD表現を学習できるかどうかを調査します。この目的のために、TPOを導入しました。これは、トマト、ジャガイモ、タマネギのほぼランダムに選ばれた、印刷済み、再生記録からなる制御された顔なしプレゼンテーション攻撃データセットであり、従来の顔のPADデータセットに密接に似たプロトコルで取得されました。基礎モデルベースのPADアーキテクチャを用いて、TPOで訓練された検出器が4つの標準的なクロスデータセットの顔PADベンチマークで平均AUC92.70%を達成し、合成顔での訓練を上回り、実際の顔データセットで訓練されたモデルと競合していることを実証しました。逆に、顔のPADデータセットで訓練されたモデルは、TPOへの確率を超えて一貫して転送されており、学習された表現はオブジェクトの意味ではなく提示過程の特徴を捉えていることを示唆しています。さらに、TPOを従来の顔のPADトレーニングに組み込むことで、固定された最適化予算下でのクロスデータセット性能が一貫して向上し、顔を使わないデータが単なる追加訓練サンプルではなく補完的な情報を提供することを示しています。最後に、表現および頻度解析は、移譲可能なPAD表現が単一のスペクトルアーティファクトで説明できず、オブジェクトカテゴリ間で共有されるより豊かな提示手がかりをエンコードしていることのさらなる証拠を提供します。これらの結果は、移転可能なプレゼンテーション攻撃表現が顔の内容から独立して学習可能であるという実証的証拠を提供し、プライバシー保護とアイデンティティに依存しないPAD開発の新たな機会を開きます。

研究の出発点

印刷・再生攻撃はモアレパターン、表示サブピクセル、紙の質感、ガンマシフト、反射、再捕獲ノイズを導入し、これらは描写されるアイデンティティではなく、提示機器の特性です。しかし、反スプーフィング研究はほとんどの場合、より多くの人間の顔を収集し、同意や人口統計学的な懸念を高め、検出器に顔やデータセットのショートカットを吸収させることを促します。著者らは、移転可能な攻撃証拠が顔なしで学習可能であるという意図的に強い仮説を検証しています。

手法

TPOには、face PADデータセットをモデル化したプロトコルでキャプチャされたトマト、ジャガイモ、玉ねぎの12,480件の本物、印刷物、リプレイプレゼンテーションが含まれています。CLIP ViT-B/16 FoundPADモデルは、LoRAでTPOのみを用いて適応され、その後MSU-MFSD、CASIA-FASD、Replay-Attack、OULU-NPUで評価されます。コントロールには、ゼロショットCLIP、ImageNet初期化アーキテクチャマッチ、SynthASpoof、単一および複数ソースの実顔トレーニング、顔データセットからTPOへの逆転送、固定予算置換実験、周波数解析、オブジェクトクラス、攻撃タイプ、フレーム数のアブレーションが含まれます。

論文要点

印刷・リプレイ攻撃の検出では、新たな人物を収集することより、現実的な再撮影条件を多様化することの方が重要な場合があります。顔を含まない補助データは、プライバシーに配慮しながらセンサー間の汎化を改善できます。ただし、この結果は検証済みの印刷・画面表示プロセスに関するもので、マスクや新種の物理攻撃へ自動的に一般化すべきではありません。

論文 032026-08-30cs.CV

顔提示攻撃・モーフィング攻撃検出のための基盤モデルとマルチモーダル大規模言語モデル

著者・所属

Hatef Otroshi Shahreza

Idiap Research Institute, Switzerland

Asif Hussain Khan

Idiap Research Institute, Switzerland

Peter Lorenz

Idiap Research Institute, Switzerland

Alain Komaty

Idiap Research Institute, Switzerland

Sébastien Marcel

Idiap Research Institute, Switzerland

University of Lausanne, Switzerland

何を解決するか

本研究は、顔表象攻撃検出と形態攻撃検出の両方のアクセス戦略を単一かつ大規模に比較します。ゼロショット言語出力、出力ロジット、凍結視覚特徴、タスク特異のMLLMチューニング、LoRA適応の価値を区別し、すべての利点を一般的な基礎モデルラベルに帰属させるのではありません。

主要結果

市販のプロンプトは信頼できる検出器ではありません。最良のゼロショット平均はPADで31.1%のACER、MADで19.4%です。凍結されたエンコーダーとリニアヘッドを使えば、これらの数値は24.4%と5.0%に向上します。タスク固有のPADLLMとMADLLMは、説明を生成しながらそれぞれ13.6%と2.9%に達します。最良のLoRA適応エンコーダは、PADで平均ACERが14.9%、最も有力な引用スペシャリストでは17.3%に対し、MADは3.7%で11.3%を達成しています。MADはPADよりも移行しやすく、最良のクロスデータセットACERは4.9%対19.8%であり、事前学習の目標的予測はパラメータ数よりも優れています。

要旨

顔認識システムはセキュリティに重要なアプリケーションでますます導入されていますが、プレゼンテーション攻撃やモーフ攻撃に対して依然として脆弱です。プレゼンテーション攻撃検出(PAD)とモーフィング攻撃検出(MAD)は、信頼できる顔バイオメトリクスの不可欠な要素です。PADおよびMAD手法の進歩にもかかわらず、既存の検出器は一般化が限られ、データセット間評価の性能が低下しています。本論文では、汎用基礎モデル(FM)およびマルチモーダル大規模言語モデル(MLLM)がPAD関連およびMAD関連情報を符号化しているかどうか、そしてこれらのモデルが両タスクにどのように最適に展開できるかを体系的に調査します。モデルの内部情報へのアクセスが増える中で、5つのアプローチを検討します:(i) 市販MLLM(市販MLLM)のゼロショットプロンプト;(ii) MLLMの出力時の次トークンロギット確率で浅いモデルを訓練すること;(iii) タスク固有の質問回答データに対するパラメータ効率のファインチューニングを行い、PADLMとMADLMと呼ばれる2つの専門的なMLLMを生成し、さらにテキスト上の判断理由を提供します。(iv) 凍結された視覚エンコーダーの線形プローブ;および(v) FMおよびMLLMのビジョンエンコーダーの微調整。私たちは、4つのPADデータセット(MSU-MFSD、CASIA-FASD、REPLAY-ATTACK、OULU-NPU)および4つのMADデータセット(FFHQ、FRGC、FRLL、FERET)に対して、16のオープンウェイトMLLMと30のビジョンエンコーダバックボーンをベンチマークしました。実験により、FMとMLLMはPADおよびMADにおいて顕著な性能を達成できることが示されました。さらに、ファインチューニングされたモデルはクロスデータセット評価において最先端の検出性能を発揮しており、汎用事前学習表現が攻撃に関連する重要な情報を含んでいることを示しています。すべての実験のソースコードは公開されます。

研究の出発点

汎用視覚やマルチモーダルモデルは、プレゼンテーションやモーフ攻撃に役立つテクスチャ、幾何学、意味的な手がかりをすでにエンコードしているかもしれませんが、モデルサイズだけではその証拠の抽出方法を明らかにしません。セキュリティチームは、既製品プロンプトで十分か、説明に専門的なMLLMが必要か、視覚エンコーダー自体がデータセット間のセンサーや攻撃の変化に耐えられるように適応すべきかを知る必要があります。

手法

16のオープンウェイトMLLMと30の視覚エンコーダーが、4つのPADデータセット(MSU-MFSD、CASIA-FASD、Replay-Attack、OULU-NPU)および4つのMADデータセット(FFHQ、FRGC、FRLL、FERET)で評価されます。 [EOS]5つの展開モードが各モデルの特性を徐々に増やします:ゼロショットプロンプト、次トークン確率の浅い分類器、パラメータ効率の高い質問回答チューニング(テキスト推論によるPADLLMまたはMADLLMへのチューニング)、凍結された視覚エンコーダーの線形プローブ、エンコーダーのLoRA適応。開発時に設定されたEER閾値は、データセット内およびクロスデータセットのACERテストの両方に適用されます。

論文要点

プロンプトを与えただけのMLLMを生体攻撃検出器として導入すべきではありません。凍結した視覚特徴は有用な基準になりますが、PADには通常エンコーダー適応が必要です。一方、人が読める根拠が必要ならタスク特化型MLLMが有効です。モデル選定は提示攻撃とモーフィング攻撃で個別に検証すべきです。