← ブログ一覧へ戻る
リサーチレーダー顔検出プレゼンテーション攻撃検出arXiv2026年7月

月次 arXiv レーダー

2026年7月の顔検出論文:マルチスペクトルパッチ、概念誘導PAD、眼球認証チャレンジ

7月は顔検出器に関する論文は少なかったものの、キャプチャセキュリティ層に関する研究は活発に行われていた。そこで本稿では、検出スタックを順に検証していく。具体的には、可視光と赤外線を融合させた検出器を物理的に隠蔽できるかどうか、顔なりすまし防止モデルが目に見えない素材やセンサーにも適用できるかどうか、そして眼球の生体情報によって、リプレイやジェネレーターでは再現できないリアルタイムの生物学的反応を引き起こせるかどうか、といった点について考察する。

本月の重要シグナル

VIPatchは、可視光センサーと赤外線センサーを組み合わせても、物理的な攻撃リスクが自動的に排除されるわけではないことを示しています。これは、マスクとサーマルステッカーを連携させることで両方のチャネルを抑制できるためです。CPG-PADは、別の弱点、つまり再利用可能な視覚的概念ではなくデータセットのアーティファクトに固執するなりすまし防止プロンプトを攻撃します。眼球プロトコルは、受動的な分類から能動的なチャレンジへと移行し、視線追跡と瞳孔反応を組み合わせます。これらの論文を総合すると、階層的なキャプチャ防御、明示的なクロスドメインテスト、およびシミュレーションされたセキュリティ証拠と人間が検証した展開主張との慎重な分離の必要性が示唆されます。

論文 012026-07-25cs.CR

人目を欺く:可視光・赤外線融合顔検出に対する有効な物理敵対パッチ攻撃

著者・所属

Qiucheng Yu

City University of Hong Kong, Hong Kong, China

Tao Ni

King Abdullah University of Science and Technology, Saudi Arabia

Yihe Zhou

City University of Hong Kong, Hong Kong, China

Jiayimei Wang

City University of Hong Kong, Hong Kong, China

Qingchuan Zhao

City University of Hong Kong, Hong Kong, China

何を解決するか

従来のパッチは、可視画像への最適化が赤外線応答と矛盾する可能性があり、目立つパターンは人や二次システムに気づかれやすいため、融合型検出器への適用性が低い。VIPatchは、物理的に実現可能で、統合型であり、視覚的に目立たない攻撃を目指している。

主要結果

デジタルブラックボックス攻撃では、可視検出器全体で平均94.59%、赤外線検出器全体で平均97.40%のASRを達成しています。物理融合設定では、VIPatchはYOLOv8-FaceとMTCNNで97.27%、TFWとOpenCVで100%のASRを達成しています。可視物理ASRは12,000ルクスの光で80.29%を維持し、テストした1~3メートルの距離で92.51%から100%の範囲となっています。

要旨

深層学習に基づく可視光と赤外線を融合した顔検出モデルは、幅広いアプリケーションでますます広く利用されていますが、敵対的パッチ攻撃に対して脆弱なままです。これまでの攻撃のほとんどは、デジタル領域における可視光画像または赤外線画像のいずれか一方のみを標的としており、物理世界における融合モデルに対しては効果がありません。さらに、これらの手法の多くは、パッチパターンが現実世界で見られるものと大きく異なるため、容易に認識されてしまいます。本論文では、顔画像に対して目立たず、リアルで自然な外観のパッチを生成する、新しい物理的敵対的パッチ攻撃であるVIPatch(Visual-Infrared Patch)を紹介します。具体的には、VIPatchは、可視光画像と赤外線画像の両方にグラデーションカラーマスクと絆創膏ステッカーを作成し、これら2つの要素を共同で最適化します。生成されたデジタルパッチは、物理的な対応物の製造をさらにガイドします。実験結果は、VIPatchがデジタル領域と物理領域の両方で90%を超える攻撃成功率を達成しつつ、パッチが人間の観察者にとって目立たない状態を維持していることを示しています。

研究の出発点

可視光と赤外線の融合は、低照度環境や温度スクリーニング環境下でも顔検出機能を維持するために用いられますが、ほとんどの敵対的攻撃に関する研究は、いずれか一方のモダリティのみを攻撃するか、あるいはデジタルデータに留まっています。実用システムでは、印刷、配置、照明の変化、カメラの動きといった様々な要因によって、一見普通の物体が両方のチャネルを抑制できるかどうかを把握する必要があります。

手法

VIPatchは、可視光チャネル用のグラデーションカラーのフェイスマスクと赤外線チャネル用の包帯状のサーマルステッカーを共同で最適化し、実物を製作します。評価では、複数の可視光および赤外線検出器、ホワイトボックスおよびブラックボックス転送、視野角、200~12,000ルクスの照度、1~3メートルの距離における物理テストを組み合わせて実施します。

論文要点

マルチスペクトルセンシングは、2つの独立した防御策としてではなく、結合されたシステムとして脅威をモデル化する必要があります。この攻撃は緩和策ではなく、レッドチームによる攻撃の結果ですが、検出器ベンダーに、パッチ検出、センサーの一貫性チェック、およびフォールバックポリシーを評価するための具体的な物理的条件、転送モデル、および攻撃成功目標を提供します。

論文 022026-07-01cs.CV

CPG-PAD:概念情報に基づくプロンプト誘導型プレゼンテーション攻撃検出

著者・所属

Haoyuan Zhang

School of Artificial Intelligence, University of Chinese Academy of Sciences, China

State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, China

Xiangyu Zhu

State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, China

School of Artificial Intelligence, University of Chinese Academy of Sciences, China

Li Gao

China Mobile Financial Technology Co., Ltd., China

Ajian Liu

State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, China

School of Artificial Intelligence, University of Chinese Academy of Sciences, China

Siran Peng

State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, China

School of Artificial Intelligence, University of Chinese Academy of Sciences, China

Zhen Lei

State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, China

School of Artificial Intelligence, University of Chinese Academy of Sciences, China

Centre for Artificial Intelligence and Robotics, Hong Kong Institute of Science and Innovation, Chinese Academy of Sciences, Hong Kong, China

School of Computer Science and Engineering, Macau University of Science and Technology, Macau, China

何を解決するか

本論文は、学習したプロンプトを、攻撃に関連する詳細な視覚的証拠と整合させつつ、ドメイン固有のショートカットを抑制することを目的としている。また、単一のデータセット分割に依存するのではなく、複数の情報源、限られた情報源、単一の情報源、および未知のプレゼンテーション攻撃ツールプロトコルにわたって同じアイデアを検証する。

主要結果

補足データがない場合、CPG-PADは4方向マルチソースプロトコルで平均HTERが2.08%に達し、CLIPベースラインの5.43%を改善します。CelebA-Spoofを使用すると、1.19%に達します。シングルソース転送では平均HTERが5.33%、未知の攻撃機器では1.02%と報告されており、CLIPベースラインは3.03%です。テストから導出された閾値の代わりに検証セットの閾値を使用すると、平均HTERは2.28%となり、閾値設定の限界が明らかになります。

要旨

プレゼンテーション攻撃検出 (PAD) は、印刷された写真、再生されたビデオ、3D マスクなどのプレゼンテーション攻撃から顔認識システムを保護するための重要な手段です。PAD は大きく進歩しましたが、センサー、照明、攻撃材料の変動により、既存の PAD モデルは未知の領域に汎化するのに苦労しています。最近のビジョン言語モデル (VLM) は高い汎化能力を示していますが、クラス ラベルの監視下で最適化されることが多い学習プロンプトが、攻撃に関連する細かい視覚的意味論に明示的に対応しないため、PAD への応用は限定的です。その結果、学習された表現は、転移可能な攻撃の手がかりを捉えるのではなく、ドメイン固有のアーティファクトに過剰適合することがよくあります。この問題を解決するために、モデル レベルの概念ガイダンスをプロンプト学習プロセスに導入するフレームワークである、概念情報に基づくプロンプト誘導型プレゼンテーション攻撃検出 (CPG-PAD) を提案します。具体的には、説明可能なAI(XAI)技術を用いてPADに関連する視覚概念を自動的に発見し、局所的なきめ細かなガイダンスを提供する概念関連ヒートマップを生成するビジュアルコンセプト駆動型強化(VCE)モジュールを設計しました。これらのヒートマップに基づいて、プロンプトベース概念注入(PCI)メカニズムがビジュアルプロンプトデコーダ(VPD)と概念マッピング損失を介してこれらの概念をプロンプト空間に統合し、プロンプトをモデルの内部概念空間に整合させます。この設計により、CPG-PADは汎用的でドメイン不変の攻撃手がかりを捉えつつ、データセット固有のバイアスを効果的に抑制できます。9つのベンチマークデータセットにわたる広範な実験により、CPG-PADはマルチソース、リミテッドソース、シングルソースの設定において、常に最先端のクロスドメイン性能を達成することが実証されました。

研究の出発点

顔認証偽装対策モデルは、トレーニング時に使用したセンサーや攻撃対象メディアに対しては高い性能を発揮することが多いものの、照明、カメラ、印刷プロセス、マスク、メイクアップなどが変化すると失敗する。視覚言語モデルは幅広い事前情報を提供するが、ラベルのみに基づくプロンプト学習では、実際のプレゼンテーション攻撃を説明する概念ではなく、ローカルデータセットのアーティファクトに固執してしまう可能性がある。

手法

CPG-PADは、まずビジュアルコンセプト駆動型強化モジュールにおいて説明可能性手法を用いて概念を発見し、局所的な概念ヒートマップを生成します。次に、ビジュアルプロンプトデコーダーと概念マッピング損失を用いてこれらのマップをプロンプト空間に挿入し、CLIPの視覚的特徴を複数の学習可能なreal/fakeプロンプトに接続します。この視覚のみのモデルは9つのデータセットで評価され、従来のHTER/AUCとISO準拠の動作点指標の両方が報告されます。

論文要点

コンセプト主導型のプロンプトは、PAD製品が複数のセンサーや攻撃対象物を横断する必要がある場合に有望です。特に、マルチモーダル言語モデルよりも視覚のみのフットプリントが小さいという利点があります。ただし、購入者は展開状況に合わせて調整された閾値で結果を比較する必要があります。論文では、一般的なテストで得られたEER閾値では、現場での準備状況を過大評価する可能性があることを明示的に指摘しています。

論文 032026-07-10cs.CV

眼球生体認証のためのデュアルストリームチャレンジレスポンスプロトコル

著者・所属

Ismail Kably

Konelia Inc., Austin, Texas, USA

何を解決するか

提案されたプロトコルは、自発的な滑らかな追跡視線と不随意的な瞳孔対光反射を組み合わせることで、リプレイ、生成型ディープフェイク、および人工装具による眼球および虹彩系への脅威に対処する。中心的な問題は、レンダリングの遅延が、繰り返し行われるランダムなチャレンジにおいて、測定可能な同期ギャップを生み出すかどうかである。

主要結果

シミュレーションでは、ジェネレーターのレンダリングに遅延が発生しない場合、AUCは0.502、25msでは0.717、50msでは0.948、75msを超えると少なくとも0.997となることが報告されています(1ラウンドあたり)。25msの場合、10ラウンドでAUCは0.966に上昇し、5ラウンド以上でシミュレーションによる0.90-AUC検出閾値は50msから25msに低下します。これらはコンピュータシミュレーションの結果であり、人間を対象とした実験や実際の生成攻撃は測定されていません。

要旨

眼球生体認証システムは、高解像度ビデオ再生やリアルタイム生成ディープフェイクなど、静的な生体認証チェックを容易に回避する高度なプレゼンテーション攻撃に直面しています。現在のプレゼンテーション攻撃検出(PAD)フレームワークは、通常、視線追跡や瞳孔対光反射(PLR)などの個別の生理学的指標に依存していますが、これらは個別に偽装される可能性があります。本論文では、これらの指標を同時認証チャレンジに統合することで、眼球生体認証のためのデュアルストリームチャレンジ・レスポンスフレームワークを導入する空間輝度センサー融合プロトコルを提案します。空間軌跡と輝度強度の両方が変動するランダム化された時間変動視覚刺激を生成することで、同期行列と呼ばれる数学的に結合された状態空間尤度モデルを構築し、滑らかな追跡追跡と瞳孔収縮の予想される生物学的遅延間の連続的な相互相関を評価します。文献から得られた遅延分布に基づいたモンテカルロシミュレーションを用いて、真正な攻撃条件とシミュレーションされた攻撃条件との理論的な分離可能性を実証し、レンダリング遅延ギャップがゼロでない場合、複数ラウンドのチャレンジ設計が生成型ディープフェイクの検出精度を向上させることを示します。本研究は、眼球および虹彩生体認証における次世代動的なりすまし防御のためのシミュレーションに裏付けられた理論的枠組みを提供します。実用化を主張する前に、人間による検証が今後の必要な作業として特定されています。

研究の出発点

静止した視線や瞳孔のチェックは個別に再生でき、リアルタイム生成システムはますます自然な眼球運動を再現できるようになっている。より強力な生体認証テストでは、単一のキャプチャフレームを分類するのではなく、新たな刺激に対する生物学的に制約された2つの反応を要求し、それらのタイミング関係を検証する必要がある。

手法

ディスプレイは、ターゲットの位置と輝度を同時に変化させます。システムは、視線遅延、瞳孔収縮遅延、およびそれらの相互相関を同期行列で推定し、それらを組み合わせて総合スコアを作成します。モンテカルロシミュレーションでは、先行研究から得られた遅延分布を用いて、条件ごとに10,000回の試行を実行し、想定される発生器遅延に対して1回、3回、5回、または10回の独立したラウンドを評価します。

論文要点

この設計は、アクティブなライブネスを実現するための有用な設計図を提供し、セキュリティとレイテンシのトレードオフを明確に示しているが、現時点では実用化可能な精度を保証するものではない。製品評価には、人間のキャリブレーション、センサーのタイミング測定、相関レイテンシ攻撃、および実際のリアルタイムレンダラーに対するレッドチームテストが必要となる。