← ブログ一覧へ戻る
リサーチレーダー顔認識arXiv2026年9月

月刊arXivレーダー

2026年9月の顔認識論文:より公平な照合、熱画像適応、双生児テスト

セプテンバーの顔認識研究は、別のバックボーン競争というよりも、困難な運用環境に関するものです。DenseFaceは既存モデルのマッチングルールを変更して、人種による誤マッチの不均衡を減らします。SynThermFaceは、稀少な可視-サーマルペアを、推論時に画像変換を追加することなく、より大きな適応セットに変えます。Celeb Twins Test Setは、今日の埋め込みが一卵性双生児を区別するために人間が頼るわずかな局所的手がかりを使用しているかどうかを問います。

本月の重要シグナル

DenseFaceは、局所的な埋め込み密度が事後の確率的マッチング信号として使用できることを示しており、検証精度を保持しながら、いくつかの非コーカソイドの誤マッチ率をコーカソイドの基準値にかなり近づけることができる。SynThermFaceは訓練時にのみ拡散モデルを使用し、その後は単一の適応済みEdgeFaceフォワードパスを展開する。その合成ペアモデルはMCXFaceで0.99%のEERを達成するが、未使用のTuftsデータでは14.70%となり、センサーの転送は依然として重要である。CTTSは21,120対の双子中心ペアを提供し、12の最新マッチャー変種が、通常のベンチマーク平均が約97%であるにもかかわらず、精度が73〜77%付近にとどまることを発見した。共通の教訓は、マッチングルール、キャプチャスペクトラム、および難しい個人群をまとめて一つの総合スコアで生産準備度を評価するのではなく、個別に検証することである。

論文 012026-09-14cs.CV

DenseFace:密度を考慮した確率的照合による顔認識のバイアス緩和

著者・所属

Mansur Bultygov

VisionLabs

Vadim Seliutin

Amazon Web Services

VisionLabs (work performed there)

Dmitry Nekhaev

VisionLabs

Ivan Laptev

Mohamed bin Zayed University of Artificial Intelligence

何を解決するか

DenseFaceは、人種による誤一致の格差を、基盤となる顔エンコーダを変更または再訓練することなく比較時に減らせるかどうかを問います。また、サブグループの精度の標準偏差を、展開指向のプロトコルに置き換えます:白人の偽陽性率を0.001に設定し、他のすべてのコホートが公平性からどれだけ逸脱するかを測定します。

主要結果

Glint360K、MS1MV2、WebFace4M、WebFace12M、BUPT-BalancedFaceで訓練されたCosFaceおよびAdaFaceモデル全体で、同じグローバル閾値は大幅に均等化されます。BUPTモデルでは、アフリカ系コホートの偽陽性倍率は6.15から1.43に、インド系コホートは4.01から1.03に低下し、白人の基準と比較されます。従来の認証精度は維持されます:CosFace Glint360Kモデルでは、RFWの平均精度は98.61%から98.68%に上昇し、サブグループの標準偏差は0.53から0.44に低下します。回帰器は著者のGPUテストで約0.2%のメモリと1.75%のエンドツーエンド遅延を追加し、最適化されたCPUスコア計算は生のコサイン計算の約1.5倍のコストです。結果は依然として代表的なアンカーまたは回帰器の訓練人口に依存します。

要旨

顔認識における着実な進展にもかかわらず、現在の顔認識モデルは依然として重大な人口統計的バイアスに悩まされています。バイアス軽減のためのアプローチは提案されてきましたが、既存の方法はしばしば訓練手順に制約を課し、認識精度の低下を引き起こします。この問題に対処するために、我々は、精度を損なうことなく事前学習された顔認識モデルの人種的バイアスを低減する手法を導入します。そのために、各人物の顔埋め込みをフォン・ミーゼス・フィッシャー(MF)分布でモデル化します。次に、人口統計属性とMF分布の密度との依存関係を観察し、MF分布の違いを考慮した確率的顔照合手法であるDenseFaceを提案します。我々の大規模な実験により、DenseFaceはネットワークアーキテクチャ、訓練データセット、損失関数の異なる強力な顔認識モデルにおいて一貫して人種的バイアスを低減することが示されました。特に、DenseFaceは認識精度を保持し、基盤となる顔認識モデルの再訓練を必要としません。我々の研究は、以前に採用されたバイアス測定についても検討し、提案を行っています。

研究の出発点

顔認識システムはしばしば1つのグローバルな判定閾値を使用しますが、不正利用者のスコア分布は異なる人口統計群ごとに異なります。したがって、各グループが独自の交差検証された閾値を受け取る場合、モデルはRFWで正確に見えるかもしれませんが、実際のサービスでは非常に異なる誤照合率を生み出す可能性があります。多くの緩和方法も、認識性能を低下させる可能性があるバランスの取れた再学習データ、アーキテクチャの変更、または公平性損失を必要とし、承認済みモデルに後付けするのは困難です。

手法

各顔埋め込みについて、この方法は人口統計学的にバランスの取れたアンカーセット内で最も近い同一人物を見つけ、局所的なクラス間密度を推定します。そして埋め込みを、その密度を反映した濃度を持つフォン・ミーゼス-フィッシャー分布で表現し、ペアを生のコサイン類似度ではなく相互尤度でスコアリングします。近傍の同一人物はマージンで分離され、軽量回帰器のバリアントは密度を直接予測するため、実際のマッチングでは大規模なアンカー検索は必要ありません。エンコーダー、埋め込み次元、登録データは変更されません。

論文要点

比較層の公正性制御は、モデルの再トレーニングを行わずにコーホートの均等性を改善することができますが、実際の運用しきい値での代表的なキャリブレーションデータやサブグループの監視の必要性をなくすことはできません。

論文 022026-09-09cs.CV

SynThermFace:合成データ生成で限られた可視光・熱画像ペアを拡張する顔認識

著者・所属

Anjith George

Idiap Research Institute, Switzerland

Adam Unal

Idiap Research Institute, Switzerland

Sebastien Marcel

Idiap Research Institute, Switzerland

University of Lausanne, Switzerland

何を解決するか

SynThermFaceは、可視から熱への認識のための限られたペア付き監督を増幅し、合成熱ペアが、訓練に使用されなかったセンサー/データベースへの転送だけでなく、データベース内での精度向上にも役立つかどうかをテストします。また、合成識別子のスケーリングの利点から、その適応目的の利点を区別します。

主要結果

分離されたMCXFace開発分割では、実際のペアPACTがEER 3.04%、Rank-1 96.49%に達し、比較された実ペア適応ベースラインを上回ります。CASIA由来の合成アイデンティティ1,000体では、EERは0.99%に低下し、Rank-1は99.75%に達し、0.1% FARでの認証は93.48%に達します。一方、適応していないEdgeFaceベースラインはEER 23.06%、Rank-1 40.10%です。未見のTuftsデータでは、Digi2Real由来のトレーニングによりEdgeFaceはEER 43.41%から13.91%、Rank-1は12.03%から56.37%に改善します。残りのMCXFaceからTuftsへのギャップはまだ大きく、ジェネレーターは依然として実際のMCXFaceペアに依存しているため、この手法は実際のクロススペクトル収集を排除するのではなく減少させます。

要旨

顔認識(FR)は生体認証のために広く使用されている手法ですが、従来のモデルは可視光スペクトルの画像に依存しており、高品質なRGB画像を取得できない場合には性能が低下します。クロススペクトル顔認識は、この制約に対処するもので、可視画像と熱画像などの他のモダリティを照合することで、低照度、夜間、および制約の少ない条件下でもより信頼性の高い性能を実現します。しかし、進展はペアになった可視-熱画像データの不足によって制限されており、このデータは大規模に収集するのが困難でコストがかかります。私たちは、限られた実際の可視-熱監督データをクロススペクトル顔認識用の大規模なペア適応データセットに拡張するフレームワークとして、SynThermFaceを提案します。まず、拡散モデルを限られたペアの可視-熱画像セットで適応させ、その後、既存の実際または合成の可視顔データセットから大規模なペアの可視-合成熱データを生成するために使用します。生成されたペアは、事前学習済みの可視スペクトル顔認識モデルをCFRモデルに適応させるために使用されます。テスト時に画像変換を必要とする合成ベースのアプローチとは異なり、提案手法は生成の処理を訓練段階に移行させ、適応された認識モデルを単一の順方向パスで推論することが可能です。同じMCXFace実ペアプロトコルの下では、PACTは評価されたCFR適応ベースラインよりも改善を示し、提案された適応目的の効果を明確に分離します。生成された大規模なペアデータセットでPACTを訓練すると、未適応モデルや実ペアPACT構成の両方に対してさらに改善が得られます。Tuftsデータセットでのクロスデータベース評価は、学習された表現が未見のデータベースに転移することを示す証拠を提供します。ソースコードと訓練済みモデルは公開される予定です。

研究の出発点

サーマルカメラは、可視光による撮影が失敗した場合に認証や監視を支援できますが、ほとんどの身元ギャラリーはRGBであり、可視光とサーマルのペアの顔を収集するのは高価です。実行時にすべてのサーマルプローブを直接変換すると、重要経路にジェネレーターを追加し、身元を変更する可能性があります。実際的な問題は、小さな実際のペアセットが、展開時に通常の埋め込み検索として残しながら、はるかに大きなトレーニングセットを監督できるかどうかです。

手法

拡散ジェネレーターはまずペアになったMCXFaceトレーニング分割に適応され、次に実際のCASIA-WebFace画像または合成Digi2Realアイデンティティのいずれかを対応するサーマルビューに変換します。Preservation-Aware Cross-Spectral Tuningは事前学習済みのEdgeFaceモデルから開始し、対称的なサーマルから可視および可視からサーマルへのコントラスト学習を、可視の埋め込みを元のモデルの固定コピーに近く保つ損失と組み合わせます。生成は適応セットを構築する際にのみ行われ、推論は調整済み認識器を通した1回のフォワードパスで行われます。

論文要点

オフラインでの合成サーマル生成は、小規模なペアコレクションを有用な認識監督に変えることができますが、新しいセンサーや人口に対しては、それぞれ独自の転移および公平性テストが依然として必要です。

論文 032026-09-01cs.CV

一卵性双生児の顔認識を再検討する:Celeb Twins Test Set

著者・所属

Michael Zang

Department of Computer Science and Engineering, University of Notre Dame

Haiyu Wu

Department of Computer Science and Engineering, University of Notre Dame

Mrinal Sharma

Department of Computer Science and Engineering, University of Notre Dame

Kevin W. Bowyer

Department of Computer Science and Engineering, University of Notre Dame

何を解決するか

本論文では、双子が異なるクロスバリデーションに対応できるほど大きく、局所的な識別マークと左右非対称の可能性について注釈付きの検証スタイルベンチマークを作成する。次に、現代の深層顔マッチャーがこれらの手がかりを活用するか、あるいは水平反転の仮定を取り除いたり、合成双子を生成することで実現可能な方法が提供されるかを検証する。

主要結果

12のマッチャ構成は平均CTTS精度が73.14〜76.50%にとどまり、従来の検証セット5組で平均すると約97.00〜97.69%と比べて高いです。可視的なマークを消去しても埋め込みやペア距離分布はほぼ変わらないまま、現在のモデルは人間が使える手がかりを無視していることを示しています。非対称性認識型再学習は78.58%の±3.7%に達し、元のモデルと統計的に差はありません。一部のミラー双子セットには有利で、他のセットには不利です。生成された双子は対面内および双子間の距離構造を現実的に保持しないため、まだ検証済みのトレーニング代替手段ではありません。

要旨

一卵性(「一卵性」)双生児の顔認識に関する過去の文献では、顔の特徴や左右非対称性が双生児認識精度向上の可能性のある方向として示唆されている。Celeb Twins テストセット(CTTS)は、ウェブから収集された80組の有名人双子の画像ペアを含む。これは、皮膚の特徴や左右非対称の可能性を持つ双子に関するメタデータを持つ唯一の双子テストセットである。CTTSは、LFW、CALFW、CPLFW、CFP-FP、AgeDB-30などの顔認証テストセットの形式で整理されている。現行の深層CNNマッチャーは、CTTSにおける同一人物/異なる人物の画像ペア分類において76%以上の精度を達成できる。我々は、現行のマッチャーが皮膚の特徴や非対称性を利用していないことを示し、その理由について議論する。最後に、Grok、ChatGPT、Geminiなどの生成AIツールを用いて想像上の一卵性双生児の画像を作成し、顔認識訓練セットにおける双子の表現を増やすことの実現可能性について論じる。

研究の出発点

一卵性双子は、通常の顔認証ベンチマークではほとんど表現されない個人識別の境界を露出させる。NISTは以前、非双子の誤一致率を0.0001に設定した閾値で、多くのアルゴリズムが一方の双子をもう一方として98〜99%の確率で認識してしまうと報告している。既存の双子データセットは小規模で古く、そばかす、ほくろ、傷、左右反転双子の状態に関するメタデータが欠けているため、現代の埋め込みが実際にどの手がかりを使用しているかを学習することが困難である。

手法

CTTS-80は、80組の有名人の双子セットのウェブ画像を収集し、各双子セットを1つのフォールドに完全に保持しながら、10フォールドにわたって21,120の均衡のとれた同一人物ペアおよび双子インポスター(偽双子)ペアを構築します。著者らは、3つの一般的なデータセットで訓練されたArcFace、AdaFace、UniFace、およびMagFace ResNet-100モデルを評価します。彼らは選択された身元の目立つ肌の痕跡を消去し、元の埋め込み分布と編集後の埋め込み分布を比較し、水平反転拡張なしでArcFaceを再訓練し、3つの生成システムから要求された合成双子セットを検査します。

論文要点

双子の認証は依然として特有のリスククラスであり、標準的な精度ではほとんど何も示していません。また、現行の埋め込み(エンベディング)は明白な局所的特徴を使用していないようです。高信頼性の展開では、一般的なベンチマークから性能を推測するのではなく、双子のなりすましを明示的にテストするべきです。