著者・所属
Tahar Chettaoui
Fraunhofer Institute for Computer Graphics Research IGD, Germany
Guray Ozgur
Fraunhofer Institute for Computer Graphics Research IGD, Germany
Technical University of Darmstadt, Germany
Eduarda Caldeira
Fraunhofer Institute for Computer Graphics Research IGD, Germany
Technical University of Darmstadt, Germany
Arturas Nakvosas
Vilnius University, Lithuania
Hatef Otroshi Shahreza
Idiap Research Institute, Switzerland
Sébastien Marcel
Idiap Research Institute, Switzerland
Rishabh Shukla
Indian Institute of Technology Jammu, India
Aditya Takkar
Indian Institute of Technology Jammu, India
Rushil Khullar
Indian Institute of Technology Jammu, India
Lalak Yadav
Indian Institute of Technology Jammu, India
Gourav Gupta
ArogyaPandit Private Limited, India
Anant Gupta
ArogyaPandit Private Limited, India
Shiqi Yu
Southern University of Science and Technology, China
Vitomir Struc
University of Ljubljana, Slovenia
Naser Damer
Fraunhofer Institute for Computer Graphics Research IGD, Germany
Technical University of Darmstadt, Germany
Fadi Boutros
Fraunhofer Institute for Computer Graphics Research IGD, Germany
何を解決するか
以前の合成データを用いた課題では、ジェネレータの品質、バックボーンの選択、トレーニング方法などが混在していました。今回のベンチマークでは、CLIP ViT-L/14とIDPERTURBジェネレータを修正することで、完全なファインチューニング、LoRA、ランク安定化LoRA、射影のみの適応を、同一の識別データと評価スイートの下で比較できるようにしました。
主要結果
Sub-Center ArcFace を使用した完全な微調整により、フルデータ トラックでは、小規模ベンチマークで平均精度 95.51%、IJB-C の FAR 1e-5 で TAR 87.42% を達成し、FRoundation ベースラインの 76.71% を上回ります。限定データでは、rsLoRA の方が堅牢です。Idiap-BSP は平均精度 94.52%、IJB-C TAR 81.13%(FAR 1e-5)を達成します。公平性の評価も体制によって異なり、フルデータで勝者は平均 RFW 精度 91.70%、限定データで勝者は 88.92% を達成します。
要旨
本稿では、2026年国際バイオメトリクス合同会議(IJCB 2026)で開催された、合成トレーニングデータを用いた顔認識のための基盤モデルの適応に関するコンペティション(AFMFR)の概要を述べる。このコンペティションには、2つの補完的なトラック(参加者が大規模な合成IDデータを使用してCLIP ViT-L/14基盤モデルを適応させるフルデータトラックと、よりリソース制約のある適応体制を反映するように設計されたリミテッドデータトラック)から、4つの異なるチームから合計8つの有効な応募があった。すべてのトレーニングデータは、IDPERTURBのみを使用して生成された。提出されたソリューションは、Bordaカウント法を使用して、LFW、CFP-FP、AgeDB-30、CALFW、CPLFW、IJB-B、IJB-C、TinyFaceなどの多様なベンチマークにおける検証および識別性能に基づいてランク付けされる。公平性評価は、RFWデータセットについて4つの人口統計グループにわたって追加で実施される。今回の結果は、CLIP基礎モデルを合成トレーニングデータで適応させることで、既製のモデルよりも大幅に性能が向上し、場合によってはベースラインを上回ることを示しています。特に、Sub-Center ArcFace(DMSTI-Neurotechnology)を用いたフルファインチューニングはフルデータトラックでトップの成績を収め、ランク安定化LoRA適応(Idiap-BSP)はデータ制限条件下で最も効果的であることが証明されました。
研究の出発点
顔認識の開発者は、広範かつ同意を得た実顔のトレーニングデータセットがますます不足している一方で、一般的な視覚基盤モデルは、適応なしでは厳密な生体認証動作点において十分な識別能力を発揮できない。このコンペティションでは、合成IDがその適応を提供できるかどうか、また、利用可能な合成データセットが桁違いに変化した場合に、どの程度のトレーニング容量が適切かが問われる。
手法
このコンペティションでは、35,000人の合成IDから得られた約300万枚の画像を含むフルデータトラックと、5,000人のIDから得られた250,000枚の画像を含むリミテッドデータトラックが定義されています。有効な8つの提出物は、IJB-B、IJB-C、TinyFaceという5つの小規模検証セットにわたるBorda集計によって採点され、RFWは4つの人口統計グループにわたるパフォーマンスのばらつきを測定します。提出された手法は、フルバックボーン更新、LoRAおよびrsLoRAランク、マージン損失、データ拡張、軽量射影チューニングを探求しています。
論文要点
大規模なビジュアル基盤を採用するチームにとって、合成データ量に基づいてチューニング戦略を策定する必要があります。数百万枚の画像規模では、徹底的なファインチューニングが効果を発揮しますが、IDと画像が制約されている場合は、高ランクrsLoRAが有効な正則化手法として機能します。どちらの状況にも最適な単一の手法は存在しないでしょう。