著者・所属
Dasom Choi
Chungnam National University
Sangjun Moon
Chungnam National University
Hyeongchan Im
Chungnam National University
Jaeeon Park
Institute of Science Tokyo
Jingun Kwon
Chungnam National University
Hidetaka Kamigaito
Nara Institute of Science and Technology
Taro Watanabe
Nara Institute of Science and Technology
Manabu Okumura
Institute of Science Tokyo
何を解決するか
IMFDは、多面偽造検出を、顔を同時に特定し、各顔に対する真正性ラベルを割り当てる指示に基づく視覚言語タスクとして再定式化します。これは、明示的な顔の座標と画像の文脈が、大規模視覚言語モデルが左から右への顔のインデックスを正しい出力に対応させるのに役立つかどうかをテストします。
主要結果
完全なテストセットでの地上真値座標を使用すると、IMFDはマイクロF1で0.98、マクロF1で0.98、完全一致精度で0.94を達成し、顔の数が多いサブセットではそれぞれ0.97、0.98、0.87となります。真の単一ステージ設定では、これらの全セット指標は0.90、0.84、0.77に下がり、位置特定が残りのボトルネックであることが明らかになります。顔ボックスのAPは全セットで81.9、顔の多いサブセットで83.6です。入力解像度を112ピクセルから672ピクセルに上げると、制御されたマイクロF1は0.917から0.981に、完全一致は0.654から0.948に向上します。IMFDは比較対象のベースラインを上回りますが、最も高速な単一ステージ手法より遅く、依然として合成ベンチマーク操作に依存しています。
要旨
ディープフェイクの急速な増加は、ソーシャルメディア上での拡散により重大な懸念を引き起こしています。従来のマルチフェイス偽造検出器は、各顔を個別に切り取り検証するため、背景の文脈や顔間の関係を無視しており、しばしば最適ではない性能を示します。これらの制限を克服するために、私たちは指示ベースの大規模視覚・言語モデル(LVLM)を活用します。LVLMは、画像全体を解釈し、複雑なテキスト指示に従うことができます。私たちは、IMFD(Instruction-based Multi-face Forgery Detector)と呼ばれる、単純ながら効果的な単段階マルチフェイス偽造検出器を提案します。IMFDは、顔の位置を特定し、各顔の偽造ラベルを予測するためにエンドツーエンドで共同学習されます。顔領域の予測を単なる共同目的として扱うのではなく、IMFDは予測された顔のバウンディングボックスを指示に視覚的手がかりとして明示的に統合し、指示の基盤化と偽造検出を強化します。IMFDの学習および評価を支援するために、既存のマルチフェイス偽造データセットを指示ベース形式に変換しました。実験結果と分析により、IMFDが顔のバウンディングボックスを指示に統合することでマルチフェイス偽造検出を改善し、さまざまな最先端手法よりも一貫して優れた性能を示すことが確認されました。
研究の出発点
複数人物の写真は、通常の「切り取り-分類」前提を崩します。個別の顔切り取りはシーンや顔間の文脈を捨て、各人物に対して順次作業が必要となり、検出器や順序の誤りをフォレンジック判断に伝播させます。役立つシステムは、画像に操作が含まれているかどうかだけでなく、どの顔が偽造であるかを明示する必要があります。
手法
このシステムは、OpenForensics のサンプルを左から右へ顔の名前をつける指示に変換します。CLIP ベースのアンカーステージは候補領域にスコアを付け、重なったボックスを融合し、予測された座標を画像表現とともにテキスト指示に注入します。その後、LVLM が加工された顔のインデックスとボックスを返します。著者らは、真の座標を使用する制御された二段階設定と、IMFD の予測ボックスを使用するエンドツーエンドの単段階設定の両方を評価し、マイクロ F1、マクロ F1、正確な画像レベル一致、ボックス AP、レイテンシ、スループットを報告しています。
論文要点
全体画像の推論は混雑シーンの鑑識を改善するが、提供されたボックスと予測ボックスの差は大きい。調達テストでは画像レベルのAUCだけでなく、顔ごとの正確な判定や位置特定の失敗も評価すべきである。