著者・所属
Can Wang
The Hong Kong Polytechnic University, Hong Kong, China
Yuhao Wang
University College London, United Kingdom
Yushe Cao
Tsinghua University, China
Canran Xiao
Sun Yat-sen University, China
Fei Shen
National University of Singapore, Singapore
何を解決するか
LaP-Forensicsは、明確な互換性参照を用いて、異なる生成器間での画像検出とピクセルレベルのアーティファクト位置特定に対応しています。これは、構造化された「どこで、何が、なぜ」という推論において、その証拠を参照することを目的としており、参照の使用自体が自由形式の説明におけるすべての文を証明するものではないことを認識しています。
主要結果
UniversalFakeDetectでは、画像ヘッドはGANで97.23%、ディープフェイクで71.30%、拡散で92.18%、CRNで98.98%の精度を達成しています。公式のSynthScarsプロトコルでは、人間と人工物の位置特定はmIoUが61.40、F1が66.00に達します。制御された分割では、残差を除去するとmIoUが72.19から61.83に、F1が63.62から41.71に低下します。残差をゼロまたはドナーマップに置き換えると、出力も大幅に変化します。
要旨
最近のジェネレーティブモデルは、目立った視覚的アーティファクトがほとんどない画像を生成できるため、表面的な外観のみに依存する検出器や説明を弱めることができます。本稿では、再構成ベースのフォレンジック証拠でRGBセマンティクスを拡張するマルチモーダルフレームワークであるLaP-Forensicsを紹介します。固定された安定拡散DDIM反転再構成モデルは、固定再構成参照を提供し、その残差マップはその参照との局所的な互換性を測定します。独立したプロジェクターは、構造化されたWhere-What-Whyモデルがテキスト分析とアーティファクトマスクを予測する前に、RGB画像と残差マップをエンコードします。教師あり微調整の後、グループ相対ポリシー最適化(GRPO)が行われ、その報酬はマスクの重なりと出力構造および証拠参照用語を組み合わせます。これらのテキスト側の用語は、モデルが一貫性マップを参照するように促しますが、自由形式のテキストの真実の検証者ではありません。別の画像レベルのヘッドは、RGBとDDIM残差クラスの特徴を融合します。実験では、UniversalFakeDetectにおけるクロスジェネレーター検出と、公式ベンチマークであるSynthScarsにおける競合的なアーティファクト位置特定が実証されました。制御されたキュー構築、反転ホライズン、コンポーネント、報酬項、および反事実分析は、評価された設定における残差ストリームの有用性を裏付けていますが、後処理における自由形式のテキストの忠実性と信頼性については、依然として未解決の課題が残っています。
研究の出発点
生成された画像では表面の明らかな欠陥が失われるため、RGBのみの検出器や視覚言語による説明は、確固たる法医学的証拠を示さなくても説得力があるように聞こえる可能性があります。企業でのレビューにおいては、検出スコア、空間位置、およびテキストによる説明を分離し、実際に結果を変化させる追加信号を示す有用なシステムが必要です。
手法
凍結された安定拡散DDIM反転再構成プロセスにより、入力と再構成間の残差マップが生成されます。別々のプロジェクターがRGBセマンティクスと残差証拠をエンコードし、マルチモーダルブランチが構造化テキストとマスクを生成し、別の画像ヘッドがクラス特徴を融合して検出を行います。教師あり微調整の後、マスクの重なり、出力フォーマット、証拠参照に対してGRPO報酬が与えられ、公式ベンチマークテストは、より小規模な制御されたアブレーション分割とは別に実施されます。
論文要点
再構成残差は有用な第2のフォレンジックチャネルであり、位置特定精度を大幅に向上させますが、較正済みの操作マップやソース帰属信号ではありません。チームは、検出、位置特定、説明を明確に分離することを重視し、生成された根拠をレビューワークフローで使用する前に、後処理の堅牢性とテキストの忠実性を個別にテストする必要があります。