著者・所属
Pei Li
School of Cyber Science and Technology, Shandong University, Qingdao, China
Sihan Chen
School of Cyber Science and Technology, Shandong University, Qingdao, China
Delong Ran
Institute for Network Sciences and Cyberspace, BNRist, Tsinghua University, Beijing, China
Tianshuo Cong
School of Cryptologic Science and Engineering, Shandong University, Jinan, China
何を解決するか
FakeI2V-Benchは、画像レベルと動画レベルの検出を統一的にテストし、フレームスコアを動画の判定に変換する再利用可能なブリッジを導入します。これにより、正確性、クロスジェネレーターでの挙動、レイテンシ、モデルサイズ、およびクリップのわずか20%のみが操作された場合の性能が定量化されます。
主要結果
最良の単純集計では、最も強力な画像検出器がAUC 80.16%に達し、すでにトップ動画モデルのFTCNで79.99%に肉迫しています。IV-Bridge適用後、12の画像検出器のうち11台がFTCNを上回り、RINE-IVがAUC 93.80%、AP 97.63%で首位を走り、4.34百万パラメータのPatch-IVはAUC 89.26%、AP 96.12%を達成します。14の生成器全体で、強化された画像モデルは平均AUC 95.51%を記録し、最高の動画検出器は91.01%にとどまる一方、Soraは依然として平均AUC 72.76%で難しい対象です。偽造フレームがわずか20%の場合、すべてのモデルが性能低下し、Patch-IVがAUC 77.15%で首位となります。
要旨
ビデオ生成モデルの最近の進歩によりディープフェイクの脅威は大幅に強化されましたが、現在のディープフェイクビデオ検出ベンチマークは依然として十分に発展していません。特に、映像領域における画像レベル検出器の有効性は体系的に評価されていません。このギャップを埋めるために、最先端のビデオレベルのディープフェイク検出器を評価するためのベンチマークであるFakeI2V-Benchを提案します。特に映像領域における画像レベルのディープフェイク検出器の性能を体系的に評価することに重点を置いています。FakeI2V-Benchは97,548本の動画で構成されており、最新の強力な世代モデルによって生成されたコンテンツとより広範なカテゴリーをカバーしています。このデータセットを用いて、8つのビデオレベル検出器と12の代表的な画像レベル検出器の体系的な評価を実施します。実験結果によると、最も性能の良い画像レベル検出器は80.16%のAUCを達成し、最も強力なビデオレベル検出器(すなわち79.99%のAUC)をわずかに上回っています。ベンチマークを超えて、画像レベルのディープフェイク検出器の動画への適用性を高める一般的なフレームワークであるIV-Bridgeを紹介します。IV-Bridgeは統計的特徴を持つランダムフォレストモデルを用いてフレームレベルの予測を集約し、11種類の画像レベル検出器が最先端のビデオレベル手法を上回ることを可能にし、最も性能の良いバリアントは93.80%のAUCを達成しました。全体として、FakeI2V-Benchはディープフェイク映像検出の厳格なベンチマークを設定し、画像レベル検出器をビデオ領域に拡張する新しい道筋を導入し、今後の研究に新たな洞察と方向性を提供します。コードとデータは https://github.com/CryptoAILab/FakeI2V-Bench で入手可能です。
研究の出発点
画像ディープフェイク検出器は成熟した学習パイプラインの恩恵を受けますが、動画ベンチマークは通常、動画特有のアーキテクチャのみを比較し、フレームモデルには単純な平均化を適用します。そのため、チームは、時系列ネットワークが必要かどうか、最近の動画生成器がランキングにどのように影響するか、既存の画像検出器を経済的に動画に適応できるかどうかを確信できません。全フレームの一部のみが偽造される希薄な操作では、単純な集計は特にリスクが高くなります。
手法
このベンチマークは、4つの顔用および一般生成データセットから97,548本の動画を組み合わせ、8つの動画検出器と12の代表的な画像検出器を評価します。著者らはまず、平均、最大、最小などの固定スコア集計を比較します。IV-Bridgeはその後、重複しないFFおよびGenVideoフレームで動画フレームの微調整を行い、フレームレベルスコアの統計記述子を最大800本の木で深さ8のランダムフォレストに入力します。結果は、14の生成モデル、顔用と一般コンテンツ、導入コスト、短期間の偽造ごとに分類されています。
論文要点
既存の画像検出器も、実動画フレームで調整し、学習型の時系列スコア集約と組み合わせれば、競争力のある動画検出サービスになります。IV-Bridgeは軽量導入にも魅力的ですが、短時間だけ改ざんされた動画は依然として明確な弱点であり、最高精度の構成が最小コストとは限りません。