← ブログ一覧へ戻る
リサーチレーダーディープフェイク検出動画フォレンジックarXiv2026年8月

月次 arXiv レーダー

2026年8月のディープフェイク検出論文:画像から動画への転用、マルチエージェント・フォレンジック、公平性

8月の論文では、ディープフェイク検出を単一のAUC番号ではなく展開システムとして扱っています。ある研究は、画像検出器がフレームチューニングや学習アグリゲーションで専用のビデオモデルを上回ることを示し、別の研究では、テクスチャ、ライティング、動き、物理解析をエージェント間で分離しています。3つ目は空間的特徴内の人口統計的ショートカットを対象とし、残留特徴を微調整しています。

本月の重要シグナル

FakeI2V-Benchは、ビデオフレームチューニングと統計的集約により成熟した画像検出器をより強力で時には軽量な映像システムに変えることができると発見しましたが、編集の少ない処理は依然として困難です。FaceVid-Forensics-100Kは、4人の独立した法科学エージェントと審査員を用いて、未確認生成者の検出を改善しつつ説明を返します。FairReLは、一般化と公平性が別々の目的であることを示しています。検出器は全体的にうまく移行しつつ、偽陽性を少数派サブグループに集中させることができます。したがって、信頼できる生産評価には、ジェネレーターの多様性、時間的稀少性検定、レビュー可能な証拠、そして固定閾値サブグループの指標が必要です。

論文 012026-08-04cs.CR

FakeI2V-Bench:画像レベルのディープフェイク検出器を動画検出へ適用する可能性を評価する

著者・所属

Pei Li

School of Cyber Science and Technology, Shandong University, Qingdao, China

Sihan Chen

School of Cyber Science and Technology, Shandong University, Qingdao, China

Delong Ran

Institute for Network Sciences and Cyberspace, BNRist, Tsinghua University, Beijing, China

Tianshuo Cong

School of Cryptologic Science and Engineering, Shandong University, Jinan, China

何を解決するか

FakeI2V-Benchは、画像レベルと動画レベルの検出を統一的にテストし、フレームスコアを動画の判定に変換する再利用可能なブリッジを導入します。これにより、正確性、クロスジェネレーターでの挙動、レイテンシ、モデルサイズ、およびクリップのわずか20%のみが操作された場合の性能が定量化されます。

主要結果

最良の単純集計では、最も強力な画像検出器がAUC 80.16%に達し、すでにトップ動画モデルのFTCNで79.99%に肉迫しています。IV-Bridge適用後、12の画像検出器のうち11台がFTCNを上回り、RINE-IVがAUC 93.80%、AP 97.63%で首位を走り、4.34百万パラメータのPatch-IVはAUC 89.26%、AP 96.12%を達成します。14の生成器全体で、強化された画像モデルは平均AUC 95.51%を記録し、最高の動画検出器は91.01%にとどまる一方、Soraは依然として平均AUC 72.76%で難しい対象です。偽造フレームがわずか20%の場合、すべてのモデルが性能低下し、Patch-IVがAUC 77.15%で首位となります。

要旨

ビデオ生成モデルの最近の進歩によりディープフェイクの脅威は大幅に強化されましたが、現在のディープフェイクビデオ検出ベンチマークは依然として十分に発展していません。特に、映像領域における画像レベル検出器の有効性は体系的に評価されていません。このギャップを埋めるために、最先端のビデオレベルのディープフェイク検出器を評価するためのベンチマークであるFakeI2V-Benchを提案します。特に映像領域における画像レベルのディープフェイク検出器の性能を体系的に評価することに重点を置いています。FakeI2V-Benchは97,548本の動画で構成されており、最新の強力な世代モデルによって生成されたコンテンツとより広範なカテゴリーをカバーしています。このデータセットを用いて、8つのビデオレベル検出器と12の代表的な画像レベル検出器の体系的な評価を実施します。実験結果によると、最も性能の良い画像レベル検出器は80.16%のAUCを達成し、最も強力なビデオレベル検出器(すなわち79.99%のAUC)をわずかに上回っています。ベンチマークを超えて、画像レベルのディープフェイク検出器の動画への適用性を高める一般的なフレームワークであるIV-Bridgeを紹介します。IV-Bridgeは統計的特徴を持つランダムフォレストモデルを用いてフレームレベルの予測を集約し、11種類の画像レベル検出器が最先端のビデオレベル手法を上回ることを可能にし、最も性能の良いバリアントは93.80%のAUCを達成しました。全体として、FakeI2V-Benchはディープフェイク映像検出の厳格なベンチマークを設定し、画像レベル検出器をビデオ領域に拡張する新しい道筋を導入し、今後の研究に新たな洞察と方向性を提供します。コードとデータは https://github.com/CryptoAILab/FakeI2V-Bench で入手可能です。

研究の出発点

画像ディープフェイク検出器は成熟した学習パイプラインの恩恵を受けますが、動画ベンチマークは通常、動画特有のアーキテクチャのみを比較し、フレームモデルには単純な平均化を適用します。そのため、チームは、時系列ネットワークが必要かどうか、最近の動画生成器がランキングにどのように影響するか、既存の画像検出器を経済的に動画に適応できるかどうかを確信できません。全フレームの一部のみが偽造される希薄な操作では、単純な集計は特にリスクが高くなります。

手法

このベンチマークは、4つの顔用および一般生成データセットから97,548本の動画を組み合わせ、8つの動画検出器と12の代表的な画像検出器を評価します。著者らはまず、平均、最大、最小などの固定スコア集計を比較します。IV-Bridgeはその後、重複しないFFおよびGenVideoフレームで動画フレームの微調整を行い、フレームレベルスコアの統計記述子を最大800本の木で深さ8のランダムフォレストに入力します。結果は、14の生成モデル、顔用と一般コンテンツ、導入コスト、短期間の偽造ごとに分類されています。

論文要点

既存の画像検出器も、実動画フレームで調整し、学習型の時系列スコア集約と組み合わせれば、競争力のある動画検出サービスになります。IV-Bridgeは軽量導入にも魅力的ですが、短時間だけ改ざんされた動画は依然として明確な弱点であり、最高精度の構成が最小コストとは限りません。

論文 022026-08-07cs.CV

汎化可能なディープフェイク動画検出のためのマルチエージェント・フォレンジック推論

著者・所属

Xuechao Zou

Beijing Jiaotong University, China

Shun Zhang

Beijing Jiaotong University, China

Kai Li

Tsinghua University, China

Yi Zhou

Beijing Jiaotong University, China

Xinyu Sun

Beijing Jiaotong University, China

Yuhui Chen

Ant Group, China

Zhe Wu

Tsinghua University, China

Congyan Lang

Beijing Jiaotong University, China

Junliang Xing

Tsinghua University, China

何を解決するか

この論文は、現在の説明豊富なベンチマークと、見えない生成者向けの協働推論システムの両方を提供しています。独立した専門的報告が、長い思考の連鎖プロンプトを超えて一般化を向上させるか、あるいは同じフレームを一つのモデルに繰り返し示すかを検証します。

主要結果

ドメイン外テストでは、ビデオ認識判定を備えたフルシステムが69.87%の精度、81.82%のリコール率、53.28のF1を記録しました。最も強力なクローズドモデルであるGemini 2.5 Proは63.78%、75.29%、47.45%を記録し、最良の小型視力ベースラインは64.28%の精度と45.20のF1を記録しています。テキストのみの審査員報告書は依然として2位で、67.41%の精度と51.01のF1を記録しています。Joint SFTはビデオ認識システムを42.29%から67.03%に向上させ、GRPOはさらに向上させています。4人の法医学エージェントを組み合わせると、両方のジャッジ設定で最高のF1が得られます。

要旨

生成人工知能を悪意ある利用で非常にリアルなディープフェイク動画を作成することは、深刻な倫理的問題を引き起こし、AIの安全性に大きな課題をもたらします。しかし、既存のディープフェイク動画ベンチマークは、最近の合成手法を限定的にカバーしており、信頼性のある細かいテキスト注釈が一般的に不足しています。一方、従来の検出器やマルチモーダル大規模言語モデル(MLLM)は、単一のモデルとして動作する場合でも、単一の分析視点に依存している場合でも、微妙な偽造アーティファクトを捕捉できず、その汎用化が新興のAI生成手法に限定されることが多いです。これらの制約に対処するため、FaceVid-Forensics-100Kを導入します。これは10万本の動画を含み、顔の交換、顔の再現、顔の合成を含む33の合成手法を網羅した大規模なディープフェイク動画データセットです。Seedance 2.0のような最近のジェネレーターも含まれています。このデータセットは、高度なMLLMを搭載したマルチモデル集約および紛争解決パイプラインを通じて自動的に合成された、視覚的観察の詳細なテキスト注釈と判決一貫性のある法医学的説明を提供します。このベンチマークを基に、4人の専門分野専門家エージェントを用いて、テクスチャ、ライティング、動き、物理の4つの視点から偽造手がかりを独立に分析するマルチエージェントの法科学的推論フレームワークを提案します。その後、ジャッジエージェントが報告を照合し、最終的な予測と説明を生成します。ドメイン外のテストセットでの広範な評価によると、全てが小規模なオープンソースMLLMで構成されているにもかかわらず、本フレームワークはクローズドソースのGPTやGeminiモデルを含むすべての手法を上回り、このベンチマークで報告されたすべての指標でトップにランクインしています。プロジェクトページは https://xavierjiezou.github.io/ARGUS/ でご覧いただけます。

研究の出発点

現代の顔のビデオジェネレーターは、単一の分類器や汎用MLLMでは微妙なジェネレーター固有の証拠を見逃す可能性があるため、アイデンティティと動きを十分に維持しています。既存のデータセットは新しい合成システムに遅れをとることが多く、バイナリラベルしか提供しないため、説明の訓練や監査が困難です。高リスクレビューの場合、検出器は独立した法医学的次元を検査し、矛盾する観察を調整し、根拠のない結論を出すべきではありません。

手法

FaceVid-Forensics-100Kには、Seedance 2.0を含む33の顔入れ、再現、全顔合成手法による10万本の動画が含まれています。詳細な観察結果と判定一貫した説明は、マルチモデルの集約と対立解決によって作成されます。4人の小規模なオープンソースMLLMエージェントが、テクスチャ、ライティング、動き、物理的一貫性を個別に検査します。審査員は報告を受け取り、必要に応じて動画をサンプリングし、評決と説明を出します。エージェントと審査員は監督付きファインチューニングとグループ相対政策最適化の訓練を受け、ドメイン外のジェネレーターは評価のために保持されます。

論文要点

フォレンジック観察と最終判定を分離すると、監査可能性と未知生成器への性能をともに改善できます。この構成は分析者支援に有望ですが、複数モデルの推論コストと自動生成された説明ラベルの信頼性を、単純な検出器と人手レビューの組み合わせに対して測る必要があります。

論文 032026-08-28cs.CV

FairReL:公平性を考慮した表現学習によるディープフェイク検出

著者・所属

Xiaoman Lu

Department of Computer Science, University of Warwick, Coventry, United Kingdom

Jiaqi Li

Department of Computer Science, University of Warwick, Coventry, United Kingdom

Shuntian Zheng

Department of Computer Science, University of Warwick, Coventry, United Kingdom

Huiping Chen

School of Computer Science, University of Birmingham, Birmingham, United Kingdom

Yu Guan

Department of Computer Science, University of Warwick, Coventry, United Kingdom

何を解決するか

FairReLは、多スケール空間周波数とファインチューニング時に導入される残差表現という2つのサブグループ感度成分を分離し、それぞれに異なる公平性コントロールを適用します。偽陽性の不均衡を一定の動作閾値で評価するため、単に全体的に少ないサンプル数で改善を図ることはできません。

主要結果

最も強力な公平重視のベースラインに対して、著者らは未見データセットでのAUCが3.9ポイント向上し、サブグループFPRの格差が10.2%減少したことを報告している。FairReLはCeleb-DF、DFD、DFDCでそれぞれ80.64、86.13、66.34のAUCを達成し、3つのデータセットすべてで最も低い等FPR格差(10.12、13.55、38.36)を示している。DFDCにおけるグループ平均AUCは67.03で、サブグループ間の最良から最悪までのAUC差は1.09ポイントである。全体のAUCでは2つのデータセットで精度重視のGenDにわずかに劣るが、特に女性および黒人サブグループに対して性能をより均等に分配している。

要旨

最近のディープフェイク検出器は全体的な精度が高いものの、誤差は人口統計的サブグループ間で不均等に分布しており、特定のグループの実際の顔が偽顔と誤分類されることが多いです。既存のフェアネス認識型検出器は通常、特徴表現全体を正規化し、不公平な予測を駆動する特定の要素を特定したり制御したりしません。このような粗い介入は、有用な偽造手がかりを過剰に抑制し、人口統計的構造をコンポーネント固有のサブスペースに残すことがあります。これに対処するため、2つのサブグループ感受性コンポーネントを特定します。多スケール空間特徴は局所的な顔と偽造パターンを符号化し、ファインチューニング誘発的な残留特徴は不公平な訓練分布に適応させます。私たちは、両方のコンポーネントを対象としたフェアネス認識型の表現学習フレームワークであるFairReLを提案します。FairReLはSVD分解された基礎モデルバックボーンを用いてファインチューニングによる残差表現を分離し、2つの補完的な損失を導入します。グループ条件付きウェーブレットデコレレーション(GCWD)は空間的ウェーブレットサブバンド間のサブグループ不均衡構造を抑制し、サブスペース局所平均アライメント(SLMA)は残差表現内の各実クラス/偽クラス内のサブグループ平均を整列させます。FF、Celeb-DF、DFD、DFDCを用いた実験では、最先端の公平性認識検出器に対して、FairReLは未確認データセットAUCを3.9%改善し、サブグループのFPR格差を10.2%削減することが示されています。コードは https://github.com/xiaoman89/FairReL で利用可能です。

研究の出発点

検出器は強力なグローバルAUCを達成しつつ、特定の人口統計的サブグループのメンバーを誤って非難する頻度が他よりもはるかに高いこともあります。既存の公平性の損失は最終的な予測や埋め込み全体を正則化し、局所的な人口統計的ショートカットを残したり、有用な偽造証拠を消し去ったりします。課題は、サブグループ情報が検出器に入る場所をターゲットにしつつ、公平性とドメイン横断の正確性の両方を保つことです。

手法

この手法は、SVDを用いたCLIP ViT-L/14の自己注意投影をすべて分解し、基礎表現を保持しつつランク1残差を学習します。グループ条件付きウェーブレット脱関は、空間ウェーブレット帯間でサブグループ不均衡構造を個別に抑制します。サブスペース局所平均アラインメントは、各実/偽クラス内の人口統計的平均を適応残差でのみ整列させ、無差別な全特徴平滑化を回避します。モデルはFaceForensicsで訓練され、6つの交差的な性別/民族グループとFPR指標を用いて、90%のTPRに固定されたソース検証閾値でCeleb-DF、DFD、DFDCに移行します。

論文要点

ディープフェイク評価では、集計AUCだけでなく、固定した運用点におけるサブグループ別の偽陽性率も報告すべきです。FairReLは局所的なバイアス抑制とクロスドメイン性能を両立できることを示しますが、DFDCに残る格差はなお大きく、本番の閾値とエスカレーション経路にはサブグループ別検証が必要です。