← ブログ一覧へ戻る
リサーチレーダーディープフェイク検出顔認識arXiv2026年7月

月次 arXiv レーダー

2026年7月のディープフェイク検出論文:再構成証拠、顔の生理信号、コンパクトリプレイ

7月に発表されたディープフェイクに関する論文では、検出器が静的ベンチマークを離れた後に現れる3つの弱点、すなわち、説明が根拠に乏しいこと、話し顔生成器がアーティファクト分類器を回避できること、そして継続的な更新によって以前の操作ファミリーが忘れられてしまうこと、に対処している。採用された手法では、明示的な再構成残差、生理学的ビデオチャネル、および情報密度の高い再生バッファが導入されている。

本月の重要シグナル

LaP-Forensicsは、拡散再構成残差に基づいて位置特定と構造化された説明を行うが、その自由形式のテキストが事実検証済みであると主張することは正しく避けている。rPPGの研究では、分類器とプロトコルが固定されていても、話顔検出の難易度はジェネレータによって大きく異なることが示されている。InfoDenseは、完全な過去の顔画像を保存せずに検出器を更新するという運用上の問題に取り組んでいる。3つすべてにおいて、最も強い信号は普遍的なアーティファクトではない。信頼性は、補完的な証拠を組み合わせ、評価プロトコルを分離し、分布が変化するときに重要な手がかりを保持することから生まれる。

論文 012026-07-28cs.CV

LaP-Forensics: ディープフェイク検出のための潜在ピクセル一貫性誘導型マルチモーダル推論

著者・所属

Can Wang

The Hong Kong Polytechnic University, Hong Kong, China

Yuhao Wang

University College London, United Kingdom

Yushe Cao

Tsinghua University, China

Canran Xiao

Sun Yat-sen University, China

Fei Shen

National University of Singapore, Singapore

何を解決するか

LaP-Forensicsは、明確な互換性参照を用いて、異なる生成器間での画像検出とピクセルレベルのアーティファクト位置特定に対応しています。これは、構造化された「どこで、何が、なぜ」という推論において、その証拠を参照することを目的としており、参照の使用自体が自由形式の説明におけるすべての文を証明するものではないことを認識しています。

主要結果

UniversalFakeDetectでは、画像ヘッドはGANで97.23%、ディープフェイクで71.30%、拡散で92.18%、CRNで98.98%の精度を達成しています。公式のSynthScarsプロトコルでは、人間と人工物の位置特定はmIoUが61.40、F1が66.00に達します。制御された分割では、残差を除去するとmIoUが72.19から61.83に、F1が63.62から41.71に低下します。残差をゼロまたはドナーマップに置き換えると、出力も大幅に変化します。

要旨

最近のジェネレーティブモデルは、目立った視覚的アーティファクトがほとんどない画像を生成できるため、表面的な外観のみに依存する検出器や説明を弱めることができます。本稿では、再構成ベースのフォレンジック証拠でRGBセマンティクスを拡張するマルチモーダルフレームワークであるLaP-Forensicsを紹介します。固定された安定拡散DDIM反転再構成モデ​​ルは、固定再構成参照を提供し、その残差マップはその参照との局所的な互換性を測定します。独立したプロジェクターは、構造化されたWhere-What-Whyモデルがテキスト分析とアーティファクトマスクを予測する前に、RGB画像と残差マップをエンコードします。教師あり微調整の後、グループ相対ポリシー最適化(GRPO)が行われ、その報酬はマスクの重なりと出力構造および証拠参照用語を組み合わせます。これらのテキスト側の用語は、モデルが一貫性マップを参照するように促しますが、自由形式のテキストの真実の検証者ではありません。別の画像レベルのヘッドは、RGBとDDIM残差クラスの特徴を融合します。実験では、UniversalFakeDetectにおけるクロスジェネレーター検出と、公式ベンチマークであるSynthScarsにおける競合的なアーティファクト位置特定が実証されました。制御されたキュー構築、反転ホライズン、コンポーネント、報酬項、および反事実分析は、評価された設定における残差ストリームの有用性を裏付けていますが、後処理における自由形式のテキストの忠実性と信頼性については、依然として未解決の課題が残っています。

研究の出発点

生成された画像では表面の明らかな欠陥が失われるため、RGBのみの検出器や視覚言語による説明は、確固たる法医学的証拠を示さなくても説得力があるように聞こえる可能性があります。企業でのレビューにおいては、検出スコア、空間位置、およびテキストによる説明を分離し、実際に結果を変化させる追加信号を示す有用なシステムが必要です。

手法

凍結された安定拡散DDIM反転再構成プロセスにより、入力と再構成間の残差マップが生成されます。別々のプロジェクターがRGBセマンティクスと残差証拠をエンコードし、マルチモーダルブランチが構造化テキストとマスクを生成し、別の画像ヘッドがクラス特徴を融合して検出を行います。教師あり微調整の後、マスクの重なり、出力フォーマット、証拠参照に対してGRPO報酬が与えられ、公式ベンチマークテストは、より小規模な制御されたアブレーション分割とは別に実施されます。

論文要点

再構成残差は有用な第2のフォレンジックチャネルであり、位置特定精度を大幅に向上させますが、較正済みの操作マップやソース帰属信号ではありません。チームは、検出、位置特定、説明を明確に分離することを重視し、生成された根拠をレビューワークフローで使用する前に、後処理の堅牢性とテキストの忠実性を個別にテストする必要があります。

論文 022026-07-23cs.LG

トーキングフェイス・ディープフェイク検出のための法科学的モダリティとしての生理信号

著者・所属

Othmane Harraq

Temple University, Philadelphia, Pennsylvania, USA

Tamer Aldwairi

Temple University, Philadelphia, Pennsylvania, USA

何を解決するか

本論文では、遠隔光電容積脈波測定法が、会話顔偽造の検出においてより有用な情報を提供するのか、また、訓練データにすべてのテスト対象者が含まれていない場合でも、その性能は信頼できるままなのかを検証する。さらに、検出難易度を7つの生成方法ごとに個別に測定し、そのばらつきを1つの総合スコアの中に隠してしまうことを避けている。

主要結果

165K パラメータの 1D ResNet は、AUC 0.806 ± 0.003、EER 27.8% を達成し、再現された以前の rPPG 検出器の AUC 0.622、引用された汎用 Effort モデルの 0.830 と比較されます。ジェネレータごとの AUC は、Real3DPortrait の 0.985 から IP-LAP の 0.690 までで、安定した 0.295 のばらつきがあり、シードの分散よりもはるかに大きくなっています。

要旨

トーキングフェイス(TF)ディープフェイク生成は、静止画像と音声信号からフォトリアルな顔動画を合成し、現在の画像ベースの検出器では一貫して識別できない偽造動画を生成します。顔交換操作とは異なり、TF合成には生理学的特性を引き継ぐための基となる実際の動画がないため、リモート光電脈波測定(rPPG)はこの偽造カテゴリに対する独自の検出手法となります。本稿では、RhythmFormerを介して動画ごとのrPPG波形を抽出し、軽量分類器群を訓練して、実際の生理学的信号と合成された生理学的信号を区別する検出フレームワークを提案します。 Celeb-DF++ の TF サブセットで、テスト ID がトレーニング ID から完全に分離された厳密な被験者非依存プロトコルの下で評価された、1D ResNet は、生理学的チャネルのみで動作しながら、AUC 0.806、EER 27.8% を達成し、公開されている最高の汎用検出器 (Effort、ICML 2025) から 2.4 ポイント以内に収まります。我々は、代表的な事前 rPPG 検出器である DeepFakesON-Phys の制御された再現研究を文書化し、従来の顔交換データでの AUC 0.999 か​​ら Celeb-DF++ の TF サブセットでの 0.622 への劣化を実証します。さらに、検出の難易度は手法に大きく依存することも示しました。7つのTFジェネレーター全体でAUCは0.985(Real3DPortrait)から0.690(IP-LAP)まで変化し、ランキングはすべての評価プロトコルで完全に安定しています。このばらつきは、評価ノイズではなく、各ジェネレーターの解釈可能な生理学的特性を反映しており、本研究の主要な理論的貢献となっています。

研究の出発点

トーキングフェイスジェネレーターは、静止画の人物と音声から動画全体を合成するため、実際の血流量の時間的変化を正確に反映しない可能性があります。既存のrPPG検出器は主に古い顔交換画像で検証されており、そこでは元の動画の生理学的情報が保持され、分割画像間で人物の情報が漏洩することで結果が誇張される可能性があります。

手法

RhythmFormerは各顔動画から波形を抽出し、その後、軽量な1次元ResNetとトランスフォーマー分類器が実際の生理現象と合成生理現象を区別します。Celeb-DF++の会話顔サブセットは有名人のIDごとに分割され、18人のIDが評価用に保持されています。著者らはDeepFakesON-Physを同じ設定で再現し、5つのシードの集計分析とジェネレータごとの分析を実行します。

論文要点

顔面生理学は、単独の答えではなく、補完的で解釈可能な情報源です。非常に少ないパラメータで、より大規模な視覚検出器に近い性能を発揮しますが、一部のジェネレーターは擬似周期信号を十分に保持するため、偶然の確率に近づいてしまいます。そのため、プロダクションシステムは、rPPGを空間、周波数、および視聴覚的な証拠と融合させ、複数の人物やジェネレーター間で検証する必要があります。

論文 032026-07-18cs.CV

InfoDense:メモリ効率の高い増分型顔偽造検出のための密度認識型決定領域リプレイ

著者・所属

Jikang Cheng

Peking University, China

Hao Shen

Huazhong Agricultural University, China

Xueyi Zhang

National University of Singapore, Singapore

Guangcheng Wang

Nantong University, China

Zhongyuan Wang

Wuhan University, China

Renye Yan

Peking University, China

Baojin Huang

Huazhong Agricultural University, China

何を解決するか

InfoDenseは、リプレイを情報密度問題として捉え直します。操作の証拠を含むコンパクトな領域を保持し、それらの領域から多様なセットを選択し、古い完全な画像のバッファに関連するドメインバイアスを導入することなく、それらを現在のタスクのサンプルと組み合わせます。

主要結果

メインプロトコルでは、InfoDenseは増分データセット全体で平均AUCが90.42%(パフォーマンス低下4.52ポイント)、データセット間平均AUCが90.03%であると報告しています。論文では、ストレージを80%削減した後でも同等のパフォーマンスが得られ、同じストレージ容量でリプレイの多様性が最大10倍になると報告されています。また、保存されたフラグメントにより、報告されているプラ​​イバシー分析では、ID検索のリコール率が0.02%未満に低下しています。

要旨

顔偽造技術の急速な進化により、操作の種類がますます多様化しています。新しい偽造データを段階的に追加して、以前に学習したモデルを微調整するインクリメンタル顔偽造検出(IFFD)は、進化する偽造の脅威に対処する有望なアプローチとして登場しました。しかし、従来の再生ベースのIFFD手法は、壊滅的忘却の問題を抱えています。限られたメモリで完全な履歴画像を保存すると、微妙な偽造の手がかりを保持できないか、ドメインバイアスが導入され、モデルが固有の転移可能な操作特性を学習する能力が低下します。本論文では、これらの課題に対処するために、InfoDenseと呼ばれる密度認識型領域決定再生戦略を提案します。InfoDenseは、アーティファクトが密集し、偽造が重要な領域を優先し、ストレージ要件を大幅に削減しながら、高忠実度の偽造証拠を維持します。まず、CLIPベースの埋め込みを使用して決定的なパッチを局所化するInfoDense Cutを紹介します。次に、InfoDense Selectは、潜在空間の代表性と決定的なパッチ数を組み合わせることで候補セグメントをランク付けし、リプレイバッファ内の多様性と情報密度の両方を確保します。最後に、InfoDense Fuseは、保存されたセグメントを現在のタスクサンプルと適応的にマージすることで、偏りのないトレーニング入力を再構築し、知識の保持と汎化性能を向上させます。難易度の高いインクリメンタルディープフェイクベンチマークを用いた広範な実験により、InfoDenseは、ドメイン横断的な汎化性能を向上させながら、壊滅的な忘却を効果的に軽減することが実証されています。

研究の出発点

ディープフェイク検出器は、新たな操作手法が登場するたびに繰り返しアップデートする必要があるが、過去の顔画像全体を再生するとメモリを消費し、識別可能なコンテンツが保持されるだけでなく、バ​​ッファの大部分が背景や冗長な顔の構造に費やされる可能性がある。限られたストレージ容量の中で、検出器は以前のタスクを忘れることなく、微妙な偽造の手がかりを保持しなければならない。

手法

InfoDense Cutは、CLIPパッチ埋め込みと偽造関連テキストを使用して決定的な領域をスコアリングします。InfoDense Selectは、潜在空間の代表性と決定的なパッチの数の両方に基づいて候補セグメントをランク付けします。InfoDense Fuseは、保存された過去のセグメントと現在のサンプルを組み合わせることでトレーニング入力を再構築し、同じメモリ予算で表現できるソース画像の数を増やします。評価は、段階的な偽造シーケンスと個別のデータセット間テストによって行われます。

論文要点

領域レベルのリプレイは、ストレージ容量やプライバシーの制約下で継続的に学習する必要のある検出器にとって魅力的な手法です。その実用価値は、選択されたパッチが実際の圧縮、ポリシー変更、および敵対的後処理の後も情報量を維持できるかどうかに左右されますが、完全な過去の顔データを保持することに対する具体的な代替手段となります。