← ブログ一覧へ戻る
リサーチレーダーディープフェイク検出メディアフォレンジックarXiv2026年9月

月刊arXivレーダー

2026年9月のDeepfake検出論文:複数顔推論、スマートフォン誤検知、継続学習

9月の最も強力なディープフェイクの研究は、他の閉じたセットのスコアではなく、システムの挙動に焦点を当てています。IMFDは、ビジョン・ランゲージモデルに、1回の指示に基づく処理で全ての顔を位置特定し分類するよう求めます。LAION-Mobileは、現代の合成コンテンツとほぼ100万件のスマートフォン写真記録に対して元の検出器チェックポイントを監査し、深刻なキャリブレーションのずれを明らかにします。MSFDは、ビデオ検出器のアップデートを継続学習問題として扱い、空間的、時間的、結合周波数の証拠を別々に保持します。

本月の重要シグナル

IMFDの座標認識指示により、OpenForensicsでの二段階結果はマイクロF1で0.98、マクロF1で0.98、完全一致精度で0.94に達します;一方でエンドツーエンドの単段階版は、顔の位置特定が依然としてエラーを伝播するため、0.90、0.84、0.77に低下します。LAION-Mobileは、12の公表済み検出器のいずれも、現代AIの混合物で0.624 AUCを超えず、現代でキャリブレーションされた閾値では17〜91%の認証済み携帯写真がフラグされることを発見しました;しかしそのコーパスは、現行のフラッグシップニューラルISPをほとんどカバーしていません。MSFDは、6つの逐次ビデオデータセットで平均AUC93.02%と2.29ポイントの忘却を達成し、少数ショットプロトコルで平均精度83.65%および負の忘却を達成します。これらの論文は合わせて、シーン全体の評価、現行デバイスのネガティブ例、明示的な校正の責任、そして検出器毎の更新後の回帰テストを推奨しています。

論文 012026-09-17cs.CV

IMFD:命令ベース大規模視覚言語モデルによるエンドツーエンド複数顔偽造検出

著者・所属

Dasom Choi

Chungnam National University

Sangjun Moon

Chungnam National University

Hyeongchan Im

Chungnam National University

Jaeeon Park

Institute of Science Tokyo

Jingun Kwon

Chungnam National University

Hidetaka Kamigaito

Nara Institute of Science and Technology

Taro Watanabe

Nara Institute of Science and Technology

Manabu Okumura

Institute of Science Tokyo

何を解決するか

IMFDは、多面偽造検出を、顔を同時に特定し、各顔に対する真正性ラベルを割り当てる指示に基づく視覚言語タスクとして再定式化します。これは、明示的な顔の座標と画像の文脈が、大規模視覚言語モデルが左から右への顔のインデックスを正しい出力に対応させるのに役立つかどうかをテストします。

主要結果

完全なテストセットでの地上真値座標を使用すると、IMFDはマイクロF1で0.98、マクロF1で0.98、完全一致精度で0.94を達成し、顔の数が多いサブセットではそれぞれ0.97、0.98、0.87となります。真の単一ステージ設定では、これらの全セット指標は0.90、0.84、0.77に下がり、位置特定が残りのボトルネックであることが明らかになります。顔ボックスのAPは全セットで81.9、顔の多いサブセットで83.6です。入力解像度を112ピクセルから672ピクセルに上げると、制御されたマイクロF1は0.917から0.981に、完全一致は0.654から0.948に向上します。IMFDは比較対象のベースラインを上回りますが、最も高速な単一ステージ手法より遅く、依然として合成ベンチマーク操作に依存しています。

要旨

ディープフェイクの急速な増加は、ソーシャルメディア上での拡散により重大な懸念を引き起こしています。従来のマルチフェイス偽造検出器は、各顔を個別に切り取り検証するため、背景の文脈や顔間の関係を無視しており、しばしば最適ではない性能を示します。これらの制限を克服するために、私たちは指示ベースの大規模視覚・言語モデル(LVLM)を活用します。LVLMは、画像全体を解釈し、複雑なテキスト指示に従うことができます。私たちは、IMFD(Instruction-based Multi-face Forgery Detector)と呼ばれる、単純ながら効果的な単段階マルチフェイス偽造検出器を提案します。IMFDは、顔の位置を特定し、各顔の偽造ラベルを予測するためにエンドツーエンドで共同学習されます。顔領域の予測を単なる共同目的として扱うのではなく、IMFDは予測された顔のバウンディングボックスを指示に視覚的手がかりとして明示的に統合し、指示の基盤化と偽造検出を強化します。IMFDの学習および評価を支援するために、既存のマルチフェイス偽造データセットを指示ベース形式に変換しました。実験結果と分析により、IMFDが顔のバウンディングボックスを指示に統合することでマルチフェイス偽造検出を改善し、さまざまな最先端手法よりも一貫して優れた性能を示すことが確認されました。

研究の出発点

複数人物の写真は、通常の「切り取り-分類」前提を崩します。個別の顔切り取りはシーンや顔間の文脈を捨て、各人物に対して順次作業が必要となり、検出器や順序の誤りをフォレンジック判断に伝播させます。役立つシステムは、画像に操作が含まれているかどうかだけでなく、どの顔が偽造であるかを明示する必要があります。

手法

このシステムは、OpenForensics のサンプルを左から右へ顔の名前をつける指示に変換します。CLIP ベースのアンカーステージは候補領域にスコアを付け、重なったボックスを融合し、予測された座標を画像表現とともにテキスト指示に注入します。その後、LVLM が加工された顔のインデックスとボックスを返します。著者らは、真の座標を使用する制御された二段階設定と、IMFD の予測ボックスを使用するエンドツーエンドの単段階設定の両方を評価し、マイクロ F1、マクロ F1、正確な画像レベル一致、ボックス AP、レイテンシ、スループットを報告しています。

論文要点

全体画像の推論は混雑シーンの鑑識を改善するが、提供されたボックスと予測ボックスの差は大きい。調達テストでは画像レベルのAUCだけでなく、顔ごとの正確な判定や位置特定の失敗も評価すべきである。

論文 022026-09-10cs.CV

LAION-Mobile:100万枚のスマートフォン写真でDeepfake検出器を評価

著者・所属

Achim von Stryk

Stralsund University, Germany

Janis Keuper

Institute for Machine Learning and Analytics, Offenburg University, Germany

何を解決するか

LAION-Mobileは、12個の元の検出器チェックポイントが現代のAI画像にどの程度一般化するか、そして本物のスマートフォン写真でどのくらいの頻度で誤報するかを監査します。閾値に依存しない識別性能を閾値の調整から分離し、既存のGANのキャリブレーションが誤解を招く導入イメージを作り出すかどうかを検討します。

主要結果

NTIRE 2026では、最高の検出器でもAUCは0.624にとどまる。12個のうち5つは偶然以下のスコアであり、5%の偽陽性率で真陽性率が13.5%を超えるものはない。従来のキャリブレーション済みの閾値では、いくつかのシステムが電話写真の偽検知率11%以下で利用可能に見えるが、最新のキャリブレーションでは同じ検出器が本物の写真の17-91%を誤検知する。UnivFDはこの変化を示しており、同一の電話画像で0.2%が39.1%に増加する。コーパスは古いデバイスが支配的で、現行のフラッグシップはほとんど含まれておらず、真正性は画像ごとに認証されるのではなく推定されており、LAION-Mobileは本物のみで構成されているため、二クラスの電話AUCを提供できない。

要旨

ほとんどのディープフェイク検出器は、参照ベンチマークでほぼ完璧なAUCスコアを報告している。しかし、最近のICMLのポジションペーパーは、これらの評価が現代スマートフォン写真の影響を総じて無視していると指摘している。広く使用されているデバイス上のニューラル画像信号処理パイプライン(マルチセンサー融合やノイズ・動体ブレの抑制など)は、単純なレンズ投影から計算写真への撮影パラダイムをますます転換させている。そのため、デバイスは写真を記録するのではなく、実際には生成する。これにより、ディープフェイク検出器が通常のスマホ写真を偽と誤検出するリスクが高まる。現代のスマートフォン写真を含む大規模データセットが不足しているため、この仮説はこれまで小規模な概念実証研究でしか検証されていない。本論文の目的は、このギャップを埋めることである。我々はLAION-Mobileを紹介する。これは、re-LAION-5Bから抽出されたEXIFメタデータ付きで約100万枚のスマートフォン画像を含むオープンデータセットである。このプールの9,115枚の評価サンプル(DIREは738枚)で、論文オリジナルのチェックポイントを使って最先端のディープフェイク検出器12種を評価した結果、次の3つの主要な発見があった。(i) 現代のAI生成コンテンツでは、どの検出器もAUC 0.624を超えず、12種中5種は偶然以下であった。(ii) 実写真の誤検知率は閾値調整のアーティファクトである:従来のGANデータに基づく閾値では、いくつかの検出器が導入可能に見える(FPR 11%未満)ものの、同じ検出器でも現代コンテンツで同一基準を再調整すると17~91%の実写真を誤検知する。(iii) その結果、現代AI生成コンテンツで偶然以上の精度を達成し、かつ実写真の誤検知率が導入可能な水準である検出器は存在しない。ウェブコレクションのデバイス構成を反映し、このコーパスは初代ニューラルISP(2018-2020)を調査しており、現行フラッグシップ機はほぼ含まれておらず、現代ISP環境が未対応のギャップとして残されている。

研究の出発点

公開されているディープフェイク検出器は、しばしば自分自身のベンチマークでほぼ完璧なAUCを達成しますが、現代のスマートフォンではHDRの融合、ノイズ除去、シャープ化、モーション抑制、その他の学習済み画像信号処理が本物の写真にも適用されています。これらの計算処理の痕跡は、生成画像の指紋に似ることがあります。大規模な実際のスマートフォンコーパスや、現在の合成コンテンツに基づいた閾値がなければ、検出器は安全に見えても、通常の写真に対して使用不能な頻度で誤検出する可能性があります。

手法

著者らは、スマートフォンのEXIF情報および非写真ヒューリスティックに基づいてre-LAION-5Bをフィルタリングし、デバイスメタデータ付きの935,399枚の実写真プールを作成し、その後、固定された9,115枚の評価サンプルをスコアリングします。ただし、DIREは738件の高価な再構築に対してのみ実施します。12個の検出器はまず元のベンチマークまたはProGANスタイルのベンチマークに対して確認され、次にNTIRE 2026の現代の実物/偽物混合データセットで評価されます。従来のProGAN-ISPと現代のNTIREで別々に適合された等誤差閾値を、同じスマートフォン写真に転用することで、キャリブレーションのずれを明らかにします。

論文要点

ほぼ完璧な論文AUCは現代のコンテンツには適用できず、閾値の所有権によって本物写真の偽検知率は桁単位で変わる。すべての展開には、最新デバイスのネガティブサンプル、文書化されたキャリブレーションセット、および運用点の変化の監視が必要である。

論文 032026-09-03cs.CV

空間・時間をまたいで知識を保持する継続的動画Deepfake検出

著者・所属

Taehoon Kim

Graduate School of Artificial Intelligence, Chung-Ang University

Jongwook Choi

Graduate School of Artificial Intelligence, Chung-Ang University

Heejae Jo

Department of Advanced Imaging, Graduate School of Advanced Imaging Science, Multimedia and Film, Chung-Ang University

Byungmin Park

Graduate School of Artificial Intelligence, Chung-Ang University

Jongwon Choi

Graduate School of Artificial Intelligence, Chung-Ang University

Department of Advanced Imaging, Graduate School of Advanced Imaging Science, Multimedia and Film, Chung-Ang University

Department of Metaverse Convergence, Chung-Ang University

何を解決するか

MSFDは、特にビデオディープフェイク検出のために安定性-可塑性問題をターゲットにしています。検出器を更新する際に、空間的、時間的、および時空間的な法医学的知識を個別に保持し、単一の静的な訓練-テスト分割ではなく、全データ、ジェネレーター増分、および少数ショットのシーケンスを評価します。

主要結果

6タスクのプロトコルでは、フルシステムは平均忘却率2.29ポイントで平均AUC93.02%に達し、iCaRLスタイルのベースラインは平均AUC89.84%、忘却率6.81ポイントでした。ジェネレーター増分プロトコルでは、平均AUC96.67%、画像から動画への偽造では91.47%、忘却率1.37となります。新しいタスクごとに実動画25本と偽動画25本のみの場合でも、平均精度83.65%、忘却率-1.25で、正の逆伝達を示しています。IDERは忘却が少なく-2.10ですが、精度はわずかに低い83.47%です。アブレーションでは、3つの周波数ブランチすべてが単一の分割されていない表現より優れていることが示されています。この手法は、主にアジア系のKoDFタスク後に忘却の増加を示し、解決されていない人口統計およびドメインシフトを示しています。

要旨

高品質なビデオディープフェイクの継続的な出現は、新たな偽造パターンに継続的に適応する検出器を必要とするが、既存の手法はディープフェイク画像向けに設計されており、ビデオ特有の手がかりを捉えることができない。空間的なアーティファクトのみを含むディープフェイク画像とは異なり、ディープフェイクビデオは空間軸と時間軸の両方に沿った明確な証拠を残すため、順次モデル更新の際に各モダリティを別々に保持する必要がある。この制約を克服するために、我々は、動画特徴を周波数領域で空間、時間、空間時間モダリティに明示的に分解する継続的ディープフェイクビデオ検出フレームワーク「モダリティ特化周波数蒸留 (MSFD)」を提案する。この分解により、異なるディープフェイクビデオタイプがタスク間で空間および時間の手がかりに異なる依存を示すため、各モダリティを独立して保持できる。さらに、MSFDはクロスモダリティデコレーション損失を採用し、空間時間表現が単一モダリティの手がかりと直交するように促す。広範な実験により、本フレームワークはさまざまな継続的ディープフェイクビデオのシナリオにおいて、最先端手法よりも強力な適応性を達成し、性能をより効果的に保持することが示された。

研究の出発点

ビデオ偽造の種類は展開後に順次出現するため、検出器は古い証拠を消さずに新しい生成器を学習する必要がある。画像分類から継承された継続的手法は、ビデオディープフェイクが異なる空間境界、時間的不整合、および空間-時間の結合アーティファクトの混合を残すにもかかわらず、一つの絡み合った表現を保持する傾向がある。システムが新しいタスクに適応することを拒否する場合、低い忘却スコアも役に立たない。

手法

中間映像特徴は、2D空間、1D時間、および結合時空間周波数表現に変換される。モダリティ固有周波数蒸留は、順次更新中に各スペクトルを前のモデルに整合させる。モダリティ固有アダプターはチャネルの重みを再調整し、タスク関連の周波数帯に対するGumbel-Softmaxマスクを学習する一方で、デコレーション損失は結合ブランチが単一モダリティの手がかりを複製するのを防ぐ。再生例と同じ3D ResNet-18バックボーンは、6つのディープフェイクビデオデータセットにおけるほとんどのベースライン比較で使用される。

論文要点

空間的および時間的な法医学メモリを分離することにより、特に新しいデータが少ない場合に検出器の更新が改善されます。残りのKoDFシフトは、継続学習のリリースごとに、両方のジェネレーター群と集団ドメインを回帰テストすることを思い出させるものです。