← Retour au Blog
Radar de rechercheDétection de deepfakeCriminalistique des médiasarXivSeptembre 2026

Radar arXiv mensuel

Articles de septembre 2026 sur la détection des deepfake : raisonnement multiface, fausses alertes sur smartphones et apprentissage continu

Le travail deepfake le plus solide de septembre se concentre sur le comportement du système plutôt que sur un autre score fermé. L’IMFD demande à un modèle de vision-langage de localiser et classifier chaque visage en un seul passage à la base des instructions. LAION-Mobile audite les points de contrôle originaux du détecteur sur le contenu synthétique moderne et près d’un million d’enregistrements photo sur smartphone, révélant une dérive d’étalonnage sévère. Le MSFD considère les mises à jour des détecteurs vidéo comme un problème d’apprentissage continu et préserve séparément les preuves spatiales, temporelles et de fréquences conjointes.

Ce que révèle ce mois-ci

L’instruction coordonnée de l’IMFD élève son résultat en deux étapes sur OpenForensics à 0,98 micro-F1, 0,98 macro-F1 et 0,94 de précision exacte ; la version de bout en bout à étage unique tombe à 0,90, 0,84 et 0,77 car la localisation des faces propage toujours des erreurs. LAION-Mobile constate qu’aucun des douze détecteurs publiés ne dépasse 0,624 AUC sur un mélange IA moderne et que les seuils calibrés modernes signalent 17 à 91 % des photos téléphoniques authentiques ; son corpus, cependant, couvre à peine les FAI neuronaux phares actuels. MSFD atteint 93,02 % d’AUC moyen avec 2,29 points d’oubli sur six jeux de données vidéo séquentiels, et 83,65 % de précision moyenne avec un oubli négatif dans un protocole à quelques coups. Ensemble, les articles défendent une évaluation de la scène entière, des négatifs actuels de l’appareil, une propriété explicite de l’étalonnage et des tests de régression après chaque mise à jour du détecteur.

Article 012026-09-17cs.CV

IMFD : détection de falsifications multi-visages de bout en bout par de grands modèles vision-langage guidés par instructions

Auteurs & institutions

Dasom Choi

Chungnam National University

Sangjun Moon

Chungnam National University

Hyeongchan Im

Chungnam National University

Jaeeon Park

Institute of Science Tokyo

Jingun Kwon

Chungnam National University

Hidetaka Kamigaito

Nara Institute of Science and Technology

Taro Watanabe

Nara Institute of Science and Technology

Manabu Okumura

Institute of Science Tokyo

Problème traité

L’IMFD reformule la détection de contrefaçon multi-visages en tant que tâche de langage visuel fondé sur instruction qui localise conjointement les visages et attribue des étiquettes d’authenticité par face. Il teste si des coordonnées faciales explicites et le contexte de l’image aident un grand modèle de langage visuel à aligner les indices de visage gauche-droite avec les sorties correctes.

Résultat clé

Avec des coordonnées de précision sur l’ensemble complet du test, l’IMFD atteint 0,98 micro-F1, 0,98 macro-F1 et 0,94 de précision de correspondance exacte ; le sous-ensemble avec le plus de visages obtient 0,97, 0,98 et 0,87. Dans le véritable réglage à une seule étape, ces métriques à l’ensemble complet tombent à 0,90, 0,84 et 0,77, exposant la localisation comme goulot d’étranglement restant. L’AP de la boîte à face est de 81,9 sur l’ensemble complet et 83,6 sur le sous-ensemble à plusieurs faces. Augmenter la résolution d’entrée de 112 à 672 pixels augmente la micro-F1 contrôlée de 0,917 à 0,981 et la correspondance exacte de 0,654 à 0,948. L’IMFD surpasse les bases comparées mais est plus lent que la méthode à une étape la plus rapide et repose toujours sur des manipulations synthétiques de benchmarks.

Résumé

L’augmentation rapide des deepfakes a suscité des inquiétudes importantes en raison de leur diffusion sur les réseaux sociaux. Les détecteurs traditionnels de contrefaçon multiface recadrent et vérifient chaque visage indépendamment, ignorant le contexte de fond et les relations inter-faces, ce qui entraîne souvent des performances sous-optimales. Pour surmonter ces limites, nous utilisons les modèles de grande vision basés sur les instructions (LVLM), capables d’interpréter des images entières et de suivre des instructions textuelles complexes. Nous proposons un détecteur de contrefaçon multiface simple mais efficace en un seul stade, appelé IMFD (Instruction-based Multi-face Forgery Detector), entraîné de bout en bout pour localiser conjointement les visages et prédire les labels de contrefaçon par face. Plutôt que de traiter la prédiction de la boîte à visages uniquement comme un objectif commun, l’IMFD intègre explicitement les encadrés de visages prédits dans l’instruction comme des indices visuels améliorant la mise à la racine et la détection de la falsification. Pour soutenir la formation et l’évaluation de l’IMFD, nous convertissons les ensembles de contrefaçons multifaces existants en format basé sur des instructions. Les résultats et analyses expérimentaux montrent que l’IMFD améliore la détection des contrefaçons multifaces en intégrant des boîtes englobantes de faces dans l’instruction, et surpasse systématiquement diverses méthodes de pointe.

Point de départ de la recherche

Les photos multi-personnes brisent l’hypothèse habituelle de recadre-puis classifie. Les recadrements indépendants de visages éliminent le contexte de scène et d’interface, nécessitent un travail séquentiel pour chaque personne, et propagent des erreurs de détecteur ou d’ordre dans la décision médico-légale. Un système utile doit indiquer quels visages sont faux, pas seulement si une image contient une quelconque manipulation.

Méthode

Le système convertit des échantillons d’OpenForensics en instructions nommant les faces de gauche à droite. Un stage d’ancrage basé sur CLIP note les régions candidates, fusionne les boîtes qui se chevauchent et injecte les coordonnées prédites dans l’instruction texte aux côtés de la représentation de l’image. Le LVLM renvoie ensuite les indices et boîtes de caractères falsifiés. Les auteurs évaluent à la fois un réglage contrôlé à deux étapes en utilisant des coordonnées de base et un réglage à une étape de bout en bout en utilisant les boîtes prédites de l’IMFD, rapportant micro-F1, macro-F1, correspondance exacte au niveau de l’image, box AP, latence et débit.

À retenir

Le raisonnement global améliore la criminalistique des scènes saturées, mais l’écart entre les boîtes fournies et celles prédites est important. Les tests d’approvisionnement devraient évaluer les décisions exactes par face et les échecs de localisation, pas seulement les AUC au niveau de l’image.

Article 022026-09-10cs.CV

LAION-Mobile : Évaluer les détecteurs de deepfake sur un million de photos de smartphones

Auteurs & institutions

Achim von Stryk

Stralsund University, Germany

Janis Keuper

Institute for Machine Learning and Analytics, Offenburg University, Germany

Problème traité

LAION-Mobile vérifie si douze points de contrôle originaux des détecteurs se généralisent aux images IA modernes et à quelle fréquence ils déclenchent une fausse alerte sur des photos authentiques de smartphone. Il sépare la discrimination indépendante du seuil de la calibration par seuil et s’interroge sur la possibilité que le calibrage ancien du GAN crée une image trompeuse du déploiement.

Résultat clé

Sur NTIRE 2026, le meilleur détecteur atteint seulement 0,624 AUC ; cinq sur douze obtiennent un score inférieur au hasard, et aucun ne dépasse un taux de vrais positifs de 13,5 % à un taux de faux positifs de 5 %. Les seuils calibrés selon les méthodes traditionnelles font apparaître plusieurs systèmes comme utilisables avec au plus 11 % de fausses alertes sur photos prises au téléphone, mais une calibration moderne fait que les mêmes détecteurs signalent 17 à 91 % des photos authentiques. UnivFD illustre ce changement : 0,2 % devient 39,1 % sur des images téléphoniques identiques. Le corpus est dominé par des appareils plus anciens et contient presque aucun modèle phare actuel, l'authenticité est déduite plutôt que certifiée pour chaque image, et LAION-Mobile est uniquement composé de contenus réels, donc il ne peut pas fournir un AUC téléphonique à deux classes.

Résumé

La plupart des détecteurs de deepfake rapportent des scores AUC quasi parfaits sur leurs benchmarks de référence. Cependant, un récent document de position de l’ICML soutient que ces évaluations négligent collectivement l’impact de la photographie moderne sur smartphone : les pipelines de traitement neuronal du signal sur l’appareil largement utilisés (comme la fusion multi-capteurs ou la suppression du bruit et du flou de mouvement) déplacent de plus en plus le paradigme d’imagerie, passant des projections simples d’objectifs à la photographie computationnelle. Ainsi, les appareils génèrent réellement des photos, plutôt que d’enregistrer. Cela augmente le risque que les détecteurs deepfake marquent les photos téléphoniques ordinaires comme fausses. En raison du manque de jeux de données à grande échelle contenant des images de smartphones modernes, cette hypothèse n’a jusqu’à présent été testée que dans de petites études de preuve de concept. L’objectif de cet article est de combler cet écart. Nous introduisons LAION-Mobile, un jeu de données ouvert contenant environ 1 million d’images de smartphones avec des métadonnées EXIF distillées à partir de re-LAION-5B. En évaluant douze détecteurs deepfake de pointe avec leurs points de contrôle papier originaux sur un échantillon de 9 115 images de ce pool (DIRE sur 738), nous rapportons trois conclusions clés : (i) Sur le contenu moderne IA, aucun détecteur ne dépasse 0,624 AUC, et cinq des douze sont en dessous du hasard. (ii) Les taux de fausse alarme sur photos réelles sont un artefact de la calibration des seuils : les seuils appliqués sur les données GAN anciennes donnent l’impression que plusieurs détecteurs paraissent déployables (moins de 11 % de FPR), mais les mêmes détecteurs signalent 17 à 91 % des photos réelles une fois que le même critère est réajusté sur le contenu moderne. (iii) Par conséquent, aucun détecteur ne bat le hasard sur le contenu IA moderne et maintient un taux de fausse alarme déployable sur photos réelles. En reflétant le mix d’appareils des collections web, les sondes corpus ont la première génération de fournisseurs d’accès neuronaux (2018-2020) ; les phares actuels sont essentiellement absents, laissant le régime moderne des FAI comme vide ouverte.

Point de départ de la recherche

Les détecteurs deepfake publiés approchent souvent un AUC parfait sur leurs propres benchmarks, tandis que les téléphones modernes appliquent la fusion HDR, la réduction du bruit, la netteté, la suppression de mouvement et d’autres traitements d’images appris aux photos authentiques. Ces artefacts computationnels peuvent ressembler à des empreintes digitales d’images générées. Sans un grand corpus de téléphone réel et un seuil calibré sur le contenu synthétique actuel, un détecteur peut sembler sûr tout en signalant des photographies ordinaires à un rythme inutilisable.

Méthode

Les auteurs filtrent le re-LAION-5B par EXIF smartphone et heuristiques non photographiques afin de créer un pool de photos réelles de 935 399 images avec métadonnées d’appareil, puis évaluent un échantillon d’évaluation fixe de 9 115 images, sauf DIRE sur 738 reconstructions coûteuses. Douze détecteurs sont d’abord vérifiés par rapport à leurs benchmarks originaux ou de type ProGAN, puis évalués sur le mélange moderne réel/faux NTIRE 2026. Des seuils d’erreur égaux placés séparément sur les anciens ProGAN-ISP et NTIRE modernes sont transférés sur les mêmes photos téléphoniques pour exposer la dérive d’étalonnage.

À retenir

Un AUC proche de la perfection dans un article ne se transfère pas au contenu moderne, et la propriété du seuil peut modifier les fausses alertes sur des photos réelles de plusieurs ordres de grandeur. Chaque déploiement nécessite des négatifs provenant d'appareils actuels, un ensemble de calibration documenté et une surveillance du décalage du point de fonctionnement.

Article 032026-09-03cs.CV

Préserver le savoir à travers l'espace et le temps pour la détection continue de deepfakes vidéo

Auteurs & institutions

Taehoon Kim

Graduate School of Artificial Intelligence, Chung-Ang University

Jongwook Choi

Graduate School of Artificial Intelligence, Chung-Ang University

Heejae Jo

Department of Advanced Imaging, Graduate School of Advanced Imaging Science, Multimedia and Film, Chung-Ang University

Byungmin Park

Graduate School of Artificial Intelligence, Chung-Ang University

Jongwon Choi

Graduate School of Artificial Intelligence, Chung-Ang University

Department of Advanced Imaging, Graduate School of Advanced Imaging Science, Multimedia and Film, Chung-Ang University

Department of Metaverse Convergence, Chung-Ang University

Problème traité

MSFD cible le problème de stabilité-plasticité spécifiquement pour la détection des deepfakes vidéo. Il préserve séparément les connaissances forensiques spatiales, temporelles et spatio-temporelles tout en mettant à jour le détecteur, et évalue des séquences de données complètes, incrémentales par générateur et à faible nombre d'exemples plutôt qu'une seule répartition statique train-test.

Résultat clé

Dans le protocole à six tâches, le système complet atteint une AUC moyenne de 93,02 % avec 2,29 points d'oubli moyen, contre 89,84 % et 6,81 pour la référence de style iCaRL. Dans le protocole incrémental générateur, il atteint une AUC moyenne de 96,67 %, incluant 91,47 % sur les forgeries image-à-vidéo, avec un oubli de 1,37. Avec seulement 25 vidéos réelles et 25 fausses par nouvelle tâche, il atteint une précision moyenne de 83,65 % et un oubli de -1,25, indiquant un transfert rétroactif positif ; IDER oublie moins à -2,10 mais a une précision légèrement inférieure de 83,47 %. Les ablations montrent que les trois branches de fréquence surpassent une représentation unique non divisée. La méthode montre encore une augmentation de l'oubli après la tâche KoDF principalement asiatique, signalant un décalage démographique et de domaine non résolu.

Résumé

L'émergence continue de deepfakes vidéo de haute qualité nécessite des détecteurs qui s'adaptent en permanence aux nouveaux modèles de falsification, pourtant les approches existantes, conçues pour les images deepfake, échouent à saisir les indices spécifiques aux vidéos. Contrairement aux images deepfake qui ne contiennent que des artefacts spatiaux, les vidéos deepfake laissent des preuves distinctes le long des axes spatial et temporel, nécessitant la préservation séparée de chaque modalité lors des mises à jour séquentielles du modèle. Pour surmonter cette limitation, nous introduisons un cadre de détection continue de deepfakes vidéo, la Distillation de Fréquence Spécifique à la Modalité (MSFD), qui décompose explicitement les caractéristiques vidéo en modalités spatiales, temporelles et spatiotemporelles dans le domaine fréquentiel. Cette décomposition permet la préservation indépendante de chaque modalité, car différents types de vidéos deepfake montrent une dépendance variable aux indices spatiaux et temporels selon les tâches. De plus, MSFD adopte une perte de Décorrélation entre Modalités qui incite les représentations spatiotemporelles à rester orthogonales aux indices d'une seule modalité. Des expériences approfondies montrent que notre cadre atteint une meilleure adaptation et préserve la performance plus efficacement que les méthodes à la pointe de l'état de l'art dans divers scénarios continus de vidéos deepfake.

Point de départ de la recherche

Les types de falsification vidéo apparaissent séquentiellement après le déploiement, donc un détecteur doit apprendre de nouveaux générateurs sans effacer les anciennes preuves. Les méthodes continues héritées de la classification d'images tendent à préserver une représentation imbriquée, même si les deepfakes vidéo laissent différents mélanges de limites spatiales, d'incohérences temporelles et d'artefacts conjoints espace-temps. Un faible score d'oubli n'est également pas utile si le système refuse de s'adapter à la nouvelle tâche.

Méthode

Les caractéristiques vidéo intermédiaires sont transformées en représentations de fréquence spatiale 2D, temporelle 1D et spatiotemporelle conjointe. La distillation de fréquence spécifique à la modalité aligne chaque spectre avec le modèle précédent lors des mises à jour séquentielles. Un adaptateur spécifique à la modalité rééquilibre les canaux et apprend des masques Gumbel-Softmax pour les bandes de fréquence pertinentes pour la tâche, tandis qu'une perte de décorrélation empêche la branche conjointe de dupliquer les indices d'une seule modalité. Des exemples de relecture et le même backbone 3D ResNet-18 sont utilisés pour la plupart des comparaisons de référence sur six ensembles de données de vidéos deepfake.

À retenir

Séparer la mémoire médico-légale spatiale et temporelle améliore les mises à jour du détecteur, surtout avec peu de nouvelles données. Le décalage restant du KoDF est un rappel pour effectuer des tests de régression sur les deux familles de générateurs et les domaines de population après chaque version d'apprentissage continu.