IMFD : détection de falsifications multi-visages de bout en bout par de grands modèles vision-langage guidés par instructions
Auteurs & institutions
Dasom Choi
Chungnam National University
Sangjun Moon
Chungnam National University
Hyeongchan Im
Chungnam National University
Jaeeon Park
Institute of Science Tokyo
Jingun Kwon
Chungnam National University
Hidetaka Kamigaito
Nara Institute of Science and Technology
Taro Watanabe
Nara Institute of Science and Technology
Manabu Okumura
Institute of Science Tokyo
Problème traité
L’IMFD reformule la détection de contrefaçon multi-visages en tant que tâche de langage visuel fondé sur instruction qui localise conjointement les visages et attribue des étiquettes d’authenticité par face. Il teste si des coordonnées faciales explicites et le contexte de l’image aident un grand modèle de langage visuel à aligner les indices de visage gauche-droite avec les sorties correctes.
Résultat clé
Avec des coordonnées de précision sur l’ensemble complet du test, l’IMFD atteint 0,98 micro-F1, 0,98 macro-F1 et 0,94 de précision de correspondance exacte ; le sous-ensemble avec le plus de visages obtient 0,97, 0,98 et 0,87. Dans le véritable réglage à une seule étape, ces métriques à l’ensemble complet tombent à 0,90, 0,84 et 0,77, exposant la localisation comme goulot d’étranglement restant. L’AP de la boîte à face est de 81,9 sur l’ensemble complet et 83,6 sur le sous-ensemble à plusieurs faces. Augmenter la résolution d’entrée de 112 à 672 pixels augmente la micro-F1 contrôlée de 0,917 à 0,981 et la correspondance exacte de 0,654 à 0,948. L’IMFD surpasse les bases comparées mais est plus lent que la méthode à une étape la plus rapide et repose toujours sur des manipulations synthétiques de benchmarks.
Résumé
L’augmentation rapide des deepfakes a suscité des inquiétudes importantes en raison de leur diffusion sur les réseaux sociaux. Les détecteurs traditionnels de contrefaçon multiface recadrent et vérifient chaque visage indépendamment, ignorant le contexte de fond et les relations inter-faces, ce qui entraîne souvent des performances sous-optimales. Pour surmonter ces limites, nous utilisons les modèles de grande vision basés sur les instructions (LVLM), capables d’interpréter des images entières et de suivre des instructions textuelles complexes. Nous proposons un détecteur de contrefaçon multiface simple mais efficace en un seul stade, appelé IMFD (Instruction-based Multi-face Forgery Detector), entraîné de bout en bout pour localiser conjointement les visages et prédire les labels de contrefaçon par face. Plutôt que de traiter la prédiction de la boîte à visages uniquement comme un objectif commun, l’IMFD intègre explicitement les encadrés de visages prédits dans l’instruction comme des indices visuels améliorant la mise à la racine et la détection de la falsification. Pour soutenir la formation et l’évaluation de l’IMFD, nous convertissons les ensembles de contrefaçons multifaces existants en format basé sur des instructions. Les résultats et analyses expérimentaux montrent que l’IMFD améliore la détection des contrefaçons multifaces en intégrant des boîtes englobantes de faces dans l’instruction, et surpasse systématiquement diverses méthodes de pointe.
Point de départ de la recherche
Les photos multi-personnes brisent l’hypothèse habituelle de recadre-puis classifie. Les recadrements indépendants de visages éliminent le contexte de scène et d’interface, nécessitent un travail séquentiel pour chaque personne, et propagent des erreurs de détecteur ou d’ordre dans la décision médico-légale. Un système utile doit indiquer quels visages sont faux, pas seulement si une image contient une quelconque manipulation.
Méthode
Le système convertit des échantillons d’OpenForensics en instructions nommant les faces de gauche à droite. Un stage d’ancrage basé sur CLIP note les régions candidates, fusionne les boîtes qui se chevauchent et injecte les coordonnées prédites dans l’instruction texte aux côtés de la représentation de l’image. Le LVLM renvoie ensuite les indices et boîtes de caractères falsifiés. Les auteurs évaluent à la fois un réglage contrôlé à deux étapes en utilisant des coordonnées de base et un réglage à une étape de bout en bout en utilisant les boîtes prédites de l’IMFD, rapportant micro-F1, macro-F1, correspondance exacte au niveau de l’image, box AP, latence et débit.
À retenir
Le raisonnement global améliore la criminalistique des scènes saturées, mais l’écart entre les boîtes fournies et celles prédites est important. Les tests d’approvisionnement devraient évaluer les décisions exactes par face et les échecs de localisation, pas seulement les AUC au niveau de l’image.