IMFD: End-to-End-Erkennung von Mehrgesichts-Fälschungen mit instruktionsbasierten großen Vision-Language-Modellen
Autoren & Institutionen
Dasom Choi
Chungnam National University
Sangjun Moon
Chungnam National University
Hyeongchan Im
Chungnam National University
Jaeeon Park
Institute of Science Tokyo
Jingun Kwon
Chungnam National University
Hidetaka Kamigaito
Nara Institute of Science and Technology
Taro Watanabe
Nara Institute of Science and Technology
Manabu Okumura
Institute of Science Tokyo
Welches Problem es löst
IMFD reformuliert die Erkennung von Mehrflächenfälschungen als eine instruktionsbasierte Vision-Language-Aufgabe, die gemeinsam Gesichter lokalisiert und pro Gesicht Authentizitätsetiketten vergibt. Es testet, ob explizite Gesichtskoordinaten und Bildkontext einem großen Vision-Language-Modell helfen, die Links-nach-Rechts-Gesichtsindizes mit den richtigen Ausgaben auszurichten.
Zentrales Ergebnis
Mit Ground-Truth-Koordinaten im vollständigen Testsatz erreicht IMFD 0,98 micro-F1, 0,98 makro-F1 und 0,94 exakt-Match-Genauigkeit; die Teilmenge mit den meisten Flächen erzielt 0,97, 0,98 und 0,87. Im echten Einstufen-Setting fallen diese vollständigen Metriken auf 0,90, 0,84 und 0,77, wodurch die Lokalisierung als verbleibender Engpass sichtbar wird. Die Face-Box-AP beträgt 81,9 im vollständigen Satz und 83,6 im Many-Face-Subset. Eine Erhöhung der Eingabeauflösung von 112 auf 672 Pixel erhöht kontrolliertes micro-F1 von 0,917 auf 0,981 und die exakte Übereinstimmung von 0,654 auf 0,948. IMFD übertrifft die vergleichbaren Baselines, ist aber langsamer als die schnellste Einzelstufenmethode und setzt weiterhin auf synthetische Benchmark-Manipulationen.
Abstract
Der schnelle Anstieg von Deepfakes hat aufgrund ihrer Verbreitung in sozialen Medien erhebliche Bedenken ausgelöst. Traditionelle Multiface-Forgery-Detektoren schneiden und verifizieren jedes Gesicht unabhängig voneinander, wobei Hintergrundkontext und Interface-Beziehungen ignoriert werden, was oft zu suboptimaler Leistung führt. Um diese Einschränkungen zu überwinden, nutzen wir instruktionsbasierte Large Vision-Language Models (LVLMs), die ganze Bilder interpretieren und komplexen Textanweisungen folgen können. Wir schlagen einen einfachen, aber effektiven einstufigen Multiface-Forgery-Detektor vor, genannt IMFD (Instruction-based Multi-face Forgery Detector), der End-to-End-trainiert wird, um gemeinsam Gesichter zu lokalisieren und Etiketten pro Face Förgery vorherzusagen. Anstatt die Face-Box-Vorhersage nur als gemeinsames Ziel zu behandeln, integriert IMFD explizit vorhergesagte Face-Bounding-Boxen in die Instruktion als visuelle Hinweise, die die Instruktionserdung und Fälschungserkennung verbessern. Zur Unterstützung des Trainings und der Bewertung von IMFD wandeln wir bestehende Multiface-Forgery-Datensätze in ein instruktionsbasiertes Format um. Experimentelle Ergebnisse und Analysen zeigen, dass IMFD die Erkennung von Multiface-Fälschungen verbessert, indem es Face-Bounding-Boxen in die Instruktion integriert und verschiedene modernste Methoden konstant übertrifft.
Ausgangspunkt der Forschung
Mehrpersonenfotos brechen mit der üblichen Annahme "zuschneiden und dann klassifizieren". Unabhängige Gesichtszuschnitte verwerfen Szenen- und Zwischenflächenkontext, erfordern sequentielle Arbeit für jede Person und übertragen Detektor- oder Reihenfolgefehler in die forensische Entscheidung. Ein nützliches System muss sagen, welche Gesichter gefälscht sind, nicht nur, ob ein Bild eine Manipulation enthält.
Methode
Das System wandelt OpenForensics-Proben in Anweisungen um, die Flächen von links nach rechts benennen. Eine CLIP-basierte Ankerstufe bewertet Kandidatenregionen, fusioniert überlappende Boxen und fügt vorhergesagte Koordinaten zusammen mit der Bilddarstellung in die Textinstruktion ein. Das LVLM liefert dann die gefälschten Flächenindizes und -Boxen zurück. Die Autoren bewerten sowohl eine kontrollierte zweistufige Einstellung mit Ground-Truth-Koordinaten als auch eine End-to-End-Einstufige Einstellung mit den vorhergesagten Boxen des IMFD und berichten Mikro-F1, Makro-F1, exakte Bildniveau-Übereinstimmung, Box-AP, Latenz und Durchsatz.
Einordnung
Whole-Image Reasoning verbessert die Forensik von überfüllten Szenen, aber die Lücke zwischen gelieferten und vorhergesagten Boxen ist groß. Beschaffungstests sollten exakte Entscheidungen pro Gesicht und Lokalisierungsfehler bewerten, nicht nur AUC auf Bildebene.