← Zurück zum Blog
ForschungsradarDeepfake-ErkennungMedienforensikarXivSeptember 2026

Monatlicher arXiv Radar

Deepfake-Detection-Studien im September 2026: Mehrgesichts-Analyse, Smartphone-Fehlalarme und kontinuierliches Lernen

Die stärkste Deepfake-Arbeit im September konzentriert sich auf das Systemverhalten statt auf einen weiteren geschlossenen Wert. Das IMFD verlangt von einem Vision-Language-Modell, jedes Gesicht in einem instruktionsbasierten Durchgang zu lokalisieren und zu klassifizieren. LAION-Mobile überprüft die ursprünglichen Detektor-Checkpoints an modernen synthetischen Inhalten und fast einer Million Smartphone-Fotoaufzeichnungen und zeigt eine starke Kalibrierungsabweichung auf. MSFD behandelt Videodetektor-Updates als ein kontinuierliches Lernproblem und bewahrt räumliche, zeitliche und gemeinsame Frequenzbeweise getrennt.

Was dieser Monat zeigt

Die koordinatenbewusste Anweisung von IMFD erhöht sein zweistufiges Ergebnis bei OpenForensics auf 0,98 Mikro-F1, 0,98 Makro-F1 und 0,94 exakt-Übereinstimmung von 0,94; die End-to-End-Einstufige Version sinkt auf 0,90, 0,84 und 0,77, da die Gesichtslokalisierung weiterhin Fehler verbreitet. LAION-Mobile stellt fest, dass keiner der zwölf veröffentlichten Detektoren 0,624 AUC auf einer modernen KI-Mischung überschreitet und dass modern kalibrierte Schwellenwerte 17–91 % der authentischen Telefonfotos markieren; sein Korpus deckt jedoch kaum aktuelle Flaggschiff-neuronale ISPs ab. MSFD erreicht 93,02 % durchschnittliche AUC mit 2,29 Vergessenspunkten über sechs aufeinanderfolgende Videodatensätze und eine durchschnittliche Genauigkeit von 83,65 % mit negativem Vergessen in einem Protokoll mit wenigen Aufnahmen. Gemeinsam plädieren die Arbeiten für eine Gesamt-Szenen-Bewertung, aktuelle Gerätenegative, explizite Kalibrierungsbesitz und Regressionstests nach jedem Detektor-Update.

Paper 012026-09-17cs.CV

IMFD: End-to-End-Erkennung von Mehrgesichts-Fälschungen mit instruktionsbasierten großen Vision-Language-Modellen

Autoren & Institutionen

Dasom Choi

Chungnam National University

Sangjun Moon

Chungnam National University

Hyeongchan Im

Chungnam National University

Jaeeon Park

Institute of Science Tokyo

Jingun Kwon

Chungnam National University

Hidetaka Kamigaito

Nara Institute of Science and Technology

Taro Watanabe

Nara Institute of Science and Technology

Manabu Okumura

Institute of Science Tokyo

Welches Problem es löst

IMFD reformuliert die Erkennung von Mehrflächenfälschungen als eine instruktionsbasierte Vision-Language-Aufgabe, die gemeinsam Gesichter lokalisiert und pro Gesicht Authentizitätsetiketten vergibt. Es testet, ob explizite Gesichtskoordinaten und Bildkontext einem großen Vision-Language-Modell helfen, die Links-nach-Rechts-Gesichtsindizes mit den richtigen Ausgaben auszurichten.

Zentrales Ergebnis

Mit Ground-Truth-Koordinaten im vollständigen Testsatz erreicht IMFD 0,98 micro-F1, 0,98 makro-F1 und 0,94 exakt-Match-Genauigkeit; die Teilmenge mit den meisten Flächen erzielt 0,97, 0,98 und 0,87. Im echten Einstufen-Setting fallen diese vollständigen Metriken auf 0,90, 0,84 und 0,77, wodurch die Lokalisierung als verbleibender Engpass sichtbar wird. Die Face-Box-AP beträgt 81,9 im vollständigen Satz und 83,6 im Many-Face-Subset. Eine Erhöhung der Eingabeauflösung von 112 auf 672 Pixel erhöht kontrolliertes micro-F1 von 0,917 auf 0,981 und die exakte Übereinstimmung von 0,654 auf 0,948. IMFD übertrifft die vergleichbaren Baselines, ist aber langsamer als die schnellste Einzelstufenmethode und setzt weiterhin auf synthetische Benchmark-Manipulationen.

Abstract

Der schnelle Anstieg von Deepfakes hat aufgrund ihrer Verbreitung in sozialen Medien erhebliche Bedenken ausgelöst. Traditionelle Multiface-Forgery-Detektoren schneiden und verifizieren jedes Gesicht unabhängig voneinander, wobei Hintergrundkontext und Interface-Beziehungen ignoriert werden, was oft zu suboptimaler Leistung führt. Um diese Einschränkungen zu überwinden, nutzen wir instruktionsbasierte Large Vision-Language Models (LVLMs), die ganze Bilder interpretieren und komplexen Textanweisungen folgen können. Wir schlagen einen einfachen, aber effektiven einstufigen Multiface-Forgery-Detektor vor, genannt IMFD (Instruction-based Multi-face Forgery Detector), der End-to-End-trainiert wird, um gemeinsam Gesichter zu lokalisieren und Etiketten pro Face Förgery vorherzusagen. Anstatt die Face-Box-Vorhersage nur als gemeinsames Ziel zu behandeln, integriert IMFD explizit vorhergesagte Face-Bounding-Boxen in die Instruktion als visuelle Hinweise, die die Instruktionserdung und Fälschungserkennung verbessern. Zur Unterstützung des Trainings und der Bewertung von IMFD wandeln wir bestehende Multiface-Forgery-Datensätze in ein instruktionsbasiertes Format um. Experimentelle Ergebnisse und Analysen zeigen, dass IMFD die Erkennung von Multiface-Fälschungen verbessert, indem es Face-Bounding-Boxen in die Instruktion integriert und verschiedene modernste Methoden konstant übertrifft.

Ausgangspunkt der Forschung

Mehrpersonenfotos brechen mit der üblichen Annahme "zuschneiden und dann klassifizieren". Unabhängige Gesichtszuschnitte verwerfen Szenen- und Zwischenflächenkontext, erfordern sequentielle Arbeit für jede Person und übertragen Detektor- oder Reihenfolgefehler in die forensische Entscheidung. Ein nützliches System muss sagen, welche Gesichter gefälscht sind, nicht nur, ob ein Bild eine Manipulation enthält.

Methode

Das System wandelt OpenForensics-Proben in Anweisungen um, die Flächen von links nach rechts benennen. Eine CLIP-basierte Ankerstufe bewertet Kandidatenregionen, fusioniert überlappende Boxen und fügt vorhergesagte Koordinaten zusammen mit der Bilddarstellung in die Textinstruktion ein. Das LVLM liefert dann die gefälschten Flächenindizes und -Boxen zurück. Die Autoren bewerten sowohl eine kontrollierte zweistufige Einstellung mit Ground-Truth-Koordinaten als auch eine End-to-End-Einstufige Einstellung mit den vorhergesagten Boxen des IMFD und berichten Mikro-F1, Makro-F1, exakte Bildniveau-Übereinstimmung, Box-AP, Latenz und Durchsatz.

Einordnung

Whole-Image Reasoning verbessert die Forensik von überfüllten Szenen, aber die Lücke zwischen gelieferten und vorhergesagten Boxen ist groß. Beschaffungstests sollten exakte Entscheidungen pro Gesicht und Lokalisierungsfehler bewerten, nicht nur AUC auf Bildebene.

Paper 022026-09-10cs.CV

LAION-Mobile: Bewertung von Deepfake-Detektoren an einer Million Smartphone-Fotos

Autoren & Institutionen

Achim von Stryk

Stralsund University, Germany

Janis Keuper

Institute for Machine Learning and Analytics, Offenburg University, Germany

Welches Problem es löst

LAION-Mobile prüft, ob zwölf ursprüngliche Detektor-Checkpoints auf moderne KI-Bilder verallgemeinert werden und wie oft sie auf authentischen Smartphone-Fotos falsch alarmieren. Es trennt die grenzwerte Diskriminierung von der Schwellenwertkalibrierung und fragt, ob die Legacy-GAN-Kalibrierung ein irreführendes Deployment-Bild erzeugt.

Zentrales Ergebnis

Auf NTIRE 2026 erreicht der beste Detektor nur 0,624 AUC; fünf von zwölf liegen unter dem Zufallswert, und keiner überschreitet eine wahr-positiv-Rate von 13,5 % bei einer falsch-positiv-Rate von 5 %. Mit legacy-kalibrierten Schwellwerten erscheinen mehrere Systeme bei höchstens 11 % Fehlalarmen von Handy-Fotos nutzbar, aber moderne Kalibrierung lässt dieselben Detektoren 17–91 % authentischer Fotos markieren. UnivFD veranschaulicht die Verschiebung: 0,2 % werden bei identischen Handybildern zu 39,1 %. Das Korpus wird von älteren Geräten dominiert und enthält fast keine aktuellen Flaggschiffe, Authentizität wird pro Bild abgeleitet und nicht zertifiziert, und LAION-Mobile enthält nur echte Bilder, sodass es keine Zwei-Klassen-Handy-AUC liefern kann.

Abstract

Die meisten Deepfake-Detektoren liefern nahezu perfekte AUC-Werte in ihren Referenzbenchmarks. Ein aktuelles ICML-Positionspapier argumentiert jedoch, dass diese Bewertungen die Auswirkungen moderner Smartphone-Fotografie kollektiv vernachlässigen: Die weit verbreiteten neuronalen Bildverarbeitungs-Pipelines auf Geräten (wie Multisensor-Fusion oder Rausch- und Bewegungsunschärfeunterdrückung) verlagern das Bildgebungsparadigma zunehmend von einfachen Linsenprojektionen hin zu computergestützter Fotografie. Daher erzeugen Geräte tatsächlich Fotos statt aufnehmen. Dies erhöht das Risiko, dass Deepfake-Detektoren gewöhnliche Handyfotos als gefälscht markieren. Da groß angelegte Datensätze mit Bildern moderner Smartphones fehlen, wurde diese Hypothese bisher nur in kleinen Proof-of-Concept-Studien getestet. Ziel dieses Artikels ist es, diese Lücke zu schließen. Wir stellen LAION-Mobile vor, einen offenen Datensatz mit etwa 1 Million Smartphone-Bildern mit EXIF-Metadaten, die aus re-LAION-5B destilliert wurden. Bei der Bewertung von zwölf hochmodernen Deepfake-Detektoren mit ihren ursprünglichen Papier-Checkpoints an einer 9.115-Bild-Bewertungsstichprobe dieses Pools (DIRE bei 738) berichten wir über drei zentrale Ergebnisse: (i) Bei modernen KI-Inhalten überschreitet kein Detektor AUC 0,624, und fünf von zwölf liegen unter dem Zufall. (ii) Realfoto-Falschalarmraten sind ein Artefakt der Schwellenwertkalibrierung: Schwellenwerte auf alten GAN-Daten lassen mehrere Detektoren einsetzbar erscheinen (weniger als 11 Prozent FPR), doch dieselben Detektoren markieren 17–91 Prozent der echten Fotos, sobald das gleiche Kriterium auf modernen Inhalten neu angepasst wird. (iii) Folglich schlägt kein Detektor den Zufall bei modernen KI-Inhalten und hält eine einsetzbare Realfoto-Falschalarmrate. Im Einklang mit der Geräte-Mischung der Websammlungen untersucht der Korpus die erste neuronale ISP-Generation (2018–2020); aktuelle Flaggschiffe fehlen im Wesentlichen und lassen das moderne ISP-Regime als offene Lücke bestehen.

Ausgangspunkt der Forschung

Veröffentlichte Deepfake-Detektoren nähern sich oft perfektem AUC auf ihren eigenen Benchmarks, während moderne Telefone HDR-Fusion, Denoising, Schärfung, Bewegungsunterdrückung und andere erlernte Bildsignalverarbeitung auf authentische Fotos anwenden. Diese Rechenartefakte können generierten Bildfingerabdrücken ähneln. Ohne einen großen echten Telefonkorpus und einen auf aktuellen synthetischen Inhalt kalibrierten Schwellenwert kann ein Detektor sicher aussehen, während er gewöhnliche Fotos mit unbrauchbarer Rate markiert.

Methode

Die Autoren filtern re-LAION-5B nach Smartphone-EXIF und Nicht-Fotoheuristiken, um einen realen Fotopool mit 935.399 Bildern mit Gerätemetadaten zu erstellen, und bewerten dann eine feste Bewertungsprobe von 9.115 Bildern, mit Ausnahme von DIRE bei 738 teuren Rekonstruktionen. Zwölf Detektoren werden zunächst mit ihren ursprünglichen oder ProGAN-ähnlichen Benchmarks überprüft und anschließend an der NTIRE 2026 modernen Real/Fake-Mischung ausgewertet. Equal-Error-Schwellenwerte, die bei herkömmlichem ProGAN-ISP und modernem NTIRE separat angepasst wurden, werden auf dieselben Telefonfotos übertragen, um Kalibrierungsdrift freizulegen.

Einordnung

Eine nahezu perfekte Paper-AUC überträgt sich nicht auf modernen Inhalt, und Schwellwert-Eigentum kann Fehlalarme bei echten Fotos um mehrere Größenordnungen verändern. Jede Implementierung benötigt Negativbeispiele aktueller Geräte, ein dokumentiertes Kalibrierungsset und überwachte Driftpunkte.

Paper 032026-09-03cs.CV

Wissen über Raum und Zeit erhalten für kontinuierliche Video-Deepfake-Erkennung

Autoren & Institutionen

Taehoon Kim

Graduate School of Artificial Intelligence, Chung-Ang University

Jongwook Choi

Graduate School of Artificial Intelligence, Chung-Ang University

Heejae Jo

Department of Advanced Imaging, Graduate School of Advanced Imaging Science, Multimedia and Film, Chung-Ang University

Byungmin Park

Graduate School of Artificial Intelligence, Chung-Ang University

Jongwon Choi

Graduate School of Artificial Intelligence, Chung-Ang University

Department of Advanced Imaging, Graduate School of Advanced Imaging Science, Multimedia and Film, Chung-Ang University

Department of Metaverse Convergence, Chung-Ang University

Welches Problem es löst

MSFD adressiert speziell das Stabilitäts-Plastizitäts-Problem für die Video-Deepfake-Erkennung. Es bewahrt räumliches, zeitliches und räumlich-zeitliches forensisches Wissen separat beim Aktualisieren des Detektors und bewertet vollständige Daten-, Generator-incrementale- und Few-Shot-Sequenzen anstelle eines einzigen statischen Trainings-Test-Splits.

Zentrales Ergebnis

Im Sechs-Aufgaben-Protokoll erreicht das vollständige System 93,02 % durchschnittliche AUC mit 2,29 Punkten durchschnittlichem Vergessen, gegenüber 89,84 % und 6,81 für die iCaRL-ähnliche Baseline. Im Generator-Inkremental-Protokoll erreicht es 96,67 % durchschnittliche AUC, einschließlich 91,47 % bei Bild-zu-Video-Fälschungen, mit 1,37 Vergessen. Bei nur 25 realen und 25 gefälschten Videos pro neuer Aufgabe erreicht es 83,65 % durchschnittliche Genauigkeit und -1,25 Vergessen, was auf positiven rückwärtsgerichteten Transfer hinweist; IDER vergisst weniger bei -2,10, hat aber leicht niedrigere 83,47 % Genauigkeit. Ablationen zeigen, dass alle drei Frequenzzweige eine einzelne ungeteilte Repräsentation übertreffen. Die Methode zeigt nach der überwiegend asiatischen KoDF-Aufgabe weiterhin einen Anstieg des Vergessens, was auf ungelöste demografische und domänenbedingte Verschiebungen hinweist.

Abstract

Das fortlaufende Auftreten hochwertiger Video-Deepfakes erfordert Detektoren, die sich kontinuierlich an neue Fälschungsmuster anpassen, doch bestehende Ansätze, die für Deepfake-Bilder entwickelt wurden, erfassen video-spezifische Hinweise nicht. Im Gegensatz zu Deepfake-Bildern, die nur räumliche Artefakte enthalten, hinterlassen Deepfake-Videos in sowohl räumlicher als auch zeitlicher Dimension andere eindeutige Spuren, was die getrennte Erhaltung jeder Modalität während sequentieller Modell-Updates erforderlich macht. Um diese Einschränkung zu überwinden, führen wir ein kontinuierliches Deepfake-Video-Erkennungs-Framework ein, Modality-Specific Frequency Distillation (MSFD), das Video-Features explizit in räumliche, zeitliche und räumlich-zeitliche Modalitäten im Frequenzbereich zerlegt. Diese Zerlegung ermöglicht die unabhängige Erhaltung jeder Modalität, da verschiedene Deepfake-Video-Arten unterschiedlich stark auf räumliche und zeitliche Hinweise in den Aufgaben angewiesen sind. Darüber hinaus verwendet MSFD einen Cross-Modality-Decorrelation-Loss, der räumlich-zeitliche Repräsentationen dazu anregt, orthogonal zu Einzel-Modalitäts-Hinweisen zu bleiben. Umfangreiche Experimente zeigen, dass unser Framework eine stärkere Anpassung erreicht und die Leistung über diverse kontinuierliche Deepfake-Video-Szenarien hinweg effektiver bewahrt als State-of-the-Art-Methoden.

Ausgangspunkt der Forschung

Video-Manipulationstypen treten nach der Implementierung sequenziell auf, daher muss ein Detektor neue Generatoren erlernen, ohne alte Beweise zu löschen. Kontinuierliche Methoden, die aus der Bildklassifikation übernommen wurden, neigen dazu, eine verschränkte Repräsentation zu bewahren, obwohl Video-Deepfakes unterschiedliche Mischungen aus räumlichen Kanten, zeitlichen Inkonsistenzen und kombinierten Raum-Zeit-Artefakten hinterlassen. Ein niedriger Vergessens-Score ist ebenfalls nicht nützlich, wenn das System sich weigert, die neue Aufgabe zu adaptieren.

Methode

Zwischenvideofunktionen werden in 2D-räumliche, 1D-zeitliche und gemeinsame spatio-temporale Frequenzdarstellungen transformiert. Die modalitätsspezifische Frequenzdistillation gleicht jedes Spektrum während sequentieller Updates mit dem vorherigen Modell ab. Ein modalitätsspezifischer Adapter gewichtet Kanäle neu und lernt Gumbel-Softmax-Masken für aufgabenrelevante Frequenzbänder, während ein Dekorrelationsverlust verhindert, dass der gemeinsame Zweig die Einzelmodalitätshinweise dupliziert. Wiederholungsbeispiele und derselbe 3D ResNet-18-Backbone werden für die meisten Basislinienvergleiche über sechs Deepfake-Videodatensätze verwendet.

Einordnung

Die Trennung von räumlichem und zeitlichem forensischem Gedächtnis verbessert die Aktualisierungen des Detektors, insbesondere bei wenigen neuen Daten. Die verbleibende KoDF-Verschiebung erinnert daran, nach jeder kontinuierlichen Lernfreigabe Regressionstests an beiden Generatortypen und Bevölkerungsdomänen durchzuführen.