← Volver al Blog
Radar de InvestigaciónDetección de deepfakeForense de MediosarXivSeptiembre 2026

Radar arXiv Mensual

Artículos de detección de deepfake de septiembre de 2026: razonamiento multiface, falsas alarmas en smartphones y aprendizaje continuo

El trabajo más sólido de deepfake de septiembre se centra en el comportamiento del sistema en lugar de en otra puntuación cerrada. El IMFD pide a un modelo de lenguaje visual que localice y clasifique cada rostro en un solo pase basado en instrucciones. LAION-Mobile audita los puntos de control originales del detector sobre contenido sintético moderno y casi un millón de registros fotográficos de smartphones, revelando un deriva severo de calibración. El MSFD trata las actualizaciones de los detectores de vídeo como un problema de aprendizaje continuo y preserva la evidencia espacial, temporal y conjunta de frecuencia por separado.

Lo que señala este mes

La instrucción consciente de coordenadas del IMFD eleva su resultado en dos etapas en OpenForensics a 0,98 micro-F1, 0,98 macro-F1 y 0,94 de precisión exacta; la versión de extremo a extremo de una sola etapa baja a 0,90, 0,84 y 0,77 porque la localización de caras sigue propagando errores. LAION-Mobile encuentra que ninguno de los doce detectores publicados supera 0,624 AUC en una mezcla moderna de IA y que los umbrales calibrados modernos señalan entre el 17 y el 91% de las fotos auténticas de teléfono; su corpus, sin embargo, apenas cubre a los actuales proveedores neuronales insignia. MSFD alcanza un 93,02% de AUC medio con 2,29 puntos de olvido en seis conjuntos de datos de vídeo secuenciales, y un 83,65% de precisión media con olvido negativo en un protocolo de pocos disparos. En conjunto, los artículos defienden la evaluación de toda la escena, los negativos actuales del dispositivo, la propiedad explícita de la calibración y las pruebas de regresión tras cada actualización del detector.

Artículo 012026-09-17cs.CV

IMFD: Detección de Falsificación Multi-Rostro de Extremo a Extremo mediante Modelos de Visión y Lenguaje de Gran Tamaño Basados en Instrucciones

Autores e instituciones

Dasom Choi

Chungnam National University

Sangjun Moon

Chungnam National University

Hyeongchan Im

Chungnam National University

Jaeeon Park

Institute of Science Tokyo

Jingun Kwon

Chungnam National University

Hidetaka Kamigaito

Nara Institute of Science and Technology

Taro Watanabe

Nara Institute of Science and Technology

Manabu Okumura

Institute of Science Tokyo

Qué problema resuelve

IMFD reformula la detección de falsificación multi-rostro como una tarea de visión y lenguaje basada en instrucciones que localiza rostros de manera conjunta y asigna etiquetas de autenticidad por rostro. Prueba si las coordenadas explícitas de los rostros y el contexto de la imagen ayudan a un modelo de visión y lenguaje de gran tamaño a alinear los índices de los rostros de izquierda a derecha con las salidas correctas.

Resultado clave

Con coordenadas de verdad terreno en el conjunto completo de prueba, IMFD alcanza 0.98 micro-F1, 0.98 macro-F1 y 0.94 de exactitud en coincidencia exacta; el subconjunto con más rostros obtiene 0.97, 0.98 y 0.87. En el escenario verdaderamente de etapa única, esas métricas del conjunto completo caen a 0.90, 0.84 y 0.77, exponiendo la localización como el cuello de botella restante. El AP de las cajas de rostros es 81.9 en el conjunto completo y 83.6 en el subconjunto con muchos rostros. Aumentar la resolución de entrada de 112 a 672 píxeles incrementa el micro-F1 controlado de 0.917 a 0.981 y la coincidencia exacta de 0.654 a 0.948. IMFD supera a las líneas base comparadas, pero es más lento que el método de etapa única más rápido y aún depende de manipulaciones sintéticas de referencia.

Resumen

El rápido aumento de los deepfakes ha generado preocupaciones significativas debido a su propagación en las redes sociales. Los detectores tradicionales de falsificación multi-rostro recortan y verifican cada rostro de manera independiente, ignorando el contexto del fondo y las relaciones entre los rostros, lo que a menudo produce un rendimiento subóptimo. Para superar estas limitaciones, aprovechamos los Modelos de Visión y Lenguaje de Gran Tamaño basados en instrucciones (LVLMs), que pueden interpretar imágenes completas y seguir instrucciones textuales complejas. Proponemos un detector de falsificación multi-rostro de etapa única, simple pero efectivo, llamado IMFD (Instruction-based Multi-face Forgery Detector), que se entrena de extremo a extremo para localizar rostros y predecir etiquetas de falsificación por rostro de manera conjunta. En lugar de tratar la predicción de las cajas de los rostros solo como un objetivo conjunto, IMFD integra explícitamente las cajas predichas en la instrucción como señales visuales que mejoran la interpretación de las instrucciones y la detección de falsificaciones. Para apoyar el entrenamiento y la evaluación de IMFD, convertimos los conjuntos de datos existentes de falsificación multi-rostro a un formato basado en instrucciones. Los resultados experimentales y los análisis muestran que IMFD mejora la detección de falsificaciones multi-rostro al integrar las cajas de los rostros en la instrucción y supera consistentemente varios métodos de última generación.

Punto de partida

Las fotos con varias personas rompen la suposición habitual de recortar y luego clasificar. Los recortes de rostros independientes descartan el contexto de la escena y entre rostros, requieren trabajo secuencial para cada persona y propagan errores del detector o de orden en la decisión forense. Un sistema útil debe indicar qué rostros son falsos, no simplemente si una imagen contiene alguna manipulación.

Método

El sistema convierte las muestras de OpenForensics en instrucciones que nombran los rostros de izquierda a derecha. Una etapa ancla basada en CLIP puntúa regiones candidatas, fusiona cajas superpuestas e inyecta las coordenadas predichas en la instrucción de texto junto con la representación de la imagen. El LVLM luego devuelve los índices de los rostros falsificados y las cajas. Los autores evalúan tanto un escenario controlado de dos etapas utilizando coordenadas de verdad terreno como un escenario de etapa única de extremo a extremo usando las cajas predichas por IMFD, reportando micro-F1, macro-F1, coincidencia exacta a nivel de imagen, AP de cajas, latencia y rendimiento.

Conclusión del artículo

El razonamiento de imagen completa mejora la forense de escenas saturadas, pero la diferencia entre las cajas suministradas y las predichas es grande. Las pruebas de adquisiciones deberían puntuar decisiones exactas por cara y fallos de localización, no solo AUC a nivel de imagen.

Artículo 022026-09-10cs.CV

LAION-Mobile: Evaluando detectores de deepfake en un millón de fotos de smartphones

Autores e instituciones

Achim von Stryk

Stralsund University, Germany

Janis Keuper

Institute for Machine Learning and Analytics, Offenburg University, Germany

Qué problema resuelve

LAION-Mobile audita si doce puntos de control originales de los detectores se generalizan a imágenes modernas de IA y con qué frecuencia se activan falsas alarmas en fotos auténticas de smartphones. Separa la discriminación independiente del umbral de la calibración del umbral y pregunta si la calibración antigua del GAN crea una imagen de despliegue engañosa.

Resultado clave

En NTIRE 2026, el mejor detector alcanza solo 0,624 AUC; cinco de doce obtienen puntuaciones por debajo del azar, y ninguno supera el 13,5% de tasa de verdaderos positivos al 5% de tasa de falsos positivos. Los umbrales calibrados con métodos antiguos hacen que varios sistemas parezcan utilizables con un máximo de 11% de falsas alarmas en fotos tomadas con teléfonos, pero la calibración moderna hace que los mismos detectores marquen entre 17 y 91% de fotos auténticas. UnivFD ilustra el cambio: 0,2% se convierte en 39,1% en imágenes de teléfonos idénticas. El corpus está dominado por dispositivos antiguos y casi no contiene los modelos actuales más avanzados, la autenticidad se infiere en lugar de certificarse por imagen, y LAION-Mobile es solo real, por lo que no puede proporcionar un AUC de teléfono de dos clases.

Resumen

La mayoría de los detectores de deepfake reportan puntuaciones AUC casi perfectas en sus benchmarks de referencia. Sin embargo, un reciente documento de posición de ICML sostiene que estas evaluaciones ignoran colectivamente el impacto de la fotografía moderna con smartphones: las canaletas de procesamiento de señales neuronales de imagen ampliamente utilizadas en dispositivos (como la fusión multisensor o la supresión de ruido y desenfoque de movimiento) desplazan cada vez más el paradigma de imagen, pasando de simples proyecciones de lentes a fotografía computacional. Por ello, los dispositivos realmente generan, en lugar de grabar, fotos. Esto aumenta el riesgo de que los detectores deepfake puedan señalar fotos ordinarias de teléfonos móviles como falsas. Debido a la falta de conjuntos de datos a gran escala que contengan imágenes de smartphones modernos, esta hipótesis solo se ha probado hasta ahora en pequeños estudios de prueba de concepto. El objetivo de este artículo es cerrar esta brecha. Presentamos LAION-Mobile, un conjunto de datos abierto que contiene alrededor de 1 millón de imágenes de smartphones con metadatos EXIF destilados de re-LAION-5B. Evaluando doce detectores deepfake de última generación con sus puntos de control originales en papel en una muestra de evaluación de 9.115 imágenes de este pool (DIRE on 738), reportamos tres hallazgos clave: (i) En contenido moderno de IA ningún detector supera AUC 0,624, y cinco de doce están por debajo del azar. (ii) Las tasas de falsas alarmas con fotos reales son un artefacto de la calibración de umbrales: los umbrales instalados en datos GAN antiguos hacen que varios detectores parezcan desplegables (menos del 11 por ciento de FPR), pero los mismos detectores detectan entre el 17 y el 91 por ciento de las fotos reales una vez que se ajusta el mismo criterio en contenido moderno. (iii) En consecuencia, ningún detector supera al azar en contenido de IA moderno y mantiene una tasa de falsas alarmas con fotos reales desplegables. Reflejando la mezcla de dispositivos de colecciones web, el corpus sonda la primera generación de ISP neural (2018-2020); los buques insignia actuales están esencialmente ausentes, dejando el régimen moderno de ISP como la brecha abierta.

Punto de partida

Los detectores deepfake publicados suelen acercarse a un AUC perfecto en sus propios benchmarks, mientras que los teléfonos modernos aplican fusión HDR, reducción de ruido, enfoque, supresión de movimiento y otros procesamientos de señales de imagen aprendidos a fotos auténticas. Estos artefactos computacionales pueden asemejarse a huellas dactilares generadas por imágenes. Sin un gran corpus real de teléfono y un umbral calibrado según el contenido sintético actual, un detector puede parecer seguro mientras marca fotografías ordinarias a una velocidad inutilizable.

Método

Los autores filtran el re-LAION-5B por EXIF del smartphone y heurísticas no fotográficas para crear un pool de fotos reales de 935.399 imágenes con metadatos del dispositivo, y luego puntuan una muestra fija de evaluación de 9.115 imágenes, excepto DIRE en 738 reconstrucciones costosas. Doce detectores se comprueban primero con sus benchmarks originales o de estilo ProGAN, y luego se evalúan en la mezcla moderna real/falsa NTIRE 2026. Los umbrales de error igual, instalados por separado en ProGAN-ISP heredado y NTIRE moderno, se transfieren a las mismas fotos de teléfono para exponer la deriva de calibración.

Conclusión del artículo

Un AUC de papel casi perfecto no se transfiere al contenido moderno, y la propiedad del umbral puede cambiar las falsas alarmas en fotos reales por órdenes de magnitud. Cada implementación necesita negativos de dispositivos actuales, un conjunto de calibración documentado y el monitoreo del desplazamiento del punto de operación.

Artículo 032026-09-03cs.CV

Preservar el conocimiento a través del espacio y el tiempo para la detección continua de deepfakes en video

Autores e instituciones

Taehoon Kim

Graduate School of Artificial Intelligence, Chung-Ang University

Jongwook Choi

Graduate School of Artificial Intelligence, Chung-Ang University

Heejae Jo

Department of Advanced Imaging, Graduate School of Advanced Imaging Science, Multimedia and Film, Chung-Ang University

Byungmin Park

Graduate School of Artificial Intelligence, Chung-Ang University

Jongwon Choi

Graduate School of Artificial Intelligence, Chung-Ang University

Department of Advanced Imaging, Graduate School of Advanced Imaging Science, Multimedia and Film, Chung-Ang University

Department of Metaverse Convergence, Chung-Ang University

Qué problema resuelve

MSFD aborda el problema de estabilidad-plasticidad específicamente para la detección de deepfakes en video. Preserva el conocimiento forense espacial, temporal y espacio-temporal por separado mientras actualiza el detector, y evalúa secuencias de datos completos, incrementales por generador y de pocos ejemplos en lugar de una sola división estática de entrenamiento-prueba.

Resultado clave

En el protocolo de seis tareas, el sistema completo alcanza un AUC promedio del 93,02% con 2,29 puntos de olvido promedio, frente al 89,84% y 6,81 del referente estilo iCaRL. En el protocolo incremental de generador alcanza un AUC promedio del 96,67%, incluyendo 91,47% en falsificaciones de imagen a video, con 1,37 de olvido. Con solo 25 videos reales y 25 falsos por nueva tarea, logra una precisión promedio del 83,65% y -1,25 de olvido, lo que indica transferencia hacia atrás positiva; IDER olvida menos con -2,10 pero tiene una precisión ligeramente inferior del 83,47%. Las ablaciones muestran que las tres ramas de frecuencia superan a una representación única no dividida. El método aún muestra un aumento del olvido después de la tarea predominantemente asiática KoDF, señalando un cambio demográfico y de dominio no resuelto.

Resumen

La aparición continua de deepfakes de video de alta calidad requiere detectores que se adapten continuamente a nuevos patrones de falsificación, sin embargo, los enfoques existentes, diseñados para imágenes deepfake, no logran capturar las señales específicas de los videos. A diferencia de las imágenes deepfake que solo contienen artefactos espaciales, los videos deepfake dejan evidencia distinta a lo largo de los ejes espacial y temporal, lo que requiere la preservación separada de cada modalidad durante las actualizaciones secuenciales del modelo. Para superar esta limitación, introducimos un marco de detección continua de deepfakes de video, Destilación de Frecuencia Específica de Modalidad (MSFD), que descompone explícitamente las características del video en modalidades espaciales, temporales y espacio-temporales en el dominio de la frecuencia. Esta descomposición permite la preservación independiente de cada modalidad, ya que diferentes tipos de videos deepfake muestran distintas dependencias de las señales espaciales y temporales según la tarea. Además, MSFD adopta una pérdida de decorrelación entre modalidades que incentiva que las representaciones espacio-temporales permanezcan ortogonales a las señales de modalidad única. Experimentos extensos muestran que nuestro marco logra una adaptación más fuerte y preserva el rendimiento de manera más efectiva que los métodos de última generación en diversos escenarios de detección continua de deepfakes en video.

Punto de partida

Los tipos de falsificación de video aparecen de forma secuencial después del despliegue, por lo que un detector debe aprender nuevos generadores sin borrar la evidencia antigua. Los métodos continuos heredados de la clasificación de imágenes tienden a preservar una representación entrelazada, aunque los deepfakes de video dejan diferentes combinaciones de límites espaciales, inconsistencias temporales y artefactos conjunto espacio-tiempo. Una puntuación baja de olvido tampoco es útil si el sistema se niega a adaptarse a la nueva tarea.

Método

Las características intermedias del video se transforman en representaciones de frecuencia 2D espaciales, 1D temporales y espaciotemporales conjuntas. La Destilación de Frecuencia Específica de Modalidad alinea cada espectro con el modelo anterior durante las actualizaciones secuenciales. Un adaptador específico de modalidad repondera los canales y aprende máscaras Gumbel-Softmax para bandas de frecuencia relevantes para la tarea, mientras que una pérdida de decorrelación evita que la rama conjunta duplique las señales de una sola modalidad. Se utilizan ejemplos de reproducción y la misma columna vertebral 3D ResNet-18 para la mayoría de las comparaciones de referencia en seis conjuntos de datos de videos deepfake.

Conclusión del artículo

Separar la memoria forense espacial y temporal mejora las actualizaciones del detector, especialmente con pocos datos nuevos. El desplazamiento restante de KoDF es un recordatorio para realizar pruebas de regresión en ambas familias de generadores y dominios de población después de cada versión de aprendizaje continuo.