← Volver al Blog
Radar de investigaciónDetección de deepfakesAnálisis forense de vídeoarXivAgosto de 2026

Radar mensual de arXiv

Artículos sobre detección de deepfakes de agosto de 2026: transferencia de imagen a vídeo, forense multiagente y equidad

Los artículos de agosto tratan la detección deepfake como un sistema de despliegue en lugar de un solo número AUC. Un estudio muestra que los detectores de imagen pueden superar a los modelos de vídeo dedicados con ajuste de fotogramas y agregación aprendida; otro separa el análisis de texturas, iluminación, movimiento y física entre agentes; el tercero apunta a atajos demográficos dentro de características residuales espaciales y de ajuste fino.

Lo que señala este mes

FakeI2V-Bench encuentra que el ajuste de fotogramas de vídeo junto con la agregación estadística pueden convertir detectores de imágenes maduros en sistemas de vídeo más potentes y a veces más ligeros, pero las ediciones escasas siguen siendo difíciles. FaceVid-Forensics-100K utiliza cuatro agentes forenses independientes y un juez para mejorar la detección de generadores no visibles mientras devuelve explicaciones. FairReL muestra que generalización y equidad son objetivos separados: un detector puede transferir bien en general y aun así concentrar falsos positivos en subgrupos minoritarios. Por tanto, una evaluación de producción creíble necesita diversidad de generadores, pruebas de dispersión temporal, evidencia revisable y métricas de subgrupos con umbral fijo.

Artículo 012026-08-04cs.CR

FakeI2V-Bench: Evaluación de la aplicabilidad de los detectores de deepfake a nivel de imagen para la detección de vídeo deepfake

Autores e instituciones

Pei Li

School of Cyber Science and Technology, Shandong University, Qingdao, China

Sihan Chen

School of Cyber Science and Technology, Shandong University, Qingdao, China

Delong Ran

Institute for Network Sciences and Cyberspace, BNRist, Tsinghua University, Beijing, China

Tianshuo Cong

School of Cryptologic Science and Engineering, Shandong University, Jinan, China

Qué problema resuelve

FakeI2V-Bench proporciona una prueba unificada de detección a nivel de imagen y de video e introduce un puente reutilizable que convierte las puntuaciones de los cuadros en una decisión de video. Cuantifica precisión, comportamiento entre generadores, latencia, tamaño del modelo y rendimiento cuando solo el 20 % de un clip está manipulado.

Resultado clave

Con la mejor agregación ingenua, el detector de imágenes más fuerte alcanza un 80,16% de AUC, ya superando al mejor modelo de video FTCN con un 79,99%. Después de IV-Bridge, once de los doce detectores de imágenes superan a FTCN; RINE-IV lidera con 93,80% de AUC y 97,63% de AP, mientras que Patch-IV, con 4,34 millones de parámetros, alcanza 89,26% de AUC y 96,12% de AP. Entre catorce generadores, los modelos de imágenes mejorados promedian 95,51% de AUC frente al 91,01% del mejor detector de video, aunque Sora sigue siendo difícil con un 72,76% de AUC media. Con solo el 20% de fotogramas falsificados, todos los modelos caen y Patch-IV lidera con 77,15% de AUC.

Resumen

Los avances recientes en los modelos de generación de vídeo han intensificado significativamente la amenaza del deepfake, pero los actuales benchmarks de detección de deepfake siguen poco desarrollados. En particular, la efectividad de los detectores a nivel de imagen en el ámbito del vídeo no ha sido evaluada sistemáticamente. Para cubrir esta carencia, presentamos FakeI2V-Bench, un referente para evaluar detectores deepfake a nivel de vídeo de última generación en escenarios desafiantes, con un enfoque particular en evaluar sistemáticamente el rendimiento de los detectores deepfake a nivel de imagen en el dominio del vídeo. FakeI2V-Bench comprende 97.548 vídeos, que contienen contenido generado por los últimos modelos de generación potente y cubren una gama más amplia de categorías. Utilizando este conjunto de datos, realizamos una evaluación sistemática de ocho detectores a nivel de vídeo y doce detectores representativos a nivel de imagen. Los resultados experimentales muestran que el detector de nivel de imagen con mejor rendimiento alcanza un UCA del 80,16%, superando ligeramente al detector de nivel de vídeo más potente (es decir, 79,99% AUC). Más allá de la comparación comparativa, presentamos IV-Bridge, un marco general que mejora la aplicabilidad de los detectores deepfake a nivel de imagen a vídeos. IV-Bridge emplea un modelo de bosque aleatorio con características estadísticas para agregar predicciones a nivel de fotograma, permitiendo que once detectores a nivel de imagen superen los enfoques de última generación a nivel de vídeo, siendo la variante con mejor rendimiento lograr un AUC del 93,80%. En general, FakeI2V-Bench establece un riguroso benchmark para la detección de vídeos deepfake e introduce una vía novedosa para extender los detectores a nivel de imagen al dominio del vídeo, ofreciendo nuevas perspectivas y direcciones para futuras investigaciones. El código y los datos están disponibles en https://github.com/CryptoAILab/FakeI2V-Bench.

Punto de partida

Los detectores de deepfakes en imágenes se benefician de pipelines de entrenamiento maduros, pero los benchmarks de video generalmente comparan solo arquitecturas específicas de video y aplican modelos de cuadro con un promedio simplista. Eso deja a los equipos sin certeza sobre si las redes temporales son necesarias, cómo los generadores de video recientes cambian la clasificación y si un detector de imágenes existente puede adaptarse de manera económica a video. Las manipulaciones dispersas, donde solo una fracción de los cuadros es falsa, hacen que la agregación ingenua sea especialmente arriesgada.

Método

El benchmark combina 97,548 videos de cuatro conjuntos de datos de generación facial y general, y evalúa ocho detectores de video más doce detectores de imagen representativos. Los autores primero comparan agregaciones de puntuación fijas como la media, el máximo y el mínimo. Luego, IV-Bridge realiza un ajuste fino en video-cuadro en cuadros FF y GenVideo no superpuestos y alimenta descriptores estadísticos de las puntuaciones a nivel de cuadro a un bosque aleatorio con hasta 800 árboles y una profundidad de ocho. Los resultados se desglosan por catorce modelos de generación, contenido facial versus general, costo de implementación y falsificación a corto plazo.

Conclusión del artículo

Un detector de imágenes existente puede convertirse en un servicio de video competitivo si se ajusta en cuadros de video reales y se combina con una agregación de puntuación temporal aprendida. El puente es atractivo para implementaciones ligeras, pero las ediciones escasas siguen siendo un modo de fallo claro y el mayor ganador en precisión no es el modelo más barato.

Artículo 022026-08-07cs.CV

Razonamiento forense multiagente para la detección generalizable de videos deepfake

Autores e instituciones

Xuechao Zou

Beijing Jiaotong University, China

Shun Zhang

Beijing Jiaotong University, China

Kai Li

Tsinghua University, China

Yi Zhou

Beijing Jiaotong University, China

Xinyu Sun

Beijing Jiaotong University, China

Yuhui Chen

Ant Group, China

Zhe Wu

Tsinghua University, China

Congyan Lang

Beijing Jiaotong University, China

Junliang Xing

Tsinghua University, China

Qué problema resuelve

El artículo aporta tanto un benchmark actual y rico en explicaciones como un sistema de razonamiento colaborativo diseñado para generadores invisibles. Evalúa si los informes de especialistas independientes mejoran la generalización más allá de una cadena de pensamiento más larga o de mostrar repetidamente los mismos fotogramas a un mismo modelo.

Resultado clave

En la prueba fuera de dominio, el sistema completo con evaluación consciente de vídeo alcanza 69,87% de precisión, 81,82% de recuerdo y 53,28 F1. El modelo cerrado más potente listado, Gemini 2.5 Pro, registra 63,78%, 75,29% y 47,45%, mientras que la mejor línea base de visión pequeña alcanza 64,28% de precisión y 45,20 F1. Un juez solo por texto sobre los informes de agentes sigue siendo segundo con 67,41% de precisión y 51,01 F1. Joint SFT mejora el sistema de video-aware del 42,29% al 67,03%, y GRPO lo eleva aún más; combinar los cuatro agentes forenses da la mejor F1 en ambos jueces de evaluación.

Resumen

El uso malicioso de la inteligencia artificial generativa para crear vídeos deepfake altamente realistas plantea serias preocupaciones éticas y plantea desafíos sustanciales para la seguridad de la IA. Sin embargo, los benchmarks de vídeo deepfake existentes ofrecen una cobertura limitada de los métodos recientes de síntesis y carecen generalmente de anotaciones textuales de grano fino fiables. Mientras tanto, los detectores convencionales y los modelos de lenguaje multimodales grandes (MLLM), ya sea que operen como un solo modelo o que se basen en una perspectiva analítica única, a menudo no logran captar artefactos sutiles de falsificación, limitando su generalización a métodos emergentes generados por IA. Para abordar estas limitaciones, presentamos FaceVid-Forensics-100K, un conjunto de datos de vídeo deepfake a gran escala que comprende 100.000 vídeos y abarca 33 métodos de síntesis que abarcan intercambios de rostros, recreación facial y síntesis completa de caras, incluyendo generadores recientes como Seedance 2.0. El conjunto de datos proporciona anotaciones textuales detalladas de observaciones visuales y explicaciones forenses consistentes con el veredicto, sintetizadas automáticamente mediante una cadena de agregación multimodelo y resolución de conflictos impulsada por MLLMs avanzados. Basándonos en este benchmark, proponemos un marco de razonamiento forense multiagente que emplea cuatro agentes especializados especializados en dominio para analizar de forma independiente las señales de falsificación desde cuatro perspectivas: textura, iluminación, movimiento y física. Un agente juez reconcilia sus informes para producir una predicción final junto con una explicación. Evaluaciones exhaustivas en conjuntos de pruebas fuera de dominio muestran que, a pesar de estar compuesto íntegramente por pequeños MLLMs de código abierto, nuestro marco supera a todos los métodos, incluidos los modelos GPT y Gemini de código cerrado, y ocupa el primer puesto en todas las métricas reportadas en este benchmark. La página del proyecto está disponible en https://xavierjiezou.github.io/ARGUS/.

Punto de partida

Los generadores de vídeo facial modernos mantienen la identidad y el movimiento lo suficientemente bien como para que un único clasificador o un MLLM de propósito general pueda pasar por alto evidencia sutil específica del generador. Los conjuntos de datos existentes a menudo van rezagados en los sistemas de síntesis nuevos y solo proporcionan etiquetas binarias, dificultando el entrenamiento o auditoría de explicaciones. Para una revisión de alto riesgo, un detector debe inspeccionar dimensiones forenses independientes y reconciliar observaciones contradictorias en lugar de producir un veredicto sin fundamento.

Método

FaceVid-Forensics-100K contiene 100.000 vídeos de 33 métodos de intercambio de caras, recreación y síntesis de rostros completos, incluyendo Seedance 2.0. Se crean observaciones detalladas y explicaciones consistentes con veredicto mediante agregación multimodelo y resolución de conflictos. Cuatro pequeños agentes MLLM de código abierto inspeccionan por separado la textura, la iluminación, el movimiento y la consistencia física; un juez recibe sus informes, toma muestras opcionales del vídeo y emite un veredicto más explicación. Los agentes y el juez reciben formación en ajuste fino supervisado y luego optimización relativa de políticas en grupo, dejando los generadores fuera de dominio para su evaluación.

Conclusión del artículo

Separar la observación forense de la formación del veredicto mejora tanto la auditabilidad como el rendimiento en generadores no vistos. La arquitectura es convincente para flujos de trabajo de asistencia a analistas, pero su costo de inferencia multimodal y las etiquetas de explicación generadas automáticamente deben medirse frente a un detector más sencillo más la revisión humana antes de adoptar la producción.

Artículo 032026-08-28cs.CV

FairReL: Detección de Deepfakes utilizando Aprendizaje de Representación Consciente de la Equidad

Autores e instituciones

Xiaoman Lu

Department of Computer Science, University of Warwick, Coventry, United Kingdom

Jiaqi Li

Department of Computer Science, University of Warwick, Coventry, United Kingdom

Shuntian Zheng

Department of Computer Science, University of Warwick, Coventry, United Kingdom

Huiping Chen

School of Computer Science, University of Birmingham, Birmingham, United Kingdom

Yu Guan

Department of Computer Science, University of Warwick, Coventry, United Kingdom

Qué problema resuelve

FairReL aísla dos componentes sensibles a subgrupos: frecuencias espaciales a múltiples escalas y la representación residual introducida durante el ajuste fino, y aplica diferentes controles de equidad a cada uno. Evalúa la disparidad de falsos positivos a un umbral operativo fijo, por lo que las mejoras no pueden fabricarse simplemente rechazando menos muestras en general.

Resultado clave

Frente a la línea base más fuerte orientada a la equidad, los autores informan una mejora de 3,9 puntos en el AUC de conjuntos de datos no vistos y una reducción del 10,2% en la disparidad de FPR entre subgrupos. FairReL alcanza AUCs de 80,64, 86,13 y 66,34 en Celeb-DF, DFD y DFDC, mientras registra la disparidad de FPR igual más baja en los tres (10,12, 13,55 y 38,36). En DFDC, su AUC promedio por grupo es de 67,03 y su brecha de AUC entre el mejor y el peor subgrupo es de 1,09 puntos. Se queda ligeramente atrás del modelo GenD, enfocado en precisión, en AUC general en dos conjuntos, pero distribuye el rendimiento de manera más uniforme, especialmente para los subgrupos femeninos y negros.

Resumen

Aunque los detectores de deepfake recientes alcanzan una alta precisión global, sus errores siguen distribuyéndose de manera desigual entre subgrupos demográficos, siendo más frecuente que rostros reales de ciertos grupos se clasifiquen erróneamente como falsos. Los detectores existentes conscientes de la equidad típicamente regularizan toda la representación de características, sin identificar ni controlar los componentes específicos que generan predicciones injustas. Tal intervención general puede suprimir en exceso las pistas útiles de falsificación mientras deja la estructura demográfica en subespacios específicos de componentes. Para abordar esto, identificamos dos componentes sensibles a subgrupos: características espaciales a múltiples escalas, que codifican patrones locales de rostro y falsificación, y características residuales inducidas por ajuste fino, que adaptan la red base a la distribución de entrenamiento injusta. Proponemos FairReL, un marco de aprendizaje de representación consciente de la equidad que apunta a ambos componentes con supervisión demográfica dedicada. FairReL utiliza un backbone de modelo base descompuesto con SVD para aislar la representación residual inducida por el ajuste fino, e introduce dos pérdidas complementarias. La Descorrelación de Wavelet condicional al grupo (GCWD) suprime la estructura desequilibrada entre subgrupos a través de sub-bandas espaciales de wavelet, mientras que la Alineación de Medias Localizada en Subespacios (SLMA) alinea las medias de subgrupos dentro de cada clase real/falsa en la representación residual. Experimentos en FF, Celeb-DF, DFD y DFDC muestran que, frente al detector consciente de equidad de última generación, FairReL mejora el AUC en conjuntos de datos no vistos en un 3.9% mientras reduce la disparidad de FPR entre subgrupos en un 10.2%. El código está disponible en https://github.com/xiaoman89/FairReL.

Punto de partida

Un detector puede lograr un fuerte AUC global mientras acusa falsamente a miembros de algunos subgrupos demográficos mucho más a menudo que a otros. Las pérdidas de equidad existentes a menudo regularizan la predicción final o todo el embedding, lo que puede dejar intactos los atajos demográficos localizados o borrar evidencia útil de falsificación. El desafío es focalizar dónde entra la información de subgrupo en el detector y preservar tanto la equidad como la precisión en distintos dominios.

Método

El método descompone cada proyección de autoatención en CLIP ViT-L/14 con SVD y aprende un residual de rango uno mientras retiene la representación de base. La Descorrelación de Wavelet Condicional al Grupo suprime la estructura desequilibrada entre subgrupos por separado a través de bandas de wavelet espaciales. La Alineación de Medias Localizada en Subespacios alinea las medias demográficas dentro de cada clase real/falsa solo en el residual de adaptación, evitando un suavizado indiscriminado de todas las características. Los modelos se entrenan en FaceForensics y se transfieren a Celeb-DF, DFD y DFDC, utilizando seis grupos interseccionales de género/etnicidad y métricas FPR en un umbral de validación de origen fijado al 90% TPR.

Conclusión del artículo

La evaluación de deepfakes debe informar los falsos positivos por subgrupo en un punto de operación fijo, no solo el AUC agregado. FairReL muestra que la des-biasedización localizada puede mantener una detección competitiva a través de dominios, aunque la disparidad residual de DFDC sigue siendo lo suficientemente grande como para que los umbrales de producción y las rutas de escalamiento aún necesiten validación consciente de subgrupos.