FakeI2V-Bench: Evaluación de la aplicabilidad de los detectores de deepfake a nivel de imagen para la detección de vídeo deepfake
Autores e instituciones
Pei Li
School of Cyber Science and Technology, Shandong University, Qingdao, China
Sihan Chen
School of Cyber Science and Technology, Shandong University, Qingdao, China
Delong Ran
Institute for Network Sciences and Cyberspace, BNRist, Tsinghua University, Beijing, China
Tianshuo Cong
School of Cryptologic Science and Engineering, Shandong University, Jinan, China
Qué problema resuelve
FakeI2V-Bench proporciona una prueba unificada de detección a nivel de imagen y de video e introduce un puente reutilizable que convierte las puntuaciones de los cuadros en una decisión de video. Cuantifica precisión, comportamiento entre generadores, latencia, tamaño del modelo y rendimiento cuando solo el 20 % de un clip está manipulado.
Resultado clave
Con la mejor agregación ingenua, el detector de imágenes más fuerte alcanza un 80,16% de AUC, ya superando al mejor modelo de video FTCN con un 79,99%. Después de IV-Bridge, once de los doce detectores de imágenes superan a FTCN; RINE-IV lidera con 93,80% de AUC y 97,63% de AP, mientras que Patch-IV, con 4,34 millones de parámetros, alcanza 89,26% de AUC y 96,12% de AP. Entre catorce generadores, los modelos de imágenes mejorados promedian 95,51% de AUC frente al 91,01% del mejor detector de video, aunque Sora sigue siendo difícil con un 72,76% de AUC media. Con solo el 20% de fotogramas falsificados, todos los modelos caen y Patch-IV lidera con 77,15% de AUC.
Resumen
Los avances recientes en los modelos de generación de vídeo han intensificado significativamente la amenaza del deepfake, pero los actuales benchmarks de detección de deepfake siguen poco desarrollados. En particular, la efectividad de los detectores a nivel de imagen en el ámbito del vídeo no ha sido evaluada sistemáticamente. Para cubrir esta carencia, presentamos FakeI2V-Bench, un referente para evaluar detectores deepfake a nivel de vídeo de última generación en escenarios desafiantes, con un enfoque particular en evaluar sistemáticamente el rendimiento de los detectores deepfake a nivel de imagen en el dominio del vídeo. FakeI2V-Bench comprende 97.548 vídeos, que contienen contenido generado por los últimos modelos de generación potente y cubren una gama más amplia de categorías. Utilizando este conjunto de datos, realizamos una evaluación sistemática de ocho detectores a nivel de vídeo y doce detectores representativos a nivel de imagen. Los resultados experimentales muestran que el detector de nivel de imagen con mejor rendimiento alcanza un UCA del 80,16%, superando ligeramente al detector de nivel de vídeo más potente (es decir, 79,99% AUC). Más allá de la comparación comparativa, presentamos IV-Bridge, un marco general que mejora la aplicabilidad de los detectores deepfake a nivel de imagen a vídeos. IV-Bridge emplea un modelo de bosque aleatorio con características estadísticas para agregar predicciones a nivel de fotograma, permitiendo que once detectores a nivel de imagen superen los enfoques de última generación a nivel de vídeo, siendo la variante con mejor rendimiento lograr un AUC del 93,80%. En general, FakeI2V-Bench establece un riguroso benchmark para la detección de vídeos deepfake e introduce una vía novedosa para extender los detectores a nivel de imagen al dominio del vídeo, ofreciendo nuevas perspectivas y direcciones para futuras investigaciones. El código y los datos están disponibles en https://github.com/CryptoAILab/FakeI2V-Bench.
Punto de partida
Los detectores de deepfakes en imágenes se benefician de pipelines de entrenamiento maduros, pero los benchmarks de video generalmente comparan solo arquitecturas específicas de video y aplican modelos de cuadro con un promedio simplista. Eso deja a los equipos sin certeza sobre si las redes temporales son necesarias, cómo los generadores de video recientes cambian la clasificación y si un detector de imágenes existente puede adaptarse de manera económica a video. Las manipulaciones dispersas, donde solo una fracción de los cuadros es falsa, hacen que la agregación ingenua sea especialmente arriesgada.
Método
El benchmark combina 97,548 videos de cuatro conjuntos de datos de generación facial y general, y evalúa ocho detectores de video más doce detectores de imagen representativos. Los autores primero comparan agregaciones de puntuación fijas como la media, el máximo y el mínimo. Luego, IV-Bridge realiza un ajuste fino en video-cuadro en cuadros FF y GenVideo no superpuestos y alimenta descriptores estadísticos de las puntuaciones a nivel de cuadro a un bosque aleatorio con hasta 800 árboles y una profundidad de ocho. Los resultados se desglosan por catorce modelos de generación, contenido facial versus general, costo de implementación y falsificación a corto plazo.
Conclusión del artículo
Un detector de imágenes existente puede convertirse en un servicio de video competitivo si se ajusta en cuadros de video reales y se combina con una agregación de puntuación temporal aprendida. El puente es atractivo para implementaciones ligeras, pero las ediciones escasas siguen siendo un modo de fallo claro y el mayor ganador en precisión no es el modelo más barato.