FakeI2V-Bench: Оценка применимости детекторов дипфейков на уровне изображений для обнаружения дипфейковых видео
Авторы и организации
Pei Li
School of Cyber Science and Technology, Shandong University, Qingdao, China
Sihan Chen
School of Cyber Science and Technology, Shandong University, Qingdao, China
Delong Ran
Institute for Network Sciences and Cyberspace, BNRist, Tsinghua University, Beijing, China
Tianshuo Cong
School of Cryptologic Science and Engineering, Shandong University, Jinan, China
Какую задачу решает
FakeI2V-Bench предоставляет единый тест для обнаружения на уровне изображений и видео и вводит повторно используемый мост, который превращает оценки кадров в решение на уровне видео. Он количественно оценивает точность, поведение при разных генераторах, задержку, размер модели и производительность при манипуляции только 20% клипа.
Ключевой результат
С наилучшей наивной агрегацией самый сильный детектор изображений достигает 80,16% AUC, уже обгоняя топовую видео-модель FTCN с 79,99%. После применения IV-Bridge одиннадцать из двенадцати детекторов изображений обгоняют FTCN; RINE-IV лидирует с 93,80% AUC и 97,63% AP, в то время как Patch-IV с 4,34 миллионами параметров достигает 89,26% AUC и 96,12% AP. По четырнадцати генераторам улучшенные модели изображений в среднем достигают 95,51% AUC против 91,01% у лучшего видео-детектора, хотя Sora остаётся сложной с 72,76% средней AUC. При манипуляции только 20% кадров каждая модель теряет производительность, и Patch-IV лидирует с 77,15% AUC.
Аннотация
Недавние достижения в моделях генерации видео значительно усилили угрозу дипфейков, однако текущие эталоны обнаружения дипфейков по-прежнему недостаточно развиты. В частности, эффективность детекторов на уровне изображений в видеодомене не была систематически оценена. Чтобы восполнить этот пробел, мы представляем FakeI2V-Bench — эталон для оценки современных детекторов дипфейков на уровне видео в сложных ситуациях, с особым акцентом на систематическую оценку эффективности детекторов дипфейков на уровне изображений в видеодомене. FakeI2V-Bench включает 97 548 видео, содержащих контент, сгенерированный новейшими мощными моделями и охватывающих более широкий спектр категорий. Используя этот набор данных, мы проводим систематическую оценку восьми детекторов видео-уровня и двенадцати репрезентативных детекторов на уровне изображений. Экспериментальные результаты показывают, что лучший детектор на уровне изображения достигает 80,16% AUC, немного превосходя самый сильный детектор видео-уровня (то есть 79,99% AUC). Выходя за рамки бенчмаркинга, мы представляем IV-Bridge — общую структуру, которая повышает применимость детекторов дипфейков на уровне изображений к видео. IV-Bridge использует модель случайного леса со статистическими особенностями для агрегирования прогнозов на уровне кадров, позволяя одиннадцати детекторам на уровне изображений превосходить современные видеоподходы, при этом лучший вариант достигает 93,80% AUC. В целом FakeI2V-Bench устанавливает строгий стандарт для обнаружения дипфейк-видео и вводит новый путь расширения детекторов на уровне изображения в видеосфере, предлагая новые инсайты и направления для будущих исследований. Код и данные доступны по адресу https://github.com/CryptoAILab/FakeI2V-Bench.
Отправная точка исследования
Детекторы дипфейков изображений выигрывают от зрелых процессов обучения, но видео-бенчмарки обычно сравнивают только архитектуры, специфичные для видео, и применяют модели по кадрам с упрощённым усреднением. Это оставляет команды в неведении, необходимы ли временные сети, как недавние генераторы видео меняют рейтинг и можно ли существующий детектор изображений экономично адаптировать для видео. Разреженные манипуляции, когда только часть кадров является поддельной, делают наивное агрегирование особенно рискованным.
Метод
Бенчмарк объединяет 97 548 видео из четырёх наборов данных для генерации лиц и общих изображений и оценивает восемь детекторов видео плюс двенадцать представительных детекторов изображений. Авторы сначала сравнивают фиксированные агрегирования оценок, такие как среднее, максимум и минимум. Затем IV-Bridge выполняет дообучение на видеокадрах на основе непересекающихся кадров FF и GenVideo и передаёт статистические дескрипторы оценок на уровне кадров в случайный лес с количеством деревьев до 800 и глубиной восемь. Результаты разбиты по четырнадцати генеративным моделям, контенту лиц против общего, стоимости развертывания и краткосрочных подделок.
Вывод по статье
Существующий детектор изображений может превратиться в конкурентоспособный видео-сервис, если его настроить на реальные видеокадры и сочетать с обученным агрегированием временных оценок. Мост привлекателен для лёгких развертываний, но разреженные редактирования по-прежнему остаются очевидным режимом неудачи, и самый точный победитель не является самой дешёвой моделью.