FakeI2V-Bench: Avaliando a Aplicabilidade de Detectores de Deepfake em Nível de Imagem para Detecção de Deepfake em Vídeo
Autores e instituições
Pei Li
School of Cyber Science and Technology, Shandong University, Qingdao, China
Sihan Chen
School of Cyber Science and Technology, Shandong University, Qingdao, China
Delong Ran
Institute for Network Sciences and Cyberspace, BNRist, Tsinghua University, Beijing, China
Tianshuo Cong
School of Cryptologic Science and Engineering, Shandong University, Jinan, China
Que problema resolve
FakeI2V-Bench fornece um teste unificado de detecção em nível de imagem e vídeo e introduz uma ponte reutilizável que transforma pontuações de frames em uma decisão de vídeo. Ele quantifica acurácia, comportamento entre geradores, latência, tamanho do modelo e desempenho quando apenas 20% de um clipe é manipulado.
Resultado-chave
Com a melhor agregação ingênua, o detector de imagem mais forte alcança 80,16% de AUC, já ultrapassando o modelo de vídeo principal FTCN com 79,99%. Após o IV-Bridge, onze dos doze detectores de imagem superam o FTCN; o RINE-IV lidera com 93,80% de AUC e 97,63% de AP, enquanto o Patch-IV, com 4,34 milhões de parâmetros, alcança 89,26% de AUC e 96,12% de AP. Ao longo de quatorze geradores, modelos de imagem aprimorados apresentam média de 95,51% de AUC contra 91,01% do melhor detector de vídeo, embora Sora permaneça difícil com 72,76% de AUC média. Com apenas 20% dos frames forjados, todos os modelos caem e Patch-IV lidera com 77,15% de AUC.
Resumo
Avanços recentes em modelos de geração de vídeo intensificaram significativamente a ameaça de deepfakes, mas os benchmarks atuais de detecção de deepfakes em vídeo ainda estão subdesenvolvidos. Em particular, a eficácia de detectores em nível de imagem no domínio de vídeo não foi avaliada sistematicamente. Para preencher essa lacuna, apresentamos FakeI2V-Bench, um benchmark para avaliação de detectores de deepfake em vídeo de última geração em cenários desafiadores, com foco particular em avaliar sistematicamente o desempenho de detectores de deepfake em nível de imagem no domínio de vídeo. FakeI2V-Bench compreende 97.548 vídeos, contendo conteúdo gerado pelos modelos de geração mais recentes e poderosos, cobrindo uma gama mais ampla de categorias. Usando este conjunto de dados, conduzimos uma avaliação sistemática de oito detectores em nível de vídeo e doze detectores representativos em nível de imagem. Os resultados experimentais mostram que o detector em nível de imagem de melhor desempenho alcança um AUC de 80,16%, superando ligeiramente o detector de vídeo mais forte (isto é, 79,99% AUC). Indo além do benchmarking, apresentamos IV-Bridge, uma estrutura geral que aprimora a aplicabilidade de detectores de deepfake em nível de imagem para vídeos. IV-Bridge emprega um modelo de floresta aleatória com recursos estatísticos para agregar previsões em nível de quadro, permitindo que onze detectores em nível de imagem superem abordagens de vídeo de última geração, com a variante de melhor desempenho atingindo 93,80% de AUC. Em geral, FakeI2V-Bench estabelece um benchmark rigoroso para detecção de deepfakes em vídeo e introduz um novo caminho para estender detectores em nível de imagem para o domínio de vídeo, oferecendo novos insights e direções para pesquisas futuras. Código e dados estão disponíveis em https://github.com/CryptoAILab/FakeI2V-Bench.
Ponto de partida da pesquisa
Detectores de deepfake de imagens se beneficiam de pipelines de treinamento maduros, mas benchmarks de vídeo geralmente comparam apenas arquiteturas específicas de vídeo e aplicam modelos de frame com média simplista. Isso deixa as equipes inseguras sobre se redes temporais são necessárias, como geradores de vídeo recentes mudam o ranking e se um detector de imagem existente pode ser adaptado de forma econômica para vídeo. Manipulações esparsas, onde apenas uma fração dos frames é falsa, tornam a agregação ingênua especialmente arriscada.
Método
O benchmark combina 97.548 vídeos de quatro conjuntos de dados de geração facial e geral e avalia oito detectores de vídeo, além de doze detectores de imagem representativos. Os autores primeiro comparam agregações de pontuação fixas, como média, máximo e mínimo. O IV-Bridge então realiza fine-tuning de vídeo-frame em frames FF e GenVideo não sobrepostos e alimenta descritores estatísticos das pontuações em nível de frame para uma floresta aleatória com até 800 árvores e profundidade oito. Os resultados são detalhados por quatorze modelos de geração, conteúdo facial versus geral, custo de implementação e falsificação de curto prazo.
Síntese do artigo
Um detector de imagem existente pode se tornar um serviço de vídeo competitivo se for ajustado em frames de vídeo reais e emparelhado com agregação de pontuação temporal aprendida. A ponte é atraente para implementações leves, mas edições esparsas permanecem um modo claro de falha e o maior vencedor em acurácia não é o modelo mais barato.