← Voltar ao Blog
Radar de PesquisaDetecção de DeepfakeMídia ForensearXivSetembro de 2026

Radar Mensal do arXiv

Artigos de Detecção de Deepfake, setembro de 2026: Raciocínio Multiface, Falsos Alarmes em Smartphones e Aprendizado Contínuo

O trabalho deepfake mais forte de setembro foca no comportamento do sistema em vez de outra pontuação fechada. O IMFD pede que um modelo de linguagem de visão localice e classifique todos os rostos em uma única passagem com base em instruções. A LAION-Mobile audita os checkpoints originais do detector em conteúdo sintético moderno e quase um milhão de registros de fotos em smartphones, revelando desvios severos de calibração. O MSFD trata as atualizações do detector de vídeo como um problema de aprendizado contínuo e preserva evidências espaciais, temporais e conjuntas de frequência separadamente.

O que este mês sinaliza

A instrução consciente de coordenadas do IMFD eleva seu resultado em dois estágios no OpenForensics para 0,98 micro-F1, 0,98 macro-F1 e 0,94 de precisão exata; a versão de ponta a ponta de estágio único cai para 0,90, 0,84 e 0,77 porque a localização facial ainda propaga erros. A LAION-Mobile constata que nenhum dos doze detectores publicados ultrapassa 0,624 AUC em uma mistura moderna de IA e que limiares calibrados modernos sinalizam entre 17 e 91% das fotos autênticas de telefone; seu corpus, no entanto, mal cobre os atuais ISPs neurais principais. O MSFD atinge 93,02% de AUC médio com 2,29 pontos de esquecimento em seis conjuntos de dados de vídeo sequenciais, e 83,65% de precisão média com esquecimento negativo em um protocolo de poucos disparos. Juntos, os artigos defendem a avaliação de cena inteira, negativos atuais do dispositivo, propriedade explícita da calibração e testes de regressão após cada atualização do detector.

Artigo 012026-09-17cs.CV

IMFD: Detecção de Falsificações de Múltiplos Rostos de Ponta a Ponta com Grandes Modelos de Visão e Linguagem Baseados em Instruções

Autores e instituições

Dasom Choi

Chungnam National University

Sangjun Moon

Chungnam National University

Hyeongchan Im

Chungnam National University

Jaeeon Park

Institute of Science Tokyo

Jingun Kwon

Chungnam National University

Hidetaka Kamigaito

Nara Institute of Science and Technology

Taro Watanabe

Nara Institute of Science and Technology

Manabu Okumura

Institute of Science Tokyo

Que problema resolve

IMFD reformula a detecção de falsificação de múltiplos rostos como uma tarefa vision-language fundamentada em instrução que localiza rostos e atribui rótulos de autenticidade por rosto de forma conjunta. Ele testa se coordenadas explícitas dos rostos e o contexto da imagem ajudam um modelo grande de linguagem-visual a alinhar os índices dos rostos da esquerda para a direita com os outputs corretos.

Resultado-chave

Com coordenadas verdadeiras em todo o conjunto de teste, o IMFD alcança 0,98 de micro-F1, 0,98 de macro-F1 e 0,94 de precisão de correspondência exata; o subconjunto com mais rostos obtém 0,97, 0,98 e 0,87. No verdadeiro cenário de estágio único, essas métricas do conjunto completo caem para 0,90, 0,84 e 0,77, expondo a localização como o gargalo restante. A AP da caixa de rosto é 81,9 no conjunto completo e 83,6 no subconjunto com muitos rostos. Aumentar a resolução de entrada de 112 para 672 pixels eleva o micro-F1 controlado de 0,917 para 0,981 e a correspondência exata de 0,654 para 0,948. O IMFD supera os baselines comparados, mas é mais lento que o método de estágio único mais rápido e ainda depende de manipulações sintéticas de benchmark.

Resumo

O rápido aumento dos deepfakes levantou preocupações significativas devido à sua disseminação nas redes sociais. Detectores tradicionais de falsificação de múltiplos rostos recortam e verificam cada rosto de forma independente, ignorando o contexto do fundo e as relações entre os rostos, o que frequentemente resulta em desempenho subótimo. Para superar essas limitações, utilizamos Modelos de Linguagem-Visionais Grandes (LVLMs) baseados em instrução, que podem interpretar imagens inteiras e seguir instruções textuais complexas. Propomos um detector de falsificação de múltiplos rostos simples, porém eficaz, em estágio único, chamado IMFD (Instrution-based Multi-face Forgery Detector), que é treinado de ponta a ponta para localizar rostos e prever rótulos de falsificação por rosto simultaneamente. Em vez de tratar a predição da caixa do rosto apenas como um objetivo conjunto, o IMFD integra explicitamente as caixas de delimitação de rosto previstas na instrução como pistas visuais que melhoram o alinhamento da instrução e a detecção de falsificação. Para apoiar o treinamento e a avaliação do IMFD, convertemos conjuntos de dados existentes de falsificação de múltiplos rostos em um formato baseado em instrução. Resultados experimentais e análises mostram que o IMFD melhora a detecção de falsificação de múltiplos rostos ao integrar caixas de delimitação na instrução e supera consistentemente vários métodos de ponta.

Ponto de partida da pesquisa

Fotos com múltiplas pessoas quebram a suposição usual de recortar e classificar. Recortes de rostos independentes descartam o contexto da cena e entre rostos, exigem trabalho sequencial para cada pessoa e propagam erros do detector ou de ordenação para a decisão forense. Um sistema útil deve indicar quais rostos são falsos, não apenas se uma imagem contém alguma manipulação.

Método

O sistema converte amostras do OpenForensics em instruções nomeando rostos da esquerda para a direita. Uma etapa âncora baseada em CLIP pontua regiões candidatas, funde caixas que se sobrepõem e injeta as coordenadas previstas na instrução de texto juntamente com a representação da imagem. O LVLM então retorna os índices e caixas dos rostos falsificados. Os autores avaliam tanto um cenário controlado em duas etapas usando coordenadas verdadeiras quanto um cenário de estágio único de ponta a ponta usando caixas previstas pelo IMFD, reportando micro-F1, macro-F1, correspondência exata a nível de imagem, box AP, latência e throughput.

Síntese do artigo

O raciocínio com imagem inteira melhora a análise forense em cenas lotadas, mas a diferença entre caixas fornecidas e previstas é grande. Testes de aquisição devem avaliar decisões precisas por rosto e falhas de localização, não apenas a AUC no nível da imagem.

Artigo 022026-09-10cs.CV

LAION-Mobile: Avaliando Detectores de Deepfake em Um Milhão de Fotos de Smartphones

Autores e instituições

Achim von Stryk

Stralsund University, Germany

Janis Keuper

Institute for Machine Learning and Analytics, Offenburg University, Germany

Que problema resolve

O LAION-Mobile audita se os doze checkpoints originais de detectores generalizam para imagens modernas de IA e com que frequência geram falso-alarme em fotos autênticas de smartphones. Ele separa a discriminação independente de limiar da calibração de limiar e pergunta se a calibração de GAN legada cria uma imagem de implantação enganosa.

Resultado-chave

No NTIRE 2026, o melhor detector alcança apenas 0,624 de AUC; cinco de doze pontuam abaixo do acaso, e nenhum ultrapassa 13,5% de taxa de verdadeiros positivos com 5% de taxa de falsos positivos. Limiares calibrados de forma legada fazem vários sistemas parecerem utilizáveis com no máximo 11% de falsos positivos em fotos de telefone, mas a calibração moderna faz os mesmos detectores sinalizarem 17-91% de fotos autênticas. O UnivFD ilustra essa mudança: 0,2% se torna 39,1% nas mesmas imagens de celular. O corpus é dominado por dispositivos mais antigos e contém quase nenhum modelo atual de ponta, a autenticidade é inferida em vez de certificada por imagem, e o LAION-Mobile é apenas real, portanto não é possível fornecer um AUC de duas classes para telefones.

Resumo

A maioria dos detectores de deepfake reporta pontuações de AUC quase perfeitas em seus benchmarks de referência. No entanto, um artigo de posicionamento recente da ICML argumenta que essas avaliações negligenciam coletivamente o impacto da fotografia moderna em smartphones: os amplamente utilizados pipelines de processamento neural de sinais de imagem no dispositivo (como fusão de múltiplos sensores ou supressão de ruído e movimento borrado) alteram cada vez mais o paradigma de imagem de simples projeções de lente para fotografia computacional. Portanto, os dispositivos realmente geram, em vez de registrar, fotos. Isso aumenta o risco de que detectores de deepfake possam sinalizar fotos comuns de telefone como falsas. Devido à falta de grandes conjuntos de dados contendo imagens de smartphones modernos, essa hipótese até agora só foi testada em pequenos estudos de prova de conceito. O objetivo deste artigo é preencher essa lacuna. Nós apresentamos o LAION-Mobile, um conjunto de dados aberto contendo cerca de 1 milhão de imagens de smartphones com metadados EXIF extraídos do re-LAION-5B. Ao avaliar doze detectores de deepfake de ponta com seus checkpoints originais do artigo em uma amostra de avaliação de 9.115 imagens deste conjunto (DIRE em 738), relatamos três descobertas principais: (i) Em conteúdo moderno de IA, nenhum detector supera AUC 0,624, e cinco de doze ficam abaixo do acaso. (ii) Taxas de falso-alarme em fotos reais são um artefato da calibração de limiar: limiares ajustados em dados GAN legados fazem vários detectores parecerem implantáveis (menos de 11% de FPR), ainda assim os mesmos detectores sinalizam 17-91% das fotos reais quando o mesmo critério é reajustado no conteúdo moderno. (iii) Consequentemente, nenhum detector ao mesmo tempo supera o acaso no conteúdo moderno de IA e mantém uma taxa de falso-alarme em fotos reais implantável. Espelhando a mistura de dispositivos das coleções web, o corpus examina a primeira geração de ISP neural (2018-2020); os modelos atuais de ponta estão essencialmente ausentes, deixando o regime de ISP moderno como a lacuna aberta.

Ponto de partida da pesquisa

Detectores de deepfake publicados frequentemente se aproximam de AUC perfeita em seus próprios benchmarks, enquanto os smartphones modernos aplicam fusão HDR, redução de ruído, nitidez, supressão de movimento e outros processamentos de sinal de imagem aprendidos em fotos autênticas. Esses artefatos computacionais podem se assemelhar a impressões digitais de imagens geradas. Sem um grande corpus de fotos reais de telefone e um limiar calibrado em conteúdo sintético atual, um detector pode parecer seguro enquanto sinaliza fotografias comuns em uma taxa inviável.

Método

Os autores filtram o re-LAION-5B por heurísticas de EXIF de smartphones e não-foto para criar um conjunto de fotos reais de 935.399 imagens com metadados de dispositivos, depois avaliam uma amostra fixa de 9.115 imagens, exceto DIRE em 738 reconstruções caras. Doze detectores são primeiro verificados em relação a seus benchmarks originais ou no estilo ProGAN, depois avaliados na mistura moderna real/fake do NTIRE 2026. Limiar de erro igual ajustado separadamente no legado ProGAN-ISP e no moderno NTIRE é transferido para as mesmas fotos de telefone para expor o desvio de calibração.

Síntese do artigo

Um AUC quase perfeito em artigos não se transfere para conteúdo moderno, e a propriedade do limiar pode alterar os falsos positivos de fotos reais em ordens de magnitude. Cada implementação precisa de negativos de dispositivos atuais, um conjunto de calibração documentado e monitoramento da deriva do ponto de operação.

Artigo 032026-09-03cs.CV

Preservando Conhecimento ao Longo do Espaço e Tempo para Detecção Contínua de Deepfake em Vídeos

Autores e instituições

Taehoon Kim

Graduate School of Artificial Intelligence, Chung-Ang University

Jongwook Choi

Graduate School of Artificial Intelligence, Chung-Ang University

Heejae Jo

Department of Advanced Imaging, Graduate School of Advanced Imaging Science, Multimedia and Film, Chung-Ang University

Byungmin Park

Graduate School of Artificial Intelligence, Chung-Ang University

Jongwon Choi

Graduate School of Artificial Intelligence, Chung-Ang University

Department of Advanced Imaging, Graduate School of Advanced Imaging Science, Multimedia and Film, Chung-Ang University

Department of Metaverse Convergence, Chung-Ang University

Que problema resolve

O MSFD aborda o problema de estabilidade-plasticidade especificamente para a detecção de deepfake em vídeo. Ele preserva separadamente o conhecimento forense espacial, temporal e espácio-temporal enquanto atualiza o detector, e avalia sequências de dado completo, incremento de gerador e few-shot em vez de uma única divisão de treino-teste estática.

Resultado-chave

No protocolo de seis tarefas, o sistema completo atinge 93,02% de AUC média com 2,29 pontos de esquecimento médio, versus 89,84% e 6,81 para o baseline no estilo iCaRL. No protocolo incremental de gerador, atinge 96,67% de AUC média, incluindo 91,47% em falsificações de imagem para vídeo, com 1,37 de esquecimento. Sob apenas 25 vídeos reais e 25 falsos por nova tarefa, atinge 83,65% de acurácia média e -1,25 de esquecimento, indicando transferência retroativa positiva; o IDER esquece menos, com -2,10, mas apresenta acurácia ligeiramente menor, de 83,47%. Ablations mostram que todos os três ramos de frequência superam uma única representação não dividida. O método ainda mostra um aumento de esquecimento após a tarefa predominantemente asiática KoDF, sinalizando uma mudança de domínio e demográfica não resolvida.

Resumo

O surgimento contínuo de deepfakes em vídeo de alta qualidade exige detectores que se adaptem continuamente a novos padrões de falsificação, mas abordagens existentes, projetadas para imagens deepfake, falham em capturar sinais específicos de vídeo. Ao contrário de imagens deepfake que contêm apenas artefatos espaciais, vídeos deepfake deixam evidências distintas tanto nos eixos espacial quanto temporal, exigindo a preservação separada de cada modalidade durante atualizações sequenciais do modelo. Para superar essa limitação, introduzimos um framework contínuo de detecção de deepfakes em vídeo, Distilação de Frequência Específica de Modalidade (MSFD), que decompõe explicitamente os recursos do vídeo em modalidades espaciais, temporais e espácio-temporais no domínio de frequência. Essa decomposição permite a preservação independente de cada modalidade, já que diferentes tipos de vídeos deepfake exibem dependendo dos sinais espaciais e temporais para diferentes tarefas. Além disso, o MSFD adota uma perda de descorrelação cruzada de modalidade que incentiva as representações espácio-temporais a permanecer ortogonais aos sinais de uma única modalidade. Experimentos extensivos mostram que nosso framework alcança adaptação mais forte e preserva o desempenho de forma mais eficaz do que métodos de ponta em diversos cenários contínuos de deepfake em vídeo.

Ponto de partida da pesquisa

Tipos de falsificação de vídeo surgem sequencialmente após a implementação, então um detector deve aprender novos geradores sem apagar evidências antigas. Métodos contínuos herdados da classificação de imagens tendem a preservar uma representação entrelaçada, mesmo que vídeos deepfake deixem diferentes misturas de limites espaciais, inconsistências temporais e artefatos combinados espaço-tempo. Uma pontuação baixa de esquecimento também não é útil se o sistema se recusar a se adaptar à nova tarefa.

Método

As características intermediárias do vídeo são transformadas em representações de frequência espacial 2D, temporal 1D e espaciotemporal conjunta. A Destilação de Frequência Específica de Modalidade alinha cada espectro com o modelo anterior durante as atualizações sequenciais. Um adaptador específico de modalidade repondera os canais e aprende máscaras Gumbel-Softmax para bandas de frequência relevantes para a tarefa, enquanto uma perda de decorrelação evita que o ramo conjunto duplique os sinais de modalidade única. Exemplos de replay e a mesma arquitetura 3D ResNet-18 são usados para a maioria das comparações de baseline em seis conjuntos de dados de vídeos deepfake.

Síntese do artigo

Separar a memória forense espacial e temporal melhora as atualizações do detector, especialmente com poucos dados novos. O deslocamento restante do KoDF é um lembrete para testar a regressão de ambas as famílias de geradores e domínios de população após cada lançamento de aprendizado contínuo.