IMFD: Detecção de Falsificações de Múltiplos Rostos de Ponta a Ponta com Grandes Modelos de Visão e Linguagem Baseados em Instruções
Autores e instituições
Dasom Choi
Chungnam National University
Sangjun Moon
Chungnam National University
Hyeongchan Im
Chungnam National University
Jaeeon Park
Institute of Science Tokyo
Jingun Kwon
Chungnam National University
Hidetaka Kamigaito
Nara Institute of Science and Technology
Taro Watanabe
Nara Institute of Science and Technology
Manabu Okumura
Institute of Science Tokyo
Que problema resolve
IMFD reformula a detecção de falsificação de múltiplos rostos como uma tarefa vision-language fundamentada em instrução que localiza rostos e atribui rótulos de autenticidade por rosto de forma conjunta. Ele testa se coordenadas explícitas dos rostos e o contexto da imagem ajudam um modelo grande de linguagem-visual a alinhar os índices dos rostos da esquerda para a direita com os outputs corretos.
Resultado-chave
Com coordenadas verdadeiras em todo o conjunto de teste, o IMFD alcança 0,98 de micro-F1, 0,98 de macro-F1 e 0,94 de precisão de correspondência exata; o subconjunto com mais rostos obtém 0,97, 0,98 e 0,87. No verdadeiro cenário de estágio único, essas métricas do conjunto completo caem para 0,90, 0,84 e 0,77, expondo a localização como o gargalo restante. A AP da caixa de rosto é 81,9 no conjunto completo e 83,6 no subconjunto com muitos rostos. Aumentar a resolução de entrada de 112 para 672 pixels eleva o micro-F1 controlado de 0,917 para 0,981 e a correspondência exata de 0,654 para 0,948. O IMFD supera os baselines comparados, mas é mais lento que o método de estágio único mais rápido e ainda depende de manipulações sintéticas de benchmark.
Resumo
O rápido aumento dos deepfakes levantou preocupações significativas devido à sua disseminação nas redes sociais. Detectores tradicionais de falsificação de múltiplos rostos recortam e verificam cada rosto de forma independente, ignorando o contexto do fundo e as relações entre os rostos, o que frequentemente resulta em desempenho subótimo. Para superar essas limitações, utilizamos Modelos de Linguagem-Visionais Grandes (LVLMs) baseados em instrução, que podem interpretar imagens inteiras e seguir instruções textuais complexas. Propomos um detector de falsificação de múltiplos rostos simples, porém eficaz, em estágio único, chamado IMFD (Instrution-based Multi-face Forgery Detector), que é treinado de ponta a ponta para localizar rostos e prever rótulos de falsificação por rosto simultaneamente. Em vez de tratar a predição da caixa do rosto apenas como um objetivo conjunto, o IMFD integra explicitamente as caixas de delimitação de rosto previstas na instrução como pistas visuais que melhoram o alinhamento da instrução e a detecção de falsificação. Para apoiar o treinamento e a avaliação do IMFD, convertemos conjuntos de dados existentes de falsificação de múltiplos rostos em um formato baseado em instrução. Resultados experimentais e análises mostram que o IMFD melhora a detecção de falsificação de múltiplos rostos ao integrar caixas de delimitação na instrução e supera consistentemente vários métodos de ponta.
Ponto de partida da pesquisa
Fotos com múltiplas pessoas quebram a suposição usual de recortar e classificar. Recortes de rostos independentes descartam o contexto da cena e entre rostos, exigem trabalho sequencial para cada pessoa e propagam erros do detector ou de ordenação para a decisão forense. Um sistema útil deve indicar quais rostos são falsos, não apenas se uma imagem contém alguma manipulação.
Método
O sistema converte amostras do OpenForensics em instruções nomeando rostos da esquerda para a direita. Uma etapa âncora baseada em CLIP pontua regiões candidatas, funde caixas que se sobrepõem e injeta as coordenadas previstas na instrução de texto juntamente com a representação da imagem. O LVLM então retorna os índices e caixas dos rostos falsificados. Os autores avaliam tanto um cenário controlado em duas etapas usando coordenadas verdadeiras quanto um cenário de estágio único de ponta a ponta usando caixas previstas pelo IMFD, reportando micro-F1, macro-F1, correspondência exata a nível de imagem, box AP, latência e throughput.
Síntese do artigo
O raciocínio com imagem inteira melhora a análise forense em cenas lotadas, mas a diferença entre caixas fornecidas e previstas é grande. Testes de aquisição devem avaliar decisões precisas por rosto e falhas de localização, não apenas a AUC no nível da imagem.