IMFD: Detección de Falsificación Multi-Rostro de Extremo a Extremo mediante Modelos de Visión y Lenguaje de Gran Tamaño Basados en Instrucciones
Autores e instituciones
Dasom Choi
Chungnam National University
Sangjun Moon
Chungnam National University
Hyeongchan Im
Chungnam National University
Jaeeon Park
Institute of Science Tokyo
Jingun Kwon
Chungnam National University
Hidetaka Kamigaito
Nara Institute of Science and Technology
Taro Watanabe
Nara Institute of Science and Technology
Manabu Okumura
Institute of Science Tokyo
Qué problema resuelve
IMFD reformula la detección de falsificación multi-rostro como una tarea de visión y lenguaje basada en instrucciones que localiza rostros de manera conjunta y asigna etiquetas de autenticidad por rostro. Prueba si las coordenadas explícitas de los rostros y el contexto de la imagen ayudan a un modelo de visión y lenguaje de gran tamaño a alinear los índices de los rostros de izquierda a derecha con las salidas correctas.
Resultado clave
Con coordenadas de verdad terreno en el conjunto completo de prueba, IMFD alcanza 0.98 micro-F1, 0.98 macro-F1 y 0.94 de exactitud en coincidencia exacta; el subconjunto con más rostros obtiene 0.97, 0.98 y 0.87. En el escenario verdaderamente de etapa única, esas métricas del conjunto completo caen a 0.90, 0.84 y 0.77, exponiendo la localización como el cuello de botella restante. El AP de las cajas de rostros es 81.9 en el conjunto completo y 83.6 en el subconjunto con muchos rostros. Aumentar la resolución de entrada de 112 a 672 píxeles incrementa el micro-F1 controlado de 0.917 a 0.981 y la coincidencia exacta de 0.654 a 0.948. IMFD supera a las líneas base comparadas, pero es más lento que el método de etapa única más rápido y aún depende de manipulaciones sintéticas de referencia.
Resumen
El rápido aumento de los deepfakes ha generado preocupaciones significativas debido a su propagación en las redes sociales. Los detectores tradicionales de falsificación multi-rostro recortan y verifican cada rostro de manera independiente, ignorando el contexto del fondo y las relaciones entre los rostros, lo que a menudo produce un rendimiento subóptimo. Para superar estas limitaciones, aprovechamos los Modelos de Visión y Lenguaje de Gran Tamaño basados en instrucciones (LVLMs), que pueden interpretar imágenes completas y seguir instrucciones textuales complejas. Proponemos un detector de falsificación multi-rostro de etapa única, simple pero efectivo, llamado IMFD (Instruction-based Multi-face Forgery Detector), que se entrena de extremo a extremo para localizar rostros y predecir etiquetas de falsificación por rostro de manera conjunta. En lugar de tratar la predicción de las cajas de los rostros solo como un objetivo conjunto, IMFD integra explícitamente las cajas predichas en la instrucción como señales visuales que mejoran la interpretación de las instrucciones y la detección de falsificaciones. Para apoyar el entrenamiento y la evaluación de IMFD, convertimos los conjuntos de datos existentes de falsificación multi-rostro a un formato basado en instrucciones. Los resultados experimentales y los análisis muestran que IMFD mejora la detección de falsificaciones multi-rostro al integrar las cajas de los rostros en la instrucción y supera consistentemente varios métodos de última generación.
Punto de partida
Las fotos con varias personas rompen la suposición habitual de recortar y luego clasificar. Los recortes de rostros independientes descartan el contexto de la escena y entre rostros, requieren trabajo secuencial para cada persona y propagan errores del detector o de orden en la decisión forense. Un sistema útil debe indicar qué rostros son falsos, no simplemente si una imagen contiene alguna manipulación.
Método
El sistema convierte las muestras de OpenForensics en instrucciones que nombran los rostros de izquierda a derecha. Una etapa ancla basada en CLIP puntúa regiones candidatas, fusiona cajas superpuestas e inyecta las coordenadas predichas en la instrucción de texto junto con la representación de la imagen. El LVLM luego devuelve los índices de los rostros falsificados y las cajas. Los autores evalúan tanto un escenario controlado de dos etapas utilizando coordenadas de verdad terreno como un escenario de etapa única de extremo a extremo usando las cajas predichas por IMFD, reportando micro-F1, macro-F1, coincidencia exacta a nivel de imagen, AP de cajas, latencia y rendimiento.
Conclusión del artículo
El razonamiento de imagen completa mejora la forense de escenas saturadas, pero la diferencia entre las cajas suministradas y las predichas es grande. Las pruebas de adquisiciones deberían puntuar decisiones exactas por cara y fallos de localización, no solo AUC a nivel de imagen.