LaP-Forensics: Razonamiento multimodal guiado por la consistencia de píxeles latentes para la detección de deepfakes
Autores e instituciones
Can Wang
The Hong Kong Polytechnic University, Hong Kong, China
Yuhao Wang
University College London, United Kingdom
Yushe Cao
Tsinghua University, China
Canran Xiao
Sun Yat-sen University, China
Fei Shen
National University of Singapore, Singapore
Qué problema resuelve
LaP-Forensics aborda la detección de imágenes de diferentes generadores y la localización de artefactos a nivel de píxel mediante una referencia de compatibilidad explícita. Su objetivo es que el razonamiento estructurado de dónde, qué y por qué consulte dicha evidencia, reconociendo al mismo tiempo que el uso de referencias no demuestra por sí solo cada afirmación en una explicación libre.
Resultado clave
En UniversalFakeDetect, el cabezal de imagen alcanza una precisión del 97,23 % en GANs, del 71,30 % en Deepfakes, del 92,18 % en Difusión y del 98,98 % en CRN. Bajo el protocolo oficial SynthScars, la localización de artefactos humanos alcanza un mIoU de 61,40 y un F1 de 66,00. En la división controlada, la eliminación del residuo reduce el mIoU de 72,19 a 61,83 y el F1 de 63,62 a 41,71; reemplazar el residuo con cero o un mapa donante también modifica sustancialmente el resultado.
Resumen
Los modelos generativos recientes pueden producir imágenes con pocos artefactos visuales obvios, debilitando los detectores y las explicaciones que se basan únicamente en la apariencia superficial. Presentamos LaP-Forensics, un marco multimodal que aumenta la semántica RGB con evidencia forense basada en reconstrucción. Un modelo de inversión-reconstrucción de difusión estable DDIM congelado proporciona una referencia de reconstrucción fija, y su mapa residual mide la compatibilidad local con esa referencia. Proyectores independientes codifican la imagen RGB y el mapa residual antes de que un modelo estructurado de Dónde-Qué-Por qué prediga un análisis textual y una máscara de artefacto. El ajuste fino supervisado es seguido por la Optimización de Política Relativa de Grupo (GRPO), cuya recompensa combina la superposición de máscaras con términos de estructura de salida y referencia de evidencia. Estos términos del lado del texto animan al modelo a referirse al mapa de consistencia, pero no constituyen un verificador de la verdad textual de forma libre. Un cabezal separado a nivel de imagen fusiona las características de clase RGB y DDIM-residual. Los experimentos muestran detección entre generadores en UniversalFakeDetect y localización competitiva de artefactos en el benchmark oficial SynthScars. Los análisis de construcción controlada de señales, horizonte de inversión, componentes, términos de recompensa y contrafactuales respaldan la utilidad del flujo residual en las configuraciones evaluadas, mientras que la fidelidad y confiabilidad textual de formato libre bajo el posprocesamiento siguen siendo limitaciones abiertas.
Punto de partida
A medida que las imágenes generadas pierden los defectos superficiales evidentes, un detector basado únicamente en RGB o una explicación en lenguaje visual pueden resultar convincentes sin aportar pruebas forenses sólidas. Para la revisión empresarial, un sistema útil debería separar la puntuación de detección, la localización espacial y la descripción textual, mostrando qué señal adicional modifica realmente el resultado.
Método
Un proceso de inversión-reconstrucción DDIM de difusión estable congelada produce un mapa residual entre la entrada y la reconstrucción. Proyectores separados codifican la semántica RGB y la evidencia residual; una rama multimodal genera texto estructurado y una máscara, mientras que un cabezal de imagen independiente fusiona características de clase para la detección. El ajuste fino supervisado va seguido de recompensas GRPO para la superposición de máscaras, el formato de salida y las referencias de evidencia, con pruebas de referencia oficiales separadas de una división de ablación controlada más pequeña.
Conclusión del artículo
El residuo de reconstrucción constituye un segundo canal forense útil que mejora la localización de forma significativa, pero no es un mapa de manipulación calibrado ni una señal de atribución de origen. Los equipos deben valorar la clara separación entre detección, localización y explicación, y posteriormente evaluar de forma independiente la robustez del posprocesamiento y la fidelidad textual antes de utilizar la justificación generada en los flujos de trabajo de revisión.