← Volver al Blog
Radar de investigaciónDetección de deepfakesAnálisis forense facialarXivJulio de 2026

Radar mensual de arXiv

Artículos sobre detección de deepfakes de julio de 2026: evidencia de reconstrucción, fisiología facial y reproducción compacta.

Los artículos sobre deepfake publicados en julio abordan tres debilidades que surgen cuando un detector abandona un punto de referencia estático: las explicaciones pueden carecer de fundamento, los generadores de rostros parlantes pueden eludir los clasificadores de artefactos y las actualizaciones continuas pueden olvidar familias de manipulación anteriores. Los métodos seleccionados introducen un residuo de reconstrucción explícito, un canal de vídeo fisiológico y un búfer de reproducción con gran cantidad de información.

Lo que señala este mes

LaP-Forensics basa la localización y las explicaciones estructuradas en un residuo de reconstrucción por difusión, pero evita correctamente afirmar que su texto de formato libre está verificado. El estudio rPPG muestra que la dificultad de detección de rostros parlantes varía drásticamente según el generador, incluso cuando el clasificador y el protocolo permanecen fijos. InfoDense aborda el problema operativo de actualizar un detector sin almacenar imágenes faciales históricas completas. En los tres casos, la señal más fuerte no es un artefacto universal: la fiabilidad proviene de combinar evidencia complementaria, aislar los protocolos de evaluación y preservar las pistas relevantes cuando las distribuciones evolucionan.

Artículo 012026-07-28cs.CV

LaP-Forensics: Razonamiento multimodal guiado por la consistencia de píxeles latentes para la detección de deepfakes

Autores e instituciones

Can Wang

The Hong Kong Polytechnic University, Hong Kong, China

Yuhao Wang

University College London, United Kingdom

Yushe Cao

Tsinghua University, China

Canran Xiao

Sun Yat-sen University, China

Fei Shen

National University of Singapore, Singapore

Qué problema resuelve

LaP-Forensics aborda la detección de imágenes de diferentes generadores y la localización de artefactos a nivel de píxel mediante una referencia de compatibilidad explícita. Su objetivo es que el razonamiento estructurado de dónde, qué y por qué consulte dicha evidencia, reconociendo al mismo tiempo que el uso de referencias no demuestra por sí solo cada afirmación en una explicación libre.

Resultado clave

En UniversalFakeDetect, el cabezal de imagen alcanza una precisión del 97,23 % en GANs, del 71,30 % en Deepfakes, del 92,18 % en Difusión y del 98,98 % en CRN. Bajo el protocolo oficial SynthScars, la localización de artefactos humanos alcanza un mIoU de 61,40 y un F1 de 66,00. En la división controlada, la eliminación del residuo reduce el mIoU de 72,19 a 61,83 y el F1 de 63,62 a 41,71; reemplazar el residuo con cero o un mapa donante también modifica sustancialmente el resultado.

Resumen

Los modelos generativos recientes pueden producir imágenes con pocos artefactos visuales obvios, debilitando los detectores y las explicaciones que se basan únicamente en la apariencia superficial. Presentamos LaP-Forensics, un marco multimodal que aumenta la semántica RGB con evidencia forense basada en reconstrucción. Un modelo de inversión-reconstrucción de difusión estable DDIM congelado proporciona una referencia de reconstrucción fija, y su mapa residual mide la compatibilidad local con esa referencia. Proyectores independientes codifican la imagen RGB y el mapa residual antes de que un modelo estructurado de Dónde-Qué-Por qué prediga un análisis textual y una máscara de artefacto. El ajuste fino supervisado es seguido por la Optimización de Política Relativa de Grupo (GRPO), cuya recompensa combina la superposición de máscaras con términos de estructura de salida y referencia de evidencia. Estos términos del lado del texto animan al modelo a referirse al mapa de consistencia, pero no constituyen un verificador de la verdad textual de forma libre. Un cabezal separado a nivel de imagen fusiona las características de clase RGB y DDIM-residual. Los experimentos muestran detección entre generadores en UniversalFakeDetect y localización competitiva de artefactos en el benchmark oficial SynthScars. Los análisis de construcción controlada de señales, horizonte de inversión, componentes, términos de recompensa y contrafactuales respaldan la utilidad del flujo residual en las configuraciones evaluadas, mientras que la fidelidad y confiabilidad textual de formato libre bajo el posprocesamiento siguen siendo limitaciones abiertas.

Punto de partida

A medida que las imágenes generadas pierden los defectos superficiales evidentes, un detector basado únicamente en RGB o una explicación en lenguaje visual pueden resultar convincentes sin aportar pruebas forenses sólidas. Para la revisión empresarial, un sistema útil debería separar la puntuación de detección, la localización espacial y la descripción textual, mostrando qué señal adicional modifica realmente el resultado.

Método

Un proceso de inversión-reconstrucción DDIM de difusión estable congelada produce un mapa residual entre la entrada y la reconstrucción. Proyectores separados codifican la semántica RGB y la evidencia residual; una rama multimodal genera texto estructurado y una máscara, mientras que un cabezal de imagen independiente fusiona características de clase para la detección. El ajuste fino supervisado va seguido de recompensas GRPO para la superposición de máscaras, el formato de salida y las referencias de evidencia, con pruebas de referencia oficiales separadas de una división de ablación controlada más pequeña.

Conclusión del artículo

El residuo de reconstrucción constituye un segundo canal forense útil que mejora la localización de forma significativa, pero no es un mapa de manipulación calibrado ni una señal de atribución de origen. Los equipos deben valorar la clara separación entre detección, localización y explicación, y posteriormente evaluar de forma independiente la robustez del posprocesamiento y la fidelidad textual antes de utilizar la justificación generada en los flujos de trabajo de revisión.

Artículo 022026-07-23cs.LG

Señales fisiológicas como método forense para la detección de deepfakes con rostros parlantes.

Autores e instituciones

Othmane Harraq

Temple University, Philadelphia, Pennsylvania, USA

Tamer Aldwairi

Temple University, Philadelphia, Pennsylvania, USA

Qué problema resuelve

El artículo analiza si la fotopletismografía remota proporciona información más útil para detectar falsificaciones de rostros parlantes y si el rendimiento se mantiene fiable cuando no se incluye ninguna identidad de prueba en el entrenamiento. Además, mide la dificultad del detector por separado para siete métodos de generación, en lugar de ocultar esa variación en una puntuación global.

Resultado clave

La red ResNet 1D de 165K parámetros alcanza un AUC de 0,806 +/- 0,003 y un EER del 27,8%, frente a un AUC de 0,622 para el detector rPPG anterior reproducido y 0,830 para el modelo Effort de propósito general citado. El AUC por generador varía de 0,985 para Real3DPortrait a 0,690 para IP-LAP, con una dispersión estable de 0,295 que es mucho mayor que la varianza de la semilla.

Resumen

La generación de deepfakes de rostro parlante (TF) sintetiza vídeo facial fotorrealista a partir de una imagen estática y una señal de audio, produciendo falsificaciones que los detectores actuales basados ​​en imágenes no logran identificar. A diferencia de la manipulación de intercambio de rostros, la síntesis TF no tiene un vídeo real subyacente del que heredar características fisiológicas, lo que convierte a la fotopletismografía remota (rPPG) en una modalidad de detección especialmente útil para esta categoría de falsificaciones. Proponemos un marco de detección que extrae las formas de onda rPPG de cada vídeo mediante RhythmFormer y entrena un conjunto de clasificadores ligeros para distinguir las señales fisiológicas reales de las sintetizadas. Evaluado en el subconjunto TF de Celeb-DF++ bajo un protocolo estricto independiente del sujeto, donde las identidades de prueba están completamente separadas de las identidades de entrenamiento, nuestro ResNet 1D logra un AUC de 0,806 y un EER de 27,8 %, lo que lo sitúa dentro de 2,4 puntos del mejor detector de propósito general publicado (Effort, ICML 2025) mientras opera exclusivamente en el canal fisiológico. Documentamos un estudio de reproducción controlada de DeepFakesON-Phys, el detector rPPG anterior representativo, que demuestra una degradación de AUC 0,999 en datos heredados de intercambio de caras a 0,622 en el subconjunto TF de Celeb-DF++. Además, demostramos que la dificultad de detección depende en gran medida del método: el AUC varía de 0,985 (Real3DPortrait) a 0,690 (IP-LAP) en los siete generadores TF, y la clasificación se mantiene perfectamente estable en todos los protocolos de evaluación. Esta dispersión refleja una propiedad fisiológica interpretable de cada generador, más que ruido de evaluación, y constituye la principal contribución teórica de este trabajo.

Punto de partida

Los generadores de rostros parlantes sintetizan un video completo a partir de una imagen fija y audio, por lo que es posible que no conserven una señal real de volumen sanguíneo temporal. Los detectores rPPG existentes se validaron principalmente con intercambios de rostros antiguos, donde la fisiología subyacente del video original puede sobrevivir y donde la fuga de identidad entre las divisiones puede inflar los resultados.

Método

RhythmFormer extrae una forma de onda de cada vídeo facial, tras lo cual clasificadores ResNet y Transformer unidimensionales ligeros distinguen la fisiología real de la sintética. El subconjunto de rostros parlantes Celeb-DF++ se divide según la identidad de la celebridad, reservándose 18 identidades para su evaluación. Los autores reproducen DeepFakesON-Phys con la misma configuración y realizan análisis agregados de cinco semillas y por generador.

Conclusión del artículo

La fisiología facial es un canal complementario e interpretable, más que una respuesta independiente. Se asemeja a un detector visual más amplio con muy pocos parámetros, pero algunos generadores conservan las señales pseudoperiódicas lo suficientemente bien como para aproximarse al azar; los sistemas de producción deberían fusionar la rPPG con evidencia espacial, de frecuencia y audiovisual, y validarla entre diferentes identidades y generadores.

Artículo 032026-07-18cs.CV

InfoDense: Reproducción regional decisiva con conciencia de la densidad para la detección incremental y eficiente de falsificaciones faciales mediante memoria.

Autores e instituciones

Jikang Cheng

Peking University, China

Hao Shen

Huazhong Agricultural University, China

Xueyi Zhang

National University of Singapore, Singapore

Guangcheng Wang

Nantong University, China

Zhongyuan Wang

Wuhan University, China

Renye Yan

Peking University, China

Baojin Huang

Huazhong Agricultural University, China

Qué problema resuelve

InfoDense replantea la reproducción como un problema de densidad de información: conservar regiones compactas que contengan evidencia de manipulación, seleccionar un conjunto diverso de esas regiones y combinarlas con muestras de la tarea actual sin introducir el sesgo de dominio asociado con un búfer de imágenes completas antiguas.

Resultado clave

Según el protocolo principal, InfoDense reporta un AUC promedio del 90,42 % en conjuntos de datos incrementales con una caída de rendimiento de 4,52 puntos y un AUC promedio entre conjuntos de datos del 90,03 %. El artículo reporta un rendimiento comparable tras una reducción del 80 % en el almacenamiento y hasta diez veces la diversidad de reproducción con el mismo almacenamiento. Los fragmentos almacenados también reducen la recuperación de identidad a menos del 0,02 % en el análisis de privacidad reportado.

Resumen

La rápida evolución de las técnicas de falsificación facial ha introducido una creciente variedad de manipulaciones. La detección incremental de falsificación facial (IFFD), que añade incrementalmente nuevos datos de falsificación para ajustar modelos previamente entrenados, ha surgido como un enfoque prometedor para abordar las amenazas de falsificación en constante evolución. Sin embargo, los métodos IFFD convencionales basados ​​en la reproducción sufren de olvido catastrófico. Almacenar imágenes históricas completas con memoria limitada a menudo no logra preservar las sutiles pistas de falsificación o introduce un sesgo de dominio, lo que reduce la capacidad del modelo para aprender características de manipulación intrínsecas y transferibles. En este artículo, proponemos una estrategia de reproducción regional decisiva con conciencia de la densidad, denominada InfoDense, para abordar estos desafíos. InfoDense prioriza las regiones con alta densidad de artefactos y críticas para la falsificación, reduciendo significativamente los requisitos de almacenamiento al tiempo que mantiene evidencia de falsificación de alta fidelidad. Primero introducimos InfoDense Cut para localizar parches decisivos utilizando incrustaciones basadas en CLIP. A continuación, InfoDense Select clasifica los segmentos candidatos combinando la representatividad del espacio latente y el número de parches decisivos, lo que garantiza tanto la diversidad como la densidad de información en el búfer de reproducción. Finalmente, InfoDense Fuse reconstruye entradas de entrenamiento imparciales fusionando de forma adaptativa los segmentos almacenados con las muestras de la tarea actual, lo que mejora la retención del conocimiento y la generalización. Numerosos experimentos realizados con exigentes conjuntos de datos de referencia incrementales para deepfakes demuestran que InfoDense mitiga eficazmente el olvido catastrófico a la vez que mejora la generalización entre dominios.

Punto de partida

Los detectores de deepfakes necesitan actualizaciones frecuentes a medida que aparecen nuevas familias de manipulación, pero reproducir imágenes faciales históricas completas consume memoria, conserva contenido identificable y aún puede ocupar la mayor parte del búfer con el fondo o la estructura facial redundante. Con un presupuesto de almacenamiento fijo, un detector debe preservar las sutiles pistas de falsificación sin olvidar las tareas anteriores.

Método

InfoDense Cut utiliza incrustaciones de parches CLIP y texto relacionado con la falsificación para puntuar las regiones decisivas. InfoDense Select clasifica los segmentos candidatos según su representatividad en el espacio latente y el número de parches decisivos. InfoDense Fuse reconstruye las entradas de entrenamiento combinando segmentos históricos almacenados con muestras actuales, lo que aumenta el número de imágenes de origen representadas con el mismo presupuesto de memoria. La evaluación sigue secuencias de falsificación incrementales y pruebas independientes entre conjuntos de datos.

Conclusión del artículo

La reproducción a nivel regional resulta atractiva para un detector que debe aprender continuamente bajo restricciones de almacenamiento o privacidad. Su utilidad depende de si los parches seleccionados conservan su carácter informativo tras la compresión real, los cambios de política y el posprocesamiento adversario, pero ofrece una alternativa concreta a la conservación de rostros históricos completos.