← Назад в Блог
Исследовательский радарОбнаружение дипфейковКриминалистическая экспертиза лицаarXivИюль 2026 г.

Ежемесячный радар arXiv

Июль 2026 г. Статьи по обнаружению дипфейков: доказательства реконструкции, физиология лица и компактное воспроизведение

В июльских статьях, посвященных дипфейкам, рассматриваются три недостатка, возникающие после того, как детектор покидает статичный эталон: объяснения могут быть необоснованными, генераторы говорящих лиц могут обходить классификаторы артефактов, а постоянные обновления могут забывать о более ранних семействах манипуляций. Выбранные методы вводят явный остаток реконструкции, физиологический видеоканал и информационно насыщенный буфер воспроизведения.

Что показывает этот месяц

LaP-Forensics основывает локализацию и структурированные объяснения на остаточном эффекте диффузионной реконструкции, но справедливо избегает утверждения о том, что его текст в свободной форме подтвержден фактами. Исследование rPPG показывает, что сложность обнаружения говорящих лиц значительно варьируется в зависимости от генератора, даже когда классификатор и протокол остаются неизменными. InfoDense решает операционную проблему обновления детектора без хранения полных исторических изображений лиц. Во всех трех случаях самый сильный сигнал не является универсальным артефактом: надежность достигается за счет объединения взаимодополняющих доказательств, изоляции протоколов оценки и сохранения важных признаков при эволюции распределений.

Статья 012026-07-28cs.CV

LaP-Forensics: многомодальный подход к обнаружению дипфейков, основанный на согласованности скрытых пикселей.

Авторы и организации

Can Wang

The Hong Kong Polytechnic University, Hong Kong, China

Yuhao Wang

University College London, United Kingdom

Yushe Cao

Tsinghua University, China

Canran Xiao

Sun Yat-sen University, China

Fei Shen

National University of Singapore, Singapore

Какую задачу решает

LaP-Forensics решает задачу обнаружения изображений, полученных от разных источников, и локализации артефактов на уровне пикселей с помощью явной ссылки на совместимость. Его цель — заставить структурированное рассуждение типа «где-что-почему» опираться на эти доказательства, признавая при этом, что использование ссылки само по себе не доказывает каждое предложение в свободном объяснении.

Ключевой результат

На UniversalFakeDetect точность определения местоположения по изображению достигает 97,23% на GAN, 71,30% на Deepfakes, 92,18% на Diffusion и 98,98% на CRN. В рамках официального протокола SynthScars локализация артефактов, связанных с человеком, достигает 61,40 mIoU и 66,00 F1. В контролируемом разделении удаление остаточного значения снижает mIoU с 72,19 до 61,83 и F1 с 63,62 до 41,71; замена остаточного значения на ноль или карту-донор также существенно сдвигает выходные данные.

Аннотация

Современные генеративные модели могут создавать изображения с небольшим количеством очевидных визуальных артефактов, ослабляя детекторы и объяснения, основанные только на внешнем виде. Мы представляем LaP-Forensics, многомодальную структуру, которая дополняет семантику RGB криминалистическими доказательствами, основанными на реконструкции. Замороженная модель инверсии-реконструкции Stable Diffusion DDIM обеспечивает фиксированную эталонную реконструкцию, а ее остаточная карта измеряет локальную совместимость с этой эталонной моделью. Независимые проекторы кодируют изображение RGB и остаточную карту, после чего структурированная модель «Где-Что-Почему» предсказывает текстовый анализ и маску артефактов. За контролируемой тонкой настройкой следует групповая относительная оптимизация политики (GRPO), награда которой объединяет перекрытие маски с терминами структуры выходных данных и эталонными терминами доказательств. Эти термины на стороне текста побуждают модель ссылаться на карту согласованности, но не являются верификатором текстовой истины в свободной форме. Отдельный блок на уровне изображения объединяет признаки классов RGB и остаточных классов DDIM. Эксперименты показывают возможность обнаружения артефактов разными генераторами на UniversalFakeDetect и конкурентную локализацию артефактов на официальном бенчмарке SynthScars. Контролируемое построение подсказок, анализ горизонта инверсии, компонентный анализ, анализ терминов вознаграждения и контрфактический анализ подтверждают полезность остаточного потока в оцениваемых условиях, в то время как точность и надежность в отношении свободной текстовой формы при постобработке остаются открытыми ограничениями.

Отправная точка исследования

Поскольку на сгенерированных изображениях теряются очевидные дефекты поверхности, детектор, использующий только RGB-изображения, или объяснение на основе визуального языка могут звучать убедительно, не указывая на достоверные криминалистические доказательства. Для корпоративного анализа полезная система должна разделять оценку обнаружения, пространственную локализацию и текстовое описание, показывая при этом, какой дополнительный сигнал фактически изменяет результат.

Метод

Процесс инверсной реконструкции с использованием замороженной стабильной диффузии DDIM создает остаточную карту между входными данными и реконструкцией. Отдельные проекторы кодируют семантику RGB и остаточные данные; многомодальная ветвь генерирует структурированный текст и маску, а отдельный блок обработки изображений объединяет признаки классов для обнаружения. После контролируемой тонкой настройки следует вознаграждение GRPO за перекрытие маски, формат выходных данных и ссылки на данные, при этом официальные эталонные тесты проводятся отдельно от меньшего контролируемого разделения.

Вывод по статье

Остаточный результат реконструкции является полезным вторым каналом криминалистической экспертизы и заметно улучшает локализацию, но это не калиброванная карта манипуляций и не сигнал для определения источника. Командам следует ценить четкое разделение обнаружения, локализации и объяснения, а затем независимо проверять надежность постобработки и соответствие текста, прежде чем использовать сгенерированное обоснование в рабочих процессах анализа.

Статья 022026-07-23cs.LG

Физиологические сигналы как криминалистический метод обнаружения дипфейков с говорящим лицом.

Авторы и организации

Othmane Harraq

Temple University, Philadelphia, Pennsylvania, USA

Tamer Aldwairi

Temple University, Philadelphia, Pennsylvania, USA

Какую задачу решает

В статье рассматривается вопрос о том, является ли дистанционная фотоплетизмография более информативной для подделок говорящих лиц и сохраняется ли достоверность результатов, когда все тестовые личности отсутствуют в обучающей выборке. Также измеряется сложность детектора отдельно для семи методов генерации, вместо того чтобы скрывать это различие в одном сводном показателе.

Ключевой результат

Одномерная ResNet с 165 тысячами параметров достигает AUC 0,806 +/- 0,003 и EER 27,8%, по сравнению с AUC 0,622 для воспроизведенного ранее детектора rPPG и 0,830 для упомянутой универсальной модели Effort. AUC для каждого генератора варьируется от 0,985 для Real3DPortrait до 0,690 для IP-LAP, стабильный разброс составляет 0,295, что значительно больше, чем дисперсия начального значения.

Аннотация

Генерация дипфейков с говорящим лицом (Talk-face, TF) синтезирует фотореалистичное видео лица из статического исходного изображения и аудиосигнала, создавая подделки, которые существующие детекторы на основе изображений постоянно не могут идентифицировать. В отличие от манипуляций с заменой лиц, синтез TF не имеет базового реального видео, от которого можно было бы унаследовать физиологические характеристики, что делает дистанционную фотоплетизмографию (rPPG) уникально мотивированным методом обнаружения для этой категории подделок. Мы предлагаем структуру обнаружения, которая извлекает волновые формы rPPG для каждого видео с помощью RhythmFormer и обучает набор легковесных классификаторов для различения реальных и синтезированных физиологических сигналов. При оценке на подмножестве TF из Celeb-DF++ в соответствии со строгим протоколом, не зависящим от субъекта, где тестовые идентификаторы полностью отделены от обучающих, наша одномерная ResNet достигает AUC 0,806 и EER 27,8%, что ставит ее в пределах 2,4 балла от лучшего опубликованного универсального детектора (Effort, ICML 2025), работая исключительно на физиологическом канале. Мы представляем контролируемое исследование воспроизведения DeepFakesON-Phys, репрезентативного априорного детектора rPPG, демонстрирующее снижение AUC с 0,999 на устаревших данных замены лиц до 0,622 на подмножестве TF из Celeb-DF++. Мы также показываем, что сложность обнаружения сильно зависит от метода: AUC варьируется от 0,985 (Real3DPortrait) до 0,690 (IP-LAP) для семи генераторов TF, при этом рейтинг остается совершенно стабильным для всех протоколов оценки. Этот разброс отражает интерпретируемое физиологическое свойство каждого генератора, а не шум оценки, и составляет основной теоретический вклад работы.

Отправная точка исследования

Генераторы говорящих лиц синтезируют целое видео из статичного изображения человека и аудиозаписи, поэтому они могут не сохранять реальный временной сигнал объема крови. Существующие детекторы rPPG в основном проверялись на более старых примерах замены лиц, где может сохраняться базовая физиология исходного видео и где утечка информации о личности при разделении может завышать результаты.

Метод

RhythmFormer извлекает волновой сигнал из каждого видео с лицом, после чего легковесные одномерные классификаторы ResNet и Transformer различают реальную и синтетическую физиологию. Подмножество видео с говорящими лицами Celeb-DF++ разделено по личности знаменитостей, при этом 18 личностей отложены для оценки. Авторы воспроизводят DeepFakesON-Phys в тех же условиях и проводят анализ агрегированных данных с пятью начальными значениями и анализ по каждому генератору.

Вывод по статье

Физиология лица представляет собой дополнительный, поддающийся интерпретации канал, а не самостоятельный ответ. Она приближается к более крупному визуальному детектору с очень небольшим количеством параметров, но некоторые генераторы сохраняют псевдопериодические сигналы достаточно хорошо, чтобы приблизиться к случайному совпадению; системы обработки данных должны объединять rPPG с пространственными, частотными и аудиовизуальными данными и проверять их достоверность для разных личностей и генераторов.

Статья 032026-07-18cs.CV

InfoDense: Региональное решающее воспроизведение с учетом плотности для эффективного использования памяти при инкрементальном обнаружении подделок лиц

Авторы и организации

Jikang Cheng

Peking University, China

Hao Shen

Huazhong Agricultural University, China

Xueyi Zhang

National University of Singapore, Singapore

Guangcheng Wang

Nantong University, China

Zhongyuan Wang

Wuhan University, China

Renye Yan

Peking University, China

Baojin Huang

Huazhong Agricultural University, China

Какую задачу решает

InfoDense переосмысливает воспроизведение как задачу плотности информации: необходимо сохранять компактные области, содержащие доказательства манипуляций, выбирать разнообразный набор этих областей и объединять их с образцами текущей задачи, не внося при этом предвзятости предметной области, связанной с буфером старых полных изображений.

Ключевой результат

В рамках основного протокола InfoDense сообщает о среднем показателе AUC 90,42% по всем дополнительным наборам данных с падением производительности на 4,52 пункта и среднем показателе AUC 90,03% по всем наборам данных. В статье сообщается о сопоставимой производительности после сокращения объема памяти на 80% и до десяти раз большем разнообразии воспроизведения при том же объеме памяти. Сохраненные фрагменты также снижают точность восстановления личности до уровня ниже 0,02% в представленном анализе конфиденциальности.

Аннотация

Быстрое развитие методов подделки лиц привело к появлению все большего разнообразия манипуляций. Метод инкрементального обнаружения подделок лиц (IFFD), который постепенно добавляет новые данные о подделках для точной настройки ранее обученных моделей, стал многообещающим подходом к борьбе с развивающимися угрозами подделки. Однако традиционные методы IFFD, основанные на воспроизведении, страдают от катастрофического забывания. Хранение полных исторических изображений в ограниченном объеме памяти часто либо не позволяет сохранить тонкие признаки подделки, либо вносит предвзятость в предметную область, снижая способность модели изучать внутренние и переносимые характеристики манипуляций. В этой статье мы предлагаем стратегию воспроизведения с учетом плотности региональных решающих областей, названную InfoDense, для решения этих проблем. InfoDense отдает приоритет областям с высокой плотностью артефактов и критическим для подделки участком, значительно сокращая требования к хранению при сохранении высокой точности доказательств подделки. Сначала мы представляем InfoDense Cut для локализации решающих участков с использованием эмбеддингов на основе CLIP. Затем InfoDense Select ранжирует сегменты-кандидаты, комбинируя репрезентативность в латентном пространстве и решающее количество фрагментов, обеспечивая как разнообразие, так и плотность информации в буфере воспроизведения. Наконец, InfoDense Fuse восстанавливает непредвзятые входные данные для обучения, адаптивно объединяя сохраненные сегменты с образцами текущей задачи, что повышает сохранение знаний и обобщающую способность. Обширные эксперименты на сложных инкрементальных эталонных тестах дипфейков демонстрируют, что InfoDense эффективно смягчает катастрофическое забывание, одновременно улучшая междоменную обобщающую способность.

Отправная точка исследования

Детекторы дипфейков нуждаются в многократных обновлениях по мере появления новых семейств манипуляций, но повторное воспроизведение полных исторических изображений лиц потребляет память, сохраняет идентифицируемое содержимое и при этом может тратить большую часть буфера на фон или избыточную структуру лица. При ограниченном объеме памяти детектор должен сохранять тонкие признаки подделки, не забывая при этом о выполненных ранее задачах.

Метод

InfoDense Cut использует векторные представления фрагментов CLIP и текст, связанный с подделками, для оценки решающих областей. InfoDense Select ранжирует сегменты-кандидаты как по репрезентативности в латентном пространстве, так и по количеству решающих фрагментов. InfoDense Fuse восстанавливает входные данные для обучения, объединяя сохраненные исторические сегменты с текущими образцами, увеличивая количество исходных изображений, представленных в рамках того же объема памяти. Оценка проводится после инкрементальных последовательностей подделок и отдельных межнаборных тестов.

Вывод по статье

Воспроизведение на региональном уровне привлекательно для детектора, который должен непрерывно обучаться в условиях ограничений по объему хранения или конфиденциальности. Его ценность для внедрения зависит от того, остаются ли выбранные фрагменты информативными после реального сжатия, изменения политики и постобработки с помощью состязательных методов, но он предоставляет конкретную альтернативу сохранению полных исторических изображений лиц.