← Назад в Блог
Исследовательский радарОбнаружение дипфейковМедиа-криминалистикаarXivСентябрь 2026

Ежемесячный радар arXiv

Исследования обнаружения дипфейков за сентябрь 2026 года: анализ нескольких лиц, ложные срабатывания на смартфонах и непрерывное обучение

Самая сильная сентябрьская работа по дипфейкам сосредоточена на поведении системы, а не на очередной заблокированной оценке. IMFD требует от модели языка зрения локализовать и классифицировать каждое лицо в одном проходе с инструкцией. LAION-Mobile проводит аудит оригинальных контрольных точек детекторов современного синтетического контента и почти миллиона фотозаписей смартфонов, выявляя сильный дрейф калибровки. MSFD рассматривает обновления видеодетекторов как проблему постоянного обучения и сохраняет пространственные, временные и совместные частотные данные отдельно.

Что показывает этот месяц

Инструкция IMFD с учётом координат повышает двухступенчатый результат в OpenForensics до 0,98 micro-F1, 0,98 макро-F1 и 0,94 точности точного совпадения; сквозная одноступенчатая версия падает до 0,90, 0,84 и 0,77, поскольку локализация лиц всё ещё вызывает ошибки. LAION-Mobile обнаружила, что ни один из двенадцати опубликованных детекторов не превышает 0,624 AUC на современной AI-смеси, а современные калиброванные пороги отмечают 17-91% аутентичных фотографий телефона; однако его корпус едва охватывает текущих флагманских нейронных провайдеров. MSFD достигает 93,02% среднего AUC с 2,29 очками забвения по шести последовательным видеонаборам данных и 83,65% средней точности при отрицательном забывании в протоколе с несколькими кадрами. В совокупности статьи выступают за оценку всей сцены, отрицательные результаты по текущим устройствам, явное владение калибровкой и регрессионное тестирование после каждого обновления детектора.

Статья 012026-09-17cs.CV

IMFD: сквозное обнаружение подделок нескольких лиц с помощью инструктивных больших визуально-языковых моделей

Авторы и организации

Dasom Choi

Chungnam National University

Sangjun Moon

Chungnam National University

Hyeongchan Im

Chungnam National University

Jaeeon Park

Institute of Science Tokyo

Jingun Kwon

Chungnam National University

Hidetaka Kamigaito

Nara Institute of Science and Technology

Taro Watanabe

Nara Institute of Science and Technology

Manabu Okumura

Institute of Science Tokyo

Какую задачу решает

IMFD реформирует обнаружение многогранной подделки в задачу на языке видения на основе инструкций, которая совместно локализирует лица и присваивает метки аутентичности для каждого лица. Он проверяет, помогают ли явные координаты лиц и контекст изображения большой модели языка зрения выравнивать индексы лиц слева направо с правильными выходами.

Ключевой результат

С точностью на полном тестовом наборе IMFD достигает 0,98 micro-F1, 0,98 макро-F1 и 0,94 точного совпадения; подмножество с большим количеством лиц оценивает 0,97, 0,98 и 0,87. В истинной одноступенчатой системе эти полные показатели падают до 0,90, 0,84 и 0,77, что делает локализацию оставшим узким местом. Face-box AP составляет 81,9 на полном наборе и 83,6 на многогранном подмножестве. Повышение входного разрешения с 112 до 672 пикселей увеличивает контролируемый micro-F1 с 0,917 до 0,981 и точное совпадение с 0,654 до 0,948. IMFD превосходит сравниваемые базовые показатели, но медленнее самого быстрого одноступенчатого метода и всё ещё зависит от синтетических тестовых манипуляций.

Аннотация

Быстрый рост дипфейков вызвал серьёзные опасения из-за их распространения в социальных сетях. Традиционные детекторы многогранной подделки вырезают и проверяют каждое лицо независимо, игнорируя фоновый контекст и взаимосвязи между лицами, что часто приводит к неоптимальной производительности. Для преодоления этих ограничений мы используем модели Large Vision-Language Models (LVLM) на основе инструкций, которые могут интерпретировать целые изображения и следовать сложным текстовым инструкциям. Мы предлагаем простой, но эффективный одноступенчатый многогранный детектор подделок, называемый IMFD (Instruction-based Multi-face Forgery Detector), который обучен сквозь конец для совместной локализации лиц и прогнозирования меток подделки на каждый лицо. Вместо того чтобы рассматривать прогнозирование коробок лиц только как совместную цель, IMFD явно интегрирует предсказаемые ограничивающие элементы в инструкцию как визуальные подсказки, улучшающие заземляние инструкции и обнаружение подделок. Для поддержки обучения и оценки IMFD мы преобразуем существующие наборы данных многогранной подделки в формат на основе инструкций. Экспериментальные результаты и анализы показывают, что IMFD улучшает обнаружение многогранной подделки, интегрируя в инструкцию ограничивающие грани, и стабильно превосходит различные современные методы.

Отправная точка исследования

Многоперсонажные фотографии нарушают привычное предположение «обрезать, затем классифицировать». Независимые кадры лиц отбрасывают контекст сцены и межлица, требуют последовательной работы для каждого человека и распространяют ошибки детектора или порядка в судебное решение. Полезная система должна определять, какие лица фальшивые, а не просто определять, содержит ли изображение какие-либо манипуляции.

Метод

Система преобразует образцы OpenForensics в инструкции, называющие грани слева направо. Якорная стадия на основе CLIP оценивает кандидатные области, объединяет перекрывающиеся блоки и вводит предсказанные координаты в текстовую инструкцию вместе с изображением. Затем LVLM возвращает поддельные индексы и боксы. Авторы оценивают как контролируемую двухступенчатую установку с использованием координат с точки истинности, так и сквозную одноступенчатую установку с использованием предсказаемых блоков IMFD, отчёт micro-F1, макро-F1, точное совпадение на уровне изображения, точки доступа блока, задержку и пропускную способность.

Вывод по статье

Рассуждение на основе целого изображения улучшает криминалистическую экспертизу на переполненном месте, но разрыв между предоставленными и предсказанными коробками велик. Тесты закупок должны оценивать точные решения по лицу и ошибки локализации, а не только на уровне изображения.

Статья 022026-09-10cs.CV

LAION-Mobile: Оценка детекторов дипфейков на миллионе фотографий смартфонов

Авторы и организации

Achim von Stryk

Stralsund University, Germany

Janis Keuper

Institute for Machine Learning and Analytics, Offenburg University, Germany

Какую задачу решает

LAION-Mobile проводит аудит, обобщаются ли двенадцать оригинальных контрольных точек детекторов на современные изображения ИИ и как часто они срабатывают ложной тревогой на аутентичных фотографиях смартфонов. Он отделяет пороговую дискриминацию от калибровки порогов и задаёт вопрос, не создаёт ли устаревшая калибровка GAN вводящую в заблуждение картину развертывания.

Ключевой результат

На NTIRE 2026 лучший детектор достигает только 0,624 AUC; пять из двенадцати имеют результат ниже шанса, и ни один не превышает 13,5% истинно положительных результатов при 5% вероятности. Пороговые значения, калиброванные по устаре, делают несколько систем пригодными для использования при не более чем 11% ложных тревог на фото телефона, но современная калибровка заставляет одни и те же детекторы отмечать 17-91% аутентичных фотографий. UnivFD иллюстрирует этот сдвиг: 0,2% становятся 39,1% на идентичных изображениях телефона. Корпус преобладает старыми устройствами и почти не содержит современных флагманов, подлинность определяется, а не сертифицируется по одному изображению, а LAION-Mobile работает только с реальностью, поэтому не может обеспечить двухклассовый телефонный AUC.

Аннотация

Большинство детекторов дипфейков показывают почти идеальные показатели AUC в своих эталонных эталонах. Однако недавняя позиционная статья ICML утверждает, что эти оценки в целом игнорируют влияние современной фотографии на смартфонах: широко используемые на устройстве конвейеры нейронных изображений и сигналов (такие как мультисенсорное слияние или подавление шума и размытия движения) всё больше смещают парадигму изображения с простых проекций объективов в сторону вычислительной фотографии. Таким образом, устройства фактически генерируют, а не записывают фотографии. Это увеличивает риск того, что детекторы дипфейков могут позначить, что обычные фотографии с телефона будут фальшивые. Из-за отсутствия крупномасштабных наборов данных с изображениями с современных смартфонов эта гипотеза пока была проверена только в небольших исследованиях по доказательству концепции. Цель этой статьи — закрыть этот разрыв. Мы представляем LAION-Mobile — открытый набор данных, содержащий около 1 миллиона изображений смартфонов с метаданными EXIF, извлеченными из re-LAION-5B. Оценивая двенадцать современных детекторов дипфейков с их оригинальными бумажными контрольными точками на выборке из 9 115 изображений этого пула (DIRE на 738), мы сообщаем о трёх ключевых выводах: (i) По современному контенту ИИ ни один детектор не превышает AUC 0,624, а пять из двенадцати находятся ниже шансов. (ii) Показатели ложных тревог на реальной фотографии — это артефакт калибровки порогов: пороги, установленные на устаревших данных GAN, делают несколько детекторов пригодными для развертывания (менее 11 процентов FPR), но те же детекторы отмечают 17-91 процент реальных фотографий после того, как тот же критерий перерабатывается на современном контенте. (iii) Следовательно, ни один детектор не превосходит шансы современного контента ИИ и поддерживает развертываемую частоту ложных тревог на реальных фото. Отражая набор веб-коллекций, корпус исследует первое поколение нейронного провайдера (2018–2020); текущие флагманы практически отсутствуют, оставляя современный режим ISP открытым разрывом.

Отправная точка исследования

Опубликованные детекторы дипфейков часто приближаются к совершенному AUC на своих собственных эталонах, тогда как современные телефоны применяют HDR-слияние, снятие шума, резкость, подавление движения и другие выученные обработки сигналов изображений к аутентичным фотографиям. Эти вычислительные артефакты могут напоминать отпечатки сгенерированных изображений. Без большого корпуса реальных телефонов и калибровки порога по текущему синтетическому содержимому детектор может выглядеть безопасно, отмечая обычные фотографии с непригодной скоростью.

Метод

Авторы фильтруют reLAION-5B по смартфонным EXIF и нефотоэвристикам, чтобы создать пул реальных фотографий из 935 399 изображений с метаданными устройства, затем получают фиксированную оценочную выборку из 9 115 изображений, за исключением DIRE на 738 дорогих реконструкциях. Двенадцать детекторов сначала проверяются по их исходным или в стиле ProGAN бенчмарками, затем оцениваются на современной смеси реальных/поддельных NTIRE 2026. Пороги равных ошибок, установленные отдельно на устаревших ProGAN-ISP и современных NTIRE, переносятся на те же фотографии телефона для экспозиции калибровочного дрейфа.

Вывод по статье

Почти идеальный бумажный AUC не переносится в современный контент, а пороговое владение может изменить ложные тревоги на реальных фотографиях в разы на порядки. Каждое развертывание требует негативов текущих устройств, документированного калибровочного набора и мониторинга дрейфа операционной точки.

Статья 032026-09-03cs.CV

Сохранение знаний во времени и пространстве для постоянного обнаружения видеодипфейков

Авторы и организации

Taehoon Kim

Graduate School of Artificial Intelligence, Chung-Ang University

Jongwook Choi

Graduate School of Artificial Intelligence, Chung-Ang University

Heejae Jo

Department of Advanced Imaging, Graduate School of Advanced Imaging Science, Multimedia and Film, Chung-Ang University

Byungmin Park

Graduate School of Artificial Intelligence, Chung-Ang University

Jongwon Choi

Graduate School of Artificial Intelligence, Chung-Ang University

Department of Advanced Imaging, Graduate School of Advanced Imaging Science, Multimedia and Film, Chung-Ang University

Department of Metaverse Convergence, Chung-Ang University

Какую задачу решает

MSFD специально нацеливается на проблему устойчивости-пластичности для обнаружения видео дипфейков. Он сохраняет пространственные, временные и пространственно-временные судебные знания отдельно, одновременно обновляя детектор, оценивая полные данные, генератор-инкрементальные и несколько выстрелов, а не разделяет один статический тест поезда.

Ключевой результат

В протоколе с шестью задачами полная система достигает средней AUC 93,02% с средним показателем забывания 2,29, по сравнению с 89,84% и 6,81 у базовой модели в стиле iCaRL. В протоколе инкрементального генератора она достигает средней AUC 96,67%, включая 91,47% для подделок из изображений в видеоролики, с показателем забывания 1,37. При использовании всего 25 реальных и 25 фальшивых видеороликов для каждой новой задачи система достигает средней точности 83,65% и забывания -1,25, что указывает на положительный обратный перенос; IDER забывает меньше при -2,10, но имеет немного более низкую точность 83,47%. Абляции показывают, что все три частотные ветви превосходят одну неделимую репрезентацию. Метод по-прежнему показывает увеличение показателя забывания после преимущественно азиатской задачи KoDF, что сигнализирует о нерешенных демографических и доменных сдвигах.

Аннотация

Постоянное появление высококачественных видеодипфейков требует детекторов, которые постоянно адаптируются к новым шаблонам подделки, однако существующие подходы, предназначенные для дипфейков, не могут захватить видеоспецифические сигналы. В отличие от дипфейков, содержащих только пространственные артефакты, дипфейковые видео оставляют чёткие следы как по пространственной, так и по временной оси, что требует отдельного сохранения каждой модальности при последовательных обновлениях модели. Чтобы преодолеть это ограничение, мы вводим непрерывную рамку обнаружения видео дипфейков — Modality-Specific Frequency Distillation (MSFD), которая явно разлагает видеоэлементы на пространственные, временные и пространственно-временные модальности в частотной области. Такое разложение позволяет независимо сохранять каждую модальность, поскольку разные типы дипфейк-видео проявляют разную зависимость от пространственных и временных подсказок в разных задачах. Кроме того, MSFD применяет кросс-модальные потери корреляции, что стимулирует пространственно-временные представления оставаться ортогональными одномодальным сигналам. Обширные эксперименты показывают, что наша структура обеспечивает более сильную адаптацию и эффективнее сохраняет производительность, чем современные методы в различных сценариях непрерывного дипфейк-видео.

Отправная точка исследования

Типы подделок видео появляются последовательно после внедрения, поэтому детектор должен изучать новые генераторы, не стирая старые доказательства. Непрерывные методы, унаследованные от классификации изображений, как правило, сохраняют одно запутанное представление, хотя видеодипфейки оставляют различные сочетания пространственных границ, временных несоответствий и совместных артефактов пространства-времени. Низкий балл забывания также не полезен, если система отказывается адаптироваться к новой задаче.

Метод

Промежуточные видеопризнаки преобразуются в 2D пространственные, 1D временные и совместные пространственно-временные частотные представления. Частотная дистилляция, специфичная для модальности, выравнивает каждый спектр с предыдущей моделью во время последовательных обновлений. Адаптер, специфичный для модальности, перенастраивает каналы и обучается маскам Gumbel-Softmax для частотных диапазонов, важных для задачи, в то время как потеря декорреляции предотвращает дублирование подсказок одной модальности в совместной ветви. Примеры воспроизведения и та же 3D ResNet-18 основа используются для большинства сравнений с базовыми методами на шести наборах данных видео с дипфейками.

Вывод по статье

Разделение пространственной и временной судебной памяти улучшает обновления детектора, особенно при малом количестве новых данных. Оставшийся сдвиг KoDF напоминает о необходимости регрессионного тестирования обеих семейств генераторов и доменов популяции после каждого выпуска с непрерывным обучением.