IMFD: сквозное обнаружение подделок нескольких лиц с помощью инструктивных больших визуально-языковых моделей
Авторы и организации
Dasom Choi
Chungnam National University
Sangjun Moon
Chungnam National University
Hyeongchan Im
Chungnam National University
Jaeeon Park
Institute of Science Tokyo
Jingun Kwon
Chungnam National University
Hidetaka Kamigaito
Nara Institute of Science and Technology
Taro Watanabe
Nara Institute of Science and Technology
Manabu Okumura
Institute of Science Tokyo
Какую задачу решает
IMFD реформирует обнаружение многогранной подделки в задачу на языке видения на основе инструкций, которая совместно локализирует лица и присваивает метки аутентичности для каждого лица. Он проверяет, помогают ли явные координаты лиц и контекст изображения большой модели языка зрения выравнивать индексы лиц слева направо с правильными выходами.
Ключевой результат
С точностью на полном тестовом наборе IMFD достигает 0,98 micro-F1, 0,98 макро-F1 и 0,94 точного совпадения; подмножество с большим количеством лиц оценивает 0,97, 0,98 и 0,87. В истинной одноступенчатой системе эти полные показатели падают до 0,90, 0,84 и 0,77, что делает локализацию оставшим узким местом. Face-box AP составляет 81,9 на полном наборе и 83,6 на многогранном подмножестве. Повышение входного разрешения с 112 до 672 пикселей увеличивает контролируемый micro-F1 с 0,917 до 0,981 и точное совпадение с 0,654 до 0,948. IMFD превосходит сравниваемые базовые показатели, но медленнее самого быстрого одноступенчатого метода и всё ещё зависит от синтетических тестовых манипуляций.
Аннотация
Быстрый рост дипфейков вызвал серьёзные опасения из-за их распространения в социальных сетях. Традиционные детекторы многогранной подделки вырезают и проверяют каждое лицо независимо, игнорируя фоновый контекст и взаимосвязи между лицами, что часто приводит к неоптимальной производительности. Для преодоления этих ограничений мы используем модели Large Vision-Language Models (LVLM) на основе инструкций, которые могут интерпретировать целые изображения и следовать сложным текстовым инструкциям. Мы предлагаем простой, но эффективный одноступенчатый многогранный детектор подделок, называемый IMFD (Instruction-based Multi-face Forgery Detector), который обучен сквозь конец для совместной локализации лиц и прогнозирования меток подделки на каждый лицо. Вместо того чтобы рассматривать прогнозирование коробок лиц только как совместную цель, IMFD явно интегрирует предсказаемые ограничивающие элементы в инструкцию как визуальные подсказки, улучшающие заземляние инструкции и обнаружение подделок. Для поддержки обучения и оценки IMFD мы преобразуем существующие наборы данных многогранной подделки в формат на основе инструкций. Экспериментальные результаты и анализы показывают, что IMFD улучшает обнаружение многогранной подделки, интегрируя в инструкцию ограничивающие грани, и стабильно превосходит различные современные методы.
Отправная точка исследования
Многоперсонажные фотографии нарушают привычное предположение «обрезать, затем классифицировать». Независимые кадры лиц отбрасывают контекст сцены и межлица, требуют последовательной работы для каждого человека и распространяют ошибки детектора или порядка в судебное решение. Полезная система должна определять, какие лица фальшивые, а не просто определять, содержит ли изображение какие-либо манипуляции.
Метод
Система преобразует образцы OpenForensics в инструкции, называющие грани слева направо. Якорная стадия на основе CLIP оценивает кандидатные области, объединяет перекрывающиеся блоки и вводит предсказанные координаты в текстовую инструкцию вместе с изображением. Затем LVLM возвращает поддельные индексы и боксы. Авторы оценивают как контролируемую двухступенчатую установку с использованием координат с точки истинности, так и сквозную одноступенчатую установку с использованием предсказаемых блоков IMFD, отчёт micro-F1, макро-F1, точное совпадение на уровне изображения, точки доступа блока, задержку и пропускную способность.
Вывод по статье
Рассуждение на основе целого изображения улучшает криминалистическую экспертизу на переполненном месте, но разрыв между предоставленными и предсказанными коробками велик. Тесты закупок должны оценивать точные решения по лицу и ошибки локализации, а не только на уровне изображения.