Препринт — материал ещё не прошёл рецензирование
Люди и программы почти случайно отличали ролики ИИ от настоящих
Кратко
Авторы проверили, как люди и современные программы для поиска подделок распознают полностью созданные ИИ видео с одним выступающим в кадре. В наборе было 271 настоящее и 2420 созданных видео, подготовленных с помощью семи современных моделей; обе группы справились примерно на уровне случайного угадывания.
Зачем это знать
Если результат подтвердится, одной проверки на глаз и нынешних автоматических инструментов будет недостаточно, чтобы уверенно устанавливать подлинность видео. Пока вывод относится только к роликам с одиночными выступающими и к использованному набору моделей.
Разбор
Авторы собрали отдельный тестовый набор DF26, чтобы проверить не просто умение находить старые дипфейки, а способность распознавать ролики, созданные новыми генераторами. В него вошли три знакомых формата публичной речи: человек говорит прямо в камеру, делает официальное заявление или участвует в студийном интервью. Для сравнения взяли настоящие записи и полностью синтетические клипы, созданные двумя типами систем — по текстовому описанию и по исходному изображению.
Главная проблема здесь — разрыв между лабораторным тестом и реальной подделкой. Детектор может хорошо узнавать признаки видео, похожих на те, на которых его обучали, но новые модели меняют эти признаки. Авторы специально проверили такой перенос на свежие генераторы и показали: привычные способы оценки переоценивают надёжность систем. Иными словами, хороший результат на старом тесте ещё не означает, что программа справится с роликом от незнакомого генератора.
DF26 задуман не только как ещё один набор видео, но и как проверка устойчивости к такому изменению «почерка» генераторов. Это важно для будущих систем проверки: их нужно испытывать на данных, которые заметно отличаются от обучающих, а не только на знакомых примерах.
Ключевые цифры
Можно ли доверять
Это препринт с arXiv, поэтому его ещё не проверили независимые рецензенты. Работа тестирует людей и готовые детекторы на видеозаписях, а не проверяет их работу в реальных информационных потоках; кроме того, выводы относятся к трём форматам одиночных выступлений.
Пересказано ИИ по научной статье. Как это устроено