Препринт — материал ещё не прошёл рецензирование
ИИ оставляет следы в опросах, даже копируя человека
Кратко
На трёх реальных опросах обычные детекторы хорошо распознавали прямые ответы ИИ, но почти переставали работать, когда ИИ изображал целого респондента. Анализ особенностей поведения и простое объединение нескольких признаков повысили средний результат обнаружения на 0,14, хотя полностью повторить человеческое поведение модели не смогли.
Зачем это знать
Это задаёт направление для проверки честности онлайн-опросов: смотреть нужно не только на текст, но и на то, как формируется ответ. Результат пока ограничен тремя опросами и искусственно созданными ответами, поэтому надёжно отличать человека от ИИ такой подход ещё не позволяет.
Разбор
Авторы собрали специальный набор данных ASURRE: к ответам настоящих участников добавили ответы, созданные несколькими языковыми моделями по разным сценариям. В простом сценарии модель лишь генерирует или правит отдельные ответы. В более сложном она сначала получает образ «респондента» и затем проходит весь опрос от его имени — так проверяют не отдельный текст, а более реалистичное участие ИИ. Эксперимент провели на трёх опросах из разных областей.
Сначала исследователи проверили шесть готовых детекторов, причём без дополнительного обучения на материалах этих опросов. Такой режим важен: для нового опроса обычно нет заранее размеченных примеров ответов ИИ, на которых можно было бы настроить систему. Детекторы оценивали ответы по отдельности, а затем сводили оценки в общий результат для предполагаемого респондента.
Главная находка — у «респондента-агента» проблема смещается от текста к поведению. Отдельные ответы могут выглядеть достаточно по-человечески, но в совокупности остаются следы: модель не до конца воспроизводит человеческую непоследовательность и разброс ответов. Авторы объединили несколько таких признаков в простой метод SPABD: ему не нужно переобучаться под каждый новый опрос, он использует несколько примеров для настройки способа оценки. Отдельные признаки можно обмануть специальной инструкцией модели, но их сочетание оказалось устойчивее.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, поэтому независимая проверка рецензентами ещё впереди. Проверка выглядит содержательной: использовали три реальных опроса и сравнили шесть методов, но ИИ-ответы создавали искусственно, а размер наборов в абстракте не указан; в настоящих опросах результат может отличаться.
Пересказано ИИ по научной статье. Как это устроено