dumai
🤖
ИИПрепринтarXiv cs.CL

Препринт — материал ещё не прошёл рецензирование

ИИ оставляет следы в опросах, даже копируя человека

0

Кратко

На трёх реальных опросах обычные детекторы хорошо распознавали прямые ответы ИИ, но почти переставали работать, когда ИИ изображал целого респондента. Анализ особенностей поведения и простое объединение нескольких признаков повысили средний результат обнаружения на 0,14, хотя полностью повторить человеческое поведение модели не смогли.

Зачем это знать

Это задаёт направление для проверки честности онлайн-опросов: смотреть нужно не только на текст, но и на то, как формируется ответ. Результат пока ограничен тремя опросами и искусственно созданными ответами, поэтому надёжно отличать человека от ИИ такой подход ещё не позволяет.

Разбор

Авторы собрали специальный набор данных ASURRE: к ответам настоящих участников добавили ответы, созданные несколькими языковыми моделями по разным сценариям. В простом сценарии модель лишь генерирует или правит отдельные ответы. В более сложном она сначала получает образ «респондента» и затем проходит весь опрос от его имени — так проверяют не отдельный текст, а более реалистичное участие ИИ. Эксперимент провели на трёх опросах из разных областей.

Сначала исследователи проверили шесть готовых детекторов, причём без дополнительного обучения на материалах этих опросов. Такой режим важен: для нового опроса обычно нет заранее размеченных примеров ответов ИИ, на которых можно было бы настроить систему. Детекторы оценивали ответы по отдельности, а затем сводили оценки в общий результат для предполагаемого респондента.

Главная находка — у «респондента-агента» проблема смещается от текста к поведению. Отдельные ответы могут выглядеть достаточно по-человечески, но в совокупности остаются следы: модель не до конца воспроизводит человеческую непоследовательность и разброс ответов. Авторы объединили несколько таких признаков в простой метод SPABD: ему не нужно переобучаться под каждый новый опрос, он использует несколько примеров для настройки способа оценки. Отдельные признаки можно обмануть специальной инструкцией модели, но их сочетание оказалось устойчивее.

Ключевые цифры

3 опросаМетод проверили на нескольких реальных анкетах из разных областей, а не на одном специально придуманном тесте.
6 детекторовАвторы сравнили разные подходы к поиску ИИ-текста, поэтому результат не зависит от одной конкретной программы.
+0,14 AUROCОбъединение поведенческих признаков заметно улучшило способность различать ответы людей и ИИ по сравнению с лучшим исходным детектором.

Можно ли доверять

Это препринт на arXiv, поэтому независимая проверка рецензентами ещё впереди. Проверка выглядит содержательной: использовали три реальных опроса и сравнили шесть методов, но ИИ-ответы создавали искусственно, а размер наборов в абстракте не указан; в настоящих опросах результат может отличаться.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.CL)
Дата публикации у нас16 сентября 2026 г.
Дата источника15 сентября 2026 г.
ОригиналОткрыть
АвторыQizhou Wang, Bogdan Mamaev, Christopher Leckie