Препринт — материал ещё не прошёл рецензирование
Детекторы ИИ могут подталкивать к большему использованию моделей
Кратко
Авторы построили упрощённую модель того, как люди меняют поведение, когда знают о проверке текста на следы ИИ. В этой модели детектор иногда приводит не к уменьшению, а к росту использования ИИ и к снижению качества ответа. Отдельно они увидели схему «сначала рост, потом спад» для самого признака, по которому ловят ИИ, и проверили её на частотах слов в аннотациях arXiv.
Зачем это знать
Это предупреждает, что такие проверки могут менять поведение людей не в ту сторону, на которую рассчитывают. Для реальных систем это значит, что за детекцией нужно следить не только как за способом ловить ИИ, но и как за фактором, который меняет качество и стиль работы.
Разбор
Авторы не просто рассуждают о детекторах ИИ на словах, а строят упрощённую модель поведения пользователя. В этой модели человек сам решает две вещи: насколько активно подключать LLM в работу и как потом править текст, чтобы он меньше походил на сгенерированный. Так исследователи смогли посмотреть не только на сам факт детекции, но и на то, как она меняет стимулы вокруг неё.
Смысл здесь в том, что детектор влияет не только на «видимый след ИИ», но и на то, как люди строят весь рабочий процесс. Если проверка штрафует за признаки, связанные с ИИ, пользователь может начать использовать модель чаще, а затем сильнее маскировать результат. И вот неприятный поворот: даже если эти признаки обычно связаны с более низким качеством текста, сама проверка может привести к тому, что итог станет хуже, а не лучше.
Отдельно авторы показывают ещё одну устойчивую картину: для самого признака, по которому детектор ловит ИИ, появляется понятная траектория «сначала рост, потом спад». И это не осталось только в теории — они воспроизвели похожий эффект на частотах слов в аннотациях arXiv. Ещё один важный кусок работы: авторы указали, при каких условиях рост использования ИИ обязателен, а в случае линейной зависимости качества их условия совпадают с необходимыми, то есть картинка получается довольно строгой, а не просто интуитивной.
Можно ли доверять
Это препринт на arXiv, то есть работу ещё не прошли внешнюю экспертную рецензию. Проверка здесь идёт через теоретическую модель и на эмпирическом примере с частотами слов в аннотациях arXiv, а не на большом наборе реальных пользователей, так что выводы хорошо показывают возможный механизм, но их стоит воспринимать как аккуратный прогноз, а не финальный вердикт для всех случаев.
Пересказано ИИ по научной статье. Как это устроено