Препринт — материал ещё не прошёл рецензирование
Модель различает тексты с помощью ChatGPT, но часто ошибается
Кратко
Авторы оценили способ отличать студенческие тексты, написанные самостоятельно и с помощью ChatGPT, по словам и построению предложений. На данных 90 участников он пропустил 11,1% текстов с помощью ИИ и ошибочно отнёс к ним 22,2% самостоятельно написанных текстов.
Зачем это знать
Результат указывает, что по самому тексту можно заметить признаки помощи ChatGPT, но ошибочная маркировка самостоятельно написанных текстов остаётся частой. Надёжность метода для других авторов, жанров и условий пока не установлена.
Разбор
Авторы не пытались угадать автора по содержанию или искать особые фразы ChatGPT. Они смотрели только на форму текста: насколько разнообразны слова, как часто встречаются существительные, глаголы и прилагательные, а также насколько сильно меняется длина предложений. Всего использовали девять таких измеримых признаков — их можно объяснить человеку, а не спрятать за непонятной логикой модели.
Текст сначала разбивали на перекрывающиеся фрагменты по 250 слов. Несколько алгоритмов машинного обучения учились различать два типа работ, причём тексты одного и того же участника целиком отправляли только в одну группу — на обучение, проверку или финальный тест. Это важно: модель не могла просто запомнить индивидуальный стиль конкретного студента. Затем оценки отдельных фрагментов объединяли в одну оценку для всего текста.
Лучше всего сработал алгоритм «случайный лес» — набор деревьев решений, которые вместе принимают итоговое решение. Его качество составило 0,87 по показателю, отражающему, насколько хорошо метод в целом разделяет два класса, и 0,84 по метрике, которая одновременно учитывает пропуски и ложные тревоги. Дополнительный анализ показал, что на решение заметнее всего влияли словарные и грамматические особенности, а не какой-то один отдельный признак.
Ключевые цифры
Можно ли доверять
Это препринт с arXiv, а не статья, прошедшая рецензирование. Проверка была аккуратно устроена: данные одного участника не смешивали между обучением и тестом, но участников было 90, поэтому на других студентах, предметах и жанрах результат может измениться.
Пересказано ИИ по научной статье. Как это устроено