dumai
🤖
ИИПрепринтarXiv cs.CL

Препринт — материал ещё не прошёл рецензирование

Модель различает тексты с помощью ChatGPT, но часто ошибается

0

Кратко

Авторы оценили способ отличать студенческие тексты, написанные самостоятельно и с помощью ChatGPT, по словам и построению предложений. На данных 90 участников он пропустил 11,1% текстов с помощью ИИ и ошибочно отнёс к ним 22,2% самостоятельно написанных текстов.

Зачем это знать

Результат указывает, что по самому тексту можно заметить признаки помощи ChatGPT, но ошибочная маркировка самостоятельно написанных текстов остаётся частой. Надёжность метода для других авторов, жанров и условий пока не установлена.

Разбор

Авторы не пытались угадать автора по содержанию или искать особые фразы ChatGPT. Они смотрели только на форму текста: насколько разнообразны слова, как часто встречаются существительные, глаголы и прилагательные, а также насколько сильно меняется длина предложений. Всего использовали девять таких измеримых признаков — их можно объяснить человеку, а не спрятать за непонятной логикой модели.

Текст сначала разбивали на перекрывающиеся фрагменты по 250 слов. Несколько алгоритмов машинного обучения учились различать два типа работ, причём тексты одного и того же участника целиком отправляли только в одну группу — на обучение, проверку или финальный тест. Это важно: модель не могла просто запомнить индивидуальный стиль конкретного студента. Затем оценки отдельных фрагментов объединяли в одну оценку для всего текста.

Лучше всего сработал алгоритм «случайный лес» — набор деревьев решений, которые вместе принимают итоговое решение. Его качество составило 0,87 по показателю, отражающему, насколько хорошо метод в целом разделяет два класса, и 0,84 по метрике, которая одновременно учитывает пропуски и ложные тревоги. Дополнительный анализ показал, что на решение заметнее всего влияли словарные и грамматические особенности, а не какой-то один отдельный признак.

Ключевые цифры

250 словКаждый текст анализировали небольшими перекрывающимися фрагментами, чтобы оценивать стиль не только целиком, но и по частям.
9 признаковМодель опиралась на девять понятных характеристик текста — например, разнообразие слов и разброс длины предложений.
0,87 ROC-AUCМетод довольно хорошо различал два типа текстов в этой проверке, хотя такая оценка не означает безошибочную работу.
0,84 F1Итоговый баланс между найденными текстами с помощью ИИ и ошибочными решениями оказался достаточно высоким на тестовых данных.

Можно ли доверять

Это препринт с arXiv, а не статья, прошедшая рецензирование. Проверка была аккуратно устроена: данные одного участника не смешивали между обучением и тестом, но участников было 90, поэтому на других студентах, предметах и жанрах результат может измениться.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.CL)
Дата публикации у нас24 сентября 2026 г.
Дата источника22 сентября 2026 г.
ОригиналОткрыть
АвторыRajesh Kumar, Nabeel Siddiqui, Alexander Fuchsberger