dumai
ИИПрепринтarXiv cs.CL

Препринт — материал ещё не прошёл рецензирование

ИИ оставляет устойчивый след при создании текста, но слабый — при правке

0

Кратко

Авторы сравнили тексты восьми систем ИИ в пяти тематических областях. Полностью созданные ИИ тексты устойчиво отличались от человеческих по неожиданности слов и разнообразию словаря, тогда как после ИИ-правок такой след был гораздо слабее и зависел от объёма изменений. Это препринт, который ещё не прошёл рецензирование.

Зачем это знать

Полностью созданный и отредактированный ИИ текст нельзя считать одним явлением: их признаки различаются, и отделять такие тексты от человеческих нужно по-разному. При этом работа не доказывает, что подобные признаки дают надёжный детектор в любых реальных текстах.

Разбор

Авторы не искали один универсальный «маркер ИИ», а проверили, какие признаки текста работают устойчиво в разных условиях. Они взяли 14 стилометрических признаков — измеримых свойств письма — и обучили простые линейные классификаторы отличать тексты. Затем проверили, сохраняются ли важные признаки, если исключить отдельную модель, отдельную тему или учесть разную длину текстов. Такой подход нужен потому, что детектор может хорошо работать на знакомых примерах, но терять точность на новом авторе или жанре.

Для полностью сгенерированных текстов устойчивое ядро составили два признака. Энтропия здесь показывает, насколько неожиданным бывает выбор следующего слова: у генерации она менялась в характерном направлении. Разнообразие словаря показывает, насколько широко текст использует разные слова. Остальные признаки часто зависели от конкретной темы или системы, поэтому переносить их результаты между условиями рискованно.

С правкой картина оказалась другой. Авторы сравнивали изменённые тексты с исходными человеческими, а не только с полностью сгенерированными примерами. После правки разнообразие словаря росло лишь немного, энтропия двигалась в противоположную сторону, а главным сигналом становилась лексическая плотность — доля содержательных слов среди всех слов. Поэтому отредактированный текст обычно оставался ближе к человеческому оригиналу, хотя по стилю его можно было довольно хорошо отличить от полностью сгенерированного текста.

Ключевые цифры

14 признаковАвторы проверили не один случайный показатель, а широкий набор измеримых свойств текста и нашли среди них небольшое устойчивое ядро.
273 420 текстовПроверка на таком большом корпусе позволяет увидеть, как результат меняется при разной степени вмешательства ИИ.
20% измененийПри небольшой правке отличить текст от человеческого оказалось заметно труднее, чем при более существенной переработке.
94,4%При доле изменений 60–80% один из методов правильно различал человеческий и отредактированный ИИ-текст почти в 19 случаях из 20.

Можно ли доверять

Это препринт с arXiv, поэтому другие учёные ещё не проверили работу рецензированием. Корпус большой, но результаты получены в рамках эксперимента с заданными долями правки; в реальных текстах, где человек и ИИ меняют материал менее предсказуемо, точность может быть ниже.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.CL)
Дата публикации у нас31 августа 2026 г.
Дата источника28 августа 2026 г.
ОригиналОткрыть
АвторыZhengyang Shan, Yukyung Lee, Sophie Hao