Препринт — материал ещё не прошёл рецензирование
Линейный детектор текстов ИИ переносился на новые условия, обучившись менее чем на 100 примерах
Кратко
Авторы проверили простой способ распознавать тексты, созданные ИИ, на четырёх наборах тестов и сравнили его с 16 другими детекторами. Он лучше переносился на незнакомые условия: примерно на 11 пунктов по сводной оценке качества распознавания, а почти лучшего результата достигал менее чем на 100 примерах. Кроме того, способ оценивал не только границу между человеческим и машинным текстом, но и степень участия ИИ в его создании.
Зачем это знать
Работа показывает, что внутренние представления языковой модели могут помогать детектору хорошо переноситься между разными условиями даже при небольшом числе обучающих примеров. Но это пока результат препринта на четырёх тестах и одной системе ИИ; он также не показывает, насколько надёжно детектор работает против авторов, специально обходящих проверку.
Разбор
Авторы не переобучали языковую модель и не искали длинный список внешних признаков. Они взяли её внутренние состояния — числовое описание, которое модель формирует во время обработки текста, — и заморозили саму модель. Затем обучили поверх этих данных простой линейный классификатор: он ищет направление, вдоль которого тексты человека и ИИ различаются. Проверили два варианта: один усредняет решения по слоям модели, другой объединяет информацию из всех слоёв.
Ключевые цифры
Можно ли доверять
Это препринт с arXiv, поэтому другие учёные ещё не провели независимую проверку работы. Авторы проверяли метод на тестовых наборах, а не в реальной переписке, и использовали представления одной базовой языковой модели; устойчивость против намеренного обхода детектора остаётся открытым вопросом.
Пересказано ИИ по научной статье. Как это устроено