Препринт — материал ещё не прошёл рецензирование
Детектор чаще считал тексты аутичных авторов сгенерированными ИИ
Кратко
В выборке примерно из 60 000 постов Reddit тексты из группы «вероятно-аутичных» авторов чаще получали метку AI-generated от детектора OpenAI GPT-2: 1,9% против 1,5% в общей группе. После учета других признаков вероятность такой метки была примерно на 25% выше.
Зачем это знать
Это повод осторожнее использовать такие детекторы в учёбе и модерации: они могут чаще ошибаться против отдельных групп людей. Результат пока нужен как сигнал для дополнительной проверки, а не как окончательный вывод о всех системах.
Разбор
Авторы не просто посмотрели на общую долю срабатываний детектора, а прогнали через него две большие группы постов с Reddit: одну из авторов, которых по признакам отнесли к «вероятно-аутичным», и вторую — обычную общую выборку. Детектор OpenAI GPT-2 для каждого текста выдавал не только ярлык, но и числовую вероятность того, что текст написан ИИ. Так можно было сравнить не только, сколько постов попало в красную зону, но и как модель в целом ведёт себя на разных типах текста.
Зачем это было нужно? Речь шла не только о слухах и отдельных примерах, что такие системы чаще цепляют тексты определённых групп людей. Авторы попытались проверить это на большом корпусе постов и одновременно понять, не объясняется ли разница какими-то свойствами самого текста. Они сравнили длину предложений, длину слов, показатель «перплексии» — по сути, меру того, насколько текст для модели предсказуем — и «burstiness», то есть насколько текст по ритму и структуре получается ровным или скачкообразным.
Самый важный итог оказался таким: тексты из вероятно-аутичной группы чаще получали метку AI-generated, даже если учесть другие признаки. При этом связь была не такой простой, как «тексты похожи на ИИ-тексты». Например, более высокая перплексия, то есть менее предсказуемый текст, наоборот, снижала шанс срабатывания детектора. А короткие посты чаще ошибочно попадали под подозрение — это хорошо согласуется с известной слабостью детекторов к коротким текстам.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, то есть работу ещё не проверяли независимые рецензенты. Зато авторы использовали очень большую выборку постов, а не маленький эксперимент. При этом данные взяты из Reddit, и выводы касаются именно такого текста и именно одного детектора, так что переносить результат на все платформы и все системы стоит осторожно.
Пересказано ИИ по научной статье. Как это устроено