Препринт — материал ещё не прошёл рецензирование
ИИ-детекторы всё ещё обходят сменой стиля текста
Кратко
Авторы проверили, как можно обходить детекторы текста, созданного ИИ, в соревновании ELOQUENT 2026. Они нашли два приёма: менять стиль и язык текста так, чтобы он выходил за пределы того, чему детектор учился, и это давало до примерно 50 раз больше успешных обходов, чем прежние способы.
Зачем это знать
Это показывает слабое место таких систем: на одних и тех же детекторах можно найти обход через смену формы текста, а не только через подмену слов. Для тех, кто строит такие фильтры, это сигнал проверять их на тексты, сильно отличающиеся от обучающих примеров.
Разбор
Авторы не просто проверили, можно ли обмануть детектор, а собрали и сравнили несколько вариантов таких атак в рамках соревнования ELOQUENT 2026. Смысл был в том, чтобы понять, какие уловки переживают дообучение детектора на «враждебных» примерах — то есть когда систему специально тренируют распознавать обходы. Оказалось, что старые приёмы после такого дообучения почти сразу ломаются, а вот другие, более хитрые способы остаются рабочими.
Главная находка здесь — детектор оказывается куда более уязвим, когда сгенерированный текст уводят далеко от того, на чём он учился. Проще говоря, если текст выглядит не просто «по-человечески», а ещё и заметно выбивается из привычного для детектора стиля, он хуже понимает, с чем имеет дело. А вот попытка, наоборот, приблизить текст к обычным образцам из обучающих данных, не помогла вообще: такая стратегия обход не усилила.
На этой идее авторы построили две новые атаки. В одной текст переводили в манеру, похожую на старую литературную прозу, а в другой — в поток почти несобранных, ассоциативных мыслей в духе модернистской прозы. Обе стратегии сохранили естественность текста, но при этом заметно чаще проходили мимо детекторов. Ещё один важный вывод: даже если просто добавить в обучение тексты из другой эпохи, это не обязательно закрывает дыру — проблема сидит глубже, в самой чувствительности детектора к структурным сдвигам текста.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, значит, работу ещё не прошли внешнее рецензирование. Сильная сторона — авторы тестировали не игрушечный пример, а сразу на лучших атаках соревнования и на нескольких семействах детекторов. Но пока это всё ещё лабораторная проверка в рамках соревнования, а не большой тест в реальном продукте, так что поведение систем на практике может отличаться.
Пересказано ИИ по научной статье. Как это устроено