dumai
🤖
ИИПрепринтarXiv cs.CL

Препринт — материал ещё не прошёл рецензирование

ИИ-детекторы всё ещё обходят сменой стиля текста

0

Кратко

Авторы проверили, как можно обходить детекторы текста, созданного ИИ, в соревновании ELOQUENT 2026. Они нашли два приёма: менять стиль и язык текста так, чтобы он выходил за пределы того, чему детектор учился, и это давало до примерно 50 раз больше успешных обходов, чем прежние способы.

Зачем это знать

Это показывает слабое место таких систем: на одних и тех же детекторах можно найти обход через смену формы текста, а не только через подмену слов. Для тех, кто строит такие фильтры, это сигнал проверять их на тексты, сильно отличающиеся от обучающих примеров.

Разбор

Авторы не просто проверили, можно ли обмануть детектор, а собрали и сравнили несколько вариантов таких атак в рамках соревнования ELOQUENT 2026. Смысл был в том, чтобы понять, какие уловки переживают дообучение детектора на «враждебных» примерах — то есть когда систему специально тренируют распознавать обходы. Оказалось, что старые приёмы после такого дообучения почти сразу ломаются, а вот другие, более хитрые способы остаются рабочими.

Главная находка здесь — детектор оказывается куда более уязвим, когда сгенерированный текст уводят далеко от того, на чём он учился. Проще говоря, если текст выглядит не просто «по-человечески», а ещё и заметно выбивается из привычного для детектора стиля, он хуже понимает, с чем имеет дело. А вот попытка, наоборот, приблизить текст к обычным образцам из обучающих данных, не помогла вообще: такая стратегия обход не усилила.

На этой идее авторы построили две новые атаки. В одной текст переводили в манеру, похожую на старую литературную прозу, а в другой — в поток почти несобранных, ассоциативных мыслей в духе модернистской прозы. Обе стратегии сохранили естественность текста, но при этом заметно чаще проходили мимо детекторов. Ещё один важный вывод: даже если просто добавить в обучение тексты из другой эпохи, это не обязательно закрывает дыру — проблема сидит глубже, в самой чувствительности детектора к структурным сдвигам текста.

Ключевые цифры

топ-5 позицийАвторы проверили свои атаки не на случайном наборе, а среди лучших решений соревнования.
2025Старые рабочие приёмы из прошлогоднего состязания уже перестали помогать после дополнительного обучения детектора.
примерно 50xНовые атаки проходили проверку детекторами примерно в 50 раз чаще, чем прежние способы.

Можно ли доверять

Это препринт на arXiv, значит, работу ещё не прошли внешнее рецензирование. Сильная сторона — авторы тестировали не игрушечный пример, а сразу на лучших атаках соревнования и на нескольких семействах детекторов. Но пока это всё ещё лабораторная проверка в рамках соревнования, а не большой тест в реальном продукте, так что поведение систем на практике может отличаться.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.CL)
Дата публикации у нас16 июля 2026 г.
Дата источника15 июля 2026 г.
ОригиналОткрыть
АвторыDima Galat, Marian-Andrei Rizoiu