dumai
🤖
ИИПрепринтarXiv cs.CL

Препринт — материал ещё не прошёл рецензирование

В тесте адаптивная атака обошла ИИ-модераторов в 80% случаев

0

Кратко

Авторы проверили защиту на 229 смысловых подгруппах и 5 002 примерах, собранных на платформах. В тесте сообщения постепенно переписывали после каждой проверки, сохраняя приемлемую читаемость; через 12 раундов такой обход удался в 80,3% случаев.

Зачем это знать

Результат показывает, что статические проверки могут не отражать устойчивость модерации к меняющимся попыткам обхода. При этом цифра 80,3% относится к специально организованному тесту и не показывает, как часто такое происходит на реальных платформах.

Разбор

Авторы заменили обычный «экзамен» для модераторов на игру с ответными ходами. Сначала система пытается сформулировать вредное сообщение, затем получает условную оценку модератора и переписывает текст так, чтобы сохранить смысл, но пройти проверку. Отдельная проверка следит, чтобы результат оставался читаемым для человека, а не превращался в набор случайных символов. Так авторы моделируют ситуацию, когда пользователь не ограничивается одной попыткой, а подстраивает формулировку после каждого отказа.

Главная проблема здесь — разрыв между лабораторным тестом и работой на платформе. В статическом наборе модератор видит заранее подготовленные примеры, тогда как в реальности формулировки могут меняться прямо в ответ на его реакцию. EvoHarmBench оценивает именно такую устойчивость: сообщения объединяют по смысловым подгруппам, а затем проверяют не один вариант, а целую цепочку изменений.

Расширенные результаты показывают, что размер и известность модели сами по себе не гарантируют защиту. В этой проверке шесть компактных открытых моделей в среднем показали 91,2% успешных обходов — выше, чем группа из семи передовых коммерческих моделей с результатом 80,3%. Авторы также сравнили обычные версии некоторых открытых моделей с вариантами, дополнительно обученными на данных модерации: такое обучение не устранило уязвимость. Для сверки с людьми они вручную разметили часть примеров; выбранный автоматический порог дал 83,8% точности.

Ключевые цифры

13 модераторовАвторы сравнили не одну систему, а широкий набор моделей — коммерческих и открытых.
91,2%Такова средняя доля успешных обходов у компактных открытых моделей в этом специально организованном тесте.
83,8%Автоматическая оценка совпала с человеческой разметкой примерно в пяти случаях из шести на проверенной части примеров.

Можно ли доверять

Это препринт arXiv, поэтому работу ещё не проверили независимые рецензенты. Тест выглядит содержательным: авторы сравнили 13 моделей и сверили автоматическую оценку с людьми, но результат измеряет устойчивость в специально созданной цепочке атак, а не частоту таких обходов на реальных платформах.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.CL)
Дата публикации у нас31 августа 2026 г.
Дата источника28 августа 2026 г.
ОригиналОткрыть
АвторыRuijie Jian, Benlei Cui, Ting Ma, Haidong Ding, Kangwei Liu, Ziwen Xu, Longtao Huang, Hui Xue, Ziqiang Zhu, Junjie Li