Препринт — материал ещё не прошёл рецензирование
В тесте адаптивная атака обошла ИИ-модераторов в 80% случаев
Кратко
Авторы проверили защиту на 229 смысловых подгруппах и 5 002 примерах, собранных на платформах. В тесте сообщения постепенно переписывали после каждой проверки, сохраняя приемлемую читаемость; через 12 раундов такой обход удался в 80,3% случаев.
Зачем это знать
Результат показывает, что статические проверки могут не отражать устойчивость модерации к меняющимся попыткам обхода. При этом цифра 80,3% относится к специально организованному тесту и не показывает, как часто такое происходит на реальных платформах.
Разбор
Авторы заменили обычный «экзамен» для модераторов на игру с ответными ходами. Сначала система пытается сформулировать вредное сообщение, затем получает условную оценку модератора и переписывает текст так, чтобы сохранить смысл, но пройти проверку. Отдельная проверка следит, чтобы результат оставался читаемым для человека, а не превращался в набор случайных символов. Так авторы моделируют ситуацию, когда пользователь не ограничивается одной попыткой, а подстраивает формулировку после каждого отказа.
Главная проблема здесь — разрыв между лабораторным тестом и работой на платформе. В статическом наборе модератор видит заранее подготовленные примеры, тогда как в реальности формулировки могут меняться прямо в ответ на его реакцию. EvoHarmBench оценивает именно такую устойчивость: сообщения объединяют по смысловым подгруппам, а затем проверяют не один вариант, а целую цепочку изменений.
Расширенные результаты показывают, что размер и известность модели сами по себе не гарантируют защиту. В этой проверке шесть компактных открытых моделей в среднем показали 91,2% успешных обходов — выше, чем группа из семи передовых коммерческих моделей с результатом 80,3%. Авторы также сравнили обычные версии некоторых открытых моделей с вариантами, дополнительно обученными на данных модерации: такое обучение не устранило уязвимость. Для сверки с людьми они вручную разметили часть примеров; выбранный автоматический порог дал 83,8% точности.
Ключевые цифры
Можно ли доверять
Это препринт arXiv, поэтому работу ещё не проверили независимые рецензенты. Тест выглядит содержательным: авторы сравнили 13 моделей и сверили автоматическую оценку с людьми, но результат измеряет устойчивость в специально созданной цепочке атак, а не частоту таких обходов на реальных платформах.
Пересказано ИИ по научной статье. Как это устроено