dumai
ИИПрепринтarXiv cs.LG

Препринт — материал ещё не прошёл рецензирование

Визуально оформленный текст обходит многие ИИ-модераторы

0

Кратко

Авторы показали способ прятать вредный смысл в тексте с помощью заметных визуальных приёмов: пробелов, выделения и расположения слов. В черном ящике на 10 системах такой текст люди распознавали как вредный более чем в 86% случаев, а системы обнаруживали его менее чем в 1% случаев; для атаки хватало трёх запросов к детектору.

Зачем это знать

Это показывает уязвимость современных ИИ-систем модерации к простым типографическим уловкам, которые легко заметны человеку. Поскольку это препринт и тестировали ограниченный набор систем, за выводами стоит следить, а не считать их окончательными.

Разбор

Авторы не просто проверили, можно ли «обмануть» модератор, а собрали саму атаку как двухшаговую схему. Сначала они берут короткий вредный фрагмент и прячут его в безобидный текст, а потом меняют его оформление так, чтобы человеку он всё ещё бросался в глаза. Для этого они опираются не на какие-то редкие трюки, а на обычные вещи, которые люди и так видят в соцсетях: жирный шрифт, необычные пробелы, цвет, выделение и расположение текста.

Логика здесь простая: современные LLM-модераторы в основном читают текст как последовательность токенов, то есть кусочков текста, и почти не учитывают визуальный вид страницы. Из-за этого возникает странная разница: человек сразу замечает токсичную реплику, а система может её почти не видеть. Чтобы проверить, насколько эта разница реально опасна, исследователи сделали несколько наборов данных и отдельно проверяли, какие типографические приёмы лучше работают на людях и на автоматике.

Самый интересный результат — атака срабатывает даже в чёрном ящике, то есть без доступа к внутренностям модели и без градиентов, которые обычно нужны для тонкой настройки атаки. Авторы говорят, что им хватало всего трёх запросов к детектору, чтобы сгенерировать обходной вариант. При этом люди распознавали вредный смысл в более чем 86% случаев, а десять проверенных систем модерации, включая коммерческие API и open-source-защиты, ловили такие примеры меньше чем в 1% случаев.

Ещё одна важная деталь: они не ограничились демонстрацией одной удачной уловки. В статье есть разбор, какие именно визуальные факторы помогают скрытности, и почему нынешние модерационные архитектуры плохо улавливают такие сигналы. То есть работа показывает не только саму дыру, но и то, что проблема системная: если модерация смотрит только на текст как на набор токенов, она легко пропускает то, что человек видит глазами.

Ключевые цифры

3 запросаАтаке хватало буквально пары попыток, чтобы подобрать вариант, который ускользает от модерации.
>86%Люди в большинстве случаев всё ещё понимали, что в тексте спрятан вредный смысл.
<1%Почти все протестированные системы модерации пропускали такие примеры.
10 систем модерацииПроблему проверили не на одной модели, а сразу на десятке разных защит, включая коммерческие и открытые решения.

Можно ли доверять

Это препринт на arXiv, так что работу ещё не проверяли независимые рецензенты. С другой стороны, авторы тестировали атаку сразу на десяти системах и отдельно смотрели, как её воспринимают люди, поэтому сигнал о слабом месте выглядит серьёзным. Но это всё же исследование конкретной атаки в лабораторных условиях, а не гарантия, что любой реальный модератор будет вести себя точно так же.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.LG)
Дата публикации у нас9 июня 2026 г.
Дата источника8 июня 2026 г.
ОригиналОткрыть
АвторыQin Yang, Lu Malloy, Joshua Lee, Xiaohan Chang, Meisam Mohammady, Doowon Kim, Yuan Hong