Препринт — материал ещё не прошёл рецензирование
Визуально оформленный текст обходит многие ИИ-модераторы
Кратко
Авторы показали способ прятать вредный смысл в тексте с помощью заметных визуальных приёмов: пробелов, выделения и расположения слов. В черном ящике на 10 системах такой текст люди распознавали как вредный более чем в 86% случаев, а системы обнаруживали его менее чем в 1% случаев; для атаки хватало трёх запросов к детектору.
Зачем это знать
Это показывает уязвимость современных ИИ-систем модерации к простым типографическим уловкам, которые легко заметны человеку. Поскольку это препринт и тестировали ограниченный набор систем, за выводами стоит следить, а не считать их окончательными.
Разбор
Авторы не просто проверили, можно ли «обмануть» модератор, а собрали саму атаку как двухшаговую схему. Сначала они берут короткий вредный фрагмент и прячут его в безобидный текст, а потом меняют его оформление так, чтобы человеку он всё ещё бросался в глаза. Для этого они опираются не на какие-то редкие трюки, а на обычные вещи, которые люди и так видят в соцсетях: жирный шрифт, необычные пробелы, цвет, выделение и расположение текста.
Логика здесь простая: современные LLM-модераторы в основном читают текст как последовательность токенов, то есть кусочков текста, и почти не учитывают визуальный вид страницы. Из-за этого возникает странная разница: человек сразу замечает токсичную реплику, а система может её почти не видеть. Чтобы проверить, насколько эта разница реально опасна, исследователи сделали несколько наборов данных и отдельно проверяли, какие типографические приёмы лучше работают на людях и на автоматике.
Самый интересный результат — атака срабатывает даже в чёрном ящике, то есть без доступа к внутренностям модели и без градиентов, которые обычно нужны для тонкой настройки атаки. Авторы говорят, что им хватало всего трёх запросов к детектору, чтобы сгенерировать обходной вариант. При этом люди распознавали вредный смысл в более чем 86% случаев, а десять проверенных систем модерации, включая коммерческие API и open-source-защиты, ловили такие примеры меньше чем в 1% случаев.
Ещё одна важная деталь: они не ограничились демонстрацией одной удачной уловки. В статье есть разбор, какие именно визуальные факторы помогают скрытности, и почему нынешние модерационные архитектуры плохо улавливают такие сигналы. То есть работа показывает не только саму дыру, но и то, что проблема системная: если модерация смотрит только на текст как на набор токенов, она легко пропускает то, что человек видит глазами.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, так что работу ещё не проверяли независимые рецензенты. С другой стороны, авторы тестировали атаку сразу на десяти системах и отдельно смотрели, как её воспринимают люди, поэтому сигнал о слабом месте выглядит серьёзным. Но это всё же исследование конкретной атаки в лабораторных условиях, а не гарантия, что любой реальный модератор будет вести себя точно так же.
Пересказано ИИ по научной статье. Как это устроено