Препринт — материал ещё не прошёл рецензирование
Вредоносные данные могут заставить ИИ-агентов делать лишнее
Кратко
Авторы описали новый способ атак на ИИ-агентов, когда злоумышленник подсовывает им вредные данные под видом доверенной служебной информации или формата контекста. В тестах этот приём срабатывал и на обычных языковых моделях, и на реальных агентах, включая веб- и кодирующих помощников.
Зачем это знать
Работа показывает уязвимость современных ИИ-агентов, которые не всегда чётко отделяют доверенные данные от внешних. Это создаёт риск опасных действий, если вредные данные попадают в контекст агента.
Разбор
Авторы посмотрели на проблему под другим углом: не на вредные команды в тексте, а на вредные данные, которые выглядят для агента как обычная служебная информация. Идея в том, что агент получает внешние данные, а потом сам решает, что с ними делать. Если в эти данные подмешать что-то, что похоже на идентификатор, формат ответа или другой «служебный» кусок контекста, агент может начать действовать не так, как должен.
Чтобы проверить это, они атаковали не только обычные языковые модели, но и реальные ИИ-агенты. Важный момент тут в том, что атака срабатывала даже там, где уже есть защита от привычных подсовываний инструкций. То есть прежние меры безопасности, которые заточены именно под «не слушай чужие команды», оказались слабее, когда вред прячется в данных и маскируется под доверенную часть контекста.
Ещё один практический вывод — уязвимость затронула сразу несколько типов агентов. У веб-помощников атака могла заставлять их кликать туда, куда не надо. У кодирующих помощников — приводить к запуску вредного кода и даже к атакам на цепочку поставки, то есть когда опасность попадает через зависимые инструменты или пакеты. Авторы этим показывают не просто одну ошибку в реализации, а более широкую проблему: современные агенты пока не умеют жёстко отделять доверенные данные от недоверенных.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, то есть работу ещё не прошли независимое рецензирование. Зато авторы проверили идею не только на моделях, но и на реальных агентах, что делает выводы практичнее. При этом часть цифр зависит от конкретных систем и форматов данных, так что в других агентных связках результат может быть другим.
Пересказано ИИ по научной статье. Как это устроено