dumai
ИИПрепринтarXiv cs.AI

Препринт — материал ещё не прошёл рецензирование

Веб-агенты на LLM уязвимы к prompt injection

0

Кратко

Авторы предлагают benchmark, который оценивает prompt-injection атаки не только по технике взлома, но и по тому, кому именно наносится вред. На проверенных конфигурациях веб-агентов они видят заметную уязвимость сразу по нескольким типам целей и режимам сбоев.

Зачем это знать

Это помогает точнее измерять риски у LLM-агентов, работающих с открытым веб-контентом, где вред может по-разному затрагивать пользователя, продавца или платформу. Но это предварительный preprint, поэтому выводы относятся к протестированным конфигурациям и не дают прямых практических рекомендаций для всех систем.

Разбор

Авторы не просто проверили, может ли атака «пробить» веб-агента. Они собрали специальный бенчмарк — то есть набор тестов, который смотрит на вред с разных сторон: кому именно он вредит, к какой цели ведёт и как ломает поведение агента. Простыми словами, они сделали проверку не только на «взломалось или нет», а на то, что именно пошло не так и для кого это оказалось проблемой.

Зачем такой подход понадобился? Потому что один и тот же вредный фрагмент на странице может по-разному ударить по разным участникам: пользователю, продавцу или платформе. Старые оценки обычно мерили только успех атаки в целом и не замечали, что одна система может тихо делать не то, что надо, другая — срывать задачу пользователя, а третья — просто становиться нестабильной. Здесь как раз показали, что эти различия не случайны, а зависят и от самой архитектуры агента, и от выбранной модели внутри него.

Самый важный итог в том, что нынешние веб-агенты уязвимы сразу по нескольким сценариям, и не нашлось ни одной цели атаки, которую они бы надёжно отражали. При этом сбои выглядят по-разному: иногда атака проходит незаметно и не мешает основной задаче, иногда ломает задачу без явного успеха самой атаки, а иногда происходит и то и другое сразу. Ещё авторы сравнили разные конфигурации и увидели, что выбор базовой модели сильнее влияет на уязвимость, чем сама оболочка агента: одна и та же архитектура с разными моделями может вести себя заметно по-разному.

Ключевые цифры

54.91%В одной из проверенных конфигураций атака срабатывала больше чем в половине случаев — это уже не редкий сбой, а регулярная проблема.
56.09%Другая конфигурация показала почти такой же уровень уязвимости, то есть проблема не сводится к одной конкретной системе.
26.49 pointsПереход на другую базовую модель резко увеличил уязвимость в одной из систем — настолько, что выбор модели стал решающим фактором.
45.09%В самой слабой по устойчивости конфигурации почти каждый второй тест заканчивался сбоем в работе агента.

Можно ли доверять

Это preprint на arXiv, то есть работу ещё не проверили рецензенты. Но авторы тестировали несколько конфигураций веб-агентов и сравнивали их между собой, так что выводы выглядят содержательно, хоть и относятся только к тем системам, которые вошли в benchmark. Для реальных продуктов это хороший сигнал о риске, но не универсальный приговор для всех LLM-агентов.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.AI)
Дата публикации у нас12 июня 2026 г.
Дата источника11 июня 2026 г.
ОригиналОткрыть
АвторыZihao Wang, Yiming Li, Yutong Wu, Zheyu Liu, Kangjie Chen, Fok Kar Wai, Pin-Yu Chen, Vrizlynn L. L. Thing, Bo Li, Dacheng Tao