dumai
🤖
ИИПрепринтarXiv cs.AI

Препринт — материал ещё не прошёл рецензирование

Защита ИИ-агента снизила успешные атаки примерно в пять раз

0

Кратко

Авторы создали SkillSonar — редактируемую защиту, которая проверяет действия ИИ-агента перед выполнением и при необходимости просит подтвердить их или меняет план. На 206 вредоносных и 43 безопасных сценариях она снизила долю успешных атак с 48,2% до 10,4% в знакомых ситуациях и с 60,6% до 11,5% в новых, сохранив часть полезности работы.

Зачем это знать

Это ранний результат на специально созданных сценариях и в основном на одном модельном агенте, поэтому переносимость на реальные системы пока неясна. Защита также увеличила расход токенов и снизила полезность на новых сценариях.

Разбор

Проблема здесь в том, что опасный навык может выглядеть безобидно сам по себе, а вред проявиться только после появления конкретной задачи и файлов пользователя. Поэтому одной проверки перед установкой недостаточно. Авторы вынесли защиту в отдельный навык: он работает рядом с остальными, смотрит на действие в контексте текущей задачи и выбирает один из трёх вариантов — разрешить, перестроить план или попросить человека подтвердить действие. При этом сам исполнительный механизм агента менять не пришлось.

Для проверки авторы собрали SCOPE-R — набор сценариев с шестью типами риска и 21 более узкой категорией. Затем они улучшали SkillSonar автоматически: система запускала агента, анализировала результат и через поиск по вариантам постепенно меняла текст хранимого навыка-защитника. Это важная деталь: защиту не зашили навсегда в код, а оставили редактируемой и проверяемой.

В десяти повторных запусках на GLM-5 защита показала небольшую разбежку результатов, то есть эффект не зависел от одного удачного прогона. По сравнению с обычной системной инструкцией она заметно лучше сдерживала атаки в обоих типах сценариев: у базового варианта успешными оставались 41,4% атак в знакомых и 48,9% в новых ситуациях. Цена защиты — больше вычислений и просадка выполнения исходной задачи: на новых сценариях полезность агента составила 0,715 против 0,839 без защиты. Дополнительные проверки также указали на перенос результата между моделями, неизвестными типами рисков и внешними тестами, но это всё ещё лабораторная оценка, а не испытание в реальной рабочей среде.

Ключевые цифры

10 запусковЗащиту проверили несколько раз на одних и тех же условиях, поэтому результат меньше зависит от случайности конкретного прогона.
6 типов риска и 21 категорияНабор тестов охватывал не один сценарий злоупотребления, а широкий спектр способов навредить через ИИ-агента.
0,715 против 0,839В новых сценариях защищённый агент сохранял меньше исходной полезности, чем агент без защиты — безопасность потребовала заметной платы.
190,2 тыс. против 179,3 тыс. токеновЗащищённый вариант использовал больше текста и вычислений, чем агент без защиты, то есть работал менее экономно.

Можно ли доверять

Это препринт arXiv, который ещё не прошёл независимое рецензирование. Проверка выглядит содержательнее одного случайного эксперимента: авторы повторили основной тест 10 раз и сравнили несколько моделей, но основная количественная оценка опирается на специально созданные сценарии и главным образом на GLM-5, поэтому поведение в реальных продуктах может отличаться.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.AI)
Дата публикации у нас2 сентября 2026 г.
Дата источника1 сентября 2026 г.
ОригиналОткрыть
АвторыXiaofang Yang, Ziqi Miao, Dianbo Sui, Jing Shao, Lijun Li