Препринт — материал ещё не прошёл рецензирование
Защита ИИ-агента снизила успешные атаки примерно в пять раз
Кратко
Авторы создали SkillSonar — редактируемую защиту, которая проверяет действия ИИ-агента перед выполнением и при необходимости просит подтвердить их или меняет план. На 206 вредоносных и 43 безопасных сценариях она снизила долю успешных атак с 48,2% до 10,4% в знакомых ситуациях и с 60,6% до 11,5% в новых, сохранив часть полезности работы.
Зачем это знать
Это ранний результат на специально созданных сценариях и в основном на одном модельном агенте, поэтому переносимость на реальные системы пока неясна. Защита также увеличила расход токенов и снизила полезность на новых сценариях.
Разбор
Проблема здесь в том, что опасный навык может выглядеть безобидно сам по себе, а вред проявиться только после появления конкретной задачи и файлов пользователя. Поэтому одной проверки перед установкой недостаточно. Авторы вынесли защиту в отдельный навык: он работает рядом с остальными, смотрит на действие в контексте текущей задачи и выбирает один из трёх вариантов — разрешить, перестроить план или попросить человека подтвердить действие. При этом сам исполнительный механизм агента менять не пришлось.
Для проверки авторы собрали SCOPE-R — набор сценариев с шестью типами риска и 21 более узкой категорией. Затем они улучшали SkillSonar автоматически: система запускала агента, анализировала результат и через поиск по вариантам постепенно меняла текст хранимого навыка-защитника. Это важная деталь: защиту не зашили навсегда в код, а оставили редактируемой и проверяемой.
В десяти повторных запусках на GLM-5 защита показала небольшую разбежку результатов, то есть эффект не зависел от одного удачного прогона. По сравнению с обычной системной инструкцией она заметно лучше сдерживала атаки в обоих типах сценариев: у базового варианта успешными оставались 41,4% атак в знакомых и 48,9% в новых ситуациях. Цена защиты — больше вычислений и просадка выполнения исходной задачи: на новых сценариях полезность агента составила 0,715 против 0,839 без защиты. Дополнительные проверки также указали на перенос результата между моделями, неизвестными типами рисков и внешними тестами, но это всё ещё лабораторная оценка, а не испытание в реальной рабочей среде.
Ключевые цифры
Можно ли доверять
Это препринт arXiv, который ещё не прошёл независимое рецензирование. Проверка выглядит содержательнее одного случайного эксперимента: авторы повторили основной тест 10 раз и сравнили несколько моделей, но основная количественная оценка опирается на специально созданные сценарии и главным образом на GLM-5, поэтому поведение в реальных продуктах может отличаться.
Пересказано ИИ по научной статье. Как это устроено