Препринт — материал ещё не прошёл рецензирование
POISE усиливает скрытность атак на навыки LLM-агентов
Кратко
В препринте описан способ атаки на навыки LLM-агентов, где вредную инструкцию прячут внутри тела навыка в «естественном» месте. На бенчмарке Skill-Inject с codex+gpt-5.2 этот подход дал более высокий успех атаки, чем сравниваемые базовые варианты, и при этом оставался труднее для обнаружения статическими фильтрами.
Зачем это знать
Это показывает, что у открытого формата навыков есть уязвимость не только к самому внедрению, но и к тому, как именно скрывают вредную инструкцию. Поскольку это препринт и результаты завязаны на конкретные бенчмарки, вывод важен прежде всего для оценки рисков и будущих защит, а не как практический совет пользователям.
Разбор
Авторы взяли обычный формат «навыков» для LLM-агентов — по сути, текстовые инструкции, которые агент подхватывает как расширение своих возможностей — и проверили, как в такой навык можно спрятать вредную команду так, чтобы она не бросалась в глаза. Их идея не сводилась к грубой вставке в заголовок или к явной вредной фразе в тексте: они попытались разместить скрытую инструкцию в таком месте внутри самого тела навыка, где она выглядит естественно и не вызывает подозрений у человека или у автоматической проверки.
Зачем это было нужно: у таких атак есть неприятная развилка. Если вредная часть слишком заметна, навык могут быстро разобрать и заблокировать. Если же её прятать слишком глубоко или неудачно, агент может не выполнить её стабильно. Поэтому исследователи оценивали не просто «сработало ли» атакующее действие, а более жёсткий сценарий: и вредная инструкция должна выполниться, и обычная задача пользователя при этом тоже должна пройти проверку. Это хороший способ посмотреть не на красивую демонстрацию, а на реально опасную атаку.
Новый подход назвали POISE. Он делает ставку на один компактный, внешне безобидный фрагмент в теле навыка и подбирает для него удачное место, а ещё подстраивает формулировку под соседний контекст — например, под шаги подготовки или предварительные действия. На бенчмарке Skill-Inject с codex+gpt-5.2 такой приём дал 89,3% успеха атаки. Это выше, чем у базового варианта со случайным размещением внутри тела навыка, и немного выше, чем у варианта, который полагается только на YAML-заголовок. При этом именно размещение в теле помогает сохранить скрытность.
Самая важная деталь здесь даже не в самом успехе атаки, а в том, как слабо современные статические фильтры различают «чистые» и испорченные навыки. Авторы показывают, что сканеры слишком нервно реагируют на обычные навыки, потому что те часто требуют привилегированных действий с инструментами; из-за этого они ошибочно помечают очень много нормальных примеров как подозрительные. На этом фоне POISE и выигрывает: его вредная версия почти не выделяется на фоне ложных тревог, поэтому текущие статические защиты оказываются малоэффективными.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, значит, работу ещё не прошли независимое рецензирование. Проверка шла на конкретном бенчмарке и конкретной связке моделей, так что цифры хорошо показывают риск, но могут не совпасть в другой системе или после появления более сильных защит.
Пересказано ИИ по научной статье. Как это устроено