dumai
ИИПрепринтHugging Face Daily Papers

Препринт — материал ещё не прошёл рецензирование

POISE усиливает скрытность атак на навыки LLM-агентов

1

Кратко

В препринте описан способ атаки на навыки LLM-агентов, где вредную инструкцию прячут внутри тела навыка в «естественном» месте. На бенчмарке Skill-Inject с codex+gpt-5.2 этот подход дал более высокий успех атаки, чем сравниваемые базовые варианты, и при этом оставался труднее для обнаружения статическими фильтрами.

Зачем это знать

Это показывает, что у открытого формата навыков есть уязвимость не только к самому внедрению, но и к тому, как именно скрывают вредную инструкцию. Поскольку это препринт и результаты завязаны на конкретные бенчмарки, вывод важен прежде всего для оценки рисков и будущих защит, а не как практический совет пользователям.

Разбор

Авторы взяли обычный формат «навыков» для LLM-агентов — по сути, текстовые инструкции, которые агент подхватывает как расширение своих возможностей — и проверили, как в такой навык можно спрятать вредную команду так, чтобы она не бросалась в глаза. Их идея не сводилась к грубой вставке в заголовок или к явной вредной фразе в тексте: они попытались разместить скрытую инструкцию в таком месте внутри самого тела навыка, где она выглядит естественно и не вызывает подозрений у человека или у автоматической проверки.

Зачем это было нужно: у таких атак есть неприятная развилка. Если вредная часть слишком заметна, навык могут быстро разобрать и заблокировать. Если же её прятать слишком глубоко или неудачно, агент может не выполнить её стабильно. Поэтому исследователи оценивали не просто «сработало ли» атакующее действие, а более жёсткий сценарий: и вредная инструкция должна выполниться, и обычная задача пользователя при этом тоже должна пройти проверку. Это хороший способ посмотреть не на красивую демонстрацию, а на реально опасную атаку.

Новый подход назвали POISE. Он делает ставку на один компактный, внешне безобидный фрагмент в теле навыка и подбирает для него удачное место, а ещё подстраивает формулировку под соседний контекст — например, под шаги подготовки или предварительные действия. На бенчмарке Skill-Inject с codex+gpt-5.2 такой приём дал 89,3% успеха атаки. Это выше, чем у базового варианта со случайным размещением внутри тела навыка, и немного выше, чем у варианта, который полагается только на YAML-заголовок. При этом именно размещение в теле помогает сохранить скрытность.

Самая важная деталь здесь даже не в самом успехе атаки, а в том, как слабо современные статические фильтры различают «чистые» и испорченные навыки. Авторы показывают, что сканеры слишком нервно реагируют на обычные навыки, потому что те часто требуют привилегированных действий с инструментами; из-за этого они ошибочно помечают очень много нормальных примеров как подозрительные. На этом фоне POISE и выигрывает: его вредная версия почти не выделяется на фоне ложных тревог, поэтому текущие статические защиты оказываются малоэффективными.

Ключевые цифры

89.3%Почти девять из десяти атак сработали — это очень высокий уровень для такой скрытной схемы.
28.0 pointsПо сравнению со случайным размещением внутри навыка атака стала заметно надёжнее.
2.6 pointsДаже против варианта только с YAML-заголовком новый способ дал небольшой, но измеримый прирост.
74.6%Статические фильтры ошибочно пометили как подозрительные почти три четверти обычных навыков, то есть у них очень много ложных тревог.

Можно ли доверять

Это препринт на arXiv, значит, работу ещё не прошли независимое рецензирование. Проверка шла на конкретном бенчмарке и конкретной связке моделей, так что цифры хорошо показывают риск, но могут не совпасть в другой системе или после появления более сильных защит.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (via Hugging Face)
Дата публикации у нас25 июля 2026 г.
Дата источника5 июня 2026 г.
ОригиналОткрыть
АвторыHaochang Hao, Dehai Min, Zhifang Zhang, Yunbei Zhang, Miao Xu, Yingqiang Ge, Lu Cheng