dumai
ИИПрепринтarXiv cs.AI

Препринт — материал ещё не прошёл рецензирование

На одной модели вредные инструменты перехватывали вызовы MCP-агентов в 93,6% тестов

0

Кратко

Работа изучала ИИ-помощников, подключённых к протоколу MCP — способу находить и использовать сторонние инструменты. На одной модели специально настроенные описания и ответы вредных инструментов часто заставляли помощника выбрать их: успешность атак на утечку данных, повреждение среды и сбой рассуждений достигала 74,4%. На четырёх других моделях без новой настройки этот показатель снизился до 24,5%.

Зачем это знать

Это ранний сигнал риска для систем, которые подключают ИИ к чужим инструментам: специально подготовленные описания и ответы могут направлять его действия. Результаты получены на конкретном наборе тестов и не показывают, как часто такие атаки сработают в реальных продуктах.

Разбор

Авторы проверяли не просто «может ли агент выбрать вредный инструмент», а разделили атаку на два шага. Сначала вредному инструменту подбирали описание и другие служебные данные так, чтобы агент чаще замечал именно его. Затем изучали следы выполнения — последовательность действий агента — и по ним дорабатывали ответы инструмента, чтобы направить уже начатую работу к нужному злоумышленнику результату. Всё это делали без доступа к внутренним параметрам моделей: система видела только их запросы и ответы, как внешний атакующий.

Проверка прошла на LiveMCPBench — наборе из 95 повседневных задач в офисе, путешествиях, покупках и других сферах. В нём использовали 70 серверов MCP и 527 инструментов, а эксперименты провели на пяти языковых моделях, включая GPT-5, Qwen3-Max и DeepSeek-V3.1. Такой дизайн важен: он показывает не только результат на одной специально настроенной модели, но и то, насколько атака переносится на другие модели без повторной оптимизации.

Отдельно авторы измерили атаку типа «когнитивный отказ в обслуживании»: вредный инструмент не обязательно крадёт данные, а может заставить агента тратить намного больше вычислений и денег на одну задачу. В самом тяжёлом сценарии расходы на токены выросли в 32,4 раза относительно обычного набора инструментов. При этом перенос на другие модели оказался заметно слабее, чем прямая настройка атаки, что показывает зависимость результата от конкретной модели и условий теста.

Ключевые цифры

95 задачАтаку проверили не на одном искусственном примере, а на наборе сценариев из разных бытовых областей.
527 инструментовТест охватывал большой набор подключаемых возможностей, поэтому вредному инструменту приходилось конкурировать с множеством обычных.
32,4×В одном из сценариев агент расходовал на задачу более чем в 32 раза больше токенов, чем с безопасным набором инструментов.
2,7×После переноса атаки на другие модели лишние расходы всё ещё были заметны, но стали гораздо меньше, чем при настройке под исходную модель.

Можно ли доверять

Это препринт на arXiv, а не статья, прошедшая рецензирование. Проверка выглядит содержательной: авторы использовали 95 задач, 70 серверов и пять моделей, а код опубликовали открыто. Но эксперимент проходил на тестовом наборе и агенте, собранном на LangChain, поэтому реальные показатели в конкретных продуктах могут отличаться.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.AI)
Дата публикации у нас24 сентября 2026 г.
Дата источника22 сентября 2026 г.
ОригиналОткрыть
АвторыLaizhen Li, Xuan Wang, Peicheng Zhao, Juanjuan Zhao, Kejiang Ye, Cheng-zhong Xu, Xitong Gao