Препринт — материал ещё не прошёл рецензирование
На одной модели вредные инструменты перехватывали вызовы MCP-агентов в 93,6% тестов
Кратко
Работа изучала ИИ-помощников, подключённых к протоколу MCP — способу находить и использовать сторонние инструменты. На одной модели специально настроенные описания и ответы вредных инструментов часто заставляли помощника выбрать их: успешность атак на утечку данных, повреждение среды и сбой рассуждений достигала 74,4%. На четырёх других моделях без новой настройки этот показатель снизился до 24,5%.
Зачем это знать
Это ранний сигнал риска для систем, которые подключают ИИ к чужим инструментам: специально подготовленные описания и ответы могут направлять его действия. Результаты получены на конкретном наборе тестов и не показывают, как часто такие атаки сработают в реальных продуктах.
Разбор
Авторы проверяли не просто «может ли агент выбрать вредный инструмент», а разделили атаку на два шага. Сначала вредному инструменту подбирали описание и другие служебные данные так, чтобы агент чаще замечал именно его. Затем изучали следы выполнения — последовательность действий агента — и по ним дорабатывали ответы инструмента, чтобы направить уже начатую работу к нужному злоумышленнику результату. Всё это делали без доступа к внутренним параметрам моделей: система видела только их запросы и ответы, как внешний атакующий.
Проверка прошла на LiveMCPBench — наборе из 95 повседневных задач в офисе, путешествиях, покупках и других сферах. В нём использовали 70 серверов MCP и 527 инструментов, а эксперименты провели на пяти языковых моделях, включая GPT-5, Qwen3-Max и DeepSeek-V3.1. Такой дизайн важен: он показывает не только результат на одной специально настроенной модели, но и то, насколько атака переносится на другие модели без повторной оптимизации.
Отдельно авторы измерили атаку типа «когнитивный отказ в обслуживании»: вредный инструмент не обязательно крадёт данные, а может заставить агента тратить намного больше вычислений и денег на одну задачу. В самом тяжёлом сценарии расходы на токены выросли в 32,4 раза относительно обычного набора инструментов. При этом перенос на другие модели оказался заметно слабее, чем прямая настройка атаки, что показывает зависимость результата от конкретной модели и условий теста.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, а не статья, прошедшая рецензирование. Проверка выглядит содержательной: авторы использовали 95 задач, 70 серверов и пять моделей, а код опубликовали открыто. Но эксперимент проходил на тестовом наборе и агенте, собранном на LangChain, поэтому реальные показатели в конкретных продуктах могут отличаться.
Пересказано ИИ по научной статье. Как это устроено