dumai
ИИПрепринтarXiv cs.AI

Препринт — материал ещё не прошёл рецензирование

Одно письмо может незаметно испортить память ИИ-агента

1

Кратко

Авторы проверили, можно ли заставить личного ИИ-агента тихо записать вредную информацию в долговременную память после одного письма. В тесте на 56 отложенных случаях атака сработала в 87,5% случаев на OpenClaw с GPT-5.4 и в 71,4% случаев на Claude Code SDK с Sonnet 4.6.

Зачем это знать

Это показывает, что у личных ИИ-агентов память может стать слабым местом: обычное внешнее сообщение иногда превращается в скрытый источник ошибок в будущем. О таких системах стоит помнить при проектировании и защите, особенно если они сами читают почту и действуют от вашего имени.

Разбор

Авторы не просто проверили, «можно ли подсунуть вредный текст» ИИ-агенту. Они собрали сценарий, в котором агент сам читает внешнее письмо, умеет запоминать важное в постоянную память и потом использует это как основу для будущих ответов. Именно в такой связке и возникает риск: если вредный кусок текста незаметно попал в память, он уже начинает работать как будто это нормальная, проверенная информация.

Чтобы проверить эту идею не в игрушечной схеме, а ближе к реальной жизни, они сделали WhisperBench — набор из 108 случаев. Там есть пять типов риска, а в саму проверку включили и подмену фактов, и подмену предпочтений. Основа тоже практическая: реальный поток писем через IMAP/SMTP и настоящий навык почтового агента. Это важно, потому что многие прошлые тесты на «инъекции» смотрели только на то, сработала ли вредная команда здесь и сейчас, а здесь проверяли полный цикл: письмо, запись в память, скрытность ответа и влияние на будущее поведение.

Для самой атаки они предложили MemGhost — схему, которая пытается подготовить одно письмо так, чтобы оно сработало без подсказок в процессе. Поскольку атакующий не видит внутреннюю работу агента и не получает обратной связи во время выполнения, авторы использовали два «заместителя»: один имитировал среду, где живёт агент, а второй оценивал, насколько хорошо письмо добилось двух целей сразу — чтобы память приняла вредный текст и чтобы сам диалог выглядел невинно. Затем эту схему дообучали на примерах и с подкреплением, то есть поощряли те варианты письма, которые лучше проходили обе проверки.

Главный практический вывод не ограничился одной связкой моделей: атака переносилась и на другие агентные архитектуры, и на разные хранилища памяти, включая файловое и векторное. Более того, она продолжала работать даже против защит на уровне входа, самой модели и системных правил. То есть проблема не сводится к одной конкретной реализации — если личный агент умеет долго помнить и сам ходит во внешнюю среду, обычное письмо может стать точкой входа для долгой скрытой порчи поведения.

Ключевые цифры

108 случаевСтолько разных сценариев включили в новый набор проверок — это уже не один удачный пример, а целая тестовая батарея.
5 категорий рискаАвторы заранее разложили угрозы по пяти типам, чтобы проверить не один частный трюк, а разные способы навредить памяти агента.
56 отложенных случаевИменно на этой скрытой части теста измеряли итоговую атаку, так что это проверка не на знакомых примерах.
87,5%Почти в девяти случаях из десяти атака добивалась своей цели на одной из протестированных связок агента и модели.
71,4%На другой связке атака тоже срабатывала чаще чем в двух случаях из трёх — это уже далеко не редкий сбой.

Можно ли доверять

Это препринт на arXiv, его ещё не проверяли независимые рецензенты. Сильная сторона работы — не только большие проценты успеха, но и реалистичная проверка на настоящем почтовом сценарии и на нескольких агентных системах. При этом это всё ещё тест в контролируемой среде, так что в живых продуктах результат может быть и слабее, и более зависеть от конкретных настроек.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.AI)
Дата публикации у нас7 июля 2026 г.
Дата источника6 июля 2026 г.
ОригиналОткрыть
АвторыYechao Zhang, Shiqian Zhao, Jiawen Zhang, Jie Zhang, Gelei Deng, Xiaogeng Liu, Chaowei Xiao, Tianwei Zhang