Препринт — материал ещё не прошёл рецензирование
Одно письмо может незаметно испортить память ИИ-агента
Кратко
Авторы проверили, можно ли заставить личного ИИ-агента тихо записать вредную информацию в долговременную память после одного письма. В тесте на 56 отложенных случаях атака сработала в 87,5% случаев на OpenClaw с GPT-5.4 и в 71,4% случаев на Claude Code SDK с Sonnet 4.6.
Зачем это знать
Это показывает, что у личных ИИ-агентов память может стать слабым местом: обычное внешнее сообщение иногда превращается в скрытый источник ошибок в будущем. О таких системах стоит помнить при проектировании и защите, особенно если они сами читают почту и действуют от вашего имени.
Разбор
Авторы не просто проверили, «можно ли подсунуть вредный текст» ИИ-агенту. Они собрали сценарий, в котором агент сам читает внешнее письмо, умеет запоминать важное в постоянную память и потом использует это как основу для будущих ответов. Именно в такой связке и возникает риск: если вредный кусок текста незаметно попал в память, он уже начинает работать как будто это нормальная, проверенная информация.
Чтобы проверить эту идею не в игрушечной схеме, а ближе к реальной жизни, они сделали WhisperBench — набор из 108 случаев. Там есть пять типов риска, а в саму проверку включили и подмену фактов, и подмену предпочтений. Основа тоже практическая: реальный поток писем через IMAP/SMTP и настоящий навык почтового агента. Это важно, потому что многие прошлые тесты на «инъекции» смотрели только на то, сработала ли вредная команда здесь и сейчас, а здесь проверяли полный цикл: письмо, запись в память, скрытность ответа и влияние на будущее поведение.
Для самой атаки они предложили MemGhost — схему, которая пытается подготовить одно письмо так, чтобы оно сработало без подсказок в процессе. Поскольку атакующий не видит внутреннюю работу агента и не получает обратной связи во время выполнения, авторы использовали два «заместителя»: один имитировал среду, где живёт агент, а второй оценивал, насколько хорошо письмо добилось двух целей сразу — чтобы память приняла вредный текст и чтобы сам диалог выглядел невинно. Затем эту схему дообучали на примерах и с подкреплением, то есть поощряли те варианты письма, которые лучше проходили обе проверки.
Главный практический вывод не ограничился одной связкой моделей: атака переносилась и на другие агентные архитектуры, и на разные хранилища памяти, включая файловое и векторное. Более того, она продолжала работать даже против защит на уровне входа, самой модели и системных правил. То есть проблема не сводится к одной конкретной реализации — если личный агент умеет долго помнить и сам ходит во внешнюю среду, обычное письмо может стать точкой входа для долгой скрытой порчи поведения.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, его ещё не проверяли независимые рецензенты. Сильная сторона работы — не только большие проценты успеха, но и реалистичная проверка на настоящем почтовом сценарии и на нескольких агентных системах. При этом это всё ещё тест в контролируемой среде, так что в живых продуктах результат может быть и слабее, и более зависеть от конкретных настроек.
Пересказано ИИ по научной статье. Как это устроено