dumai
ИИПрепринтarXiv cs.AI

Препринт — материал ещё не прошёл рецензирование

Вредоносная запись могла влиять на будущие ответы ИИ-агента

1

Кратко

В препринте проверили, может ли одна специально созданная запись без доступа к хранилищу памяти влиять на будущие запросы по той же теме. В одной системе запись извлекалась в 76,6% случаев и направляла ответ к заданному результату в 35,6%; эффект сохранялся после добавления новых записей и частично переносился на другую систему.

Зачем это знать

Такая запись может стать отдельным источником риска для ИИ-агентов, которые используют сведения из прошлых диалогов. Но это проверили лишь на нескольких системах и моделях в специально созданном сценарии, поэтому результат нельзя автоматически переносить на все продукты.

Разбор

Атака состоит из двух частей. Сначала авторы создают «якорь» — текст с большим набором признаков нужной темы, чтобы система поиска воспоминаний с высокой вероятностью подтянула именно эту запись. Затем к якорю добавляют короткую команду, которая должна сработать уже внутри длинного и непредсказуемого контекста. Команду подбирали автоматически: проверяли разные варианты на искусственных шаблонах запросов и при разных местах вставки, а затем искали вариант, который сохраняет действие на нескольких моделях.

Авторы специально проверяли не идеальные условия. После добавления вредоносной записи они продолжали записывать обычные диалоги, чтобы память постепенно менялась. Несмотря на это, запись оставалась заметной для запросов по нужной теме, а запросы из других областей не затрагивала. В системе MemGPT, где история диалогов хранится и ищется по сходству, результат был слабее, но всё равно заметным: запись извлекалась в 37,2% случаев, а заданный ответ появлялся в 18,1%.

Важная деталь — обычные способы атаки в этой проверке не сработали: прямые команды, BadChain и базовый вариант GCG дали нулевой результат. По мнению авторов, причина в том, что память собирает длинный контекст, меняет положение вставленной команды и со временем добавляет новые записи. Новый метод специально подгоняли под такую нестабильность, поэтому он оказался устойчивее стандартных атак.

Ключевые цифры

19 доменовПамять перед атакой заполнили разговорами из 19 разных областей, поэтому проверка не сводилась к одной узкой теме.
около 50 запросов на доменДля каждой темы проверяли примерно 50 будущих запросов — достаточно, чтобы увидеть повторяющийся эффект, а не один удачный пример.
10 случайных запусковВесь эксперимент повторили 10 раз с разными случайными настройками, чтобы результат меньше зависел от одной конкретной последовательности диалогов.
18,1%В MemGPT примерно в каждом пятом запросе появлялся заранее заданный ответ после одной вредоносной записи.

Можно ли доверять

Это препринт arXiv: его ещё не проверили независимые рецензенты. Авторы испытали метод на нескольких системах памяти и моделях, повторяли эксперименты с разными случайными запусками, но сценарий оставался лабораторным: проверяли около 50 запросов на домен, а не поведение реальных пользователей в разных продуктах.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.AI)
Дата публикации у нас25 августа 2026 г.
Дата источника24 августа 2026 г.
ОригиналОткрыть
АвторыHanling Tian, Gengyu Zhang, Zeyang Sha, Jingying Wang, Yuhang Liu, Zhehao Huang, Kun Yang, Xiaolin Huang