Препринт — материал ещё не прошёл рецензирование
Память ИИ-агентов могла создавать ложные разрешения для 50,2% запрещённых запросов
Кратко
В препринте проверили пять моделей, которые записывали память, и две модели, выполнявшие поручения, в сценариях закупок, кибербезопасности и финансов. При последовательных обновлениях память создавала ложное разрешение для 50,2% запрещённых запросов, а исполнители следовали ему в 98,6% случаев. Две проверенные меры защиты заметно уменьшили проблему, но стали чаще отклонять законные действия.
Зачем это знать
Память оказывается не просто способом сохранять контекст: ошибка в ней может сама подтолкнуть ИИ к запрещённому действию. Защита здесь требует выбора между меньшим риском и большим числом ошибочных отказов; результат пока нуждается в независимой проверке.
Разбор
Авторы собрали специальный тест EAL-Bench: он проверяет не только, что агент записал в долговременную память, но и сохранил ли он правильную историю разрешений. В таких сценариях доступ может сначала выдать, потом ограничить или отозвать человек либо система. Исследователи постепенно добавляли эти изменения в память и смотрели, не превращается ли запись о запрете в запись о разрешении.
Затем они разделили работу между двумя типами моделей. Одни записывали и обновляли память, другие получали поручение и решали, выполнять ли его. Так удалось отдельно увидеть источник ошибки и проверить, передаётся ли она исполнителю. Важная деталь: для появления проблемы не требовалась атака извне — достаточно было, чтобы сама память неверно сохранила состояние доступа и потеряла связь с исходным событием.
Авторы также испытали две защиты. Первая разрешала считать право действительным только при наличии подтверждающего события в истории. Вторая хранила изменения прав как ограниченную последовательность событий, чтобы их можно было проследить во времени. Обе меры уменьшали число ложных разрешений, но одновременно чаще блокировали действия, которые на самом деле были допустимы. Это показывает, что память агента влияет не только на удобство и продолжение работы, но и фактически участвует в принятии решений о доступе.
Ключевые цифры
Можно ли доверять
Это препринт с arXiv, а не статья, прошедшая независимую рецензию. Проверка охватила пять моделей памяти и две модели-исполнителя в трёх смоделированных областях, поэтому результат важен как сигнал о риске, но ещё не показывает, насколько часто такое произойдёт в реальных внедрённых системах.
Пересказано ИИ по научной статье. Как это устроено