dumai
ИИПрепринтHugging Face Daily Papers

Препринт — материал ещё не прошёл рецензирование

Память ИИ-агентов могла создавать ложные разрешения для 50,2% запрещённых запросов

0

Кратко

В препринте проверили пять моделей, которые записывали память, и две модели, выполнявшие поручения, в сценариях закупок, кибербезопасности и финансов. При последовательных обновлениях память создавала ложное разрешение для 50,2% запрещённых запросов, а исполнители следовали ему в 98,6% случаев. Две проверенные меры защиты заметно уменьшили проблему, но стали чаще отклонять законные действия.

Зачем это знать

Память оказывается не просто способом сохранять контекст: ошибка в ней может сама подтолкнуть ИИ к запрещённому действию. Защита здесь требует выбора между меньшим риском и большим числом ошибочных отказов; результат пока нуждается в независимой проверке.

Разбор

Авторы собрали специальный тест EAL-Bench: он проверяет не только, что агент записал в долговременную память, но и сохранил ли он правильную историю разрешений. В таких сценариях доступ может сначала выдать, потом ограничить или отозвать человек либо система. Исследователи постепенно добавляли эти изменения в память и смотрели, не превращается ли запись о запрете в запись о разрешении.

Затем они разделили работу между двумя типами моделей. Одни записывали и обновляли память, другие получали поручение и решали, выполнять ли его. Так удалось отдельно увидеть источник ошибки и проверить, передаётся ли она исполнителю. Важная деталь: для появления проблемы не требовалась атака извне — достаточно было, чтобы сама память неверно сохранила состояние доступа и потеряла связь с исходным событием.

Авторы также испытали две защиты. Первая разрешала считать право действительным только при наличии подтверждающего события в истории. Вторая хранила изменения прав как ограниченную последовательность событий, чтобы их можно было проследить во времени. Обе меры уменьшали число ложных разрешений, но одновременно чаще блокировали действия, которые на самом деле были допустимы. Это показывает, что память агента влияет не только на удобство и продолжение работы, но и фактически участвует в принятии решений о доступе.

Ключевые цифры

5 моделейСтолько моделей проверяли как авторов записей памяти — вывод не основан на поведении одного конкретного ИИ.
2 моделиСтолько моделей выступали исполнителями: исследователи отдельно проверили, что происходит после появления ошибочного разрешения в памяти.
50,2%При постепенном обновлении памяти почти в каждом втором запрещённом запросе запись могла ошибочно представить действие как разрешённое.
98,6%Если такое ложное разрешение уже появлялось, исполнитель почти всегда принимал его за настоящее основание для действия.

Можно ли доверять

Это препринт с arXiv, а не статья, прошедшая независимую рецензию. Проверка охватила пять моделей памяти и две модели-исполнителя в трёх смоделированных областях, поэтому результат важен как сигнал о риске, но ещё не показывает, насколько часто такое произойдёт в реальных внедрённых системах.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (via Hugging Face)
Дата публикации у нас3 сентября 2026 г.
Дата источника31 августа 2026 г.
ОригиналОткрыть
АвторыTommaso Cerruti, Mika Okamoto, Ansel Kaplan Erol