Препринт — материал ещё не прошёл рецензирование
Ложные записи в памяти ИИ обрушили точность уже при 1,2%
Кратко
В тестах ИИ добавление ложных утверждений всего в 1,2% записей снизило точность с 0,850 до 0,300. Проверенные фильтры не удалили ни одной из 360 специально испорченных записей, а усиленное недоверие к ненадёжным источникам одновременно удаляло и полезные сведения.
Зачем это знать
Пока этот результат получен только на специально подготовленном наборе данных, поэтому его нельзя напрямую переносить на реальные системы. Он показывает, что одной проверки текста или источника может быть недостаточно для защиты памяти ИИ.
Разбор
Авторы проверили не только саму атаку, но и несколько мест, где можно было бы поставить защиту. Они сначала прогоняли записи через фильтр перед сохранением, затем проверяли качество поиска по памяти на стандартном наборе LongMemEval, а потом повторяли этот тест после намеренного загрязнения корпуса. Ложные утверждения при этом создавали в один проход — без специальной инструкции, скрытого триггера и подгонки поиска под атаку. Это важно: проверяли не хитрый сценарий, а довольно простой способ добавить ошибочную запись.
Фильтр хорошо справлялся с задачами, для которых его создавали, например с косвенными попытками внедрить инструкции. Но тот же набор правил не смог понять, где само утверждение ложно: внешнего источника для сверки у него не было. Отсюда главный практический вывод авторов — проверкой одного текста нельзя надёжно отличить правду от убедительной выдумки. Для этого нужна дополнительная опора: внешний источник, проверяемая база знаний или другое ограничение на то, какие записи допускаются к выдаче.
Затем исследователи добавили к поиску оценку происхождения записи: системе предлагали сильнее доверять одним источникам и слабее — другим. Обычная настройка не дала заметной защиты. Более жёсткая настройка помогала лишь ценой потери полезных данных: если ненадёжные источники в основном содержали безобидную информацию, качество улучшалось, но когда нужный ответ тоже находился в записи с таким происхождением, система переставала его находить. Поэтому авторы предлагают не просто штрафовать ненадёжные записи, а ограничивать их долю среди результатов поиска — чтобы они не могли занять всю выдачу.
Ключевые цифры
Можно ли доверять
Это препринт arXiv, который ещё не прошёл обычную журнальную рецензию. Авторы открыли тестовые наборы, кодовые оболочки и отчёты запусков, что облегчает проверку результата, но эксперимент всё равно проводили на подготовленном бенчмарке, а не на реальных пользователях и рабочих системах.
Пересказано ИИ по научной статье. Как это устроено