dumai
ИИПрепринтarXiv cs.AI

Препринт — материал ещё не прошёл рецензирование

Ложные записи в памяти ИИ обрушили точность уже при 1,2%

0

Кратко

В тестах ИИ добавление ложных утверждений всего в 1,2% записей снизило точность с 0,850 до 0,300. Проверенные фильтры не удалили ни одной из 360 специально испорченных записей, а усиленное недоверие к ненадёжным источникам одновременно удаляло и полезные сведения.

Зачем это знать

Пока этот результат получен только на специально подготовленном наборе данных, поэтому его нельзя напрямую переносить на реальные системы. Он показывает, что одной проверки текста или источника может быть недостаточно для защиты памяти ИИ.

Разбор

Авторы проверили не только саму атаку, но и несколько мест, где можно было бы поставить защиту. Они сначала прогоняли записи через фильтр перед сохранением, затем проверяли качество поиска по памяти на стандартном наборе LongMemEval, а потом повторяли этот тест после намеренного загрязнения корпуса. Ложные утверждения при этом создавали в один проход — без специальной инструкции, скрытого триггера и подгонки поиска под атаку. Это важно: проверяли не хитрый сценарий, а довольно простой способ добавить ошибочную запись.

Фильтр хорошо справлялся с задачами, для которых его создавали, например с косвенными попытками внедрить инструкции. Но тот же набор правил не смог понять, где само утверждение ложно: внешнего источника для сверки у него не было. Отсюда главный практический вывод авторов — проверкой одного текста нельзя надёжно отличить правду от убедительной выдумки. Для этого нужна дополнительная опора: внешний источник, проверяемая база знаний или другое ограничение на то, какие записи допускаются к выдаче.

Затем исследователи добавили к поиску оценку происхождения записи: системе предлагали сильнее доверять одним источникам и слабее — другим. Обычная настройка не дала заметной защиты. Более жёсткая настройка помогала лишь ценой потери полезных данных: если ненадёжные источники в основном содержали безобидную информацию, качество улучшалось, но когда нужный ответ тоже находился в записи с таким происхождением, система переставала его находить. Поэтому авторы предлагают не просто штрафовать ненадёжные записи, а ограничивать их долю среди результатов поиска — чтобы они не могли занять всю выдачу.

Ключевые цифры

0,832Фильтр находил около 83% косвенных попыток внедрения инструкций — для этой конкретной угрозы он работал достаточно хорошо.
1,5%Столько обычных текстов с похожими на атакующие словами ошибочно помечало быстрое детерминированное ядро фильтра.
примерно в 10 000 разЛокальная детерминированная часть проверки работала на порядки быстрее моделей-трансформеров, поэтому её можно применять к каждой новой записи.
0,0417Когда нужное доказательство само приходило из источника, которому система не доверяла, точность почти исчезала — осталось около 4% правильных ответов.

Можно ли доверять

Это препринт arXiv, который ещё не прошёл обычную журнальную рецензию. Авторы открыли тестовые наборы, кодовые оболочки и отчёты запусков, что облегчает проверку результата, но эксперимент всё равно проводили на подготовленном бенчмарке, а не на реальных пользователях и рабочих системах.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.AI)
Дата публикации у нас24 августа 2026 г.
Дата источника21 августа 2026 г.
ОригиналОткрыть
АвторыArulnidhi Karunanidhi