Препринт — материал ещё не прошёл рецензирование
Вредоносные документы могут прятаться среди обычных и обходить простые фильтры
Кратко
Системы, которые сначала ищут сведения во внешних документах, могут направить ответ в нужную атакующему сторону через специально подготовленные тексты. В препринте показано, что CamoDocs маскирует такие тексты среди обычных: метод проверили на трёх наборах задач, нескольких моделях и семи вариантах защиты. Более жёсткая очистка снижала риск, одновременно ухудшая обычный поиск и ответы.
Зачем это знать
Простая проверка совпадений между запросом и документами не гарантирует защиту систем с внешними источниками. Но результаты зависят от конкретной защиты, а усиление фильтров может ухудшать их полезную работу.
Разбор
Авторы искали слабое место в обычной атаке на системы поиска по документам. Раньше вредоносный текст часто повторял сам запрос пользователя: это помогало ему попасть в выдачу, но оставляло заметный след — одинаковые слова в запросе и документе. CamoDocs пытается убрать такой след. Для этого авторы сначала создают обычные и вредоносные черновики, режут их на небольшие фрагменты, а затем заменяют часть слов в обычных фрагментах на специальные слова, которые раздвигают представления документов в модели поиска. После этого отдельные фрагменты проверяют на связность, чтобы текст не стал слишком нечитабельным.
Такой подход проверили не на одной системе, а на разных защитах и языковых моделях, включая закрытые GPT-5.4-mini и Claude-Haiku-4.5. Успехом атаки считали случаи, когда система выдавала целевой, выгодный атакующему ответ; оценку проводила отдельная языковая модель. Для каждого набора задач взяли 10 серий по 100 случайных запросов — всего 1 000 проверок, причём запросы между сериями не пересекались.
Важная деталь: атакующим хватало 10 вредоносных документов на один целевой запрос. Их доля во всём наборе данных была очень небольшой — от 0,011% до 0,037%, в зависимости от набора. При этом на закрытых моделях атака срабатывала в среднем в 61,80% случаев для GPT-5.4-mini и в 55,09% для Claude-Haiku-4.5. Авторы также показали цену сильной защиты: TrustRAG, который удаляет большие группы подозрительных документов, действительно снижал успешность атаки, но одновременно заметно портил результаты на задачах, где модель должна опираться именно на найденные документы.
Ключевые цифры
Можно ли доверять
Это препринт с arXiv, поэтому его ещё не проверили независимые рецензенты. Проверка выглядит широкой: авторы использовали несколько моделей, защит и наборов задач, но результаты получены на тестовых наборах, а успешность атаки оценивала другая языковая модель, что тоже может влиять на измерения.
Пересказано ИИ по научной статье. Как это устроено