dumai
ИИПрепринтarXiv cs.CL

Препринт — материал ещё не прошёл рецензирование

Вредоносные документы могут прятаться среди обычных и обходить простые фильтры

0

Кратко

Системы, которые сначала ищут сведения во внешних документах, могут направить ответ в нужную атакующему сторону через специально подготовленные тексты. В препринте показано, что CamoDocs маскирует такие тексты среди обычных: метод проверили на трёх наборах задач, нескольких моделях и семи вариантах защиты. Более жёсткая очистка снижала риск, одновременно ухудшая обычный поиск и ответы.

Зачем это знать

Простая проверка совпадений между запросом и документами не гарантирует защиту систем с внешними источниками. Но результаты зависят от конкретной защиты, а усиление фильтров может ухудшать их полезную работу.

Разбор

Авторы искали слабое место в обычной атаке на системы поиска по документам. Раньше вредоносный текст часто повторял сам запрос пользователя: это помогало ему попасть в выдачу, но оставляло заметный след — одинаковые слова в запросе и документе. CamoDocs пытается убрать такой след. Для этого авторы сначала создают обычные и вредоносные черновики, режут их на небольшие фрагменты, а затем заменяют часть слов в обычных фрагментах на специальные слова, которые раздвигают представления документов в модели поиска. После этого отдельные фрагменты проверяют на связность, чтобы текст не стал слишком нечитабельным.

Такой подход проверили не на одной системе, а на разных защитах и языковых моделях, включая закрытые GPT-5.4-mini и Claude-Haiku-4.5. Успехом атаки считали случаи, когда система выдавала целевой, выгодный атакующему ответ; оценку проводила отдельная языковая модель. Для каждого набора задач взяли 10 серий по 100 случайных запросов — всего 1 000 проверок, причём запросы между сериями не пересекались.

Важная деталь: атакующим хватало 10 вредоносных документов на один целевой запрос. Их доля во всём наборе данных была очень небольшой — от 0,011% до 0,037%, в зависимости от набора. При этом на закрытых моделях атака срабатывала в среднем в 61,80% случаев для GPT-5.4-mini и в 55,09% для Claude-Haiku-4.5. Авторы также показали цену сильной защиты: TrustRAG, который удаляет большие группы подозрительных документов, действительно снижал успешность атаки, но одновременно заметно портил результаты на задачах, где модель должна опираться именно на найденные документы.

Ключевые цифры

1 000 запросовАтаку проверили на тысяче разных случаев, поэтому результат не зависит от нескольких удачных примеров.
10 документов на запросДля атаки не требовалась большая доля поддельных материалов: достаточно было добавить десять вредоносных документов для одной цели.
0,011–0,037%Поддельные документы составляли лишь несколько сотых процента от набора, поэтому обнаруживать их по одному только количеству трудно.
61,80% и 55,09%На двух закрытых моделях вредоносный контент направлял ответ к нужной цели примерно в половине или более случаев.

Можно ли доверять

Это препринт с arXiv, поэтому его ещё не проверили независимые рецензенты. Проверка выглядит широкой: авторы использовали несколько моделей, защит и наборов задач, но результаты получены на тестовых наборах, а успешность атаки оценивала другая языковая модель, что тоже может влиять на измерения.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.CL)
Дата публикации у нас31 августа 2026 г.
Дата источника28 августа 2026 г.
ОригиналОткрыть
АвторыJaewon Jung, Haizhong Zheng, Hongsun Jang, Jaeyong Song, Beidi Chen, Jinho Lee