dumai
ИИПрепринтarXiv cs.CL

Препринт — материал ещё не прошёл рецензирование

Один источник может заставить ИИ приписать ложь надёжному источнику

0

Кратко

Проверяли системы, где ИИ ищет сведения во внешних источниках и прикрепляет к ответу ссылки, на шести открытых моделях и двух наборах задач. Если один источник был под контролем атакующего, доля неправильных ответов выросла с 0,01 до 0,68: модель могла сослаться на надёжный источник, хотя тот этого не подтверждал. Авторы также предложили проверять, какой источник действительно повлиял на ответ.

Зачем это знать

Одних ссылок может оказаться недостаточно, чтобы проверить ответ ИИ: источник выглядит надёжным, хотя модель использовала подменённые сведения. Предложенная защита пока проверена только в описанных опытах, поэтому её надёжность в реальных системах не установлена.

Разбор

Атака получила название CiteShade. Авторы не просто добавили в найденный текст явную вредоносную инструкцию: они подбирали содержимое под три условия — чтобы система выбрала этот источник, чтобы он повлиял на сам ответ и чтобы ссылка в итоге указывала на другой, доверенный источник. Поэтому правильные сведения могли оставаться среди найденных материалов, но модель всё равно выбирала подготовленный ложный вариант и оформляла его как будто подтверждённый надёжной ссылкой.

Проверку провели на задачах MultiModalQA и HotpotQA — это вопросы, для которых нужно соединить сведения из нескольких материалов. В каждом примере было три источника: два с нужными доказательствами и один, который мог заменить атакующий. Исследователи сравнили несколько способов подмены, включая случайное искажение текста и варианты с инструкциями, а затем проверили причинность: удаляли подозрительный источник и смотрели, исчезает ли эффект. Во всех измеренных случаях именно он оказывался причиной подмены ответа, а не просто необычным фрагментом контекста.

Оказалось, что уязвимость сильнее связана со склонностью модели ставить ссылки, чем с её размером. Простая проверка правдоподобия текста и отдельная проверка того, подтверждает ли ссылка утверждение, не закрыли проблему: источник мог выглядеть нормальным, а его содержание — формально подходить к ответу. Предложенная защита задаёт вопрос «что изменилось бы, если убрать этот источник?» и тем самым ищет реальный вклад материала, а не только совпадение между ответом и цитатой.

Ключевые цифры

6 моделейМетод проверили на нескольких открытых системах, поэтому результат не сводится к поведению одной конкретной модели.
2 набора задачПроверка охватила два разных теста вопросов, где ответ нужно собрать из нескольких источников.
0,84У самой склонной ссылаться модели доля случаев с одновременно ложным ответом и ошибочно приписанной цитатой доходила до 84% при явной инструкции атакующему.
0,64Даже без инструкции в тексте источника такой эффект доходил до 64% у наиболее уязвимой из проверенных моделей.

Можно ли доверять

Это препринт на arXiv, а не статья, прошедшая независимую журнальную рецензию. Проверка выглядит содержательной: шесть открытых моделей, два набора задач и удаление источника для проверки причинности, но эксперименты проходили на фиксированных тестовых контекстах, а не в реальных поисковых системах и пользовательских приложениях. Кроме того, ложные целевые ответы частично создавали с помощью внешней языковой модели и выборочно проверяли, поэтому переносимость результата на другие данные ещё нужно подтвердить.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.CL)
Дата публикации у нас15 сентября 2026 г.
Дата источника14 сентября 2026 г.
ОригиналОткрыть
АвторыGuo Fuzheng