dumai
🤖
ИИПрепринтarXiv cs.CL

Препринт — материал ещё не прошёл рецензирование

Длинный лишний контекст может резко сдвигать ответы ИИ на отдельных примерах

0

Кратко

В контролируемых опытах несколько современных языковых моделей отвечали почти так же точно, даже если к вопросам добавляли длинный нерелевантный текст. Но на небольшой доле примеров такой фон резко менял ответ: где-то ухудшал результат, где-то неожиданно улучшал его.

Зачем это знать

Средняя точность может скрывать редкие, но заметные срывы на отдельных задачах, поэтому общий балл не показывает всей картины надёжности. Для приложений с длинным фоном это особенно важно при оценке надёжности.

Разбор

Авторы не просто смотрели, меняется ли средний балл модели, а проверяли каждую задачу отдельно. Они брали вопросы из нескольких сложных наборов, добавляли к ним длинный фон, который никак не помогал решать задачу, и сравнивали ответы с вариантом без этого фона. Причём фон был разный: от обычного бессмысленного набора псевдослов до более «похожего на текст» шума. Так можно увидеть, что именно делает лишний контекст с конкретным примером, а не только со средней точностью по тесту.

Главная идея оказалась такой: в среднем модели выглядят почти невосприимчивыми к лишнему тексту, но это впечатление обманчиво. За ровной средней картиной прячутся редкие примеры, где ответ заметно сдвигается — иногда в худшую сторону, иногда неожиданно в лучшую. И это не случайная история одной модели: эффект повторялся у разных языковых систем и на разных наборах вопросов. Более того, одни и те же «проблемные» примеры часто были уникальны для конкретной модели, то есть сбой у одной системы не обязательно означал сбой у другой.

Ещё важный слой результатов — что на этот сдвиг влияет. Авторы показали, что он зависит от типа добавленного контекста, от его длины, от того, сколько вычислений модель тратит во время ответа, и от того, на каком этапе развития находится модель. Это полезно для понимания, почему одна и та же система может вести себя спокойно в одном сценарии и резко — в другом. Для практики отсюда следует простой вывод: проверять только среднюю точность мало, если модель будет работать с длинными документами, перепиской или другим «шумным» окружением.

Ключевые цифры

500 вопросовНа каждом наборе вопросов проверяли не единичные случаи, а достаточно большую выборку, чтобы увидеть не только средний результат, но и редкие срывы.
10 000 токеновЛишний фон был очень длинным — примерно как большой кусок текста, который легко замаскирует важную деталь в реальном приложении.
20 попытокКаждый вопрос прогоняли много раз, чтобы поймать, как сильно ответ может «гулять» даже на одном и том же примере.
53,2%У части самых уязвимых примеров производительность падала очень сильно — это уже не мелкий шум, а заметный провал.

Можно ли доверять

Это препринт на arXiv, то есть работу ещё не проверяли внешние рецензенты. С другой стороны, авторы прогнали много моделей и несколько разных наборов задач, а эффект повторяется в разных условиях — это делает выводы убедительнее. Но результаты получены в контролируемом тесте, поэтому в живых продуктах с другой структурой контекста картина может быть слабее или, наоборот, сильнее.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.CL)
Дата публикации у нас15 июля 2026 г.
Дата источника14 июля 2026 г.
ОригиналОткрыть
АвторыYanzhe Zhang, Sanmi Koyejo, Diyi Yang