Препринт — материал ещё не прошёл рецензирование
Длинный лишний контекст может резко сдвигать ответы ИИ на отдельных примерах
Кратко
В контролируемых опытах несколько современных языковых моделей отвечали почти так же точно, даже если к вопросам добавляли длинный нерелевантный текст. Но на небольшой доле примеров такой фон резко менял ответ: где-то ухудшал результат, где-то неожиданно улучшал его.
Зачем это знать
Средняя точность может скрывать редкие, но заметные срывы на отдельных задачах, поэтому общий балл не показывает всей картины надёжности. Для приложений с длинным фоном это особенно важно при оценке надёжности.
Разбор
Авторы не просто смотрели, меняется ли средний балл модели, а проверяли каждую задачу отдельно. Они брали вопросы из нескольких сложных наборов, добавляли к ним длинный фон, который никак не помогал решать задачу, и сравнивали ответы с вариантом без этого фона. Причём фон был разный: от обычного бессмысленного набора псевдослов до более «похожего на текст» шума. Так можно увидеть, что именно делает лишний контекст с конкретным примером, а не только со средней точностью по тесту.
Главная идея оказалась такой: в среднем модели выглядят почти невосприимчивыми к лишнему тексту, но это впечатление обманчиво. За ровной средней картиной прячутся редкие примеры, где ответ заметно сдвигается — иногда в худшую сторону, иногда неожиданно в лучшую. И это не случайная история одной модели: эффект повторялся у разных языковых систем и на разных наборах вопросов. Более того, одни и те же «проблемные» примеры часто были уникальны для конкретной модели, то есть сбой у одной системы не обязательно означал сбой у другой.
Ещё важный слой результатов — что на этот сдвиг влияет. Авторы показали, что он зависит от типа добавленного контекста, от его длины, от того, сколько вычислений модель тратит во время ответа, и от того, на каком этапе развития находится модель. Это полезно для понимания, почему одна и та же система может вести себя спокойно в одном сценарии и резко — в другом. Для практики отсюда следует простой вывод: проверять только среднюю точность мало, если модель будет работать с длинными документами, перепиской или другим «шумным» окружением.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, то есть работу ещё не проверяли внешние рецензенты. С другой стороны, авторы прогнали много моделей и несколько разных наборов задач, а эффект повторяется в разных условиях — это делает выводы убедительнее. Но результаты получены в контролируемом тесте, поэтому в живых продуктах с другой структурой контекста картина может быть слабее или, наоборот, сильнее.
Пересказано ИИ по научной статье. Как это устроено