dumai
🤖
ИИПрепринтarXiv cs.AI

Препринт — материал ещё не прошёл рецензирование

ИИ находит риск, но перестаёт учитывать его в решении

0

Кратко

В эксперименте с языковыми моделями объём постороннего текста увеличивали с 2 000 до 128 000 токенов — частей текста. Модели по-прежнему находили важное предупреждение, однако его влияние на решение падало до уровня случайных колебаний. Структурированное повторение предупреждения рядом с решением возвращало его влияние, а обычное дробление текста и пересказ — нет.

Зачем это знать

Работа показывает, что модельное суждение зависит не только от найденной информации, но и от того, как рабочий процесс подводит её к решению. Это препринт: результат получен в экспериментах с моделями и не доказывает улучшения реальных инвестиционных результатов.

Разбор

Авторы разделили две способности, которые обычно смешивают: модель могла отдельно пересказать предупреждение, а затем отдельно выдавала инвестиционную оценку. Так они проверяли не просто наличие нужной фразы в ответе, а меняется ли решение, если эту фразу добавить или убрать. При этом сведения о самой компании оставались прежними, а менялся только объём нерелевантного окружения.

Эффект оказался не в полном забывании. На шкале из семи уровней риска модель всё ещё сравнительно неплохо понимала, какой риск серьёзнее, но разница между её реакциями на слабое и сильное предупреждение сжималась в 5,6 раза. Более способные модели держались дольше, однако полностью проблему не устраняли. Авторы получили похожую картину у разных семейств моделей и в заданиях, где использовали настоящие финансовые отчёты 10-K, предварительно убирая из них реальные раскрытия о рисках.

Затем исследователи проверили, как информация попадает в итоговое решение. Сжатое резюме и обращение к исходному фрагменту работали вместе: одно сохраняло общий смысл, другое возвращало детали. Но стандартная схема «разбить длинный текст на части и пересказать каждую» могла вытеснить важное предупреждение. Точечный структурированный пересказ непосредственно перед вынесением решения, напротив, возвращал предупреждению заметное влияние. Отсюда главный практический вывод: качество ИИ-аналитика зависит не только от самой модели, но и от устройства цепочки обработки документов.

Ключевые цифры

3,2 процентного пунктаПри коротком окружении одно предупреждение заметно сдвигало инвестиционную оценку модели — это измеримый эффект, а не просто способность процитировать текст.
5,6 разаПри длинном контексте разница в реакции на слабый и сильный риск становилась во столько раз меньше, поэтому модель сохраняла порядок рисков, но хуже учитывала их силу.
7 уровнейИсследователи проверяли не только два противоположных случая, а целую шкалу серьёзности риска.
128 000 токеновМодель испытывали на контексте размером с очень большой документ или несколько документов, чтобы проверить поведение при реалистичной информационной перегрузке.

Можно ли доверять

Это препринт с arXiv, а не статья, прошедшая рецензирование. Эксперименты выглядят разнообразными: авторы сравнили разные семейства моделей, задания и фрагменты реальных 10-K, но проверяли поведение ИИ в контролируемых тестах, а не реальные инвестиционные результаты.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.AI)
Дата публикации у нас26 августа 2026 г.
Дата источника25 августа 2026 г.
ОригиналОткрыть
АвторыMiao Liu, Zhizhe Liu