dumai
ИИПрепринтarXiv cs.CL

Препринт — материал ещё не прошёл рецензирование

CoT-донастройка ухудшает дальний контекст в гибридных LLM

0

Кратко

В препринте на arXiv авторы проверили гибридные модели с линейным вниманием на задачах поиска нужного фрагмента в длинном контексте. После supervised fine-tuning с цепочкой рассуждений такие модели заметно хуже вспоминали удалённую информацию, а эффект усиливался на более длинных входах.

Зачем это знать

Работа важна как предупреждение: улучшение рассуждений при донастройке может идти вразрез с памятью на длинный контекст в некоторых архитектурах. Предложенный способ восстановления проверен в тех же экспериментах, но как предварительный результат ещё требует проверки на других моделях и условиях.

Разбор

Авторы взяли несколько гибридных языковых моделей с линейным вниманием и проверили их на задачах, где нужно вытащить один нужный фрагмент из очень длинного текста. Сначала модели показывали хорошие результаты после предобучения, а потом их дообучали через цепочку рассуждений — это когда модель учат не только давать ответ, но и проговаривать шаги решения. И вот тут выяснилось неприятное: память на далёкий контекст у этих моделей заметно проседала, особенно когда текст становился длиннее и задача сложнее.

Чтобы понять, где именно ломается механизм, авторы посмотрели на те части модели, которые отвечают за направление внимания к нужным словам в тексте. Они пришли к выводу, что дообучение с рассуждениями смещает модель в сторону коротких связей и мешает ей выстраивать дальние маршруты по контексту. После этого они попробовали очень простой ход: вернуть только эти “маршрутизирующие” параметры из чекпойнта до дообучения, а всё остальное оставить как есть. Такой приём не требует дополнительного обучения и, по их данным, восстанавливает способность искать нужную информацию в длинном тексте.

Ещё важная деталь: этот возврат не съедает пользу от дообучения. На задачах рассуждения модель в целом сохраняет почти тот же уровень качества, что и после обычного SFT. То есть работа показывает не просто проблему, а и довольно аккуратный способ её обойти — по крайней мере на тех архитектурах и тестах, которые авторы проверили.

Ключевые цифры

67.2% → 9.4%После дообучения модель почти перестала находить нужный фрагмент в длинном тексте — это очень резкое падение памяти на контекст
30.4 → 7.60На более сложной версии той же задачи качество тоже сильно упало, когда текст сделали длиннее
65.4% → 76.4%После восстановления нужных параметров модель снова стала заметно лучше искать информацию в длинном контексте
256KМодели проверяли на очень длинных входах — это помогает понять, выдерживает ли система действительно большой текст

Можно ли доверять

Это препринт на arXiv, значит, работу ещё не проверяли независимые рецензенты. При этом авторы тестировали не одну модель и не один сценарий, а несколько архитектур и длинные контексты, так что выводы выглядят крепче, чем в одиночном эксперименте. Но способ восстановления пока показан только в их собственных тестах, поэтому до проверки на других моделях и реальных задачах его лучше считать многообещающим, а не окончательно доказанным.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.CL)
Дата публикации у нас11 июня 2026 г.
Дата источника9 июня 2026 г.
ОригиналОткрыть
АвторыXinyu Zhou, Boyu Zhu, Yi Xu, Zhiwei Li, Yingfa Chen, Huiming Wang, Zhijiang Guo