Препринт — материал ещё не прошёл рецензирование
CoT-донастройка ухудшает дальний контекст в гибридных LLM
Кратко
В препринте на arXiv авторы проверили гибридные модели с линейным вниманием на задачах поиска нужного фрагмента в длинном контексте. После supervised fine-tuning с цепочкой рассуждений такие модели заметно хуже вспоминали удалённую информацию, а эффект усиливался на более длинных входах.
Зачем это знать
Работа важна как предупреждение: улучшение рассуждений при донастройке может идти вразрез с памятью на длинный контекст в некоторых архитектурах. Предложенный способ восстановления проверен в тех же экспериментах, но как предварительный результат ещё требует проверки на других моделях и условиях.
Разбор
Авторы взяли несколько гибридных языковых моделей с линейным вниманием и проверили их на задачах, где нужно вытащить один нужный фрагмент из очень длинного текста. Сначала модели показывали хорошие результаты после предобучения, а потом их дообучали через цепочку рассуждений — это когда модель учат не только давать ответ, но и проговаривать шаги решения. И вот тут выяснилось неприятное: память на далёкий контекст у этих моделей заметно проседала, особенно когда текст становился длиннее и задача сложнее.
Чтобы понять, где именно ломается механизм, авторы посмотрели на те части модели, которые отвечают за направление внимания к нужным словам в тексте. Они пришли к выводу, что дообучение с рассуждениями смещает модель в сторону коротких связей и мешает ей выстраивать дальние маршруты по контексту. После этого они попробовали очень простой ход: вернуть только эти “маршрутизирующие” параметры из чекпойнта до дообучения, а всё остальное оставить как есть. Такой приём не требует дополнительного обучения и, по их данным, восстанавливает способность искать нужную информацию в длинном тексте.
Ещё важная деталь: этот возврат не съедает пользу от дообучения. На задачах рассуждения модель в целом сохраняет почти тот же уровень качества, что и после обычного SFT. То есть работа показывает не просто проблему, а и довольно аккуратный способ её обойти — по крайней мере на тех архитектурах и тестах, которые авторы проверили.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, значит, работу ещё не проверяли независимые рецензенты. При этом авторы тестировали не одну модель и не один сценарий, а несколько архитектур и длинные контексты, так что выводы выглядят крепче, чем в одиночном эксперименте. Но способ восстановления пока показан только в их собственных тестах, поэтому до проверки на других моделях и реальных задачах его лучше считать многообещающим, а не окончательно доказанным.
Пересказано ИИ по научной статье. Как это устроено