dumai
ИИПрепринтHugging Face Daily Papers

Препринт — материал ещё не прошёл рецензирование

Способ для очень длинного контекста сокращает физический KV-кэш

0

Кратко

В препринте предлагают Lookahead Sparse Attention для обслуживания LLM с очень длинным контекстом. На длинноконтекстных бенчмарках авторы сообщают о меньшем физическом KV-кэше при сохранении или небольшом росте точности.

Зачем это знать

Работа показывает подход к экономии памяти при длинном контексте, но выводы пока основаны на препринте и бенчмарках, поэтому их нельзя считать готовым правилом для всех моделей и систем.

Разбор

Обычно у LLM во время ответа хранится всё, что модель «увидела» раньше, и это быстро съедает память видеокарты, особенно когда контекст растягивается на сотни тысяч токенов. Авторы предлагают другой режим работы: вместо того чтобы держать под рукой весь прошлый текст, система заранее пытается понять, какие куски истории действительно понадобятся дальше, и оставляет в памяти только их.

Для этого они добавили Neural Memory Indexer — по сути, отдельный модуль, который оценивает, какие фрагменты контекста будут важны для следующих шагов. Ключевая идея не только в экономии памяти, но и в том, чтобы убрать шум: модель меньше отвлекается на лишние детали из длинной истории и лучше фокусируется на нужных кусках. Интересно, что этот индексатор обучали отдельно от основной большой модели, как обычную систему поиска, поэтому не пришлось загружать гигантский «основной мозг» в память даже на этапе обучения.

На длинноконтекстных тестах такой подход дал заметную экономию: физический KV-кэш, то есть рабочая память для прошлых токенов, уменьшился до 13,5% от базового варианта. При этом точность не просела — наоборот, в среднем она чуть выросла на 0,6 процентного пункта. На совсем экстремальном масштабе в 500K токенов система тоже держалась стабильно и урезала накладные расходы на KV-кэш более чем на 90%, не ломая базовые способности модели к рассуждению.

Ключевые цифры

13.5%Столько памяти для прошлых токенов в среднем нужно системе вместо полного набора — это сильная экономия на длинных текстах.
+0.6%Точность не ухудшилась, а в среднем даже немного выросла по сравнению с обычным режимом.
500KПроверка на очень длинном контексте в полмиллиона токенов показывает, что метод рассчитан не только на умеренно длинные тексты.
90%На самом длинном режиме система убрала больше девяти десятых лишних затрат памяти, связанных с кэшом.

Можно ли доверять

Это препринт на arXiv, значит, работу ещё не проверяли независимые рецензенты. Авторы тестировали метод на стандартных длинноконтекстных бенчмарках, а не в реальном продукте, поэтому результаты выглядят убедительно, но в других моделях и системах эффект может быть скромнее.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (via Hugging Face)
Дата публикации у нас9 июня 2026 г.
Дата источника7 июня 2026 г.
ОригиналОткрыть
АвторыYan Wang, Qifan Zhang, Jiachen Yu, Tian Liang, Dongyang Ma, Xiang Hu, Zibo Lin, Chunyang Li, Zhichao Wang, Jia Li