dumai
ИИПрепринтHugging Face Daily Papers

Препринт — материал ещё не прошёл рецензирование

Новая схема сжатия контекста снижает память и ускоряет обработку

0

Кратко

Авторы предлагают семейство энкодер-декодерных компрессоров контекста для больших языковых моделей. В препринте они сравнивают разные варианты на уровнях сжатия 1:4, 1:8 и 1:16 и сообщают о лучшем балансе качества, скорости сжатия и пикового расхода памяти.

Зачем это знать

Это может быть полезно как направление для более экономичной работы с длинными контекстами, но пока речь идёт о препринте и оценке на бенчмарках, а не о проверенной практике в реальных системах. Для длинных задач и агентных сценариев работа показывает, куда можно двигаться дальше, но не даёт готовой рекомендации для внедрения.

Разбор

Проблема здесь простая и очень практичная: чем длиннее запрос или документ, тем больше памяти у модели уходит на хранение «следов» предыдущих токенов. Авторы взялись за альтернативу обычному кэшу и попробовали не просто ужать его, а заменить длинную последовательность токенов на короткий набор скрытых представлений — то есть сжатых внутренних векторов, которые потом читает декодер.

Чтобы понять, как такую схему делать нормально, они не ограничились одной конфигурацией. Сначала прогнали архитектурный поиск: собрали много вариантов энкодер-декодерной схемы и обучали их с нуля, чтобы увидеть, какие решения реально работают лучше. После этого выбрали удачные настройки и продолжили предобучение уже семейства моделей с энкодером на 0,6 млрд параметров и декодером на 4 млрд параметров.

Дальше они проверили сразу несколько степеней сжатия — 1:4, 1:8 и 1:16. Идея тут в том, чтобы понять не только, насколько можно уменьшить контекст, но и где начинается слишком сильная потеря качества. По их результатам, новый класс моделей, который они назвали Latent Context Language Models, сдвигает баланс в более выгодную сторону: лучше сочетает качество на разных задачах, скорость сжатия и пик памяти.

Ещё важный момент — они показали, что такие сжатые представления могут работать как основа для длинных агентных сценариев. То есть модель может быстро пробежать по сжатому длинному контексту, а если нужно, дозапросить и развернуть только важные куски. Это уже намекает не просто на экономию памяти, а на более гибкий способ работы с очень длинными входами.

Ключевые цифры

0,6BЭнкодер в их схеме довольно компактный по меркам больших моделей, что помогает экономить ресурсы на части сжатия.
4BДекодер намного больше энкодера, значит основную силу модели сохраняют там, где она нужна для ответа и генерации.
350B токеновКаждую модель учили на огромном объёме текста, так что результат опирается не на маленькую игрушечную проверку.
1:4, 1:8 и 1:16Авторы проверили сразу три уровня сжатия — от умеренного до очень жёсткого, чтобы увидеть, где модель ещё держит качество.

Можно ли доверять

Это препринт на arXiv, то есть работу ещё не оценили рецензенты. Сильная сторона — большие модели и очень крупное предобучение, но проверка идёт на бенчмарках, а не в реальных продакшен-системах, где поведение длинных контекстов часто сложнее.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (via Hugging Face)
Дата публикации у нас9 июня 2026 г.
Дата источника7 июня 2026 г.
ОригиналОткрыть
АвторыAng Li, Sean McLeish, Haozhe Chen, Nimit Kalra, Zaiqian Chen, Artem Gazizov, Venkata Anoop Suhas Kumar Morisetty, Bhavya Kailkhura, Harshitha Menon, Zhuang Liu