dumai
ИИПрепринтarXiv cs.CL

Препринт — материал ещё не прошёл рецензирование

EntropyInfer ускоряет длинный контекст без заметной потери качества

0

Кратко

EntropyInfer — это метод без обучения для инференса длинноконтекстных LLM, который распределяет вычисления между attention-головами и сегментами по энтропии внимания. В пререлизе на arXiv авторы проверили его на Llama, Qwen и openPangu и сообщают о приросте скорости до 2,39× на контекстах свыше 100 тысяч токенов при близком к полному вниманию качестве в тестах.

Зачем это знать

Работа показывает, что вычисления в длинных контекстах можно сокращать не только за счёт жёстких шаблонов, а с учётом поведения разных голов и сегментов. Но это предварительный результат из бенчмарков, поэтому его стоит воспринимать как многообещающую технику для дальнейшей проверки, а не как готовый практический стандарт.

Разбор

Обычные методы для длинного контекста часто режут вычисления по одному и тому же шаблону: например, одинаково экономят на всех головах внимания или заранее задают один бюджет на всё. Авторы посмотрели на проблему иначе и заметили, что головы внимания ведут себя по-разному. Одни почти всегда работают очень «жёстко» — их внимание почти не меняется, а другие заметно перестраиваются от одного фрагмента текста к другому. Из-за этого фиксированное правило экономии не всегда попадает в самое важное место.

EntropyInfer использует энтропию внимания — по-простому, меру того, насколько «размыто» или «собрано» распределено внимание головы — чтобы во время обработки текста решать, куда тратить вычисления. Причём это не обучаемый подход: систему не дообучали под задачу, она подстраивается прямо на лету во время чтения длинного текста. Для этапа генерации ответа авторы ещё добавили сжатие кеша KV, то есть хранилища уже посчитанных промежуточных данных, и для этого опирались не только на исходный текст, но и на токены, которые модель уже начала выдавать.

Самый заметный результат такой: метод держит качество близко к полному вниманию, но работает быстрее на очень длинных контекстах. Проверяли его на нескольких семействах моделей — Llama, Qwen и openPangu — и сравнивали с сильными базовыми методами вроде SnapKV, AdaKV и CritiPrefill. На длинных контекстах свыше 100 тысяч токенов они получили ускорение до 2,39 раза, а на наборах LongBench и InfiniteBench метод в среднем обгонял другие компрессии и местами даже выходил на уровень базовой модели или чуть выше. Ещё важная деталь: авторы показывают, что типы голов не фиксированы раз и навсегда — они зависят от контекста, поэтому подбирать их заранее «офлайн» нельзя.

Ключевые цифры

2,39×На очень длинных текстах модель может работать больше чем в два раза быстрее, чем без этой оптимизации.
100 тысяч токеновИменно на таких огромных текстах ускорение уже заметно — это длина, которую обычные системы переваривают тяжело.
16 наборов данныхМетод проверили не на одной задаче, а на широком наборе тестов для длинного контекста.
3 семейства моделейПроверка прошла на нескольких разных моделях, так что эффект не выглядит случайностью для одной архитектуры.

Можно ли доверять

Это препринт на arXiv, то есть статью ещё не прошли внешнюю рецензирование. С другой стороны, авторы прогнали метод на нескольких моделях и на большом наборе бенчмарков, а код выложили публично — это повышает доверие. Но пока это всё ещё тесты в контролируемых условиях, так что до реального внедрения стоит ждать независимых проверок.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.CL)
Дата публикации у нас9 июня 2026 г.
Дата источника8 июня 2026 г.
ОригиналОткрыть
АвторыZhanchao Xu, Haoyang Li, Qingfa Xiao, Fei Teng, Chen Jason Zhang, Lei Chen, Qing Li