Препринт — материал ещё не прошёл рецензирование
Sparse attention ускоряет длинный контекст в LLM
Кратко
MSA — это блочный разреженный механизм внимания для моделей с очень длинным контекстом. В препринте его проверили на крупной мультимодальной модели и показали сопоставимое качество с GQA при меньших вычислениях и более быстром запуске на H800.
Зачем это знать
Это может помочь делать длинный контекст для больших языковых моделей дешевле и быстрее, но пока речь идёт о препринте и о результатах на конкретной модели и оборудовании. Прямой вывод о практической пользе для других систем делать рано.
Разбор
Самое интересное в результатах — MSA проверили не на игрушечной задаче, а на большой мультимодальной модели с 109 миллиардами параметров. На контексте в 1 миллион токенов метод сохранил качество на уровне GQA, но снизил вычисления внимания на один токен в 28,4 раза. А в связке с новым GPU-ядром это превратилось в ускорение реального запуска: на H800 этап подготовки входа стал быстрее в 14,2 раза, а генерация ответа — в 7,6 раза. То есть выигрыш оказался не только на бумаге, но и в измеряемом времени работы.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, значит работу ещё не проверили независимые рецензенты. С другой стороны, авторы тестировали метод на очень крупной модели и на реальном GPU, а не только в симуляции, так что результаты выглядят практичными. Но пока это один источник и одна архитектура, поэтому переносить выводы на все модели и все железки стоит осторожно.
Пересказано ИИ по научной статье. Как это устроено