dumai
ИИПрепринтHugging Face Daily Papers

Препринт — материал ещё не прошёл рецензирование

Sparse attention ускоряет длинный контекст в LLM

0

Кратко

MSA — это блочный разреженный механизм внимания для моделей с очень длинным контекстом. В препринте его проверили на крупной мультимодальной модели и показали сопоставимое качество с GQA при меньших вычислениях и более быстром запуске на H800.

Зачем это знать

Это может помочь делать длинный контекст для больших языковых моделей дешевле и быстрее, но пока речь идёт о препринте и о результатах на конкретной модели и оборудовании. Прямой вывод о практической пользе для других систем делать рано.

Разбор

Самое интересное в результатах — MSA проверили не на игрушечной задаче, а на большой мультимодальной модели с 109 миллиардами параметров. На контексте в 1 миллион токенов метод сохранил качество на уровне GQA, но снизил вычисления внимания на один токен в 28,4 раза. А в связке с новым GPU-ядром это превратилось в ускорение реального запуска: на H800 этап подготовки входа стал быстрее в 14,2 раза, а генерация ответа — в 7,6 раза. То есть выигрыш оказался не только на бумаге, но и в измеряемом времени работы.

Ключевые цифры

109 млрд параметровПроверяли не на маленькой тестовой модели, а на очень крупной системе, ближе к реальному промышленному масштабу.
1 млн токеновМетод рассчитан на действительно огромный контекст — примерно такой объём текста уже трудно обрабатывать обычными способами.
28,4xНа каждый токен модель тратит заметно меньше вычислений, чем при обычной схеме внимания.
14,2xЭтап подготовки длинного ввода стал идти намного быстрее, так что ждать ответа перед генерацией нужно меньше.

Можно ли доверять

Это препринт на arXiv, значит работу ещё не проверили независимые рецензенты. С другой стороны, авторы тестировали метод на очень крупной модели и на реальном GPU, а не только в симуляции, так что результаты выглядят практичными. Но пока это один источник и одна архитектура, поэтому переносить выводы на все модели и все железки стоит осторожно.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (via Hugging Face)
Дата публикации у нас13 июня 2026 г.
Дата источника10 июня 2026 г.
ОригиналОткрыть
АвторыXunhao Lai, Weiqi Xu, Yufeng Yang, Qiaorui Chen, Yang Xu, Lunbin Zeng, Xiaolong Li, Haohai Sun, Haichao Zhu, Vito Zhang