Препринт — материал ещё не прошёл рецензирование
xLSTM лучше других субквадратичных моделей на трёх задачах
Кратко
В препринте сравнили xLSTM, Mamba-2 и Gated DeltaNet в трёх сценариях: предобучение на коде, дистилляция кодовых моделей и предобучение моделей для временных рядов. В этих условиях xLSTM показал лучший общий результат среди сравниваемых архитектур.
Зачем это знать
Работа помогает понять, какие именно идеи в субквадратичных моделях могут быть полезнее других, но это пока вывод из препринта и ограниченного набора сравнений. Механизм преимущества объясняют архитектурным анализом и синтетическими задачами, так что делать практические выводы для реальных систем стоит осторожно.
Разбор
Авторы не просто посмотрели на один бенчмарк, а свели три разных сценария, где модели последовательностей реально упираются в память: предобучение на коде, сжатие знаний из больших кодовых моделей и обучение для временных рядов. Чтобы сравнение было честным, они держали условия одинаковыми и подставляли в одну и ту же базовую схему разные «сердца» модели — xLSTM, Mamba-2 и Gated DeltaNet. Такой подход нужен, потому что по отдельности каждая архитектура может хорошо выглядеть на своей любимой задаче, но это ещё не значит, что она лучше в целом.
Главный результат здесь не в том, что xLSTM где-то чуть обошёл соперников, а в том, что его преимущество повторилось почти везде и особенно заметно на задачах со сложной структурой. На коде он лидировал при всех режимах обучения и при разных объёмах выборки, а на общих задачах на понимание и здравый смысл тоже сохранял лучший суммарный результат, хотя разница там была меньше. Это важно, потому что сложные задачи оказались более чувствительным тестом: они лучше показывают, какие архитектурные идеи действительно работают, а какие помогают только в узком случае.
Дальше авторы попытались понять не только «кто выиграл», но и «почему». Для этого они разобрали архитектуру через единый взгляд на механизм памяти и проверили идеи на синтетических задачах, где можно специально контролировать длину и сложность зависимостей. Такой набор тестов нужен, чтобы отделить случайный выигрыш на конкретном датасете от более общего свойства модели. Итоговый вывод у них такой: xLSTM лучше справляется с накоплением информации и её исправлением по ходу обработки последовательности, а это и даёт ему преимущество на трудных длинных задачах.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, то есть работу ещё не прошли внешнюю рецензию. Сильная сторона — они сравнили несколько архитектур на крупных моделях и в трёх разных сценариях, но все проверки всё равно остаются в рамках одного исследования и заданного набора задач. Для практических выводов это хороший сигнал, но не окончательный вердикт.
Пересказано ИИ по научной статье. Как это устроено