dumai
ИИПрепринтarXiv cs.LG

Препринт — материал ещё не прошёл рецензирование

xLSTM лучше других субквадратичных моделей на трёх задачах

0

Кратко

В препринте сравнили xLSTM, Mamba-2 и Gated DeltaNet в трёх сценариях: предобучение на коде, дистилляция кодовых моделей и предобучение моделей для временных рядов. В этих условиях xLSTM показал лучший общий результат среди сравниваемых архитектур.

Зачем это знать

Работа помогает понять, какие именно идеи в субквадратичных моделях могут быть полезнее других, но это пока вывод из препринта и ограниченного набора сравнений. Механизм преимущества объясняют архитектурным анализом и синтетическими задачами, так что делать практические выводы для реальных систем стоит осторожно.

Разбор

Авторы не просто посмотрели на один бенчмарк, а свели три разных сценария, где модели последовательностей реально упираются в память: предобучение на коде, сжатие знаний из больших кодовых моделей и обучение для временных рядов. Чтобы сравнение было честным, они держали условия одинаковыми и подставляли в одну и ту же базовую схему разные «сердца» модели — xLSTM, Mamba-2 и Gated DeltaNet. Такой подход нужен, потому что по отдельности каждая архитектура может хорошо выглядеть на своей любимой задаче, но это ещё не значит, что она лучше в целом.

Главный результат здесь не в том, что xLSTM где-то чуть обошёл соперников, а в том, что его преимущество повторилось почти везде и особенно заметно на задачах со сложной структурой. На коде он лидировал при всех режимах обучения и при разных объёмах выборки, а на общих задачах на понимание и здравый смысл тоже сохранял лучший суммарный результат, хотя разница там была меньше. Это важно, потому что сложные задачи оказались более чувствительным тестом: они лучше показывают, какие архитектурные идеи действительно работают, а какие помогают только в узком случае.

Дальше авторы попытались понять не только «кто выиграл», но и «почему». Для этого они разобрали архитектуру через единый взгляд на механизм памяти и проверили идеи на синтетических задачах, где можно специально контролировать длину и сложность зависимостей. Такой набор тестов нужен, чтобы отделить случайный выигрыш на конкретном датасете от более общего свойства модели. Итоговый вывод у них такой: xLSTM лучше справляется с накоплением информации и её исправлением по ходу обработки последовательности, а это и даёт ему преимущество на трудных длинных задачах.

Ключевые цифры

3Авторы сравнили модели сразу в трёх разных режимах, так что вывод не держится на одной удачной задаче.
400M параметровПроверка шла на крупных моделях, а не на маленьких учебных версиях, поэтому результат ближе к практике.
20B токеновОдна из проверок использовала очень большой объём текста — это серьёзная тренировка, а не короткий прогон.
100B токеновНа ещё большем объёме данных сравнение показало, что преимущество xLSTM не исчезает при более долгом обучении.

Можно ли доверять

Это препринт на arXiv, то есть работу ещё не прошли внешнюю рецензию. Сильная сторона — они сравнили несколько архитектур на крупных моделях и в трёх разных сценариях, но все проверки всё равно остаются в рамках одного исследования и заданного набора задач. Для практических выводов это хороший сигнал, но не окончательный вердикт.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.LG)
Дата публикации у нас11 июня 2026 г.
Дата источника10 июня 2026 г.
ОригиналОткрыть
АвторыAnamaria-Roberta Hartl, Levente Zólyomi, David Stap, Pieter-Jan Hoedt, Niklas Schmidinger, Lukas Hauzenberger, Sebastian Böck, Günter Klambauer, Sepp Hochreiter