Препринт — материал ещё не прошёл рецензирование
Лупи обошла обычные модели при том же бюджете вычислений
Кратко
Loopie — это модель с несколькими экспертами, которая «зацикливает» один и тот же блок вместо простого наращивания размера. В сравнении с обычным Transformer и при одинаковом объёме вычислений она показала более сильные результаты в серии проверок. Авторы также сообщают о золотом уровне на олимпиадах 2025 года без внешних инструментов.
Зачем это знать
Если результат подтвердится, это подсказывает более выгодный путь строить большие модели: не только увеличивать число параметров, но и переиспользовать один блок несколько раз. Пока это ранняя черновая работа, поэтому к олимпийским результатам и общему выводу стоит относиться осторожно.
Разбор
Авторы взяли идею «зациклить» один и тот же трансформер — то есть прогонять один блок несколько раз, вместо того чтобы просто наращивать модель новыми слоями, — и проверили, можно ли таким способом выиграть у обычной схемы при том же бюджете вычислений. Для этого они собрали серию моделей Loopie на базе Mixture-of-Experts, где в работе участвует не вся огромная сеть целиком, а только часть экспертов: одна версия с 20 млрд параметров, из которых активно работают 2 млрд, и более компактная с 6 млрд параметров и 0,6 млрд активных параметров.
Сама проблема здесь старая: если у вас есть фиксированное количество вычислений на обучение, обычно выгоднее просто сделать модель больше, чем гонять один и тот же блок по кругу. Авторы прямо говорят, что именно это и мешало looped Transformers выглядеть убедительно на фоне обычных моделей. Loopie пытается решить этот перекос и показывает, что при честном сравнении на одинаковом compute такой подход всё-таки может быть сильнее базовой схемы.
Чтобы проверить это аккуратно, они провели много абляций — то есть по очереди выключали или меняли отдельные части системы, чтобы понять, что именно даёт прирост. В этих сравнениях Loopie заметно обошла обычные Transformer-базовые модели, в том числе vanilla 30B-A3B, при том же бюджете вычислений. Ещё одна важная часть работы — отдельный посттренировочный пайплайн, который уже после основного обучения настраивает модель на более сильное рассуждение; именно он помогает Loopie решать сложные задачи лучше, чем ждёшь от обычной большой языковой модели.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, то есть работу ещё не проверяли независимые рецензенты. Авторы показывают сильные результаты на сравнении моделей и на олимпиадных задачах, но без внешнего инструментария и в одном исследовании такие заявления лучше воспринимать как многообещающий сигнал, а не как окончательный вердикт.
Пересказано ИИ по научной статье. Как это устроено