Препринт — материал ещё не прошёл рецензирование
Zero RL масштабировали до 1 трлн параметров, и модель стала строить более структурированные рассуждения без разметки
Кратко
Авторы обучили модель Ring-2.5-1T-Zero по схеме обучения с проверяемой наградой без человеческой разметки и масштабировали её до 1 трлн параметров. В их опытах это улучшило эффективность обучения и предел качества, а на семи математических тестах модель показала конкурентные результаты и стала выдавать более понятные, воспроизводимые и экономные цепочки рассуждений.
Зачем это знать
Работа показывает, что zero RL можно масштабировать до 1 трлн параметров без человеческой разметки, но это пока preprint и выводы требуют независимой проверки.
Разбор
Авторы не просто взяли большую модель и включили обучение с наградой за правильный ответ. Они собрали целый конвейер: несколько этапов обучения с подкреплением, промежуточное сжатие длинных цепочек рассуждений и набор технических настроек, которые делают такое обучение стабильным на длинных ответах. Проблема тут простая: на маленьких моделях zero RL уже показывал себя неплохо, но было непонятно, что случится, если перенести тот же подход на масштаб в триллион параметров.
Самое интересное — при наивном масштабировании качество рассуждений проседало не в самой точности ответа, а в том, как модель объясняет ход мысли: текст становился хуже читаемым, появлялись лишние повторы, а глубина рассуждения не подстраивалась под сложность задачи. Поэтому авторы не ограничились только увеличением размера модели и добавили вещи вроде исправления перекоса между обучением и генерацией ответа, отсечения слишком сильных вкладов отдельных примеров и контроля точности вычислений. То есть они пытались не просто сделать модель больше, а удержать её от типичных сбоев большого RL-обучения.
По итогам они увидели три вещи. Во-первых, масштаб до 1 трлн параметров действительно помог: модель стала учиться более экономно и подняла свой потолок качества. Во-вторых, процесс обучения шёл не хаотично, а как будто по двум стадиям — сначала модель что-то обнаруживает в поведении рассуждений, потом начинает это оттачивать. В-третьих, без ручных подсказок у неё сами собой появились более сложные привычки: проверка себя, параллельные ветки рассуждения, структурированный формат ответа и даже признаки «тревоги по поводу контекста», когда модель как будто осторожнее относится к уже сказанному.
Чтобы оценить не только правильность финального ответа, но и саму цепочку рассуждений, авторы ввели отдельную схему оценки по трём признакам: насколько текст понятен, можно ли воспроизвести логику и насколько он короткий и по делу. На семи математических тестах модель показала конкурентный результат, а по качеству объяснений — более аккуратные и сжатые цепочки мыслей. Это важно, потому что раньше zero RL в основном изучали на небольших моделях, и было неясно, сохранится ли такой эффект на уровне триллиона параметров.
Ключевые цифры
Можно ли доверять
Это preprint на arXiv, то есть работу ещё не проверяли независимые рецензенты. При этом авторы тестировали модель не на игрушечной задаче, а на очень крупной системе и на семи бенчмарках, так что инженерная часть выглядит серьёзно. Но заявления про «спонтанные когнитивные поведения» и превосходство цепочек рассуждений пока лучше воспринимать как сильный результат одной команды, который ещё стоит подтвердить в других работах.
Пересказано ИИ по научной статье. Как это устроено