dumai
🤖
ИИПрепринтarXiv cs.CL

Препринт — материал ещё не прошёл рецензирование

Zero RL масштабировали до 1 трлн параметров, и модель стала строить более структурированные рассуждения без разметки

0

Кратко

Авторы обучили модель Ring-2.5-1T-Zero по схеме обучения с проверяемой наградой без человеческой разметки и масштабировали её до 1 трлн параметров. В их опытах это улучшило эффективность обучения и предел качества, а на семи математических тестах модель показала конкурентные результаты и стала выдавать более понятные, воспроизводимые и экономные цепочки рассуждений.

Зачем это знать

Работа показывает, что zero RL можно масштабировать до 1 трлн параметров без человеческой разметки, но это пока preprint и выводы требуют независимой проверки.

Разбор

Авторы не просто взяли большую модель и включили обучение с наградой за правильный ответ. Они собрали целый конвейер: несколько этапов обучения с подкреплением, промежуточное сжатие длинных цепочек рассуждений и набор технических настроек, которые делают такое обучение стабильным на длинных ответах. Проблема тут простая: на маленьких моделях zero RL уже показывал себя неплохо, но было непонятно, что случится, если перенести тот же подход на масштаб в триллион параметров.

Самое интересное — при наивном масштабировании качество рассуждений проседало не в самой точности ответа, а в том, как модель объясняет ход мысли: текст становился хуже читаемым, появлялись лишние повторы, а глубина рассуждения не подстраивалась под сложность задачи. Поэтому авторы не ограничились только увеличением размера модели и добавили вещи вроде исправления перекоса между обучением и генерацией ответа, отсечения слишком сильных вкладов отдельных примеров и контроля точности вычислений. То есть они пытались не просто сделать модель больше, а удержать её от типичных сбоев большого RL-обучения.

По итогам они увидели три вещи. Во-первых, масштаб до 1 трлн параметров действительно помог: модель стала учиться более экономно и подняла свой потолок качества. Во-вторых, процесс обучения шёл не хаотично, а как будто по двум стадиям — сначала модель что-то обнаруживает в поведении рассуждений, потом начинает это оттачивать. В-третьих, без ручных подсказок у неё сами собой появились более сложные привычки: проверка себя, параллельные ветки рассуждения, структурированный формат ответа и даже признаки «тревоги по поводу контекста», когда модель как будто осторожнее относится к уже сказанному.

Чтобы оценить не только правильность финального ответа, но и саму цепочку рассуждений, авторы ввели отдельную схему оценки по трём признакам: насколько текст понятен, можно ли воспроизвести логику и насколько он короткий и по делу. На семи математических тестах модель показала конкурентный результат, а по качеству объяснений — более аккуратные и сжатые цепочки мыслей. Это важно, потому что раньше zero RL в основном изучали на небольших моделях, и было неясно, сохранится ли такой эффект на уровне триллиона параметров.

Ключевые цифры

1 трлн параметровМодель проверили на гигантском масштабе, а не на маленьком прототипе, так что выводы о росте возможностей здесь особенно важны.
7 математических тестовРезультаты сравнили сразу на нескольких задачах, а не на одном удачном примере.
320 H200 GPUОбучение потребовало очень серьёзных вычислительных ресурсов — это признак того, что масштаб эксперимента был действительно большим.
16 rollout responsesДля каждого вопроса модель генерировала сразу несколько вариантов ответа, чтобы обучение лучше исследовало разные пути рассуждения.

Можно ли доверять

Это preprint на arXiv, то есть работу ещё не проверяли независимые рецензенты. При этом авторы тестировали модель не на игрушечной задаче, а на очень крупной системе и на семи бенчмарках, так что инженерная часть выглядит серьёзно. Но заявления про «спонтанные когнитивные поведения» и превосходство цепочек рассуждений пока лучше воспринимать как сильный результат одной команды, который ещё стоит подтвердить в других работах.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.CL)
Дата публикации у нас15 июля 2026 г.
Дата источника14 июля 2026 г.
ОригиналОткрыть
АвторыXinyu Tang, Gangqiang Cao, Yurou Liu, Yuliang Zhan, Xiaochong Lan, Yifan Li, Yuchen Yan, Han Peng, Zican Dong, Zhenduo Zhang