dumai
ИИПрепринтarXiv cs.AI

Препринт — материал ещё не прошёл рецензирование

CPPO улучшил стабильность обучения и точность рассуждений в LLM

0

Кратко

Авторы предложили схему CPPO — правило маскирования для обучения с подкреплением у языковых моделей с проверяемой наградой. В экспериментах на нескольких масштабах Qwen3 она работала стабильнее и в изученных настройках давала лучшие результаты на тестах на рассуждение по сравнению с PPO-базовыми методами.

Зачем это знать

Работа показывает, что способ ограничения обновлений может заметно влиять на обучение моделей, особенно когда ошибки на ранних шагах накапливаются. Но это пока предварительный результат из препринта и из ограниченного набора экспериментов, поэтому его стоит рассматривать как направление для дальнейшей проверки, а не как готовый рецепт.

Разбор

Авторы не просто поменяли алгоритм обучения, а добавили к нему правило, которое по-разному смотрит на токены в начале и в конце ответа. Идея простая: если модель слишком сильно отклонится в самом начале, дальше ошибка начнёт накапливаться, как снежный ком. Поэтому они сделали ранние шаги более "жёсткими", а поздние — чуть свободнее, плюс ввели общий "бюджет" на отклонение, который следит, сколько модель уже ушла от исходной траектории.

Проверяли это не на одной игрушечной настройке, а на нескольких вариантах Qwen3 и сравнивали с разными базовыми схемами маскирования и доверительного ограничения. Важный момент: эксперимент ставили в одинаковых условиях по данным, длине ответов и окну выбора лучшей версии, чтобы новая схема не выигрывала просто за счёт большего времени обучения. В таком честном сравнении CPPO оказался стабильнее и дал лучшие результаты на тестах по рассуждению почти во всех конфигурациях.

Ещё интереснее, что авторы отдельно сравнили CPPO с DPPO, где меняли только то, как распределяется допустимое отклонение по токенам. Это помогло показать, что выигрыш идёт именно от нового правила для токенов и учёта накопленного отклонения, а не от какого-то другого трюка вроде более мягкого порога. В самой тяжёлой настройке, где ответ длиннее и ранняя ошибка успевает сильнее разрастись, разница вышла особенно заметной.

По сути, работа отвечает на вопрос, который раньше часто обходили стороной: если генерация идёт по одному слову за раз, то и ограничивать обновления стоит не одинаково для всех позиций. Здесь авторы показали, что "один порог на все токены" может быть слишком грубым инструментом, и что более тонкое управление обновлениями действительно помогает обучению.

Ключевые цифры

4CPPO проверили сразу в четырёх настройках одной и той же модели, так что это не единичный удачный запуск.
3.06 пунктаНа одной из конфигураций новая схема дала заметный прирост по итоговой метрике по сравнению с ближайшим конкурентом.
0.91 пунктаДаже в самой близкой по качеству настройке CPPO всё равно немного, но стабильно обошёл следующий лучший метод.
5.56 пунктаВ самой сложной и длинной настройке выигрыш оказался особенно большим, что намекает: новый подход лучше справляется с накапливающимися ошибками.

Можно ли доверять

Это препринт на arXiv, то есть статья ещё не прошла обычную независимую рецензию. Зато авторы сравнили методы в нескольких конфигурациях и старались держать условия одинаковыми, что делает выводы убедительнее, хотя проверка пока ограничена одной семейством моделей и набором тестов на рассуждение.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.AI)
Дата публикации у нас11 июня 2026 г.
Дата источника9 июня 2026 г.
ОригиналОткрыть
АвторыRenjie Mao, Xiangxin Zhou, Lvfang Tao, Yixin Ding, Yu Shi, Yongguang Lin, Yuheng Wu, Honglin Zhu, Qian Qiu, Wenxi Zhu