Препринт — материал ещё не прошёл рецензирование
Две модели учат друг друга лучше рассуждать через соревнование
Кратко
Авторы предложили способ обучения, где две модели соревнуются друг с другом и используют ответы соперника как сигнал качества мышления. На DeepMath с Qwen3 этот подход дал примерно двукратный рост pass@1 по сравнению с GRPO на сложных задачах и около +31 процентного пункта в одном сравнении.
Зачем это знать
Это ранний результат на ограниченном наборе задач и моделей, так что заранее переносить его на другие системы нельзя. Но если подход подтвердится, он может помочь учить модели не просто выдавать ответ, а лучше рассуждать в процессе решения.
Разбор
Авторы взяли две обучаемые версии одной и той же базовой модели и устроили между ними парное соревнование на одних и тех же задачах. Одна версия сначала пишет черновик решения, а другая видит этот черновик и пытается ответить лучше. Потом роли меняются. Так каждая модель не просто выдаёт финальный ответ, а всё время сталкивается с соперником, который уже успел увидеть её ход мысли.
Зачем это нужно? У обычного обучения с подкреплением модель чаще всего получают награду только за финальный ответ. Из-за этого на сложных задачах она может учиться писать больше текста, но не обязательно думать лучше. Здесь же авторы попытались сделать сам процесс рассуждения частью соревнования: чтобы победить, надо обойти соперника, который видел твоё решение и может на него опираться. При этом им не понадобились пометки о «хороших шагах рассуждения» и отдельная модель-судья.
Ещё одна важная деталь: обе модели обучались одновременно, поэтому у каждой был не статичный, а постоянно усиливающийся противник. Это отличает подход от схем, где учится только одна модель, а вторая роль остаётся неизменной. На практике авторы встроили всё это в две LoRA-адаптации — то есть две «надстройки» над одной замороженной базовой моделью — и отдельно учли, чтобы сравнение было честным по вычислениям. На тестах это дало не только рост точности, но и показало, что простой обмен черновиками уже помогает, а добавление соревнования даёт ещё заметный прирост сверху.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, так что работу ещё не проверяли независимые рецензенты. Проверяли на сравнительно узком наборе задач и нескольких семействах моделей, а сами авторы прямо пишут, что пока нельзя без оговорок переносить эффект на другие системы и сценарии.
Пересказано ИИ по научной статье. Как это устроено