dumai
🤖
ИИПрепринтarXiv cs.AI

Препринт — материал ещё не прошёл рецензирование

Две модели учат друг друга лучше рассуждать через соревнование

0

Кратко

Авторы предложили способ обучения, где две модели соревнуются друг с другом и используют ответы соперника как сигнал качества мышления. На DeepMath с Qwen3 этот подход дал примерно двукратный рост pass@1 по сравнению с GRPO на сложных задачах и около +31 процентного пункта в одном сравнении.

Зачем это знать

Это ранний результат на ограниченном наборе задач и моделей, так что заранее переносить его на другие системы нельзя. Но если подход подтвердится, он может помочь учить модели не просто выдавать ответ, а лучше рассуждать в процессе решения.

Разбор

Авторы взяли две обучаемые версии одной и той же базовой модели и устроили между ними парное соревнование на одних и тех же задачах. Одна версия сначала пишет черновик решения, а другая видит этот черновик и пытается ответить лучше. Потом роли меняются. Так каждая модель не просто выдаёт финальный ответ, а всё время сталкивается с соперником, который уже успел увидеть её ход мысли.

Зачем это нужно? У обычного обучения с подкреплением модель чаще всего получают награду только за финальный ответ. Из-за этого на сложных задачах она может учиться писать больше текста, но не обязательно думать лучше. Здесь же авторы попытались сделать сам процесс рассуждения частью соревнования: чтобы победить, надо обойти соперника, который видел твоё решение и может на него опираться. При этом им не понадобились пометки о «хороших шагах рассуждения» и отдельная модель-судья.

Ещё одна важная деталь: обе модели обучались одновременно, поэтому у каждой был не статичный, а постоянно усиливающийся противник. Это отличает подход от схем, где учится только одна модель, а вторая роль остаётся неизменной. На практике авторы встроили всё это в две LoRA-адаптации — то есть две «надстройки» над одной замороженной базовой моделью — и отдельно учли, чтобы сравнение было честным по вычислениям. На тестах это дало не только рост точности, но и показало, что простой обмен черновиками уже помогает, а добавление соревнования даёт ещё заметный прирост сверху.

Ключевые цифры

примерно в 2 разаНовая схема почти удвоила долю задач, где модель сразу даёт правильный ответ с первой попытки.
+31 процентный пунктВ одном сравнении результат вырос очень заметно: из каждых 100 задач правильных ответов стало примерно на 31 больше.
+16 процентных пунктовСам по себе обмен черновиками между моделями уже заметно улучшил качество решений.
+15 процентных пунктовДополнительное соревнование поверх обмена дало ещё один крупный шаг вперёд.

Можно ли доверять

Это препринт на arXiv, так что работу ещё не проверяли независимые рецензенты. Проверяли на сравнительно узком наборе задач и нескольких семействах моделей, а сами авторы прямо пишут, что пока нельзя без оговорок переносить эффект на другие системы и сценарии.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.AI)
Дата публикации у нас12 июля 2026 г.
Дата источника8 июля 2026 г.
ОригиналОткрыть
АвторыVladislav Beliaev