Препринт — материал ещё не прошёл рецензирование
Новая схема оценки лучше обучает большие языковые модели
Кратко
В работе предложили схему, где система оценки и сама модель улучшают друг друга по ходу обучения. В опытах на моделях с 8 миллиардами параметров она дала более сильные сигналы для обучения, чем базовые подходы с более крупными системами оценки, и улучшила результаты на проверяемых задачах рассуждения и программирования.
Зачем это знать
Если такой подход подтвердится в других условиях, им можно будет точнее обучать языковые модели там, где ответы становятся очень похожими друг на друга. Авторы также сообщают о внедрении в поисковом сервисе WeChat, так что за этой идеей стоит следить как за практическим способом улучшать ответы ИИ.
Разбор
Авторы разбирают довольно практичную проблему: когда большая языковая модель уже неплохо отвечает, её варианты ответов начинают сильно походить друг на друга, и обычному оценщику становится трудно понять, какой ответ действительно лучше. Из-за этого обучение получает слабый сигнал — модель как будто видит, что «всё примерно одинаково», и исправлять поведение становится сложнее.
Чтобы проверить эту идею, они сначала посмотрели на обучение как на перераспределение вероятности между двумя ответами: если у одного ответа оценка выше, то сдвиг вероятности в его пользу даёт выигрыш ровно на величину разницы оценок. На основе этого вывода они предложили DynamicRubric — схему, где оценщик подстраивается под текущий набор ответов и для каждой группы вариантов сам собирает короткие бинарные пункты проверки, а потом превращает эти частные оценки в итоговый балл для ответа.
Главный смысл экспериментов такой: оценщик, который меняется вместе с моделью, лучше различает близкие ответы и даёт более полезные сигналы для дообучения, чем статичные схемы. Это проверили на моделях с 8 миллиардами параметров и сравнили с более тяжёлыми альтернативами, включая reward-модель на 70B и статический генератор рубрик на 235B. Кроме того, улучшенная политика показала прирост не только в оценке, но и на задачах, где ответ можно проверить автоматически, например в рассуждениях и написании кода.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, то есть работу ещё не прошли независимые рецензенты. С другой стороны, авторы проверили подход не только в теории, но и на моделях, а ещё сообщили о реальном внедрении в поисковом сервисе WeChat, что добавляет веса результатам. При этом подробности про сами онлайн-метрики и условия внедрения в абстракте не раскрыты, так что к масштабу практического эффекта стоит относиться аккуратно.
Пересказано ИИ по научной статье. Как это устроено