Препринт — материал ещё не прошёл рецензирование
Языковые модели создают больше хороших ответов, но плохо выбирают лучший
Кратко
В этом препринте сравнили пять способов улучшать ответы за счёт дополнительных вычислений на пяти задачах без единственного правильного ответа — от медицины и права до общения и творчества. Лучший ответ среди множества кандидатов становился качественнее, но автоматические оценщики почти не совпадали с реальным качеством: их корреляция составила примерно 0,12. Надёжнее всего сработал синтез нескольких ответов, однако он использовал лишь около 40% доступного качества.
Зачем это знать
Для ИИ, который решает задачи без единственного правильного ответа, увеличение вычислений само по себе не устраняет главную проблему: нужно научиться выбирать итоговый вариант. Это пока предварительный результат одной основной модели и пяти наборов задач, поэтому неизвестно, повторится ли он в других системах.
Разбор
Авторы свели разные способы «додумать» ответ к одной схеме: сначала модель исследует пространство вариантов, а затем пытается превратить найденное множество в один финальный текст. В сравнении были параллельная генерация с выбором, два варианта поиска по частичным ответам, последовательная доработка, длинная одиночная цепочка рассуждений и объединение нескольких кандидатов. Всем методам дали сопоставимый бюджет токенов, чтобы сравнивать не просто качество, а отдачу от одинакового количества вычислений.
Такой тест понадобился потому, что прежние методы в основном проверяли на математике и программировании: там ответ часто можно проверить автоматически. В медицине, праве, финансовых советах, обычном диалоге и творческих текстах правильность устроена сложнее. Авторы отдельно оценили качество лучшего кандидата в наборе и качество варианта, который система в итоге выбрала. Первая величина росла по мере добавления вычислений, а вторая упиралась в слабое место оценщиков.
Особенно показателен результат для древовидного поиска: когда система слишком активно отбрасывает варианты по оценке промежуточных шагов, разные ветви начинают сходиться к похожим ответам — это уменьшает разнообразие, а не помогает найти лучший путь. Последовательная критика и переписывание дали устойчивую пользу только на одной задаче; на остальных улучшения могли объясняться особенностями сравнения. При этом объединение кандидатов оказалось единственным методом, который стабильно превзошёл простой выбор одного ответа, хотя далеко не полностью использовал потенциал набора.
Ключевые цифры
Можно ли доверять
Это препринт arXiv, поэтому работу ещё не проверили рецензенты. Кроме того, основной эксперимент провели на одной языковой модели и пяти наборах открытых задач; результат важен как систематический сигнал, но на других моделях и задачах может измениться.
Пересказано ИИ по научной статье. Как это устроено