dumai
ИИПрепринтarXiv cs.AI

Препринт — материал ещё не прошёл рецензирование

Языковые модели создают больше хороших ответов, но плохо выбирают лучший

0

Кратко

В этом препринте сравнили пять способов улучшать ответы за счёт дополнительных вычислений на пяти задачах без единственного правильного ответа — от медицины и права до общения и творчества. Лучший ответ среди множества кандидатов становился качественнее, но автоматические оценщики почти не совпадали с реальным качеством: их корреляция составила примерно 0,12. Надёжнее всего сработал синтез нескольких ответов, однако он использовал лишь около 40% доступного качества.

Зачем это знать

Для ИИ, который решает задачи без единственного правильного ответа, увеличение вычислений само по себе не устраняет главную проблему: нужно научиться выбирать итоговый вариант. Это пока предварительный результат одной основной модели и пяти наборов задач, поэтому неизвестно, повторится ли он в других системах.

Разбор

Авторы свели разные способы «додумать» ответ к одной схеме: сначала модель исследует пространство вариантов, а затем пытается превратить найденное множество в один финальный текст. В сравнении были параллельная генерация с выбором, два варианта поиска по частичным ответам, последовательная доработка, длинная одиночная цепочка рассуждений и объединение нескольких кандидатов. Всем методам дали сопоставимый бюджет токенов, чтобы сравнивать не просто качество, а отдачу от одинакового количества вычислений.

Такой тест понадобился потому, что прежние методы в основном проверяли на математике и программировании: там ответ часто можно проверить автоматически. В медицине, праве, финансовых советах, обычном диалоге и творческих текстах правильность устроена сложнее. Авторы отдельно оценили качество лучшего кандидата в наборе и качество варианта, который система в итоге выбрала. Первая величина росла по мере добавления вычислений, а вторая упиралась в слабое место оценщиков.

Особенно показателен результат для древовидного поиска: когда система слишком активно отбрасывает варианты по оценке промежуточных шагов, разные ветви начинают сходиться к похожим ответам — это уменьшает разнообразие, а не помогает найти лучший путь. Последовательная критика и переписывание дали устойчивую пользу только на одной задаче; на остальных улучшения могли объясняться особенностями сравнения. При этом объединение кандидатов оказалось единственным методом, который стабильно превзошёл простой выбор одного ответа, хотя далеко не полностью использовал потенциал набора.

Ключевые цифры

5 семейств методовАвторы сравнили не один приём, а основные разные подходы к дополнительным вычислениям.
ρ ≈ 0,12Оценки модели почти не совпадали с настоящим качеством ответа: по ним выбирать лучший вариант было почти как наугад.
≈ 40% доступного качестваДаже лучший устойчивый способ объединения ответов использовал меньше половины качества, которое уже содержалось в наборе кандидатов.
1 из 5 бенчмарковПоследовательная критика и переписывание надёжно помогли только на одной проверке из пяти.

Можно ли доверять

Это препринт arXiv, поэтому работу ещё не проверили рецензенты. Кроме того, основной эксперимент провели на одной языковой модели и пяти наборах открытых задач; результат важен как систематический сигнал, но на других моделях и задачах может измениться.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.AI)
Дата публикации у нас20 августа 2026 г.
Дата источника19 августа 2026 г.
ОригиналОткрыть
АвторыDavide Romano, Kanak Raj, Jerrod Parker, Daniele Giofrè