Препринт — материал ещё не прошёл рецензирование
Новый способ верификации ответов ИИ даёт более точную оценку
Кратко
Авторы предлагают способ проверки ответов больших языковых моделей, который превращает их внутренние оценки в плавный балл вместо жёсткого «верно/неверно». На нескольких задачах для агентов и роботов такой подход дал более точную проверку и лучшие результаты, чем у сравниваемых методов.
Зачем это знать
Если этот подход подтвердится, он может помочь лучше отбирать удачные ответы ИИ, точнее отслеживать ход решения и давать более плотную обратную связь при обучении. Сейчас это ранний результат, поэтому его стоит рассматривать как направление для дальнейших проверок, а не готовый стандарт.
Разбор
Авторы взяли привычную схему с языковой моделью-судьёй и поменяли самый грубый шаг: вместо ответа в духе «верно» или «неверно» модель сначала смотрит на распределение своих внутренних оценок, а потом собирает из него непрерывный балл. Идея тут простая: если модель колеблется между близкими вариантами, это лучше учитывать, чем заставлять её рубить с плеча одним ярлыком. Такой подход особенно полезен для агентных задач, где важны не только финальные ответы, но и то, как именно система к ним пришла.
Дальше они проверили, что происходит, если усиливать саму верификацию по трём направлениям: делать шкалу оценок более тонкой, повторять проверку несколько раз и разбивать критерии оценки на части. Все три хода дали свой плюс. Более тонкая шкала помогла лучше разводить удачные и неудачные решения, а повторные проверки и разбиение критериев снижали шум и упрощали задачу оценки. На практике это дало более точное сравнение кандидатов и помогло выбрать лучший ответ без лишних затрат.
Ещё один важный результат — такие непрерывные оценки можно использовать не только как проверку, но и как сигнал о том, насколько задача уже продвинулась к решению. Авторы показали это в расширении для Claude Code, где разработчики могут следить за работой своих агентов и подстраивать их поведение. Плюс они использовали эти же плотные сигналы как дополнительную обратную связь для обучения с подкреплением, и это улучшило эффективность обучения в задачах робототехники и математических рассуждений.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, то есть работу ещё не прошли независимые рецензенты. Проверяли метод не на одном тесте, а на нескольких бенчмарках для агентов, кода, роботов и медицины — это плюс к надёжности, но пока всё равно речь о лабораторной проверке, а не о массовом внедрении.
Пересказано ИИ по научной статье. Как это устроено