Препринт — материал ещё не прошёл рецензирование
Усиление размышлений в ИИ не делает ответы точнее
Кратко
Авторы разобрали 15 282 трассы ответов 15 моделей на 6 тестах и сравнили, какие признаки поведения чаще совпадают с правильным ответом. Сильнее всего с точностью связаны калибровка уверенности, согласованность со знанием и самосознание, но при обучении на размышлениях они почти не усиливаются; зато распознавание неопределенности растёт в 3–7 раз.
Зачем это знать
Это показывает, почему ИИ может звучать более вдумчиво, не становясь при этом надёжнее. Для оценки таких моделей важнее смотреть не на «вид размышлений», а на то, насколько хорошо они умеют признавать уверенность и опираться на знания.
Разбор
Авторы не просто посмотрели, у каких моделей чаще получается правильный ответ, а разобрали сами «следы рассуждений» — то есть короткие цепочки шагов, которыми модель приходит к ответу. Потом они отметили в этих цепочках разные типы поведения: например, когда модель сверяет себя с уже известным знанием, когда явно сомневается или когда пытается исправить собственную ошибку. После этого они сравнили, насколько часто такое поведение встречается рядом с правильными ответами и насколько сильно оно вообще усиливается после обучения на рассуждениях.
Зачем всё это понадобилось: у моделей, обученных «думать вслух», текст ответа часто выглядит более вдумчивым. Но внешний вид рассуждения ещё не значит, что модель стала точнее. Поэтому исследователи ввели свою метрику — Behavioral Lift, она показывает, насколько наличие конкретного поведения связано с правильным ответом. Так можно отличить полезные признаки рассуждения от тех, что просто делают ответ более «человечным» на вид.
Самый важный вывод оказался немного неожиданным. Сильнее всего с правильными ответами связаны калибровка уверенности, согласованность с известными фактами и самосознание модели. Но именно эти признаки почти не усиливаются при reasoning-oriented training — обучении, которое специально делает ставку на рассуждение. Зато такие штуки, как признание неопределенности, растут очень заметно, в 3–7 раз, хотя с точностью они связаны слабо или даже отрицательно. Получается, обучение на рассуждениях действительно меняет стиль мышления модели, но не обязательно двигает её в сторону более надёжных ответов.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, то есть работу ещё не проверяли внешние рецензенты. Сильная сторона исследования — большой набор трасс и сравнение сразу на 15 моделях и 6 тестах, но все выводы всё равно основаны на автоматической разметке и анализе поведения моделей, а не на живых пользователях или реальном внедрении.
Пересказано ИИ по научной статье. Как это устроено