Препринт — материал ещё не прошёл рецензирование
Самооценки ИИ совпадают с поведением только в некоторых контекстах
Кратко
На 11 продвинутых языковых моделях проверили, когда их самоотчёты совпадают с поведением в четырёх задачах. Лучше всего в одном разговоре с поведением совпадал опросник Theory of Planned Behavior, а Big 5 такого совпадения не давал.
Зачем это знать
Это показывает, что совпадение самоотчётов и поведения у моделей зависит от задачи и контекста. Но из-за статуса препринта и ограниченного набора моделей и задач эти выводы пока нельзя считать универсальными.
Разбор
Исследователи сравнили два способа «прощупать» модель: один очень общий, как опрос про черты личности, и другой более точечный — про намерение вести себя определённым образом. Смысл был в том, чтобы понять, можно ли по ответам модели заранее угадать, как она действительно поведёт себя в похожей ситуации. Для этого модели не просто отвечали на вопросы, а ещё проходили несколько поведенческих задач, чтобы потом можно было сопоставить слова и действия.
Главный вывод оказался не в том, что ИИ «честный» или «нечестный», а в том, что совпадение между самоотчётом и поведением сильно зависит от того, как именно его проверяют. Когда вопросы и поведение были встроены в один и тот же разговор, более узкий опросник про намерения давал совпадение на уровне людей, а широкий набор черт личности — нет. То есть общие ярлыки вроде «экстравертный» или «добросовестный» плохо помогают понять конкретный поступок, а вот вопрос, связанный с конкретным действием, уже полезнее.
Ещё важная деталь: если модели отвечали в разных отдельных беседах, связь между словами и действиями сохранялась не всегда. Она держалась для вещей, которые меньше зависят от текущей подсказки, например для скрытых предубеждений, связанных с обучением, но ломалась там, где поведение сильно задавал сам контекст разговора — например, в случае поддакивания собеседнику. А если модели задавали «персону», то ответы становились стабильнее между беседами, но само поведение от этого не начинало лучше совпадать с этими ответами.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, то есть работу ещё не прошли независимые рецензенты. С другой стороны, авторы сравнили сразу 11 моделей и несколько задач, а не сделали вывод по одному примеру. Но набор моделей и сценариев всё равно ограничен, поэтому результаты лучше считать хорошей проверкой гипотезы, а не окончательным правилом для всех ИИ.
Пересказано ИИ по научной статье. Как это устроено