dumai
ИИПрепринтHugging Face Daily Papers

Препринт — материал ещё не прошёл рецензирование

Самооценки ИИ совпадают с поведением только в некоторых контекстах

0

Кратко

На 11 продвинутых языковых моделях проверили, когда их самоотчёты совпадают с поведением в четырёх задачах. Лучше всего в одном разговоре с поведением совпадал опросник Theory of Planned Behavior, а Big 5 такого совпадения не давал.

Зачем это знать

Это показывает, что совпадение самоотчётов и поведения у моделей зависит от задачи и контекста. Но из-за статуса препринта и ограниченного набора моделей и задач эти выводы пока нельзя считать универсальными.

Разбор

Исследователи сравнили два способа «прощупать» модель: один очень общий, как опрос про черты личности, и другой более точечный — про намерение вести себя определённым образом. Смысл был в том, чтобы понять, можно ли по ответам модели заранее угадать, как она действительно поведёт себя в похожей ситуации. Для этого модели не просто отвечали на вопросы, а ещё проходили несколько поведенческих задач, чтобы потом можно было сопоставить слова и действия.

Главный вывод оказался не в том, что ИИ «честный» или «нечестный», а в том, что совпадение между самоотчётом и поведением сильно зависит от того, как именно его проверяют. Когда вопросы и поведение были встроены в один и тот же разговор, более узкий опросник про намерения давал совпадение на уровне людей, а широкий набор черт личности — нет. То есть общие ярлыки вроде «экстравертный» или «добросовестный» плохо помогают понять конкретный поступок, а вот вопрос, связанный с конкретным действием, уже полезнее.

Ещё важная деталь: если модели отвечали в разных отдельных беседах, связь между словами и действиями сохранялась не всегда. Она держалась для вещей, которые меньше зависят от текущей подсказки, например для скрытых предубеждений, связанных с обучением, но ломалась там, где поведение сильно задавал сам контекст разговора — например, в случае поддакивания собеседнику. А если модели задавали «персону», то ответы становились стабильнее между беседами, но само поведение от этого не начинало лучше совпадать с этими ответами.

Ключевые цифры

11 моделейПроверка шла не на одной системе, а сразу на группе современных языковых моделей, так что это не случайность одной удачной или неудачной модели.
4 поведенческие задачиАвторы сравнивали слова и действия не в одной ситуации, а в четырёх разных — это помогает увидеть, где совпадение работает, а где ломается.

Можно ли доверять

Это препринт на arXiv, то есть работу ещё не прошли независимые рецензенты. С другой стороны, авторы сравнили сразу 11 моделей и несколько задач, а не сделали вывод по одному примеру. Но набор моделей и сценариев всё равно ограничен, поэтому результаты лучше считать хорошей проверкой гипотезы, а не окончательным правилом для всех ИИ.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (via Hugging Face)
Дата публикации у нас13 июня 2026 г.
Дата источника9 июня 2026 г.
ОригиналОткрыть
АвторыRafal Kocielnik, Pengrui Han, Peiyang Song, Myrl G. Marmarelis, Ramit Debnath, Dean Mobbs, Anima Anandkumar, R. Michael Alvarez