Препринт — материал ещё не прошёл рецензирование
Нейтральная роль приблизила три ИИ к ответам норвежцев
Кратко
Шести открытым ИИ-моделям предложили один и тот же моральный опросник. Нейтральная роль норвежского респондента приблизила ответы трёх из них к средним ответам 1282 жителей Норвегии на 44–77%, хотя роль не содержала данных о людях; у части моделей ответы зависели от формулировки самого опроса. Другой способ настройки скорее сгладил различия между ответами, чем менял отдельные ценности.
Зачем это знать
Похожие на человеческие ответы ИИ могут зависеть от заданной роли и формы опроса, а не отражать устойчивые моральные взгляды. Вывод пока относится к шести моделям и одному опросу, поэтому переносить его на другие системы рано.
Разбор
Авторы проверяли не только «какие ценности» приписывает себе модель, но и отвечает ли она на вопросы как осмысленный участник опроса. Шесть открытых моделей прошли норвежский опросник моральных оснований из 30 пунктов, а исследователи сравнили их профили с ответами 1 282 жителей Норвегии. У половины моделей ответы менялись в зависимости от содержания вопросов, а другая половина чаще выдавала ровные или средние оценки — внешне похожие на человеческие, но без явной связи с формулировками заданий. Этот результат сохранился, когда авторы меняли шкалу ответов и добавляли разные роли.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, поэтому другие учёные ещё не проверили работу в рамках рецензирования. Авторы изучили только шесть открытых моделей, один норвежский опросник и одну человеческую выборку; кроме того, часть результатов зависит от того, считали ли ответы модели осмысленными, а не просто средними.
Пересказано ИИ по научной статье. Как это устроено