dumai
ИИПрепринтarXiv cs.AI

Препринт — материал ещё не прошёл рецензирование

Языковые модели представляют мораль как несколько связанных, но разных направлений

0

Кратко

Авторы изучили шесть моральных тем в моделях с открытыми параметрами. Эти темы частично связаны, но в основном представлены независимо; в моральных дилеммах модель собирает ответ из них, а большая часть различий отражает сам конфликт, а не заранее выбранное решение.

Зачем это знать

Это указывает, что ответы ИИ на моральные дилеммы могут складываться во время столкновения ценностей, а не извлекаться из одного готового правила. Но работа — лишь препринт: анализ внутренних представлений моделей не доказывает, что они действительно понимают мораль.

Разбор

Авторы не пытались спросить модель о её взглядах напрямую. Они обучили отдельные простые классификаторы для каждой моральной темы и взяли найденные ими направления в пространстве внутренних представлений модели. Затем сравнили углы между направлениями: так можно увидеть, сливаются ли все моральные оценки в один общий сигнал или разные темы занимают разные области. Для проверки результата использовали и другой способ — просто вычитали среднее представление нейтральных примеров из среднего представления моральных. Он дал ту же общую картину, поэтому вывод не выглядит следствием одного конкретного алгоритма.

У направлений оказался общий моральный компонент, но каждая тема при этом сохраняла заметную самостоятельность. Такой общий компонент был гораздо сильнее, чем у набора неморальных понятий, собранного для сравнения. Геометрия повторялась в разных архитектурах и размерах моделей и появлялась уже на ранних этапах обучения — раньше, чем классификаторы достигали максимальной точности. Это важно: модель, по-видимому, довольно рано формирует общую структуру моральных сигналов, а затем уточняет её.

Авторы также проверили предсказание теории моральных оснований о разделении тем на два типа. Ожидаемого устойчивого разбиения не нашли; сами авторы оговаривают, что такая проверка была слабой. Когда анализ перенесли на моральные дилеммы, направление конкретной дилеммы частично складывалось из направлений её отдельных тем, но большая часть различий отражала именно столкновение ценностей. Иными словами, в представлении модели сохраняется напряжение между сторонами ситуации, а не только готовый ответ «за» или «против».

Ключевые цифры

0,26 против 0,013Общий компонент у моральных тем заметно сильнее, чем у сопоставимых неморальных понятий; это говорит о специфической для морали связи, а не просто о сходстве любых тем.
2,7 разаСвязь дилеммы с подходящими моральными основаниями была в 2,7 раза сильнее, чем со случайной несовпадающей парой.
90%+Найденные направления правильно различали моральные и нейтральные фрагменты в более чем девяти случаях из десяти при проверке на текстах дилемм.
8–11%Первое направление метода PCA объясняло лишь небольшую долю разброса данных, поэтому этот способ оказался слишком слабым для выделения морального понятия из маленькой выборки.

Можно ли доверять

Это препринт с arXiv, поэтому работу ещё не проверили независимые рецензенты. Авторы тестировали открытые модели и несколько способов найти направления, но выводы относятся к их внутренним представлениям, а не доказывают наличие у моделей человеческого морального понимания; кроме того, проверка предсказанного теорией разбиения была признана маломощной.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.AI)
Дата публикации у нас28 августа 2026 г.
Дата источника27 августа 2026 г.
ОригиналОткрыть
АвторыOrion Reblitz-Richardson