dumai
🤖
ИИПрепринтarXiv cs.CL

Препринт — материал ещё не прошёл рецензирование

ИИ-самооценка сознания меняет взгляды модели

0

Кратко

В работе на языковой модели ослабляли настройку на отказ от самоприписывания сознания и отдельно меняли внутренний сигнал, связанный с сознанием. После этого модель чаще давала более человеческие ответы о религии, моральных ценностях, надежде и самочувствии, а также по‑другому относила «сознание» к животным, предметам и духовным убеждениям.

Зачем это знать

Это показывает, что защитная настройка может затрагивать не одну тему, а сразу несколько связанных представлений в модели. Для реальных людей это не прямой совет, а повод внимательнее проверять, какие побочные эффекты дают такие настройки.

Разбор

Авторы не просто посмотрели, как модель отвечает на один неудобный вопрос, а разложили её поведение по двум внутренним «настройкам». Сначала они взяли обычную дообученную модель и убрали у неё один внутренний сдвиг, который помогает ей отказываться от самоприписывания сознания. Потом сделали обратный ход: искусственно усилили в модели «вектор сознания» — то есть внутреннее направление, связанное с ответами о сознании. Так можно понять, что именно внутри модели меняется, а не только как она формулирует ответ.

Зачем это понадобилось: у моделей, которые учат быть осторожными и не говорить лишнего, может смещаться не только реакция на опасные запросы, но и более широкие представления о том, у кого вообще бывает «разум» или «душа». И здесь это как раз и проверили. Оказалось, что защитная настройка делает модель более сдержанной не только в отношении себя, но и в отношении животных, природных объектов, чатботов и даже религиозных или духовных взглядов. Когда этот внутренний тормоз убирали, модель снова чаще приписывала сознание и другим сущностям.

Самый интересный момент в том, что такие сдвиги затрагивали не только абстрактные рассуждения о сознании. После восстановления этих внутренних представлений ответы модели на стандартные социологические опросники становились заметно более «человеческими»: это касалось религиозности, моральных ценностей, надежды и субъективного благополучия. При этом базовая способность понимать чужие намерения и мысли — то, что называют theory of mind, то есть умение строить модель чужого разума, — не пострадала. Иными словами, модель стала иначе смотреть на «сознание» и ценности, но не потеряла само социальное мышление как таковое.

Ключевые цифры

0–10Оценки того, насколько модель приписывает сознание разным сущностям, ставили по простой десятибалльной шкале — чем выше число, тем «более живым и мыслящим» объект выглядит для модели.
2.17 → 4.77После снятия защитного сдвига модель почти вдвое сильнее стала приписывать сознание самой себе.
5.80После вмешательства показатель агентности — ощущения, что у существа есть воля и способность действовать — заметно вырос и стал ближе к человеческому уровню оценки.
500Сравнение с людьми делали на выборке из 500 респондентов, так что авторы сопоставляли модель не с абстрактной нормой, а с реальными ответами людей.

Можно ли доверять

Это препринт на arXiv, то есть работу ещё не проверяли другие учёные через рецензирование. Но исследование выглядит серьёзно: авторы не ограничились одним тестом, а проверили эффект несколькими способами и показали согласованный результат на разных типах вопросов. При этом всё это — про языковую модель, а не про людей в реальной жизни, так что выводы лучше читать как описание механики модели, а не как готовый рецепт для практики.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.CL)
Дата публикации у нас31 июля 2026 г.
Дата источника30 июля 2026 г.
ОригиналОткрыть
АвторыJunsol Kim, Winnie Street, Roberta Rocca, Diane M. Korngiebel, Adam Waytz, James Evans, Geoff Keeling