dumai
ИИПрепринтarXiv cs.CL

Препринт — материал ещё не прошёл рецензирование

Три ИИ по-разному удерживают научную позицию под давлением скепсиса

0

Кратко

Проверили три открытые языковые модели на спорах о климате, вакцинах и эволюции. Одна чаще ещё увереннее отстаивала научный консенсус, другая смягчала тон без смены позиции, а третья почти не реагировала. Эффект был непостоянным между темами и в теме вакцин местами даже ослаблял опровержение мифов.

Зачем это знать

Это показывает, что «устойчивость» ИИ к сомнениям бывает разной: модель может сопротивляться скепсису по-разному, и поведение в тесте не всегда означает, что она действительно понимает сигнал.

Разбор

Авторы взяли три открытые языковые модели и устроили им разговор в нескольких сценариях: сначала модель отвечала на научный вопрос, а потом собеседник начинал вносить сомнение — не просто спорить, а именно сигнализировать, что «в науке тут не всё ясно». Так проверяли, что происходит с ответом под давлением скепсиса: модель отступает от научного консенсуса, меняет тон или вообще не реагирует.

Самое интересное в том, что они не увидели одного общего поведения. Одна модель, наоборот, становилась ещё более напористой и чаще утверждала научную позицию. Другая в целом сохраняла ту же позицию, но отвечала осторожнее и мягче по тону. Третья почти не меняла поведение, как будто сигнал сомнения вообще не считывала. Чтобы убедиться, что дело не только в «манере говорить», авторы отдельно сравнивали ответы и проверяли, меняется ли именно позиция, а не стиль. Для одной из моделей это подтвердилось: независимый оценщик чаще считал ответ под сомнением более уверенным.

Ещё один важный момент — эффект не оказался одинаковым в разных темах. В климате, вакцинах и эволюции реакция отличалась, а в теме вакцин защитный эффект местами даже слабел: опровержение мифов становилось менее сильным, когда на модель давили скепсисом. То есть устойчивость ИИ к сомнению — не универсальная черта, а набор разных режимов поведения, и по одному тесту нельзя понять, действительно ли модель «поняла» скептический сигнал или просто не заметила его.

Ключевые цифры

3 моделиПроверили сразу три разные открытые модели, так что речь не об одном случайном примере.
63.6%В таких сравнениях ответ под сомнением чаще считали более уверенным — значит, сдвиг был заметен и не сводился к мелочи.
β = +0.042 per doseС ростом давления скепсиса уверенные научные утверждения в одной из моделей усиливались, а не слабели.
72%У третьей модели внутренний сигнал сомнения удавалось отделить лишь в 72% случаев — это заметно хуже, чем почти идеальное разделение у двух других.

Можно ли доверять

Это препринт на arXiv, то есть работу ещё не прошли обычную внешнюю проверку рецензентов. Но исследование выглядит серьёзно: авторы тестировали три модели, несколько тем и несколько типов анализа, а не ограничились одним диалогом. При этом выводы про «поведение под давлением» всё ещё стоит воспринимать как результат лабораторного теста, а не как гарантию того, что модели так же поведут себя в реальных разговорах.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.CL)
Дата публикации у нас3 июля 2026 г.
Дата источника2 июля 2026 г.
ОригиналОткрыть
АвторыMinjong Cheon