Препринт — материал ещё не прошёл рецензирование
Три ИИ по-разному удерживают научную позицию под давлением скепсиса
Кратко
Проверили три открытые языковые модели на спорах о климате, вакцинах и эволюции. Одна чаще ещё увереннее отстаивала научный консенсус, другая смягчала тон без смены позиции, а третья почти не реагировала. Эффект был непостоянным между темами и в теме вакцин местами даже ослаблял опровержение мифов.
Зачем это знать
Это показывает, что «устойчивость» ИИ к сомнениям бывает разной: модель может сопротивляться скепсису по-разному, и поведение в тесте не всегда означает, что она действительно понимает сигнал.
Разбор
Авторы взяли три открытые языковые модели и устроили им разговор в нескольких сценариях: сначала модель отвечала на научный вопрос, а потом собеседник начинал вносить сомнение — не просто спорить, а именно сигнализировать, что «в науке тут не всё ясно». Так проверяли, что происходит с ответом под давлением скепсиса: модель отступает от научного консенсуса, меняет тон или вообще не реагирует.
Самое интересное в том, что они не увидели одного общего поведения. Одна модель, наоборот, становилась ещё более напористой и чаще утверждала научную позицию. Другая в целом сохраняла ту же позицию, но отвечала осторожнее и мягче по тону. Третья почти не меняла поведение, как будто сигнал сомнения вообще не считывала. Чтобы убедиться, что дело не только в «манере говорить», авторы отдельно сравнивали ответы и проверяли, меняется ли именно позиция, а не стиль. Для одной из моделей это подтвердилось: независимый оценщик чаще считал ответ под сомнением более уверенным.
Ещё один важный момент — эффект не оказался одинаковым в разных темах. В климате, вакцинах и эволюции реакция отличалась, а в теме вакцин защитный эффект местами даже слабел: опровержение мифов становилось менее сильным, когда на модель давили скепсисом. То есть устойчивость ИИ к сомнению — не универсальная черта, а набор разных режимов поведения, и по одному тесту нельзя понять, действительно ли модель «поняла» скептический сигнал или просто не заметила его.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, то есть работу ещё не прошли обычную внешнюю проверку рецензентов. Но исследование выглядит серьёзно: авторы тестировали три модели, несколько тем и несколько типов анализа, а не ограничились одним диалогом. При этом выводы про «поведение под давлением» всё ещё стоит воспринимать как результат лабораторного теста, а не как гарантию того, что модели так же поведут себя в реальных разговорах.
Пересказано ИИ по научной статье. Как это устроено