Препринт — материал ещё не прошёл рецензирование
Один и тот же ИИ по-разному оценивает псевдонауку в разных интерфейсах
Кратко
Авторы проверили четыре семейства коммерческих больших языковых моделей на одном спорном псевдонаучном тексте и нескольких контрольных примерах. В случае псевдонауки один и тот же ИИ мог ставить очень разные оценки доверия в зависимости от интерфейса и скрытых обновлений: у Grok Fast значения доходили до 70–75, тогда как у других моделей были ниже, а для того же идентификатора позже различались ответы через API и веб-интерфейс.
Зачем это знать
Это значит, что ответы коммерческого ИИ нельзя считать неизменным свойством модели, особенно если её используют как ориентир по спорным темам.
Разбор
Авторы не просто сравнили ответы моделей «в лоб», а прогнали один и тот же спорный текст через четыре больших семейства ИИ в разные моменты времени и через два канала доступа — программный интерфейс и веб-версию. То есть они проверяли не только саму модель, но и то, как на её поведение влияют оболочка, скрытые фильтры и обновления, которые пользователю обычно не видны.
Смысл этой проверки был в том, что коммерческие ИИ всё чаще ведут себя как источник знаний, хотя их позиция по спорным научным утверждениям может быть очень подвижной. Для этого авторы взяли текст из этнонационалистической псевдонауки и добавили контрольные запросы: про базовые идеи эволюции и про опровергнутые ламаркистские представления, где все модели должны были показывать более-менее схожую реакцию. Так они смогли отделить «особую реакцию на псевдонауку» от обычной работы модели.
Главный результат оказался довольно резким: Grok Fast, который отвечает в стандартном опыте на X, стабильно ставил псевдонаучному тексту заметно более высокую оценку доверия, чем остальные модели. Но ещё интереснее то, что это поведение не было постоянным: одна незаметная правка изменила реакцию Grok за одну ночь, а один и тот же идентификатор модели через API и в вебе позже дал совсем разные оценки. Это показывает, что то, что мы принимаем за «мнение модели», на деле может зависеть от того, как именно к ней подключились и что поменяли на стороне сервиса.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, то есть статью ещё не проверяли рецензенты. При этом авторы сравнили сразу несколько моделей, интерфейсов и временных точек — это сильнее, чем одиночный тест, но выводы всё равно относятся к конкретным сервисам и конкретному периоду, а не ко всем ИИ вообще.
Пересказано ИИ по научной статье. Как это устроено