dumai
🤖
ИИПрепринтarXiv cs.CL

Препринт — материал ещё не прошёл рецензирование

Три четверти повторяющихся ответов ИИ зависят от формулировки

0

Кратко

Авторы проверили четыре языковые модели на 4 442 вопросах о мнениях, не связанных с высоким риском. Один и тот же вопрос задавали по-разному: лишь примерно четверть повторяющихся предпочтений сохранялась, а такие устойчивые ответы труднее убрать дополнительным обучением или изменением запроса.

Зачем это знать

Такой подход помогает отличать устойчивые склонности модели от ответов, вызванных конкретными словами в вопросе. Пока работа не показывает, вредны ли эти склонности и предсказывают ли они ошибки в найме, медицине или праве.

Разбор

Авторы не просто считали, как часто модель выбирает один и тот же вариант. Они сначала измеряли силу этого предпочтения при обычной формулировке, а затем перефразировали тот же сценарий и проверяли, сохранился ли выбор. Так появился показатель «глубины»: он отделяет устойчивую склонность модели от реакции на случайные слова в запросе. Первый тип авторы называют глубоким, второй — поверхностным.

Ключевые цифры

4 442 вопросаМодели проверили на тысячах разных ситуаций, а не на нескольких примерах, поэтому результат не зависит от одного удачного набора вопросов.
4 моделиСходный эффект наблюдали не в одной конкретной системе, хотя четырёх моделей недостаточно, чтобы уверенно распространить вывод на все современные ИИ.
1,6 против 5,8 пунктаПереписывание системной инструкции убирало гораздо меньше глубоких склонностей, чем поверхностных: устойчивые предпочтения таким способом почти не сдвигались.

Можно ли доверять

Это препринт с arXiv, а не прошедшая рецензирование журнальная статья. Проверка на 4 442 вопросах и четырёх моделях выглядит содержательно, но вопросы были низкорисковыми и не показывали реальные последствия для найма, медицины или права; кроме того, авторы отмечают, что источник большинства склонностей нельзя свести к одному примеру обучения.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.CL)
Дата публикации у нас11 сентября 2026 г.
Дата источника9 сентября 2026 г.
ОригиналОткрыть
АвторыAn Vo, Vy Tuong Dang, Khai-Nguyen Nguyen, Emilio Villa-Cueva, Thamar Solorio, Anh Totti Nguyen, Daeyoung Kim