Препринт — материал ещё не прошёл рецензирование
Три четверти повторяющихся ответов ИИ зависят от формулировки
Кратко
Авторы проверили четыре языковые модели на 4 442 вопросах о мнениях, не связанных с высоким риском. Один и тот же вопрос задавали по-разному: лишь примерно четверть повторяющихся предпочтений сохранялась, а такие устойчивые ответы труднее убрать дополнительным обучением или изменением запроса.
Зачем это знать
Такой подход помогает отличать устойчивые склонности модели от ответов, вызванных конкретными словами в вопросе. Пока работа не показывает, вредны ли эти склонности и предсказывают ли они ошибки в найме, медицине или праве.
Разбор
Авторы не просто считали, как часто модель выбирает один и тот же вариант. Они сначала измеряли силу этого предпочтения при обычной формулировке, а затем перефразировали тот же сценарий и проверяли, сохранился ли выбор. Так появился показатель «глубины»: он отделяет устойчивую склонность модели от реакции на случайные слова в запросе. Первый тип авторы называют глубоким, второй — поверхностным.
Ключевые цифры
Можно ли доверять
Это препринт с arXiv, а не прошедшая рецензирование журнальная статья. Проверка на 4 442 вопросах и четырёх моделях выглядит содержательно, но вопросы были низкорисковыми и не показывали реальные последствия для найма, медицины или права; кроме того, авторы отмечают, что источник большинства склонностей нельзя свести к одному примеру обучения.
Пересказано ИИ по научной статье. Как это устроено