Препринт — материал ещё не прошёл рецензирование
Модели ИИ пока ненадёжно воспроизводят человеческие социальные закономерности
Кратко
Авторы проверили 12 открытых моделей в пяти тестах, где уже были данные о поведении людей. В начале одной из игр с общим фондом 8 из 11 моделей показали близкий результат, но к концу ни одна не воспроизвела человеческий уровень сотрудничества. Простая смена порядка действий изменила сотрудничество одной модели на 58 пунктов.
Зачем это знать
Такие модели пока подходят лишь для первых гипотез о социальных явлениях, а не для подтверждённых выводов о поведении людей. Это результат препринта, поэтому его выводы ещё требуют независимой проверки; кроме того, заданные тесты не показывают, как ИИ поведёт себя в настоящих социальных системах.
Разбор
Авторы создали SILICA — набор проверок, который смотрит не только на сходство итоговых чисел с человеческими данными. В пяти игровых средах они оставляли правила прежними, но по-разному их оформляли: меняли порядок действий, названия и подачу инструкций. В других вариантах меняли выгодность решений, чтобы проверить, действительно ли модель рассчитывает последствия, а не просто повторяет знакомый из публикаций ответ.
Такой подход нужен из-за трёх разных источников ошибок. Модель может случайно попасть в человеческий результат, но не уметь воспроизводить сам ход поведения; может реагировать на внешний вид задания, хотя правила не изменились; наконец, она может извлекать из памяти известный эксперимент вместо того, чтобы рассуждать о ситуации. Поэтому авторы сравнивали не одну красивую цифру, а устойчивость поведения при разных представлениях одной задачи.
Результаты показали, что оформление задания заметно влияет на выводы: статистически заметные сдвиги появились в 64 из 182 сравнимых ячеек. В проверке с заранее заданным расписанием предложений только одна модель выставила порог принятия там, где его требовала экономическая мотивация; две сдвинули порог лишь частично, две — в неправильную сторону, а три вообще не сформировали такой порог. В задаче на возникновение условностей большинство моделей сходились на одинаковых названиях даже при перемешивании доступных имён, но делали это медленнее. Когда общую подсказку о названиях нарушали, переговоры снова начинали играть роль — то есть согласие возникало не только из самой коммуникации.
Ключевые цифры
Можно ли доверять
Это препринт с arXiv, а не статья, прошедшая рецензирование. Проверка охватила 12 открытых моделей и много вариантов заданий, что полезно для поиска хрупких результатов, но все выводы относятся к искусственным играм; по абстракту нельзя сказать, сохранятся ли они в настоящих социальных системах.
Пересказано ИИ по научной статье. Как это устроено