Препринт — материал ещё не прошёл рецензирование
Программы чаще людей сходились в ответе на 34–44 процентных пункта
Кратко
Авторы сравнили 100 человеческих групп с сопоставимыми группами программ, работающих с текстом, в одной логической задаче. Машины чаще приходили к единому ответу, но согласие не означало точность: в одном варианте они почти единодушно выбирали ошибочный ответ.
Зачем это знать
Общее мнение такой группы нельзя автоматически считать признаком правильного решения или точным прогнозом результата человеческого обсуждения. Вывод пока относится к одной задаче и группам, которым заранее задали исходные взгляды участников.
Разбор
Авторы взяли 100 уже проведённых человеческих групп в задаче Уэйсона — логическом тесте, где нужно выбрать, какие данные проверить, чтобы понять правило. Затем они воспроизвели эти обсуждения с группами языковых моделей: каждому программному участнику дали стартовое мнение конкретного человека, а ответы людей и моделей оценивали одной и той же схемой. Такой подход нужен, чтобы сравнивать не абстрактные «способности ИИ», а поведение групп с похожими исходными взглядами.
Главная методическая проблема оказалась не только в самих ответах, но и в том, как считать участие и согласие. Примерно каждый пятый человек вообще ничего не написал, тогда как агенты почти всегда отправляли сообщение. Поэтому исследователи проверили вывод двумя способами: сначала учитывали только тех, кто действительно ответил, а затем подгоняли уровень участия программ под человеческий. Оба способа дали почти одинаковый результат — разница между ними составила менее половины процентного пункта.
Дополнительная проверка убрала из задачи ответ, который модель могла просто запомнить. Даже тогда группы в режиме рассуждений почти единогласно сходились на решении, причём чаще на неправильном. Это показывает, что согласие возникало не из-за одного случайного технического эффекта. При этом такие группы не смогли надёжно воспроизвести распределение итогов человеческих обсуждений: в этой постановке их коллективные ответы были систематически смещены.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, а не статья, прошедшая рецензирование, поэтому выводы ещё должна проверить независимая экспертиза. Исследование охватило 100 человеческих групп и несколько способов анализа, но проверяло одну логическую задачу, а программные группы лишь имитировали участников по их исходным ответам; переносить результат на другие обсуждения пока рано.
Пересказано ИИ по научной статье. Как это устроено