dumai
🤖
ИИПрепринтarXiv cs.AI

Препринт — материал ещё не прошёл рецензирование

Программы чаще людей сходились в ответе на 34–44 процентных пункта

0

Кратко

Авторы сравнили 100 человеческих групп с сопоставимыми группами программ, работающих с текстом, в одной логической задаче. Машины чаще приходили к единому ответу, но согласие не означало точность: в одном варианте они почти единодушно выбирали ошибочный ответ.

Зачем это знать

Общее мнение такой группы нельзя автоматически считать признаком правильного решения или точным прогнозом результата человеческого обсуждения. Вывод пока относится к одной задаче и группам, которым заранее задали исходные взгляды участников.

Разбор

Авторы взяли 100 уже проведённых человеческих групп в задаче Уэйсона — логическом тесте, где нужно выбрать, какие данные проверить, чтобы понять правило. Затем они воспроизвели эти обсуждения с группами языковых моделей: каждому программному участнику дали стартовое мнение конкретного человека, а ответы людей и моделей оценивали одной и той же схемой. Такой подход нужен, чтобы сравнивать не абстрактные «способности ИИ», а поведение групп с похожими исходными взглядами.

Главная методическая проблема оказалась не только в самих ответах, но и в том, как считать участие и согласие. Примерно каждый пятый человек вообще ничего не написал, тогда как агенты почти всегда отправляли сообщение. Поэтому исследователи проверили вывод двумя способами: сначала учитывали только тех, кто действительно ответил, а затем подгоняли уровень участия программ под человеческий. Оба способа дали почти одинаковый результат — разница между ними составила менее половины процентного пункта.

Дополнительная проверка убрала из задачи ответ, который модель могла просто запомнить. Даже тогда группы в режиме рассуждений почти единогласно сходились на решении, причём чаще на неправильном. Это показывает, что согласие возникало не из-за одного случайного технического эффекта. При этом такие группы не смогли надёжно воспроизвести распределение итогов человеческих обсуждений: в этой постановке их коллективные ответы были систематически смещены.

Ключевые цифры

24,0–57,0%В зависимости от правила подсчёта один и тот же человеческий материал давал очень разные оценки полного согласия — измерение заметно влияет на вывод.
примерно 1 из 5 участниковОколо каждого пятого человека не написал ни одного сообщения, поэтому прямое сравнение с почти всегда отвечающими программами могло бы быть несправедливым.
0,5 процентного пунктаПосле двух разных способов выровнять участие людей и программ их оценки различались совсем немного — это усиливает уверенность в устойчивости найденного разрыва.
n = 45В самом строгом сравнении, где участие программ подогнали под человеческое, осталось 45 сопоставимых групп — заметно меньше исходных 100.

Можно ли доверять

Это препринт на arXiv, а не статья, прошедшая рецензирование, поэтому выводы ещё должна проверить независимая экспертиза. Исследование охватило 100 человеческих групп и несколько способов анализа, но проверяло одну логическую задачу, а программные группы лишь имитировали участников по их исходным ответам; переносить результат на другие обсуждения пока рано.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.AI)
Дата публикации у нас18 сентября 2026 г.
Дата источника17 сентября 2026 г.
ОригиналОткрыть
АвторыTengfei Shao