Препринт — материал ещё не прошёл рецензирование
Ответы шести ИИ часто не удаётся объяснить через человеческие навыки
Кратко
В препринте сравнили ответы людей и шести ИИ в заданиях по количественному мышлению и химии. Эксперты смогли объяснить большинство закономерностей в ответах людей, но не нашли понятного смысла ни в одной закономерности ответов ИИ по количественному мышлению и лишь в половине — по химии. Это не доказывает отсутствия у ИИ нужных навыков: скорее, привычные человеческие объяснения не всегда подходят к их ответам.
Зачем это знать
Хороший результат ИИ в тесте не обязательно означает тот же навык, который тест проверяет у человека. Поэтому способности ИИ нельзя автоматически трактовать через привычные человеческие представления.
Разбор
Авторы не пытались выяснить, «думает» ли модель как человек, напрямую заглядывая внутрь нейросети. Они взяли ответы людей и шести языковых моделей на задания по химии и количественному мышлению, а затем отдельно для людей и ИИ сгруппировали задания, на которых участники отвечали похожим образом. Такой метод называют эксплораторным факторным анализом: он ищет скрытые связки между ответами и предполагаемые способности, которые за ними стоят.
После этого специалисты по предметам получили схемы этих связок, но не знали, откуда взялась каждая схема — от людей или от ИИ. Их попросили дать факторам содержательное, педагогическое объяснение. Для человеческих ответов это обычно удавалось. А в схемах ИИ специалисты часто не видели знакомой логики: возможно, модели используют непривычные навыки, а возможно, их ответы возникают из статистических закономерностей, которые вообще плохо описываются как отдельные способности.
Это важно для самих тестов. Если задания создавали, чтобы измерять человеческое количественное мышление или знание химии, одинаковая группировка правильных ответов ещё не гарантирует одинаковый способ решения. Тем более что модели сильно различаются по устройству и данным, на которых обучались; поэтому единая шкала «способностей», не зависящая от внутреннего механизма, может оказаться труднее, чем предполагают обычные бенчмарки.
Ключевые цифры
Можно ли доверять
Это препринт с arXiv, поэтому его ещё не проверили независимые рецензенты. Кроме того, выводы относятся к конкретным заданиям по химии и количественному мышлению и к шести моделям; сами авторы отмечают ограничения анализа, так что переносить результат на все ИИ-тесты пока рано.
Пересказано ИИ по научной статье. Как это устроено