Препринт — материал ещё не прошёл рецензирование
Люди и ИИ совпадают в оценке новизны, но расходятся в контексте
Кратко
В трёх исследованиях сравнили оценки креативности у людей и шести популярных языковых моделей. Совпадение оказалось самым сильным там, где нужно судить о новизне идеи, а разногласия — там, где важны социальный, рыночный и репутационный контекст. Разные модели опирались на разные наборы критериев, и это заметно меняло их оценки одних и тех же идей.
Зачем это знать
Это значит, что выбор модели для оценки идей нельзя считать нейтральным: разные ИИ могут признать креативными разные предложения. Для задач, где важен контекст, на результаты ИИ стоит смотреть особенно осторожно.
Разбор
Авторы не просто сравнили «мнение людей» и «мнение ИИ» в целом, а попытались понять, на каких именно правилах эти оценки держатся. Для этого они взяли шесть популярных языковых моделей и посмотрели, какие признаки те считают важными, когда оценивают идеи как креативные. Идея была простая: если люди и модели расходятся, полезно понять, из-за чего именно — из-за самой идеи или из-за того, в каком мире эта идея будет работать.
Самое заметное совпадение оказалось там, где речь идёт о новизне: и люди, и модели довольно хорошо сходились в оценке того, насколько идея свежая. А вот когда в оценку нужно было включать внешний фон — социальный смысл, рынок, репутационные риски и похожие вещи, — модели начинали заметно отставать от людей. То есть ИИ лучше видит «ново или не ново», но хуже улавливает, насколько идея уместна в реальной среде.
Ещё один важный результат: модели сами по себе были разными. Одни опирались на более широкий набор критериев, другие — на более узкий, и это напрямую отражалось на их оценках. В третьем исследовании добавление контекстной информации меняло оценки людей, но почти не сдвигало оценки моделей. Поэтому авторы и делают вывод, что согласие между людьми и ИИ зависит не только от самой идеи, но и от того, что именно нужно учитывать при её оценке.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, то есть статья ещё не прошла полноценное рецензирование. При этом авторы опираются на три исследования и более чем на тысячу идей в двух из них, так что база выглядит неплохой. Но выводы пока стоит воспринимать как сильный рабочий результат, а не как окончательную точку.
Пересказано ИИ по научной статье. Как это устроено