dumai
🤖
ИИПрепринтarXiv cs.AI

Препринт — материал ещё не прошёл рецензирование

Люди и ИИ совпадают в оценке новизны, но расходятся в контексте

0

Кратко

В трёх исследованиях сравнили оценки креативности у людей и шести популярных языковых моделей. Совпадение оказалось самым сильным там, где нужно судить о новизне идеи, а разногласия — там, где важны социальный, рыночный и репутационный контекст. Разные модели опирались на разные наборы критериев, и это заметно меняло их оценки одних и тех же идей.

Зачем это знать

Это значит, что выбор модели для оценки идей нельзя считать нейтральным: разные ИИ могут признать креативными разные предложения. Для задач, где важен контекст, на результаты ИИ стоит смотреть особенно осторожно.

Разбор

Авторы не просто сравнили «мнение людей» и «мнение ИИ» в целом, а попытались понять, на каких именно правилах эти оценки держатся. Для этого они взяли шесть популярных языковых моделей и посмотрели, какие признаки те считают важными, когда оценивают идеи как креативные. Идея была простая: если люди и модели расходятся, полезно понять, из-за чего именно — из-за самой идеи или из-за того, в каком мире эта идея будет работать.

Самое заметное совпадение оказалось там, где речь идёт о новизне: и люди, и модели довольно хорошо сходились в оценке того, насколько идея свежая. А вот когда в оценку нужно было включать внешний фон — социальный смысл, рынок, репутационные риски и похожие вещи, — модели начинали заметно отставать от людей. То есть ИИ лучше видит «ново или не ново», но хуже улавливает, насколько идея уместна в реальной среде.

Ещё один важный результат: модели сами по себе были разными. Одни опирались на более широкий набор критериев, другие — на более узкий, и это напрямую отражалось на их оценках. В третьем исследовании добавление контекстной информации меняло оценки людей, но почти не сдвигало оценки моделей. Поэтому авторы и делают вывод, что согласие между людьми и ИИ зависит не только от самой идеи, но и от того, что именно нужно учитывать при её оценке.

Ключевые цифры

3 исследованияАвторы проверили выводы не в одном тесте, а в трёх независимых проверках, так что результат выглядит устойчивее.
6 моделейСравнили сразу несколько популярных ИИ, а не один случайный вариант, поэтому видно, что модели могут расходиться между собой.
1 103 идеиНа таком наборе идей уже можно заметить, насколько оценки ИИ и людей действительно совпадают или расходятся.
1 195 участников/оценокВо втором крупном тесте проверили, как контекст меняет человеческие и ИИ-оценки, и этого объёма достаточно, чтобы увидеть общий сдвиг.

Можно ли доверять

Это препринт на arXiv, то есть статья ещё не прошла полноценное рецензирование. При этом авторы опираются на три исследования и более чем на тысячу идей в двух из них, так что база выглядит неплохой. Но выводы пока стоит воспринимать как сильный рабочий результат, а не как окончательную точку.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.AI)
Дата публикации у нас27 июля 2026 г.
Дата источника24 июля 2026 г.
ОригиналОткрыть
АвторыPengzhao Lyu, Yeun Joon Kim, Hanlin Xiao, Yingyue Luna Luan