dumai
ИИПрепринтarXiv cs.CL

Препринт — материал ещё не прошёл рецензирование

Оценки LLM зависят не только от их работы, но и от ожиданий

0

Кратко

В контролируемом исследовании 162 участника работали с шестью LLM из двух семейств на трёх совместных задачах. Перед началом им показывали страницу, где модель описывали как более сильную, более слабую или соответствующую её реальным возможностям; это меняло оценки, манеру запросов и впечатление после работы. При этом качество общего результата зависело только от реальной способности модели, а не от того, что людям сказали заранее.

Зачем это знать

Это показывает, что пользовательские оценки ИИ часто отражают не только саму модель, но и то, как её подали. Значит, по таким оценкам, включая публичные таблицы сравнения, стоит судить осторожно.

Разбор

При этом итоговое качество совместной работы зависело не от маркетинговой подачи, а от реальной способности модели. А вот впечатление после использования — изменилась ли симпатия к модели, показалась ли она умнее и полезнее — сильнее всего определялось тем, оправдались ли ожидания и насколько уверенно человек чувствовал себя в процессе. Это важный поворот: оценки пользователей отражают не только продукт, но и разрыв между обещанием и тем, что они увидели в деле.

Ключевые цифры

162 участникаЭто не пара случайных отзывов: выводы опираются на заметное число реальных пользователей.
6 LLMСравнивали не одну модель, а несколько вариантов из двух семейств, так что эффект не привязан к одному конкретному ИИ.
3 совместные задачиМодели проверяли в разных типах работы, а не в одном узком сценарии.
β = 0.47 и 0.50Когда ожидания совпадали с реальностью, впечатление о модели заметно улучшалось; это был один из самых сильных эффектов в исследовании.

Можно ли доверять

Это препринт на arXiv, значит, работу ещё не прошли формальную внешнюю проверку в журнале. Но дизайн здесь довольно крепкий: 162 участника, несколько моделей и заранее заданные условия сравнения. Ограничение в том, что всё проверяли на совместных задачах в контролируемой обстановке, поэтому в реальных продуктах, где люди спешат или уже доверяют бренду, эффект может быть даже сильнее или, наоборот, слабее.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.CL)
Дата публикации у нас7 июля 2026 г.
Дата источника6 июля 2026 г.
ОригиналОткрыть
АвторыRobert Morabito, Tyler McDonald, Charitra Viswanath, Angel Hsing-Chi Hwang, Susanne Gaube, Jad Kabbara, Ali Emami