Препринт — материал ещё не прошёл рецензирование
Оценки LLM зависят не только от их работы, но и от ожиданий
Кратко
В контролируемом исследовании 162 участника работали с шестью LLM из двух семейств на трёх совместных задачах. Перед началом им показывали страницу, где модель описывали как более сильную, более слабую или соответствующую её реальным возможностям; это меняло оценки, манеру запросов и впечатление после работы. При этом качество общего результата зависело только от реальной способности модели, а не от того, что людям сказали заранее.
Зачем это знать
Это показывает, что пользовательские оценки ИИ часто отражают не только саму модель, но и то, как её подали. Значит, по таким оценкам, включая публичные таблицы сравнения, стоит судить осторожно.
Разбор
При этом итоговое качество совместной работы зависело не от маркетинговой подачи, а от реальной способности модели. А вот впечатление после использования — изменилась ли симпатия к модели, показалась ли она умнее и полезнее — сильнее всего определялось тем, оправдались ли ожидания и насколько уверенно человек чувствовал себя в процессе. Это важный поворот: оценки пользователей отражают не только продукт, но и разрыв между обещанием и тем, что они увидели в деле.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, значит, работу ещё не прошли формальную внешнюю проверку в журнале. Но дизайн здесь довольно крепкий: 162 участника, несколько моделей и заранее заданные условия сравнения. Ограничение в том, что всё проверяли на совместных задачах в контролируемой обстановке, поэтому в реальных продуктах, где люди спешат или уже доверяют бренду, эффект может быть даже сильнее или, наоборот, слабее.
Пересказано ИИ по научной статье. Как это устроено