Препринт — материал ещё не прошёл рецензирование
Новый бенчмарк показывает, что рост модели не всегда означает лучший UX
Кратко
UXBench — это бенчмарк, собранный на основе реальных логов обратной связи пользователей и диалогов с AI-ассистентом. Авторы проверили его на 26 современных языковых моделях и отдельно сравнили оценку предпочтений, генерацию диалогов и восстановление после ошибок.
Зачем это знать
Работа полезна как способ измерять не только общую силу модели, но и то, как она ведёт себя с точки зрения пользователя. Но это preprint, а выводы относятся прежде всего к оценке и сравнению моделей, а не к прямым эффектам для людей.
Разбор
Авторы не просто взяли абстрактные оценки качества и сравнили модели «в целом». Они собрали бенчмарк из живых сигналов: реальные логи общения пользователей с китайским AI-ассистентом и их обратную связь. Из этого они сделали три связанные задачи: угадать, понравится ли ответ пользователю; оценить уже готовый ответ; и восстановить диалог после ошибки. То есть проверяли не только «умение отвечать», но и то, как модель ведёт себя в реальной переписке, где важны сбои, недопонимания и способ исправляться.
Почему это важно? Потому что до этого модели чаще мерили по прокси-метрикам — например, по общим тестам на знания или по оценке ответов другими моделями. Но такие измерения плохо ловят то, что чувствует человек в чате. Здесь же данные взяли не из придуманных сценариев, а из более чем 70 тысяч реальных диалоговых логов, поэтому бенчмарк получился ближе к настоящему использованию, а не к учебной задачке.
Интересный результат: рост мощности модели не всегда даёт такой же рост пользовательской пользы. Авторы нашли устойчивые перекосы в оценке, включая склонность судей быть слишком доброжелательными, предпочтение собственным ответам и разрыв между тем, насколько модель «сильна» по общим меркам и насколько она удобна в общении. Ещё они показали, что предсказание пользовательской обратной связи — это вообще обучаемый навык: отдельная reward-модель, натренированная на сигналах из реальных логов, смогла довольно точно угадывать оценки.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, так что работу ещё не прошли через обычное рецензирование. Сильная сторона — данные взяли из реальных диалогов и протестировали на 26 моделях, но источник взаимодействий один: китайский AI-ассистент. Значит, результаты хорошо показывают поведение в этой среде, но в других языках, продуктах и аудиториях картина может быть другой.
Пересказано ИИ по научной статье. Как это устроено