Препринт — материал ещё не прошёл рецензирование
Ни одна модель не лучшая по всем показателям работы интернет-магазина
Кратко
Открытый тест проверяет, как 18 моделей ведут несколько интернет-магазинов в течение года: закупают товары, меняют цены, общаются с поставщиками и справляются со сбоями поставок. GPT-5.6 Sol превратила стартовые 100 000 в 1 431 425, но заняла лишь 16-е место из 18 по предотвращению мошенничества и уступила другой модели в эффективности работы.
Зачем это знать
Тест помогает сравнивать ИИ не по одному красивому показателю, а по разным сторонам долгой работы. Его результаты описывают поведение в смоделированной среде: спрос и переговоры там задаются фиксированными правилами, поэтому выводы не полностью переносятся на настоящую торговлю.
Разбор
Авторы собрали не набор отдельных задач, а целый год работы виртуального торговца. Модель каждый день исследует рынок, договаривается с поставщиками, заказывает товары, меняет стратегию продаж, обрабатывает возвраты и следит за деньгами. Важная деталь: магазинов несколько, поэтому агенту приходится распределять внимание и принимать решения, последствия которых проявляются далеко не сразу.
Чтобы среда была похожа на настоящую торговлю, авторы взяли данные о товарах и поставщиках с реальной торговой площадки. В течение года они добавляли календарные события, стихийные бедствия и перебои в цепочках поставок — всё это меняет спрос и доступность товаров. При этом покупатели, возвраты и реакция поставщиков подчиняются заранее заданным правилам: языковая модель формулирует переговоры, но не может случайно изменить саму механику рынка. Такой подход делает сравнение воспроизводимым: разные модели сталкиваются с одной и той же последовательностью событий.
Модели сравнили не только по итоговой сумме денег, но и по семи сторонам работы. Среди открытых моделей лучшей оказалась Qwen3.8-Max-Preview: она заработала 416 252 и заметно опередила GLM 5.2 (high). Кроме того, Qwen3.8-Max-Preview постепенно училась на повторяющихся заказах и со временем добивалась более низких цен у поставщиков — то есть использовала накопленный опыт, а не просто реагировала на каждый заказ заново. Авторы также выложили исходный код теста, чтобы другие команды могли повторить сравнение и добавить свои модели.
Ключевые цифры
Можно ли доверять
Это препринт с arXiv, а не статья, прошедшая рецензирование другими учёными. Тест выглядит воспроизводимым и использует данные реальной торговой площадки, но покупатели и поставщики действуют по фиксированным правилам, поэтому результат показывает поведение моделей в симуляции, а не гарантирует такой же успех в настоящем бизнесе.
Пересказано ИИ по научной статье. Как это устроено