dumai
🤖
ИИПрепринтHugging Face Daily Papers

Препринт — материал ещё не прошёл рецензирование

Ни одна модель не лучшая по всем показателям работы интернет-магазина

0

Кратко

Открытый тест проверяет, как 18 моделей ведут несколько интернет-магазинов в течение года: закупают товары, меняют цены, общаются с поставщиками и справляются со сбоями поставок. GPT-5.6 Sol превратила стартовые 100 000 в 1 431 425, но заняла лишь 16-е место из 18 по предотвращению мошенничества и уступила другой модели в эффективности работы.

Зачем это знать

Тест помогает сравнивать ИИ не по одному красивому показателю, а по разным сторонам долгой работы. Его результаты описывают поведение в смоделированной среде: спрос и переговоры там задаются фиксированными правилами, поэтому выводы не полностью переносятся на настоящую торговлю.

Разбор

Авторы собрали не набор отдельных задач, а целый год работы виртуального торговца. Модель каждый день исследует рынок, договаривается с поставщиками, заказывает товары, меняет стратегию продаж, обрабатывает возвраты и следит за деньгами. Важная деталь: магазинов несколько, поэтому агенту приходится распределять внимание и принимать решения, последствия которых проявляются далеко не сразу.

Чтобы среда была похожа на настоящую торговлю, авторы взяли данные о товарах и поставщиках с реальной торговой площадки. В течение года они добавляли календарные события, стихийные бедствия и перебои в цепочках поставок — всё это меняет спрос и доступность товаров. При этом покупатели, возвраты и реакция поставщиков подчиняются заранее заданным правилам: языковая модель формулирует переговоры, но не может случайно изменить саму механику рынка. Такой подход делает сравнение воспроизводимым: разные модели сталкиваются с одной и той же последовательностью событий.

Модели сравнили не только по итоговой сумме денег, но и по семи сторонам работы. Среди открытых моделей лучшей оказалась Qwen3.8-Max-Preview: она заработала 416 252 и заметно опередила GLM 5.2 (high). Кроме того, Qwen3.8-Max-Preview постепенно училась на повторяющихся заказах и со временем добивалась более низких цен у поставщиков — то есть использовала накопленный опыт, а не просто реагировала на каждый заказ заново. Авторы также выложили исходный код теста, чтобы другие команды могли повторить сравнение и добавить свои модели.

Ключевые цифры

365 днейМодель проверяли на длинной дистанции, где сегодняшнее решение может повлиять на работу магазина через месяцы.
7 показателейУспех оценивали с разных сторон, поэтому одна большая сумма не могла полностью скрыть слабые места модели.
416 252Столько активов накопила лучшая открытая модель в этом тесте — заметно меньше результата абсолютного лидера, но это ориентир для систем с открытыми весами.
38%На столько результат Qwen3.8-Max-Preview оказался выше результата GLM 5.2 (high) среди открытых моделей.

Можно ли доверять

Это препринт с arXiv, а не статья, прошедшая рецензирование другими учёными. Тест выглядит воспроизводимым и использует данные реальной торговой площадки, но покупатели и поставщики действуют по фиксированным правилам, поэтому результат показывает поведение моделей в симуляции, а не гарантирует такой же успех в настоящем бизнесе.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (via Hugging Face)
Дата публикации у нас2 сентября 2026 г.
Дата источника30 августа 2026 г.
ОригиналОткрыть
АвторыWei Fan, Xinjie Shen, Xudong Guo, Jianhong Tu, Yang Su, Yinger Zhang, Lianghao Deng, Fengyu Wang, Baohua Dong, Yangqiu Song