Препринт — материал ещё не прошёл рецензирование
Языковая модель достигла уровня лучших методов в восьми из десяти классов задач
Кратко
В десяти задачах управления запасами, очередями и ассортиментом сильнейшая проверенная модель почти всегда достигала уровня лучших известных способов решения. В восьми типах задач её результат отличался от лучшего не более чем на 0,1% или был лучше. Это сохранялось даже тогда, когда модель заранее видела только описание задачи и общие диапазоны параметров, а не сами тестовые примеры.
Зачем это знать
Результат указывает, что современные языковые модели могут быть перспективны для хорошо формализованных задач проектирования алгоритмов. Но вывод основан на ограниченном наборе задач и одной проверенной модели, поэтому его нельзя переносить на произвольные практические проблемы.
Разбор
Авторы проверили не один способ применения модели, а два. В первом случае модель получает конкретный экземпляр задачи и сразу предлагает решение. Во втором ей показывают только описание целого класса задач и широкие диапазоны параметров — после этого она должна написать один алгоритм, который сам будет подставлять параметры и выдавать решения для новых экземпляров. Это важная проверка: во втором варианте модель не может подстроиться под тестовые данные. Человеческой настройки почти не было — использовали один обычный запрос и Python-песочницу с фиксированным лимитом вычислений.
Сравнение получилось жёстким: для каждого экземпляра брали лучший результат из методов, описанных в прежних работах, включая точные алгоритмы там, где они существовали. В задачах управления запасами модель в среднем улучшила результат каждого из четырёх базовых методов. В задачах с очередями она совпала с оптимумом, найденным точным динамическим программированием, для сети criss-cross; для N-модели отстала от оптимума менее чем на 0,2%. В задачах подбора ассортимента она достигла оптимума на всех проверенных экземплярах модели смешанного многонормального логита и лучшего известного результата на всех экземплярах с ограничениями.
Главное исключение — nested logit, другой распространённый способ описывать выбор покупателей: здесь модель оказалась немного хуже сильнейшего сравнения. При этом результат заметно менялся от версии к версии: модели, выпущенные с разницей меньше восьми месяцев, показывали резкий рост качества. Это объясняет, почему авторы предлагают считать передовые языковые модели не заменой точным методам, а новым базовым ориентиром для хорошо описанных задач проектирования алгоритмов.
Ключевые цифры
Можно ли доверять
Это препринт с arXiv, а не статья, прошедшая рецензирование. Проверка выглядит содержательной: модель сравнили с сильнейшими опубликованными методами и точными решениями, где они доступны, но эксперименты охватывают только десять формализованных классов задач и одну модель; это не проверка работы алгоритмов в реальных компаниях.
Пересказано ИИ по научной статье. Как это устроено