dumai
ИИПрепринтarXiv cs.CL

Препринт — материал ещё не прошёл рецензирование

Симулятор для обслуживания многоходовых LLM-агентов

0

Кратко

Предложен AGENTSERVESIM — симулятор, который учитывает работу LLM-агентов с несколькими ходами, вызовами внешних инструментов и состоянием кэша. На проверенных конфигурациях он воспроизводит ключевые метрики реальных систем с ошибкой до 6% и работает на обычных CPU.

Зачем это знать

Это помогает быстрее и дешевле проверять идеи для планирования, маршрутизации и управления кэшем без постоянных запусков на дорогих ускорителях. Поскольку это препринт и симулятор, результаты пока стоит воспринимать как основу для дальнейшей проверки, а не как готовое производственное решение.

Разбор

Здесь авторы решают довольно практичную проблему: как заранее проверить, как будет вести себя система, если один LLM-агент делает не один ответ, а целую цепочку шагов, ещё и с обращениями к внешним инструментам. В такой схеме обычные способы оценки уже плохо подходят, потому что важны не только сами запросы к модели, но и паузы между ходами, повторное использование уже загруженного состояния кэша и то, как запросы распределяются между разными экземплярами сервиса.

Для этого они собрали симулятор AGENTSERVESIM. Он не просто «рисует» нагрузку, а отдельно моделирует разные части процесса: хранит порядок ходов, вставляет задержки, которые возникают из-за инструментов, учитывает привязку программы к конкретному серверу ради экономии кэша и следит, где лежит состояние модели — в быстрой памяти, в обычной памяти сервера или уже вытеснено наружу. По сути, это попытка перенести логику реального обслуживания агентов в воспроизводимую симуляцию.

Главный результат в том, что на проверенных конфигурациях симулятор довольно близко повторяет поведение реальных систем — расхождение по ключевым метрикам не превышает 6%. При этом всё это работает на обычных CPU, то есть без дорогих GPU-ускорителей. Это важно, потому что раньше похожие симуляторы в основном были заточены под более простые, «безсостояниеые» запросы и не ловили именно те эффекты, которые создают многоходовые агенты.

Ключевые цифры

6%Симулятор почти совпадает с реальной системой: ошибка по важным метрикам остаётся небольшой.
CPUПроверки можно запускать на обычных процессорах, без дорогих ускорителей.

Можно ли доверять

Это препринт на arXiv, значит, статью ещё не прошли полноценную независимую рецензию. Зато авторы сравнили симулятор с реальными развертываниями и проверили его на нескольких конфигурациях, что делает выводы убедительными как минимум для тестируемых сценариев.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.CL)
Дата публикации у нас9 июня 2026 г.
Дата источника8 июня 2026 г.
ОригиналОткрыть
АвторыRakibul Hasan Rajib, Mengxin Zheng, Qian Lou