Препринт — материал ещё не прошёл рецензирование
Версионные инструменты ускорили и стабилизировали triage-агента
Кратко
В производственной системе для разбора тревог LLM-агент перевёл повторяющиеся шаги из обычного генерирования кода в заранее подготовленные, версионные инструменты. Это снизило медианную задержку на 42% и на исторических данных уменьшило долю ошибок до 53% за счёт того, что ответы перестали так сильно меняться от запуска к запуску. В отдельном контролируемом сравнении более простые прямые вызовы структурированных инструментов дали ещё 62% снижения задержки по сравнению со сложной схемой.
Зачем это знать
Это показывает, как такие системы можно делать быстрее и предсказуемее в промышленной среде. Для компаний, которые запускают LLM-агентов на реальных процессах, это сигнал смотреть в сторону инструментов, а не каждый раз заново просить модель писать код.
Разбор
Авторы взяли самый дорогой и нестабильный кусок работы агента — когда он снова и снова заново пишет код для одних и тех же шагов, — и вынесли его в отдельные инструменты. Логика такая: сначала система собирает следы выполнения, смотрит на схемы бэкендов и реальные значения в них, потом предлагает инструмент и проверяет его на размеченных примерах. То есть инструмент не рождается «из головы» на каждом запросе, а готовится заранее и потом просто вызывается как обычная функция.
Зачем это вообще понадобилось: в их промышленном сценарии один тревожный инцидент проходит через дерево решений из 44 шагов, а внутри некоторых шагов агент может делать больше сотни обращений к модели. Почти вся эта цена уходила на повторение одного и того же перевода текста SOP в одинаковые запросы к метрикам. Новая схема убирает этот бесконечный цикл и оставляет генерацию кода только как запасной вариант, если готового инструмента не хватает.
Самое интересное — что выигрыш оказался не только в скорости. В продакшене время ответа на медиане упало, а на 1 500 исторических тревогах число ошибок снизилось, потому что результат перестал так сильно «плавать» от запуска к запуску. Ещё один плюс: компактный структурированный ответ от инструмента позволил упростить саму архитектуру вызова, и в контролируемом сравнении это дало дополнительное ускорение. Авторы отдельно отмечают, что версионные инструменты помогают и с разбором инцидентов: становится легче понять, где в спецификации есть дыры и где данные из источника начали дрейфовать.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, так что работу ещё не проверяли независимые рецензенты. Зато проверка была не только на синтетике: авторы показали результат в реальной production-системе и отдельно на 1 500 исторических инцидентах, что делает выводы гораздо убедительнее, чем тест на игрушечной задаче.
Пересказано ИИ по научной статье. Как это устроено