dumai
🤖
ИИПрепринтarXiv cs.CL

Препринт — материал ещё не прошёл рецензирование

Версионные инструменты ускорили и стабилизировали triage-агента

0

Кратко

В производственной системе для разбора тревог LLM-агент перевёл повторяющиеся шаги из обычного генерирования кода в заранее подготовленные, версионные инструменты. Это снизило медианную задержку на 42% и на исторических данных уменьшило долю ошибок до 53% за счёт того, что ответы перестали так сильно меняться от запуска к запуску. В отдельном контролируемом сравнении более простые прямые вызовы структурированных инструментов дали ещё 62% снижения задержки по сравнению со сложной схемой.

Зачем это знать

Это показывает, как такие системы можно делать быстрее и предсказуемее в промышленной среде. Для компаний, которые запускают LLM-агентов на реальных процессах, это сигнал смотреть в сторону инструментов, а не каждый раз заново просить модель писать код.

Разбор

Авторы взяли самый дорогой и нестабильный кусок работы агента — когда он снова и снова заново пишет код для одних и тех же шагов, — и вынесли его в отдельные инструменты. Логика такая: сначала система собирает следы выполнения, смотрит на схемы бэкендов и реальные значения в них, потом предлагает инструмент и проверяет его на размеченных примерах. То есть инструмент не рождается «из головы» на каждом запросе, а готовится заранее и потом просто вызывается как обычная функция.

Зачем это вообще понадобилось: в их промышленном сценарии один тревожный инцидент проходит через дерево решений из 44 шагов, а внутри некоторых шагов агент может делать больше сотни обращений к модели. Почти вся эта цена уходила на повторение одного и того же перевода текста SOP в одинаковые запросы к метрикам. Новая схема убирает этот бесконечный цикл и оставляет генерацию кода только как запасной вариант, если готового инструмента не хватает.

Самое интересное — что выигрыш оказался не только в скорости. В продакшене время ответа на медиане упало, а на 1 500 исторических тревогах число ошибок снизилось, потому что результат перестал так сильно «плавать» от запуска к запуску. Ещё один плюс: компактный структурированный ответ от инструмента позволил упростить саму архитектуру вызова, и в контролируемом сравнении это дало дополнительное ускорение. Авторы отдельно отмечают, что версионные инструменты помогают и с разбором инцидентов: становится легче понять, где в спецификации есть дыры и где данные из источника начали дрейфовать.

Ключевые цифры

44 узлаАгенту приходится проходить довольно длинное дерево проверок, а не отвечать по одному простому запросу.
100+ LLM turnsВ самых сложных случаях старый подход заставлял модель работать больше сотни раз на один инцидент, поэтому система сильно тормозила.
1 500 исторических тревогАвторы проверили эффект не только в бою, но и на большой пачке прошлых случаев.
42%На медиане система стала отвечать заметно быстрее — почти на половину.

Можно ли доверять

Это препринт на arXiv, так что работу ещё не проверяли независимые рецензенты. Зато проверка была не только на синтетике: авторы показали результат в реальной production-системе и отдельно на 1 500 исторических инцидентах, что делает выводы гораздо убедительнее, чем тест на игрушечной задаче.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.CL)
Дата публикации у нас10 июля 2026 г.
Дата источника9 июля 2026 г.
ОригиналОткрыть
АвторыKalle Kujanpää, Ning Liu, Shahnawaz Alam, Yeshwanth Reddy Sura, Tianyu Yang, Kristina Klinkner, Shervin Malmasi