dumai
ИИПрепринтHugging Face Daily Papers

Препринт — материал ещё не прошёл рецензирование

EEVEE улучшает тестовое обучение промптов для разнородных задач

0

Кратко

EEVEE — это схема для LLM-агентов, которая на этапе использования пытается распределять входы по кластерам задач и подбирать подходящие настройки промпта. В препринте её проверили на нескольких наборах данных и в описанных экспериментах она показала более высокие средние результаты, чем сравниваемые базовые модели и методы.

Зачем это знать

Это помогает понять, как можно уменьшать смешение между разными наборами задач в потоках запросов. Но пока это результат из препринта и ограниченных бенчмарков, поэтому выводы о работе в реальных развертываниях делать рано.

Разбор

Здесь авторы решают вполне практичную проблему: в жизни LLM-агенту редко прилетает один и тот же тип задач из одного и того же набора. Обычно запросы перемешаны — разные домены, разные форматы, разные правила игры. А многие методы тестового обучения промптов, то есть подстройки инструкции прямо во время использования модели, хорошо работают только в «чистом» мире одного датасета. Из-за этого одна настройка начинает мешать другой, и качество на смешанном потоке проседает.

EEVEE пытается разрулить этот конфликт двумя шагами. Сначала специальный маршрутизатор, то есть модуль-распределитель, относит входящий запрос к одному из кластеров похожих задач. Потом для этого кластера выбирается подходящая конфигурация промпта — по сути, своя версия инструкции. Самое интересное тут в том, что эти две части обучают не по отдельности, а по очереди и с взаимной подстройкой: сначала немного учат маршрутизатор, потом промпт, потом снова маршрутизатор. Так они пытаются учесть, что хороший выбор кластера зависит от промпта, а хороший промпт — от того, как именно сгруппированы задачи.

По экспериментам на нескольких наборах данных схема стала заметно устойчивее на разнородных потоках, но при этом не потеряла способность учиться на одном бенчмарке и не стала тяжёлой в использовании. То есть идея не просто «сделать точнее», а сохранить работоспособность в более реалистичном сценарии, где запросы мешаются между собой. До этого большинство методов были заточены под один датасет, поэтому именно переход к многодатасетному тестовому обучению и стал здесь ключевым шагом.

Ключевые цифры

10.38 pointsНа таком среднем отрыве EEVEE обошёл одну из сравниваемых моделей по суммарному результату на нескольких бенчмарках.
24.32 pointsНа столько же EEVEE опередил ещё одну сильную базовую модель в среднем по тестам.
37.2%Насколько выше EEVEE оказался лучших из сравниваемых методов GEPA в одном из сравнений.
48.2%Насколько EEVEE превзошёл другой сильный метод ACE в одном из сравнений.

Можно ли доверять

Это препринт на arXiv, его ещё не проверяли рецензенты журнала. Авторы пишут про эксперименты на нескольких наборах данных, что лучше, чем проверка на одной задаче, но это всё ещё бенчмарки, а не живой продакшен. Поэтому выводы выглядят обнадёживающе, но для реальных развертываний нужна дополнительная проверка.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (via Hugging Face)
Дата публикации у нас11 июня 2026 г.
Дата источника9 июня 2026 г.
ОригиналОткрыть
АвторыWeixian Xu, Shilong Liu, Mengdi Wang