Препринт — материал ещё не прошёл рецензирование
LatentSkill переносит текстовые навыки в веса LLM-агентов
Кратко
В препринте предлагают LatentSkill — способ превращать текстовые навыки в LoRA-адаптеры через гиперсеть. На ALFWorld и Search-QA он работал лучше базового подхода с навыками в промпте и при этом тратил меньше токенов на каждый шаг.
Зачем это знать
Это показывает, что навыки для LLM-агентов можно хранить не только в контексте, но и в весах модели, уменьшая накладные расходы на длинные подсказки. Но вывод пока опирается на препринт и ограничен несколькими бенчмарками, так что до практического правила для всех агентных систем он не дотягивает.
Разбор
Авторы взяли привычную для LLM-агентов идею «навык хранится в тексте» и перевели её в другой формат: вместо длинной подсказки на каждом шаге текст навыка сначала прогоняют через отдельный модуль, который превращает его в LoRA-адаптер. LoRA — это небольшой набор добавочных весов, который можно подключать к уже готовой модели без полного переобучения. То есть сам навык больше не лежит в контексте, а как бы встраивается в параметры модели.
Зачем это понадобилось? Потому что у текстовых навыков есть два неудобства: они съедают место в контексте на каждом шаге и показывают сам текст навыка целиком. Авторы хотели убрать этот постоянный токеновый «налог», но оставить удобство модульности: навык можно загрузить, масштабировать и даже комбинировать с другими.
Проверяли подход на двух бенчмарках для агентов: ALFWorld, где модель решает бытовые задачи в виртуальной среде, и Search-QA, где нужно искать и извлекать ответы из текста. На обоих наборах LatentSkill обошёл вариант, где навык просто добавляют в промпт. Ещё интересно, что после обучения полученные LoRA-адаптеры оказались не случайным набором чисел, а образовали упорядоченное «семантическое пространство»: силу влияния навыка можно было плавно менять коэффициентом масштабирования, а некоторые навыки даже складывались в параметрах, если их части хорошо совпадали.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, значит, работу ещё не проверяли внешние рецензенты. При этом проверка не ограничилась одной игрушечной задачей: авторы тестировали метод на двух разных бенчмарках, но всё равно это пока только несколько наборов задач, а не реальная эксплуатация в продукте. Поэтому вывод о пользе weight-space навыков выглядит убедительно, но его лучше считать хорошим кандидатом на практику, а не окончательным правилом.
Пересказано ИИ по научной статье. Как это устроено