Препринт — материал ещё не прошёл рецензирование
Q-Planning повысил успешность задач робота: с 40% до 90% и с 25% до 80%
Кратко
Авторы добавили к системе управления роботом небольшой модуль, который оценивает, какое действие скорее приведёт к успеху. Он учился на удачных и неудачных попытках, пока основная система оставалась неизменной: за пять циклов обучения успех вырос с 40% до 90% в одной задаче и с 25% до 80% в другой — без помощи человека.
Зачем это знать
Если результат подтвердится на более широком наборе задач, роботы смогут улучшать управление по собственным попыткам, а не только по новым примерам человека. Пока подход проверили лишь на двух реальных задачах, поэтому переносить вывод на других роботов рано.
Разбор
Проблема здесь в том, что поведенческое клонирование учит робота повторять удачные человеческие действия. Если робот ошибся сам, такая система не понимает, как использовать этот опыт: неудача не превращается в новый обучающий пример. Полностью дообучать современные модели управления тоже трудно — они содержат миллиарды параметров и требуют много вычислений.
Q-Planning обходит это ограничение, добавляя к уже обученной модели небольшой оценщик ценности действия. Он не пытается заново учить робота движениям, а сравнивает несколько предложенных моделью вариантов и выбирает тот, который выглядит перспективнее. После выполнения действия оценщик получает и удачные, и неудачные попытки, тогда как основная модель остаётся замороженной. Поэтому новые знания накапливаются только в дополнительном модуле, а не во всей системе.
В симуляциях такой подход улучшал не только две задачи из карточки, а все проверенные наборы: например, результат LIBERO-10 вырос с 93% до 99%, а RoboTwin — с 83,8% до 91,4% после десяти циклов. На задачах, где робот и без того часто справлялся, успешные эпизоды стали короче. Для сравнения, обучение только на успешных новых попытках быстро упиралось в потолок: на двух реальных задачах оно остановилось на 55% и 30%. Среди нескольких сопоставленных методов именно Q-Planning устойчиво использовал ошибки без обучения отдельной новой модели действий.
Ключевые цифры
Можно ли доверять
Это препринт с arXiv, то есть статью ещё не проверили независимые рецензенты. В симуляциях авторы усредняли результаты по 20 эпизодам на задачу, а в реальности проверили только две задачи и одного типа роботов; для вывода о надёжности метода в широком мире этого пока мало.
Пересказано ИИ по научной статье. Как это устроено