dumai
🤖
ИИПрепринтarXiv cs.LG

Препринт — материал ещё не прошёл рецензирование

Q-Planning повысил успешность задач робота: с 40% до 90% и с 25% до 80%

0

Кратко

Авторы добавили к системе управления роботом небольшой модуль, который оценивает, какое действие скорее приведёт к успеху. Он учился на удачных и неудачных попытках, пока основная система оставалась неизменной: за пять циклов обучения успех вырос с 40% до 90% в одной задаче и с 25% до 80% в другой — без помощи человека.

Зачем это знать

Если результат подтвердится на более широком наборе задач, роботы смогут улучшать управление по собственным попыткам, а не только по новым примерам человека. Пока подход проверили лишь на двух реальных задачах, поэтому переносить вывод на других роботов рано.

Разбор

Проблема здесь в том, что поведенческое клонирование учит робота повторять удачные человеческие действия. Если робот ошибся сам, такая система не понимает, как использовать этот опыт: неудача не превращается в новый обучающий пример. Полностью дообучать современные модели управления тоже трудно — они содержат миллиарды параметров и требуют много вычислений.

Q-Planning обходит это ограничение, добавляя к уже обученной модели небольшой оценщик ценности действия. Он не пытается заново учить робота движениям, а сравнивает несколько предложенных моделью вариантов и выбирает тот, который выглядит перспективнее. После выполнения действия оценщик получает и удачные, и неудачные попытки, тогда как основная модель остаётся замороженной. Поэтому новые знания накапливаются только в дополнительном модуле, а не во всей системе.

В симуляциях такой подход улучшал не только две задачи из карточки, а все проверенные наборы: например, результат LIBERO-10 вырос с 93% до 99%, а RoboTwin — с 83,8% до 91,4% после десяти циклов. На задачах, где робот и без того часто справлялся, успешные эпизоды стали короче. Для сравнения, обучение только на успешных новых попытках быстро упиралось в потолок: на двух реальных задачах оно остановилось на 55% и 30%. Среди нескольких сопоставленных методов именно Q-Planning устойчиво использовал ошибки без обучения отдельной новой модели действий.

Ключевые цифры

10 цикловСтолько раз система обновляла оценщик после новых попыток; улучшение сохранялось не после одной удачной настройки, а проходило через серию циклов.
93% → 99%На сложном симулированном наборе LIBERO-10 робот приблизился к почти полному успеху.
83,8% → 91,4%На наборе RoboTwin система заметно улучшила результат после самостоятельного дообучения.
20 эпизодов на задачуКаждый показатель в симуляциях усредняли по двадцати запускам одной задачи, поэтому это не единичная демонстрация.

Можно ли доверять

Это препринт с arXiv, то есть статью ещё не проверили независимые рецензенты. В симуляциях авторы усредняли результаты по 20 эпизодам на задачу, а в реальности проверили только две задачи и одного типа роботов; для вывода о надёжности метода в широком мире этого пока мало.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.LG)
Дата публикации у нас24 августа 2026 г.
Дата источника21 августа 2026 г.
ОригиналОткрыть
АвторыVarun Giridhar, Anant Khandelwal, Jeremy A. Collins, Ignat Georgiev, Animesh Garg