Препринт — материал ещё не прошёл рецензирование
Автоматически созданные траектории дали модели успех на 27 задачах в симуляции
Кратко
Система сама создавала удачные траектории в симуляторе и по ним обучала модель управлять роботом — без новых записей действий человека. На 27 задачах, где исходная модель ни разу не справилась, новый подход получил хотя бы один успех в каждой; средняя успешность составила 97,8% и 97,1% в двух наборах тестов. Отдельно авторы проверили, что заранее построенные траектории можно выполнить на физическом роботе без подстройки по его обратной связи.
Зачем это знать
Главный результат пока получен в симуляции, поэтому он не доказывает работу на реальных роботах и новых задачах. Если вывод подтвердится в дальнейших проверках, такой подход может уменьшить зависимость обучения роботов от дорогостоящих записей действий людей.
Разбор
Авторы разделили обучение на два шага. Сначала автоматический «учитель» смотрит на внутреннее состояние симулятора — например, точные координаты объектов, недоступные обычной модели, — и строит по нему удачные последовательности действий. Затем модель, которая получает только изображение и язык, учится повторять эти последовательности. После этого её дообучают методом проб и ошибок: за выполненную задачу она получает один сигнал успеха, а за неудачу — ноль.
Главная проверка показала, что сами синтетические примеры решают проблему поиска гораздо лучше, чем одно лишь случайное обучение с редкой наградой. При одинаковых настройках прямой запуск обучения с подкреплением смог найти решение только для части задач, тогда как предварительное обучение на траекториях дало модели хотя бы отправную точку для каждой из полностью провальных задач. Авторы отдельно называют это «покрытием награды»: важно не только среднее качество, но и наличие хотя бы одного успешного опыта по каждой задаче.
На обычном наборе LIBERO система набрала 96,0% без новых человеческих демонстраций — это всего на 1,7 процентного пункта ниже версии модели, обученной на 50 ручных показах для каждой задачи. Проверка на RoboTwin 2.0 показала, что подход переносится ещё на один симуляторный набор. Наконец, авторы взяли траектории из близнеца робота в MuJoCo — физического симулятора — и запустили их на настоящей машине без корректировки по её обратной связи; это проверка исполнимости, а не полноценное обучение в реальном мире.
Ключевые цифры
Можно ли доверять
Это препринт arXiv, а не статья, прошедшая независимое рецензирование. Основные результаты получили в симуляторах; физического робота проверили только на заранее подготовленных траекториях и без адаптации по обратной связи, поэтому надёжность подхода в разнообразных реальных условиях ещё не показана.
Пересказано ИИ по научной статье. Как это устроено