Препринт — материал ещё не прошёл рецензирование
Тренировка слабых мест подняла успех роботов до 61–95%
Кратко
Авторы предложили обучать робота не всей задаче целиком, а тем действиям, на которых он чаще всего ошибается. На двуручном роботе доля полностью выполненных задач выросла с 32% до 61%, на одноручном — с 50% до 95%; обучение требовало в среднем десятков минут работы на реальном роботе для каждой задачи.
Зачем это знать
Это ранний результат на двух конкретных роботах и ограниченном наборе задач: человек заранее отмечал слабые места и при необходимости физически перезапускал робота. Если подход подтвердится на других системах, обучение реальных роботов может требовать меньше ручного участия.
Разбор
Авторы исходили из простой проблемы: робот часто умеет почти всю длинную последовательность, но снова и снова проваливает один короткий шаг. Вместо того чтобы заново собирать полные примеры выполнения, они оставили базовую модель без изменений и добавили небольшие корректирующие модули для слабых мест. Человек отмечает такие места заранее, а программа сама решает, когда включить поправку и считать, удалось ли локальное действие.
Награда поступает не только за успех всей задачи, а за отдельный фрагмент длительностью несколько секунд. Это важно: при редких полных успехах обычное обучение с подкреплением почти не получает полезного сигнала. Здесь робот чаще видит промежуточный результат и может учиться на удачных попытках даже тогда, когда вся цепочка ещё не складывается. После переобучения модуль снова ставят на робота и собирают новые попытки, постепенно уточняя исправление.
Дополнительные эксперименты показали, где именно выигрывает такой подход. На задаче с кабелем почти вдвое вырос успех вставки всего за 29 минут практики, потому что надёжное отключение кабеля не тратили на обучение. В задаче с наушником успех всей последовательности стал в четыре раза выше исходного, а отдельные операции вставки прибавили 20–35 процентных пунктов. В самой длинной задаче с LEGO исправление закрытия захвата подняло прогресс с 54% до 82% за 17 минут; одни и те же два модуля коррекции использовали для всех десяти деталей. При одинаковом времени работы робота PARTS превзошёл методы, которые обучают всю задачу целиком, более чем на 25%: те тратили часть попыток на действия, которые робот уже выполнял хорошо, и получали слишком мало успешных полных эпизодов.
Ключевые цифры
Можно ли доверять
Это препринт arXiv, поэтому работу ещё не проверили рецензенты. Результаты получены на двух роботах и нескольких специально выбранных задачах; человек заранее отмечал слабые места и физически перезапускал робота, так что перенос метода на другие системы и более самостоятельное обучение пока не доказан.
Пересказано ИИ по научной статье. Как это устроено