Препринт — материал ещё не прошёл рецензирование
Робот научился сам выбирать: идти рысью, ползти или преодолевать препятствия
Кратко
Авторы объединили перебор возможных действий с короткими прогнозами поведения и обучением по ошибкам, чтобы робот эффективнее осваивал движения по изображению. В виртуальной среде система научила роботов ходить, преодолевать препятствия, толкать ящики и переносить предметы двумя руками. Затем политика без дообучения перенесла на настоящего Go2 управление по глубине: он самостоятельно шёл рысью, полз, преодолевал препятствия и переключался между этими режимами.
Зачем это знать
Результат в основном получен в виртуальной среде и проверен на одном типе настоящего робота. Работа показывает направление к более самостоятельным роботам, которые смогут выбирать способ движения по обстановке вокруг.
Разбор
Главная проблема здесь — робот может найти движение, которое хорошо работает в симуляции на первых шагах, но создаёт неправильные контакты: цепляется не той частью тела, теряет равновесие или упирается в препятствие. Авторы добавили к обычному обучению постоянный «поиск подсказок»: система пробует несколько ближайших вариантов действий, коротко прогнозирует их последствия и уточняет цель для политики — правила, которое по изображению выбирает движение. Затем политика немного подстраивается под эту цель и снова ищет более удачные варианты.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, поэтому работу ещё не проверили независимые рецензенты. Основные эксперименты прошли в симуляции на роботах Go2 и G1, а на реальном железе проверили только Go2; авторы также отмечают, что сложные взаимодействия с предметами и испытания гуманоидного робота в реальности пока остались за рамками.
Пересказано ИИ по научной статье. Как это устроено