Препринт — материал ещё не прошёл рецензирование
Видео человека помогло роботу выполнять новые задачи в симуляции
Кратко
Модель Zero-WAM использует видео с действиями человека, чтобы робот выполнял незнакомые задачи с предметами. В компьютерной симуляции на семи новых задачах средняя успешность составила 47% — на 29,5 процентного пункта выше, чем у лучшего сравниваемого подхода; на реальных роботах описана работа со сложными сценами, но подробных чисел нет.
Зачем это знать
Видео человека может быть способом задавать роботу новые действия без отдельного обучения под каждую задачу. Но основной количественный результат получен только в симуляции, поэтому практическое применение ещё требует проверки.
Разбор
Авторы перенесли в робототехнику идею, знакомую по языковым моделям: новую задачу можно не «вшивать» в параметры модели, а показать ей прямо в запросе. Только вместо текста здесь используют видео человека — оно показывает не только цель, но и порядок движений, положение предметов и то, как должна развиваться сцена. Zero-WAM смотрит такой ролик и по ходу выполнения предсказывает следующий фрагмент действий робота.
Главная практическая проблема — роботов редко обучают на больших наборах пар «человек показывает — робот повторяет». Поэтому команда сначала сгенерировала множество траекторий робота для разных задач, а затем автоматически подобрала к ним смыслово похожие видео человека. Так появился набор HumanGen: он нужен, чтобы модель училась извлекать из человеческой демонстрации именно информацию о задаче, а не запоминала знакомые движения.
Для этого авторы добавили отдельный режим обучения: модель должна предсказывать будущий кусок действия, опираясь на видео-подсказку. Такой приём должен мешать ей пользоваться короткими обходными признаками, например узнавать задачу только по внешнему виду сцены или повторять шаблон из обучающих примеров. В реальных проверках робот справлялся с конфигурациями, которых не видел раньше: сценами с несколькими предметами, длинными последовательностями действий и точной вставкой одного объекта в другой. Однако для этих испытаний абстракт не приводит численных результатов.
Ключевые цифры
Можно ли доверять
Это препринт с arXiv, а не статья, прошедшая независимую проверку рецензентами. Авторы проверили подход в симуляции на семи новых задачах и дополнительно показали работу на реальных роботах, но для реальных испытаний не сообщили подробных чисел, поэтому их практическую надёжность пока трудно оценить.
Пересказано ИИ по научной статье. Как это устроено