dumai
🤖
ИИПрепринтHugging Face Daily Papers

Препринт — материал ещё не прошёл рецензирование

Видео человека помогло роботу выполнять новые задачи в симуляции

0

Кратко

Модель Zero-WAM использует видео с действиями человека, чтобы робот выполнял незнакомые задачи с предметами. В компьютерной симуляции на семи новых задачах средняя успешность составила 47% — на 29,5 процентного пункта выше, чем у лучшего сравниваемого подхода; на реальных роботах описана работа со сложными сценами, но подробных чисел нет.

Зачем это знать

Видео человека может быть способом задавать роботу новые действия без отдельного обучения под каждую задачу. Но основной количественный результат получен только в симуляции, поэтому практическое применение ещё требует проверки.

Разбор

Авторы перенесли в робототехнику идею, знакомую по языковым моделям: новую задачу можно не «вшивать» в параметры модели, а показать ей прямо в запросе. Только вместо текста здесь используют видео человека — оно показывает не только цель, но и порядок движений, положение предметов и то, как должна развиваться сцена. Zero-WAM смотрит такой ролик и по ходу выполнения предсказывает следующий фрагмент действий робота.

Главная практическая проблема — роботов редко обучают на больших наборах пар «человек показывает — робот повторяет». Поэтому команда сначала сгенерировала множество траекторий робота для разных задач, а затем автоматически подобрала к ним смыслово похожие видео человека. Так появился набор HumanGen: он нужен, чтобы модель училась извлекать из человеческой демонстрации именно информацию о задаче, а не запоминала знакомые движения.

Для этого авторы добавили отдельный режим обучения: модель должна предсказывать будущий кусок действия, опираясь на видео-подсказку. Такой приём должен мешать ей пользоваться короткими обходными признаками, например узнавать задачу только по внешнему виду сцены или повторять шаблон из обучающих примеров. В реальных проверках робот справлялся с конфигурациями, которых не видел раньше: сценами с несколькими предметами, длинными последовательностями действий и точной вставкой одного объекта в другой. Однако для этих испытаний абстракт не приводит численных результатов.

Ключевые цифры

74,2 тыс. парСтолько примеров «видео человека — действия робота» собрали для обучения, чтобы модель видела много разных способов описать задачу.
8,6 тыс. задачНабор охватывает тысячи отдельных задач, поэтому модель обучали не на нескольких повторяющихся сценариях, а на широком разнообразии действий.

Можно ли доверять

Это препринт с arXiv, а не статья, прошедшая независимую проверку рецензентами. Авторы проверили подход в симуляции на семи новых задачах и дополнительно показали работу на реальных роботах, но для реальных испытаний не сообщили подробных чисел, поэтому их практическую надёжность пока трудно оценить.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (via Hugging Face)
Дата публикации у нас28 августа 2026 г.
Дата источника25 августа 2026 г.
ОригиналОткрыть
АвторыJiaming Zhou, Qihang Zhang, Gangwei Xu, Cunxin Fan, Yujie Zhao, Ruilin Wang, Yiming Luo, Shuai Yang, Xing Zhu, Yujun Shen