dumai
🤖
ИИПрепринтarXiv cs.AI

Препринт — материал ещё не прошёл рецензирование

Автоматически созданные траектории дали модели успех на 27 задачах в симуляции

0

Кратко

Система сама создавала удачные траектории в симуляторе и по ним обучала модель управлять роботом — без новых записей действий человека. На 27 задачах, где исходная модель ни разу не справилась, новый подход получил хотя бы один успех в каждой; средняя успешность составила 97,8% и 97,1% в двух наборах тестов. Отдельно авторы проверили, что заранее построенные траектории можно выполнить на физическом роботе без подстройки по его обратной связи.

Зачем это знать

Главный результат пока получен в симуляции, поэтому он не доказывает работу на реальных роботах и новых задачах. Если вывод подтвердится в дальнейших проверках, такой подход может уменьшить зависимость обучения роботов от дорогостоящих записей действий людей.

Разбор

Авторы разделили обучение на два шага. Сначала автоматический «учитель» смотрит на внутреннее состояние симулятора — например, точные координаты объектов, недоступные обычной модели, — и строит по нему удачные последовательности действий. Затем модель, которая получает только изображение и язык, учится повторять эти последовательности. После этого её дообучают методом проб и ошибок: за выполненную задачу она получает один сигнал успеха, а за неудачу — ноль.

Главная проверка показала, что сами синтетические примеры решают проблему поиска гораздо лучше, чем одно лишь случайное обучение с редкой наградой. При одинаковых настройках прямой запуск обучения с подкреплением смог найти решение только для части задач, тогда как предварительное обучение на траекториях дало модели хотя бы отправную точку для каждой из полностью провальных задач. Авторы отдельно называют это «покрытием награды»: важно не только среднее качество, но и наличие хотя бы одного успешного опыта по каждой задаче.

На обычном наборе LIBERO система набрала 96,0% без новых человеческих демонстраций — это всего на 1,7 процентного пункта ниже версии модели, обученной на 50 ручных показах для каждой задачи. Проверка на RoboTwin 2.0 показала, что подход переносится ещё на один симуляторный набор. Наконец, авторы взяли траектории из близнеца робота в MuJoCo — физического симулятора — и запустили их на настоящей машине без корректировки по её обратной связи; это проверка исполнимости, а не полноценное обучение в реальном мире.

Ключевые цифры

57 задачИменно столько изменённых задач вошло в оценку LIBERO-PRO, поэтому выводы относятся к заметному, но всё же ограниченному набору сценариев.
10 из 27 задачСтолько полностью провальных задач удалось «спасти» обычным обучением с подкреплением без синтетической подготовки; остальные 17 так и остались без единого успеха.
50 траекторий на задачуДля каждой задачи система сама создавала достаточно примеров, чтобы дать модели исходную точку для дальнейшего обучения.
1,7 процентного пунктаТак мало отделило результат без новых человеческих показов от версии, обученной на 50 ручных демонстрациях для каждой задачи в обычном LIBERO.

Можно ли доверять

Это препринт arXiv, а не статья, прошедшая независимое рецензирование. Основные результаты получили в симуляторах; физического робота проверили только на заранее подготовленных траекториях и без адаптации по обратной связи, поэтому надёжность подхода в разнообразных реальных условиях ещё не показана.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.AI)
Дата публикации у нас21 сентября 2026 г.
Дата источника18 сентября 2026 г.
ОригиналОткрыть
АвторыHiroaki Kingetsu, Hiroaki Kurihara, Kaoru Yokoo, Kenji Fukumizu, Manohar Kaul