dumai
🤖
ИИПрепринтarXiv cs.LG

Препринт — материал ещё не прошёл рецензирование

Тренировка слабых мест подняла успех роботов до 61–95%

0

Кратко

Авторы предложили обучать робота не всей задаче целиком, а тем действиям, на которых он чаще всего ошибается. На двуручном роботе доля полностью выполненных задач выросла с 32% до 61%, на одноручном — с 50% до 95%; обучение требовало в среднем десятков минут работы на реальном роботе для каждой задачи.

Зачем это знать

Это ранний результат на двух конкретных роботах и ограниченном наборе задач: человек заранее отмечал слабые места и при необходимости физически перезапускал робота. Если подход подтвердится на других системах, обучение реальных роботов может требовать меньше ручного участия.

Разбор

Авторы исходили из простой проблемы: робот часто умеет почти всю длинную последовательность, но снова и снова проваливает один короткий шаг. Вместо того чтобы заново собирать полные примеры выполнения, они оставили базовую модель без изменений и добавили небольшие корректирующие модули для слабых мест. Человек отмечает такие места заранее, а программа сама решает, когда включить поправку и считать, удалось ли локальное действие.

Награда поступает не только за успех всей задачи, а за отдельный фрагмент длительностью несколько секунд. Это важно: при редких полных успехах обычное обучение с подкреплением почти не получает полезного сигнала. Здесь робот чаще видит промежуточный результат и может учиться на удачных попытках даже тогда, когда вся цепочка ещё не складывается. После переобучения модуль снова ставят на робота и собирают новые попытки, постепенно уточняя исправление.

Дополнительные эксперименты показали, где именно выигрывает такой подход. На задаче с кабелем почти вдвое вырос успех вставки всего за 29 минут практики, потому что надёжное отключение кабеля не тратили на обучение. В задаче с наушником успех всей последовательности стал в четыре раза выше исходного, а отдельные операции вставки прибавили 20–35 процентных пунктов. В самой длинной задаче с LEGO исправление закрытия захвата подняло прогресс с 54% до 82% за 17 минут; одни и те же два модуля коррекции использовали для всех десяти деталей. При одинаковом времени работы робота PARTS превзошёл методы, которые обучают всю задачу целиком, более чем на 25%: те тратили часть попыток на действия, которые робот уже выполнял хорошо, и получали слишком мало успешных полных эпизодов.

Ключевые цифры

29 минутСтолько реальной практики понадобилось, чтобы почти вдвое улучшить вставку в задаче с кабелем — обучение направили только на проблемный шаг.
20–35 процентных пунктовНастолько выросла успешность отдельных операций вставки в сложной задаче с наушником, то есть улучшение заметно не только в итоговой оценке.
17 минутЗа такое время коррекция закрытия захвата подняла прогресс в длинной LEGO-задаче с 54% до 82%.
10 деталейОдин и тот же набор из двух корректирующих модулей применили к десяти кирпичикам, а не обучали отдельное исправление для каждого.

Можно ли доверять

Это препринт arXiv, поэтому работу ещё не проверили рецензенты. Результаты получены на двух роботах и нескольких специально выбранных задачах; человек заранее отмечал слабые места и физически перезапускал робота, так что перенос метода на другие системы и более самостоятельное обучение пока не доказан.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.LG)
Дата публикации у нас22 сентября 2026 г.
Дата источника18 сентября 2026 г.
ОригиналОткрыть
АвторыSichang Su, Benjamin Yang, Zhiyun Deng, Boyuan Liang, Yip Fun Yeung, Zelin Wang, Lingfeng Sun