dumai
🤖
ИИПрепринтHugging Face Daily Papers

Препринт — материал ещё не прошёл рецензирование

Роботам дали более длинную память без потери скорости

0

Кратко

RoboTTT — это способ обучать роботов работать с гораздо более длинной историей действий и изображений: до 8 тысяч шагов вместо короткого отрезка. В опытах на реальных роботах такой подход помог лучше копировать действия человека по видео, реже сбиваться и успешнее выполнять длинные многошаговые задачи.

Зачем это знать

Если результат подтвердится в других роботах и задачах, это может сделать бытовых и промышленных роботов устойчивее в сложных сценариях, где нужно помнить длинную последовательность действий. Пока это ранний результат на конкретных тестах, поэтому его стоит воспринимать как направление для следующих разработок, а не как готовое решение.

Разбор

Обычно роботов учат действовать почти «здесь и сейчас»: модель видит короткий кусок прошлого и на его основе выбирает следующий шаг. Авторы RoboTTT попытались сдвинуть эту границу и научить модель учитывать очень длинную цепочку того, что робот уже видел и делал — до 8 тысяч шагов подряд. Для этого они встроили в политику робота обучение на лету: часть внутренних параметров модели подстраивается не только во время обычного обучения, но и прямо во время работы, чтобы сжать длинную историю в компактное состояние и потом доставать из него нужный контекст.

Зачем вообще так усложнять систему? Потому что длинные задания ломаются именно на памяти: робот может начать верно, но потом теряет нить, сбивается на промежуточном этапе или не справляется с тем, что нужно помнить несколько минут подряд. Здесь RoboTTT проверяли как раз на таких сценариях: копирование действий человека по видео, подстройка поведения прямо во время выполнения и сложные многошаговые задачи. Важный момент — авторы не просто увеличивали память, а добивались этого без роста задержки на каждом шаге, то есть робот не становился заметно медленнее при принятии решений.

Самый интересный результат — модель начала лучше работать именно тогда, когда ей давали более длинный контекст уже на этапе предобучения. Это важно, потому что раньше в робототехнике обычно не считали длину истории отдельной осью улучшения, как размер модели или объём данных. Здесь же вышло, что больше контекста даёт заметный выигрыш: версия с 8K-историей обошла ту же модель, но с 1K-историей, а на сложной реальной сборке робот смог довести пяти минутную, десятишаговую задачу до конца, чего ни одна базовая схема не делала.

Ключевые цифры

8K timestepsРобот может опираться на очень длинную историю из тысяч прошлых шагов, а не на короткий кусок памяти.
three orders of magnitudeЭто означает скачок примерно в тысячу раз по длине контекста по сравнению с лучшими прежними моделями.
87%По сравнению с базовой версией общая успешность на сложных реальных задачах выросла очень заметно.
62%Модель с более длинной памятью оказалась намного сильнее той же модели, если её учили на коротком контексте.

Можно ли доверять

Это препринт на arXiv, то есть работу ещё не проверяли независимые рецензенты. Зато авторы тестировали подход не только в симуляции, но и на реальных роботах, включая длинную многозадачную сборку, что делает результаты более убедительными. При этом проверки, судя по абстракту, идут в рамках конкретной архитектуры и набора задач, так что перенос на другие роботы и сценарии ещё нужно подтверждать.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (via Hugging Face)
Дата публикации у нас17 июля 2026 г.
Дата источника15 июля 2026 г.
ОригиналОткрыть
АвторыYunfan Jiang, Yevgen Chebotar, Ruijie Zheng, Fengyuan Hu, Yunhao Ge, Jimmy Wu, Tianyuan Dai, Scott Reed, Li Fei-Fei, Yuke Zhu