Препринт — материал ещё не прошёл рецензирование
Навигация по одной RGB-камере обходит более сложные системы
Кратко
Модель Robostral Navigate весом 8 миллиардов параметров обучают на изображениях с одной RGB-камеры, без датчиков глубины, нескольких камер и заранее построенных карт. На двух тестах для навигации в помещениях она показала 77,4% и 75,1% успешных проходов, обогнав прежние модели с одной камерой и даже часть систем с более сложным оборудованием.
Зачем это знать
Если результаты подтвердятся, это может упростить навигационные системы для разных типов роботов. Но пока речь идёт только о тестах на симуляционных бенчмарках.
Разбор
Здесь важна не только сама модель, а то, как её учили. Вместо обычной схемы, где робот учится по кусочкам и потом отдельно собирает поведение, авторы загрузили в обучение целые эпизоды — то есть полные маршруты от начала до конца. Для этого они придумали режим с prefix-caching: ранние части эпизода переиспользуются, и не нужно каждый раз прогонять всю историю заново. Так обучение стало гораздо короче по времени и легче по объёму вычислений.
Ещё одна хитрость — модель работает не в «координатах робота», а прямо в картинке с камеры. Проще говоря, она не думает в духе «повернуть на столько-то градусов и проехать метр», а указывает следующую точку прямо на изображении. Это удобно, потому что один и тот же подход можно переносить на роботов с разной формой и разной посадкой камеры, без дополнительной подгонки под каждый корпус.
Чтобы не зависеть от дорогих реальных съёмок, авторы сгенерировали 2,4 миллиона траекторий в 350 тысячах симулированных сцен. А чтобы модель не подглядывала на правильные прошлые действия и действительно училась ориентироваться по картинке, в обучении использовали специальную маску внимания, которая отрезает доступ к таким подсказкам. Потом ещё добавили reinforcement learning — это дообучение через пробу и ошибку — чтобы лучше справляться с поиском пути и восстановлением после ошибок.
В итоге система не просто показала хорошие результаты на тестах: она ещё и тренируется намного практичнее для масштабирования. То есть здесь попытались решить сразу две проблемы — как сделать навигацию более универсальной для разных роботов и как обучать такие модели быстрее, чем обычно.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, его ещё не проверяли рецензенты. Проверяли не на реальных роботах, а на симуляционных бенчмарках, так что в живой среде результат может оказаться скромнее. С другой стороны, работа опирается на большие числа и сравнения с сильными базовыми моделями, поэтому как исследовательский сигнал она выглядит серьёзно.
Пересказано ИИ по научной статье. Как это устроено