dumai
🤖
ИИПрепринтHugging Face Daily Papers

Препринт — материал ещё не прошёл рецензирование

Навигация по одной RGB-камере обходит более сложные системы

0

Кратко

Модель Robostral Navigate весом 8 миллиардов параметров обучают на изображениях с одной RGB-камеры, без датчиков глубины, нескольких камер и заранее построенных карт. На двух тестах для навигации в помещениях она показала 77,4% и 75,1% успешных проходов, обогнав прежние модели с одной камерой и даже часть систем с более сложным оборудованием.

Зачем это знать

Если результаты подтвердятся, это может упростить навигационные системы для разных типов роботов. Но пока речь идёт только о тестах на симуляционных бенчмарках.

Разбор

Здесь важна не только сама модель, а то, как её учили. Вместо обычной схемы, где робот учится по кусочкам и потом отдельно собирает поведение, авторы загрузили в обучение целые эпизоды — то есть полные маршруты от начала до конца. Для этого они придумали режим с prefix-caching: ранние части эпизода переиспользуются, и не нужно каждый раз прогонять всю историю заново. Так обучение стало гораздо короче по времени и легче по объёму вычислений.

Ещё одна хитрость — модель работает не в «координатах робота», а прямо в картинке с камеры. Проще говоря, она не думает в духе «повернуть на столько-то градусов и проехать метр», а указывает следующую точку прямо на изображении. Это удобно, потому что один и тот же подход можно переносить на роботов с разной формой и разной посадкой камеры, без дополнительной подгонки под каждый корпус.

Чтобы не зависеть от дорогих реальных съёмок, авторы сгенерировали 2,4 миллиона траекторий в 350 тысячах симулированных сцен. А чтобы модель не подглядывала на правильные прошлые действия и действительно училась ориентироваться по картинке, в обучении использовали специальную маску внимания, которая отрезает доступ к таким подсказкам. Потом ещё добавили reinforcement learning — это дообучение через пробу и ошибку — чтобы лучше справляться с поиском пути и восстановлением после ошибок.

В итоге система не просто показала хорошие результаты на тестах: она ещё и тренируется намного практичнее для масштабирования. То есть здесь попытались решить сразу две проблемы — как сделать навигацию более универсальной для разных роботов и как обучать такие модели быстрее, чем обычно.

Ключевые цифры

8BМодель очень крупная: в ней 8 миллиардов параметров, поэтому она может учиться более сложным навигационным решениям.
2,4 миллиона траекторийДля обучения использовали огромный набор маршрутов, чтобы не полагаться только на дорогие реальные данные.
350 тысяч симулированных сценМодель натренировали на очень большом числе виртуальных помещений и ситуаций, а не на узком наборе примеров.
22xОбучение стало в 22 раза экономнее по числу токенов, то есть процесс удалось сильно ускорить и удешевить.

Можно ли доверять

Это препринт на arXiv, его ещё не проверяли рецензенты. Проверяли не на реальных роботах, а на симуляционных бенчмарках, так что в живой среде результат может оказаться скромнее. С другой стороны, работа опирается на большие числа и сравнения с сильными базовыми моделями, поэтому как исследовательский сигнал она выглядит серьёзно.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (via Hugging Face)
Дата публикации у нас24 июля 2026 г.
Дата источника21 июля 2026 г.
ОригиналОткрыть
АвторыArjun Majumdar, Avinash Sooriyarachchi, Benjamin Tibi, Chris Bamford, Elliot Chane-Sane, Guillaume Lample, Khyathi Raghavi Chandu, Ludovic Ho Fuh, Mathieu Poiree, Olivier Duchenne