Препринт — материал ещё не прошёл рецензирование
Асинхронная модель для робота показала более высокий успех в манипуляциях
Кратко
Авторы предложили DAM-VLA — модель, где разные модальности обрабатываются с разной скоростью через отдельные латентные буферы и gated cross-attention. В семи реальных задачах на манипуляцию она превзошла синхронные базовые модели и работала на 100 Гц.
Зачем это знать
Это указывает, что для задач с быстрым физическим взаимодействием может быть полезно не заставлять все модальности идти в одном темпе. Но это пока preprint и результат получен на одном роботе и наборе задач, поэтому его нельзя напрямую переносить на все системы.
Разбор
Проблема тут в том, что разные сигналы у робота живут в разном ритме. Картинка меняется сравнительно медленно, а сила, прикосновения и положение рук могут меняться очень быстро. Авторы взяли обычную модель для связи зрение–язык–действие и убрали из неё идею «всё должно обновляться одновременно». Вместо этого они сделали для каждой модальности свой латентный буфер — по-простому, отдельную внутреннюю память, которая обновляется со своей скоростью и потом подаётся в блок, отвечающий за действия.
Ещё одна важная деталь: новые быстрые сигналы они не вшивали грубо в уже обученную основу, а добавляли через gated cross-attention — это такой способ, который позволяет модели аккуратно решать, что именно взять из нового источника информации, не ломая то, что она уже умеет. Авторы проверили идею на семи реальных задачах, где роботу нужно было работать в контакте с предметами: складывать шарф, чистить доску, нажимать кнопку, вставлять штекер и так далее. В этих задачах асинхронная схема оказалась заметно сильнее синхронной: средний успех вырос с 40.95% до 95.2%.
Интересно и то, что модель не просто стала точнее, но и сохранила плавное управление на высокой частоте — 100 Гц. Это значит, что робот мог очень часто пересчитывать действия, не дёргаясь и не теряя отзывчивость. В дополнительном тесте на более быстром контроллере модель оставалась реактивной и при ещё более высоких частотах пересчёта.
Ключевые цифры
Можно ли доверять
Это preprint на arXiv, его ещё не проверяли независимые рецензенты. Проверка была на реальном роботе, что плюс, но тестировали одну платформу и набор из семи задач, так что за пределами этих условий результат может измениться.
Пересказано ИИ по научной статье. Как это устроено