Xiaomi-Robotics-1: как обойти дефицит данных для роботов

· Искусственный интеллект
Xiaomi представила базовую модель для роботов, которая обучается на 100 000 часах «бестелесных» траекторий и переносит навыки на реальные машины.

cover.svg

Языковые и визуальные модели давно живут по эмпирическим законам масштабирования: чем больше данных, параметров и вычислений, тем выше способности. Робототехника от этого праздника оставалась в стороне — качественных данных в больших объёмах взять негде, и именно этот дефицит, а не что-либо ещё, ограничивал рост управляющих моделей. Xiaomi предлагает обходной путь и описывает его в работе Xiaomi-Robotics-1.

Данные без тела

Ключевая идея — предобучение на «бестелесных» (embodiment-free) траекториях формата UMI. Речь идёт о 100 000 часах записей, охватывающих более 1700 сценариев: жилые дома, коммерческие помещения, промышленные площадки и открытые пространства. Размечать такой массив вручную невозможно, поэтому Xiaomi построила автоматический конвейер: длинные видео нарезаются на фрагменты фиксированной длины, а сильная визуально-языковая модель описывает, как в каждом фрагменте меняется состояние захватов и объектов.

На этапе дообучения в ход идут данные с настоящих роботов — свыше 7200 часов записей в реальных квартирах: уборка дивана, разбор обувного шкафа, раскладывание кухонной утвари. Схема повторяет логику обучения больших языковых моделей: сначала предобучение ради широты, затем выравнивание под конкретные «тела» роботов и под выполнение инструкций на естественном языке.

Масштабирование работает

Главный вывод авторов оптимистичен: модель масштабируется аккуратно. С ростом объёма данных и размера модели ошибка предсказания действий на валидации стабильно снижается, а после дообучения растёт и доля успешно выполненных задач на реальных роботах — причём в незнакомых обстановках и с незнакомыми предметами. Признаков насыщения, по утверждению команды, пока не видно: чем сильнее предобученная модель, тем лучше она работает «из коробки».

Цифры

На новых сложных задачах — упаковка телефонов, заправка принтера, загрузка стиральной машины, укладка коробок — модель осваивается быстро. Менее чем за 10 часов демонстраций на задачу она достигает 75% успеха против 40% у базовой π0.5 при том же бюджете; при бюджете до 40 часов результат поднимается до 85%.

На четырёх популярных симуляционных бенчмарках (RoboCasa, RoboCasa365, VLABench, RoboDojo) Xiaomi-Robotics-1 занимает первые места. Отрыв от ближайшего конкурента варьируется от скромных 2,6% на RoboCasa до внушительных 58,3% на RoboDojo.

В финале авторы, следуя духу подобных публикаций, обещают несмонтированную запись того, как робот собирает чемодан. Работа опубликована в виде препринта на arXiv.


Источник: Hacker News

Комментарии

Войдите, чтобы комментировать.

  • Пока нет комментариев.