Когда гуманоидный робот сталкивается со сложной местностью, такой как сливовые сваи, сломанные мосты, узкие ступенчатые лестницы и т. Д., Испытание, которое действительно лежит перед ним, намного больше, чем просто « видеть под ногами».
На непрерывной плоской земле обычно есть место для корректировки неточного посадки; Но в разреженной, дискретной и геометрически ограниченной области посадки ноги могут быть пустыми, если они отклоняются на несколько сантиметров. Как только робот делает неправильный выбор в одно мгновение, он часто не успевает настроиться, и тело теряет равновесие.
Возникает ключевой вопрос: может ли робот заранее определить, в какое будущее он поведет себя, прежде чем сделать этот шаг?
Чтобы решить эту проблему, команда разработчиков роботов - алгоритмов разработала World Model Augmented VisualLocomotion (WM - LOCO).
WM - LOCO вводит в сложные топографические ходьбы гуманоидных роботов модели мира, предназначенные для прогнозирования визуальных и спортивных состояний в будущем, проводит сквозную совместную тренировку в моделировании и реализует реальную миграцию zero - shot. Это означает, что стратегии, обученные в симуляции, могут быть развернуты непосредственно на реальных роботах без вторичной настройки.
Архитектура WM - LOCO: стратегия PPO слева, модель кругового мира справа, совместное использование кодеров и сквозное совместное обучение
Проще говоря, роботы в прошлом больше основывались на « том, что они видят перед глазом», чтобы определить следующий шаг; WM - LOCO научил роботов « предсказывать будущее, а затем решать, что делать дальше.
I. Понимание только прошлого, почему недостаточно?
Традиционное визуальное обучение обычно вводит текущую и историческую визуальную информацию в сеть стратегий вместе с состоянием тела робота, а затем выводит команды управления суставами в режиме реального времени.
Такие стратегии, основанные на истории наблюдений, могут « видеть » информацию, которую робот уже испытал, вводя непрерывные многокадровые изображения или часть истории состояния тела, чтобы судить о том, как робот ранее двигался и как изменялась местность, и соответственно генерировать текущие действия.
Но проблема в том, что стратегия использует всегда « прошлую» информацию и не будет явно учиться « будущим изменениям состояния, которые может вызвать определенное действие». Это ограничение не является очевидным на плоской и регулярной местности, но при столкновении с строго ограниченной местностью в таких местах посадки, как столбы сливы, сломанные мосты, узкие ступенчатые лестницы, короткие доски для принятия решений на основе истории наблюдений резко увеличиваются.
Из - за сложного рельефа ходьба никогда не была простым наложением ряда несвязанных одноступенчатых движений.
Где эта нога наступает в настоящее время, будет продолжать влиять на центр тяжести тела, отношения поддержки, траекторию качания ноги и какие области можно достичь дальше. Действие, которое сейчас кажется жизнеспособным, может привести к тому, что робот в следующий момент окажется в безвыходном положении.
Итак, роботу нужно не только понять, что было раньше, но и предвидеть: что может произойти дальше, если это действие будет выполнено?
Добавьте в стратегию понимание « будущего»
WM - LOCO одновременно получает информацию о глубинном зрении и восприятии тела на борту робота и постоянно изучает динамические отношения между роботом, движением и окружающей средой в скрытом пространстве с помощью циклической модели мира.
Следует подчеркнуть, что цель этой мировой модели заключается не в создании будущего видео для просмотра, а в изучении более компактных, более подходящих для управления в реальном времени будущих характеристик состояния. WM - LOCO пытается ответить на три вопроса в каждый момент:
В каком состоянии находятся роботы и ландшафт?
Как меняется зрение и физическое состояние после выполнения действий?
Способствует ли это изменение дальнейшей стабильной ходьбе?
В практической реализации модель мира состоит из определенной траектории памяти и случайной неявной переменной: первая накапливает историю по временному циклу, а вторая выводится из текущих наблюдений.
Изучая реконструкцию наблюдений, потенциальный перенос состояния и прогнозирование обратной связи с задачами, мировая модель постепенно выводит динамические представления, содержащие будущие тенденции движения, и возвращает эту информацию в стратегию PPO.
Таким образом, стратегия получает больше не только ступеньки, препятствия и зоны посадки на текущих изображениях глубины, но и историческую траекторию движения, а также перспективную информацию о том, как может развиваться физическое состояние робота в будущем.
GT - истинная глубина следующего кадра, Recon - прогноз модели, Error - пиксельная ошибка
В этом и заключается основное различие между WM - LOCO и обычной многокадровой стратегией ввода. История наблюдений в основном помогает стратегии понять « что произошло в прошлом»; Мировая модель дополнительно изучает динамические связи между наблюдениями, движениями и будущими состояниями, позволяя стратегии выводить « то, что может случиться».
Таким образом, стратегические решения больше не полагаются только на историческую информацию, но действительно имеют возможность прогнозировать будущее.
III. Всестороннее обучение, прощание с громоздким процессом
Для того, чтобы роботы могли проходить через сложную местность, многие технологические маршруты разделяют систему на несколько модулей, таких как восприятие, планирование конечной точки, формирование траектории, стратегия учителя и управление нижним уровнем.
Некоторые программы также должны сначала обучить « открытую вешаю» стратегию учителя с полной топографической точностью, а затем переместить способность к стратегии студента с использованием бортовых датчиков посредством дистилляции знаний. Стоимость таких программ заключается в более длинных учебных каналах, более ручном проектировании, более высоких затратах на сборку данных, а также в том, что ошибки между несколькими модулями могут передаваться шаг за шагом и усиливаться на разных уровнях.
Напротив, WM - LOCO выбрала более простой путь: модель мира и стратегия ходьбы были оптимизированы в одном и том же учебном процессе.
Вся система не требует ручной фиксации конечной точки, не зависит от заранее спланированной траектории стопы, не требует многоступенчатой дистилляции в стиле учителя - ученика, не требует сложной многопрофильной структуры и не требует обучения нескольких отдельных модулей. От визуального ввода до движения сустава, тренируйтесь шаг за шагом на месте.
Динамическая информация, полученная мировыми моделями, также не воссоздается для реконструкции, а служит одной цели: помочь стратегии принять более эффективные последующие решения.
IV. Более высокие показатели успеха, более естественная походка
При том же визуальном вводе и задачах команда алгоритмов сравнила WM - LOCO с базовой стратегией PPO.
По мере того, как область посадки становится все более разреженной, узкой и прерывистой, между двумя подходами наблюдается явный разрыв. Чистые стратегии PPO, которые полагаются только на историю наблюдений, более склонны к преждевременным посадкам, частым испытаниям, непоследовательному ритму левой и правой ног и проблемам, когда локальные действия возможны, а последующие не могут продолжаться. В некоторых сложных ландшафтах просто PPO трудно даже сформировать стабильную пропускную способность.
После введения мировой модели успех роботов в сложных сценах, таких как сливовые сваи, сломанные мосты, узкие ступенчатые лестницы и однодеревянные мосты, значительно улучшился и приблизился к 100% в симуляции. В то же время роботы уменьшают внезапную коррекцию и колеблющуюся походку.
Другими словами, модель мира приносит больше, чем просто "возможность пройти", но и позволяет роботу демонстрировать более непрерывное и стабильное намерение двигаться во время ходьбы - более последовательное расположение ног, посадка и сдвиг центра тяжести тела, более скоординированный ритм левой и правой ног, общее движение также более естественное и ближе к человеческой ходьбе.
На реальных машинах один и тот же набор весов был развернут на Unitree G1 в виде zero - shot: ступеньки, ступеньки и щели три типа рельефа были протестированы по 10 раз каждый, средний показатель успеха 93,3%. Из этих щелей шириной 0,8 метра робот прошел шаг за шагом с полным движением « маятник - скачок - посадка» - по соображениям безопасности команда не продолжала тестировать более широкие щели, но это уже редкий реальный пересечение расстояния в текущей открытой работе.
V. Проверка подлинной машины на месте: не только Demo
Работа на рынке, как правило, демонстрирует скрининговое видео demo, которое часто трудно полностью отразить стабильность алгоритма в реальной среде.
Показ на месте совершенно другой. Робот должен сталкиваться с реальным шумом датчика, изменениями состояния устройства, световыми помехами и однократной работой, которая не может быть восстановлена. Любая ошибка восприятия или контроля будет непосредственно перед аудиторией.
На недавней пресс - конференции Sunshine S600 гуманоидный робот с WM - LOCO завершил публичное реальное шоу на месте. Алгоритмы работают в режиме реального времени на реальных роботах, реальных датчиках и вычислительной платформе S600 Survey, выполняя полное замкнутое кольцо от визуального восприятия, моделирования мира до управления движением всего тела.
По сравнению с демонстрацией сложной топографической ходьбы в виде видео - демо, открытая полевая работа предъявляет более высокие требования к стабильности алгоритма, надежности в режиме реального времени и развертывания, что еще больше подтверждает инженерную надежность, реальную развертываемость и высокий уровень успеха WM - LOCO.
Мировые модели используются не только для создания будущего, но и для того, чтобы помочь роботам понять его.
Когда робот переходит от принятия решений, основанных на истории наблюдений, к активному прогнозированию последствий действия, его логика ходьбы меняется: сначала предсказывает будущее, а затем делает следующий шаг.
(Выдержки)