Microsoft совместно с консорциумом академических исследователей представила новый метод обучения роботов, который позволяет им одновременно планировать действия и определять точное местоположение для их выполнения. Разработанный бенчмарк GroundedPlanBench решает давнюю проблему в робототехнике, где роботы до сих пор испытывают трудности с совмещением этих двух задач.
Большинство современных систем разделяют эти решения на два этапа: сначала модель компьютерного зрения и языка создает план на естественном языке, а затем другая модель преобразует этот план в действия. Такой раздельный подход часто приводит к ошибкам, особенно в загроможденных средах.
Фото: Interesting Engineering
Проблема проявляется в простых задачах: например, робот, которому поручено выбросить бумажные стаканчики, может перепутать, какой именно стаканчик нужно взять, или даже придумать шаги, которые не были запрошены. Это происходит потому, что планирование и пространственное ориентирование обрабатываются отдельно, позволяя ошибкам на одном этапе влиять на следующий.
Для решения этой проблемы команда разработала GroundedPlanBench, чтобы проверить, могут ли модели ИИ планировать задачи, одновременно определяя, где должно происходить каждое действие. Вместо того чтобы полагаться только на текст, каждое действие привязывается к конкретному местоположению на изображении.
Базовые действия, такие как захват, размещение, открытие и закрытие, связываются с объектами или позициями, заставляя систему соединять решения с физическим миром. Бенчмарк включает более 1000 задач, созданных на основе реальных взаимодействий с роботами.
Некоторые инструкции являются прямыми, например, «положить ложку на тарелку». Другие более открытые, например, «привести в порядок стол». Эта смесь важна, потому что роботы часто терпят неудачу, когда инструкции расплывчаты.
Язык, который люди легко понимают, может быть слишком неоднозначным для машин, особенно когда несколько объектов выглядят похожими. В одном примере систему попросили положить четыре салфетки на диван. Она неоднократно выбирала одну и ту же салфетку, потому что описание не позволяло четко различать их.
Для повышения производительности команда также разработала метод обучения под названием Video-to-Spatially Grounded Planning (V2GP). Эта система учится на видео, где роботы выполняют задачи. Она определяет, когда робот взаимодействует с объектами, идентифицирует эти объекты и отслеживает их позиции.
Используя этот подход, команда сгенерировала более 40 000 обоснованных планов. Они варьируются от простых одношаговых действий до более длинных последовательностей, включающих до 26 шагов.
Когда модели обучались на этих данных, их производительность улучшалась. Они лучше выбирали правильные действия и связывали их с нужными объектами. Система также уменьшила повторяющиеся ошибки, такие как многократное воздействие на один и тот же предмет.
Тем не менее, проблемы остаются. Длинные и сложные задачи трудны, особенно когда инструкции косвенные. Исследователи отмечают, что «модели должны рассуждать о более длинных последовательностях действий и поддерживать согласованность на многих шагах».
Команда предполагает, что будущая работа может объединить этот метод с прогностическими моделями, которые оценивают результат действий до их выполнения. Это может помочь роботам избегать ошибок в реальном времени.
Исследование было опубликовано на arXiv и указывает на четкое направление для робототехники: системы, которые понимают как действия, так и местоположения вместе, с большей вероятностью будут работать в реальных условиях.
Источник: Interesting Engineering
Оцените новость 0 0 0 0 0 0 0
- Ии
- Робототехника
- Microsoft
- Groundedplanbench
- Планированиедействий
- Локализация