Как Microsoft и ученые решают проблемы взаимодействия роботов с объектами

Современные роботы часто сталкиваются с проблемой, когда им необходимо связать действие с конкретным объектом в пространстве. Для решения этого вопроса Microsoft, совместно с университетскими учеными, представила новый тест под названием GroundedPlanBench. Он проверяет, насколько эффективно модель может строить план действий и точно связывать каждый шаг с объектами, изображенными на картинке.

Обычно процесс делится на два этапа: первая модель генерирует словесный план, а вторая переводит его в физические действия. Однако такая раздельная система часто приводит к ошибкам, когда робот ошибочно выбирает не тот предмет или выполняет лишние действия. Обычно подобные проблемы возникают в загроможденной обстановке.

В новом тесте важно не просто выдать последовательность действий, но и жестко связать их с конкретными объектами. Каждый шаг должен носить привязанный характер, что помогает модели учитывать физическую обстановку. В тест вошло более 1000 заданий, основанных на реальных взаимодействиях. Некоторые инструкции кажутся простыми, но в сложных случаях, например, «приберите на столе», машины часто не понимают задание.

Команда также представила метод обучения Video-to-Spatially Grounded Planning (V2GP), который обучается на видео с взаимодействиями роботов и предметов. Этот подход позволяет создать структурированные планы действий, улучшая точность выполнения заданий.

Хотя успехи уже заметны, полностью решить проблему не удалось. Роботы все еще имеют трудности с длинными инструкциями, особенно если они формулируются косвенно. Тем не менее, исследователи полагают, что их подход может быть интегрирован с предсказательными моделями, которые заранее оценят результат действий, что повысит эффективность работы роботов.

Понравилась статья? Поделиться с друзьями: