Как мы учим гуманоида работать в динамической среде

Сегодня большинство впечатляющих демонстраций роботов показывают их действия в статической среде: предметы лежат на столе, освещение стабильно, камера направлена в рабочую зону, а сама сцена почти не меняется. В таких условиях современные VLA действительно показывают высокое качество управления.
Но реальные задачи для роботов в быту или на производстве намного сложнее. Как минимум — объекты движутся по конвейеру. И если с ними взаимодействует не закрепленный манипулятор, а полноростовой робот, ему придется делать шаги и поддерживать баланс тела дополнительными движениями. Все это многократно усложняет расчет движений.
Привет, Хабр! Меня зовут Дания, я ML-инженер в MTC Web Services. Мы в RnD-направлении Physical AI разрабатываем VLA (Vision-Language-Action) политику для гуманоида, который должен взаимодействовать не с аккуратно разложенными объектами на столе, а с предметами, которые двигаются во время выполнения действия.
В этом материале я хочу сосредоточиться на одной конкретной проблеме: почему робот уверенно берет предмет со стола, но начинает промахиваться, когда предмет едет по конвейеру. А еще расскажу, над чем мы сейчас работает у себя, чтобы научить гуманоида справляться с задачей в подобных условиях.
Это отрывок статьи. Полную версию читайте на сайте источника по ссылке ниже.
Источник: Habr