Как мы учим гуманоида работать в динамической среде и почему это не так просто, как кажется
Сегодня роботы наиболее впечатляющих демонстраций показывают их в статичной обстановке: предметы оставлены на столе, освещение стабильно, камера направлена в сторону зоны, а сама сцена действия почти не меняется. В таких современных условиях VLA действительно демонстрирует превосходное качество управления. Но реальные задачи для роботов в быту или на производстве намного сложнее. Как минимум — объекты движутся по конвейеру. И если с ними взаимодействует не закрепленный манипулятор, а полноростовой робот, ему придется делать шаги и поддерживать баланс тела дополнительными движениями. Все это многократно усложняет расчетные операции. Привет, Хабр! Меня зовут Дания, я ML-инженер в MTC Web Services. Мы в RnD-направлении Физического ИИ разрабатываем VLA (Видение-Язык-Действие) стратегию для гуманоида, которая должна взаимодействовать не с аккуратно разложенными объектами на столе, а с предметами, которые двигаются во время выполнения действия. В этом материале я хочу сосредоточиться на одной конкретной проблеме: почему робот уверенно берет предмет со стола, но начинает промахиваться, когда предмет едет по конвейеру. А еще поговорим, над чем мы сейчас работаем у себя, чтобы научить гуманоида справляться с такими условиями. Читать дальше