论文
从视觉到收获:多臂机器人水果收获的视觉语言模型基准测试
From Vision to Harvest: Benchmarking Vision-Language Models for Multi-Arm Robotic Fruit Harvesting
摘要
多臂机器人收割为提高收割效率和减少对体力劳动的依赖提供了一条有前途的途径。然而,实际部署仍然具有挑战性,因为系统必须在不同的环境中通用,同时在共享工作空间中有效协调多个手臂。现有方法通常需要在目标环境中收集大量数据,或者依赖于限制规划质量的简化假设。在这项工作中,我们引入了第一个用于评估零样本多臂水果采收计划的预训练视觉语言模型(VLM)的综合基准。我们的基准测试使用真实的苹果和柑橘园图像,并将基于 VLM 的规划流程与传统的感知和规划流程进行比较。 VLM 管道直接生成每个臂的收获序列和路径点,同时轻量级轨迹验证器检查碰撞。我们的结果表明,前沿 VLM 可以零次生成有效的多臂收获计划,但实际部署仍然受到准确的 3D 航路点生成和碰撞感知协调的限制。这些结果凸显了用于多臂机器人收获的预训练 VLM 的前景和当前局限性。