论文
评估非人形机器人形态的 VLM 驱动的语义可供推理
Assessing VLM-Driven Semantic-Affordance Inference for Non-Humanoid Robot Morphologies
摘要
视觉语言模型(VLM)在理解人与物体交互方面表现出了卓越的能力,但它们在具有非人形形态的机器人系统中的应用在很大程度上仍未得到探索。这项工作研究了 VLM 是否可以有效地推断与人类完全不同的机器人的可供性,从而解决在不同机器人应用中部署这些模型的关键差距。我们引入了一种新颖的混合数据集,它将带注释的现实世界机器人可供性-对象关系与 VLM 生成的合成场景相结合,并对跨多个对象类别和机器人形态的 VLM 性能进行实证分析,揭示可供性推理能力的显着变化。我们的实验表明,虽然 VLM 对非人形机器人形式具有良好的泛化能力,但它们的性能在不同的对象域中明显不一致。至关重要的是,我们在所有形态和对象类别中发现了低假阳性率但高假阴性率的一致模式,这表明 VLM 倾向于保守的可供性预测。我们的分析表明,这种模式对于新颖的工具使用场景和非常规的对象操作尤其明显,这表明将 VLM 有效集成到机器人系统中需要补充方法来减轻过度保守的行为,同时保留低误报率的固有安全优势。