论文
部位定位而非动作知识:识别视觉语言模型操作预测的瓶颈
Part Grounding, Not Action Knowledge: Locating the Bottleneck in VLM Affordance Prediction
摘要
基准评测显示,视觉语言模型对基础操作的推理表现较差,但总体准确率无法指出具体失败环节。本文将可供性问题混合的两步分开:识别应操作物体的哪个部位,以及判断该部位需要什么动作。研究针对19个铰接物体,向来自三家开发者的八个模型询问机器人应施加什么运动。在64次正确答案为“推”的开放提示评测中,模型仅一次回答“推”;尽管19个物体中有8个需要该动作,且每次给出的选项都包含它。输出分析发现,模型描述的部位往往不是被评分的目标,例如解释如何拿起相机,而非按下按钮。明确命名目标部位后,各模型动作准确率提高0.32—0.63,从0.158—0.474升至0.684—0.947,“推”的召回率从0—1/8升至7—8/8。开放提示下,没有模型超过忽略图像的固定答案基线;命名部位后,八个模型都超过该基线。要求在没有选项的自由文本中描述同一部位时,八个模型中有6—8个会使用按压相关表达。因此,主要瓶颈更接近部位定位,而非缺少动作知识;该现象横跨三个模型系列,也未随模型能力增强而减弱。部位名称提供了定位所需的信息,因此这些结果反映理想部位检测器可能带来的上限,而不是通用力学模型的证明。辅助实验同样发现:真实照片上仅三个模型的抓取点定位超过固定基线,渲染物体上则没有。研究还记录了两项自身测量错误:一个阈值让固定基线获得0.929分,另一个标注规则在19个物体中的4个上出错;二者均在与简单替代方案对照时才被发现。