论文
视觉语言模型可以评估以自我为中心的机器人图像的邻近风险吗?
Can Vision-Language Models Assess Proxemic Risk from Egocentric Robot Images?
摘要
从机器人的自我中心角度评估邻近危险对于人类环境中的安全实体导航至关重要,并且需要视觉和上下文推理。我们评估了三种开源视觉语言模型(VLM)(\textit{InternVL}、\textit{Qwen-VL} 和 \textit{SmolVLM})将自我中心机器人图像分类为四个危险级别,将三种提示策略和两轮 QLoRA 微调 与分层随机基线进行比较。如果没有 微调,所有模型的性能都接近基线,而 微调 仅产生适度的整体改进。然而,具有高级提示的 \textit{Qwen-VL} 在高危险情况下的召回率比其他模型要高得多。对人员定位的分析进一步表明,正确的危险分类并不对应于更好的空间定位,这表明模型可以在不关注场景的相关区域的情况下产生有用的安全标签。这些结果表明,尽管有针对性的提示和 微调 可以改善所选模型的高危险检测,但当前的 VLM 在细粒度邻近推理和空间定位方面仍然有限。