论文
Gold Points Sniper:VLM 中的自我引导视觉推理,实现细粒度动作理解
Gold Points Sniper: Self-guided Visual Reasoning in VLM for Fine-grained Action Understanding
摘要
在日常环境中运行的机器人必须从人们只占据小区域的广阔视野中理解细粒度的人类行为、意图和上下文线索,这是当前系统无法满足的能力。虽然开放词汇动作识别方法仍然仅限于分配预定义的标签,并且视觉语言模型(VLM)在其输出中面临着信息丰富性和事实保真度之间固有的权衡,但这两种方法都无法实现可靠的人机交互所需的深层语义解释。我们提出了 Gold Points Sniper (GPS),这是一种新颖的框架,可为轻量级 VLM 提供自引导多模态推理功能,以实现细粒度的人类行为理解。我们的方法包括三个关键模块:金点提取器训练 VLM 识别与行动相关的关键细节,选择性苏格拉底提问者通过选择性自我提问验证和细化这些细节,语义蕴涵评估器使用语义蕴涵分类定量评估事实一致性。基于 CAP 基准对我们精心策划的指令调整数据集进行的大量实验表明,GPS 增强型轻量级 VLM 实现了显着的性能改进,其中一些模型达到了与专有 GPT-4o 相当的性能,同时保持了卓越的事实准确性。我们的工作为家用机器人的细粒度动作理解奠定了可靠的基础,使机器人能够通过信息密集且基于事实的描述来安全地解释人类行为。源代码、训练配置、注释提示和数据集详细信息发布于 https://github.com/Haodi-Liu/GPS-Gold-Point-Sniper。