论文
HandVQA:诊断和改进视觉语言模型中手部的细粒度空间推理
HandVQA: Diagnosing and Improving Fine-Grained Spatial Reasoning about Hands in Vision-Language Models
摘要
了解人手的细粒度关节对于机器人辅助手术、芯片制造和基于 AR/VR 的人机交互等高风险环境至关重要。尽管在一般视觉语言基准上实现了接近人类的表现,但当前的视觉语言模型(VLM)在细粒度的空间推理方面存在困难,特别是在解释复杂且清晰的手势方面。我们推出了 HandVQA,这是一个大规模诊断基准,旨在通过视觉问答来评估 VLM 对详细手部解剖结构的理解。我们的基准测试基于高质量 3D 手部数据集(FreiHAND、InterHand2.6M、FPHA),包括超过 160 万个受控多项选择题,这些问题探究手部关节之间的空间关系,例如角度、距离和相对位置。我们通过 LoRA 使用轻量级 微调 在基础和微调设置中评估了几种最先进的 VLM(LLaVA、DeepSeek 和 Qwen-VL)。我们的研究结果揭示了当前模型的系统局限性,包括幻觉的手指部位、不正确的几何解释和较差的概括性。 HandVQA 不仅揭示了这些关键的推理差距,而且提供了一条经过验证的改进路径。我们证明,从我们的基准测试中学习到的基于 3D 的空间知识在零样本设置中传输,显着提高了模型在手势识别 (+10.33%) 和手与物体交互 (+2.63%) 等新型下游任务上的准确性。