论文
SafeGesture:通过场景条件安全解释评估视觉语言模型中的细粒度手势理解
SafeGesture: Evaluating Fine-Grained Hand Gesture Understanding in Vision-Language Models through Scenario-Conditioned Safety Interpretation
摘要
开放权重和前沿视觉语言模型(VLM)在一般图像理解方面表现良好,但它们在安全关键操作环境中解释细粒度手势的能力在很大程度上仍未得到检验。我们引入了 SafeGesture,这是一个评估模型是否可以从手势推断出适合场景的安全操作的基准。它将 6 个 HaGRID 手势与 4,800 个项目的 8 个操作场景配对,并评估 Qwen2.5-VL-7B、LLaVA-NeXT-7B、InternVL2-8B、Phi-3.5-Vision 和 GPT-4o。结果揭示了感知推理脱钩:GPT-4o 实现了 98.4% 的手势准确度,但安全准确度为 53.3%,而 Qwen2.5-VL 达到 84.9% 和 39.5%,差距达 45.0 和 45.4 个百分点。五分之四的模型很少或从不使用不确定性标签,并且不同模型的故障方向存在很大差异。准确性还掩盖了标签偏差:没有视觉输入的场景多数策略达到 58.3%,高于所有评估的模型,而只有 GPT-4o 在宏观 F1 下超过了这一先验值。视觉输入将安全准确度提高了 11.2 至 30.2 个百分点,但提供 真值 手势作为文本仅将性能提高了 0.4 至 3.2 个百分点,并且没有模型超过 56.2%。这些结果表明主要瓶颈是场景条件安全推理而不是手势识别。