论文

物理视觉语言推理的答案级信任选择

Answer-Level Trust Selection for Physical Vision-Language Reasoning

模型推理推理验证与自校正

摘要

视觉语言模型 (VLM) 可以根据视觉观察来估计物理量,例如持续时间、速度和加速度,但现有基准主要根据带注释的 真值 评估整体模型性能。在部署中,一个关键问题是当单个预测的 真值 不可用时是否可信。仅自洽可能无法捕获重要的故障模式:VLM 可能会产生稳定但错误的估计,或者依赖于文本先验而不是视觉证据。我们为定量物理推理制定答案级选择性预测,并提出答案级信任选择(ATS),这是一种事后、模型不可知的框架,用于接受或拒绝单个 VLM 预测。 ATS 不需要 微调、辅助验证器或访问模型内​​部 logits。相反,它将来自重复查询和受控干预的八个可解释的行为诊断分数汇总为统一的信任分数。我们在 Qwen2.5-VL-7B 和 20 个 VLM 主干上深入评估 ATS,检查选择性性能、诊断行为和目标故障模式。我们的结果表明,基于干预的诊断有助于识别稳定但错误的先前跟踪预测,而仅重复一致可能会错过这些预测。然而,改进的失败案例拒绝可能会以降低正确预测的保留率为代价。因此,ATS 通过定量 VLM 预测的答案级可靠性评估来补充模型级能力评估。代码将在发布后发布。