论文

Metric-Bench:探索室内场景 VLM 中的上下文空间度量推理

Metric-Bench: Exploring In-context Spatial Metric Reasoning in VLMs for Indoor Scenes

模型训练强化学习RLVR

摘要

度量推理对于视觉语言模型(VLM)来说是一项关键且具有挑战性的任务,在机器人操作和自主导航等具体人工智能任务中发挥着关键作用。然而,当前的空间推理仍然受到严格的像素级监督的瓶颈;这种局部优化通常会损害一般的多模式智能,引发性能下降或广泛推理能力的灾难性遗忘。为了解决这些限制,我们引入了 Metric-Bench,这是一个专门的基准测试,旨在使用上下文信息指导度量空间推理。通过将图像内参考对象与已知的物理尺寸结合起来,Metric-Bench 指导模型隐式学习 2D 到 3D 映射,而无需相机内部参数。我们进一步提出了 MetricReasoner,一种基于任务的强化微调方法,用于基于参考的度量推理,使用结构化提示和可验证的数字奖励。 Metric-Bench 上的大量实验表明,我们的方法显着增强了空间度量理解,比现有的甚至更大的专有模型提高了 43.1%,同时在 RoboSpatial 整体精度上比空间专业模型的下游体现性能提高了 30.4%,在 ERQA 上提高了 9.3%,并且在一般基准上提供了一致的增益(V$\star$Bench 上为 15.9\%,在 V$\star$Bench 上为 88.9\%) BLINK),表明所提议的调整不一定会损害一般 VLM 功能。