论文
MapReason-OSM:视觉语言模型能否根据街道地图做出可验证图形的移动决策?
MapReason-OSM: Can Vision-Language Models Make Graph-Verifiable Mobility Decisions from Street Maps ?
摘要
视觉语言模型 (VLM) 越来越多地用于读取物流、交付和无障碍导航地图,其中输出是必须尊重道路网络的可行决策(路线、图钉、停车选择)。然而,大多数地图基准对自由文本或多项选择答案进行评分,而这些答案无法根据底层图表进行验证。我们提出了 MapReason-OSM,这是一个基准和评估工具,用于在自渲染 OpenStreetMap 面板上进行图形可验证的移动决策。我们以两个对齐的缩放比例渲染十个美国市中心的固定样式地图,覆盖一致的标记语法,并将每个面板与隐藏的街道图和精确的预言机配对,在 12 个路线、设施位置和视觉消歧任务中生成 6,000 个实例(两个缩放中的 12,000 个面板)。模型返回结构化决策,我们将其快速返回图表,并对有效性、合法性、最优性和约束满足以及跨缩放一致性进行评分。在七个 VLM 中,模型可以简单地读取地图和路线,但无法进行图形成本推理(即使对于前沿推理模型,单设施引脚放置也几乎是偶然的),并且经常在比例上不一致。我们发布了基准测试、工具和确定性生成器。代码和数据:https://github.com/Vi-Sri/mapreason-osm