论文
EVGeoQA:评测LLM的动态多目标地理空间探索能力
EVGeoQA: Benchmarking LLMs on Dynamic, Multi-Objective Geo-Spatial Exploration
摘要
尽管大语言模型(LLM)展现出卓越的推理能力,其在动态地理空间环境中进行目的驱动探索的潜力仍未得到充分研究。现有的地理空间问答(GSQA)基准主要聚焦于静态检索,未能捕捉涉及动态用户位置和复合约束的真实世界规划的复杂性。为弥合这一差距,我们提出EVGeoQA,一个基于电动汽车(EV)充电场景构建的新型基准,具有独特的位置锚定和双目标设计。具体而言,EVGeoQA中的每个查询都显式绑定用户的实时坐标,并集成了充电必要性与同址活动偏好这一双重目标。为在此类复杂设定下系统评估模型,我们进一步提出GeoRover,一个基于工具增强智能体架构的通用评估框架,用于评估LLM的动态多目标探索能力。我们的实验揭示,尽管LLM能够成功利用工具完成子任务,但它们在长程空间探索上表现挣扎。值得注意的是,我们观察到一种涌现能力:LLM能够总结历史探索轨迹以提升探索效率。这些发现使EVGeoQA成为未来地理空间智能的一个具有挑战性的试验场。数据集与提示可在https://github.com/kg-bnu/EVGeoQA获取。
