论文

MapSatisfyBench:经行为锚定隐式决策因素基准测试满意度感知地图智能体

MapSatisfyBench: Benchmarking Satisfaction-Aware Map Agents through Behavior-Grounded Implicit Decision Factors

智能体系统Agent任务评测

摘要

大语言模型智能体日益集成到地图服务中。由于地图服务嵌入日常生活场景而非专业任务设定——用户常非正式表达需求——产生带许多未言之需的欠指定查询——即对用户满意度至关重要的隐式决策因素。虽然澄清是缓解该问题的有效方式——但它增加日常交互中的用户负担——有能力的智能体应首先从可用信息源主动恢复此类因素。但评估该能力充满挑战。第一个挑战是确定哪些隐式决策因素适合评估:一个因素只有当它影响用户接受度、且可在智能体响应前从可得信息恢复时才可评估。其次——用户满意度无法由单一参考答案可靠表示——需要把满意度相关因素转为客观、可量化评估目标的基准。为应对这些挑战——我们提出恢复-识别-过滤框架——从行为链证据重建完整用户需求——识别隐式决策因素——仅保留有查询前证据支持的因素。基于该方法学——我们从大规模真实匿名用户数据构建MapSatisfyBench——从五个维度标注真值——支持满意度感知地图智能体的全链评估。实验表明当前智能体在显式任务完成上普遍良好——但在满足隐式决策因素与主动获取满意度感知决策所需证据上仍受限。这些发现确立MapSatisfyBench为把地图智能体评估从任务完成转向满意度感知空间决策的基准。

MapSatisfyBench:经行为接地隐式决策因素基准测试满意度感知地图智能体:论文配图
图 1:MapSatisfyBench 的动机。地图服务查询通常定义多个可行的响应,满意度取决于代理是否恢复行为支持的隐式决策因素。