论文
VehicleMemBench:面向车载智能体中多用户长期记忆的可执行基准
VehicleMemBench: An Executable Benchmark for Multi-User Long-Term Memory in In-Vehicle Agents
摘要
随着对智能车载体验需求的增长,基于车辆的智能体正从简单的助手演变为长期陪伴者。这一演进要求智能体持续建模多用户偏好,并在面对用户间偏好冲突与随时间变化的习惯时做出可靠决策。然而,现有基准大多局限于单用户、静态问答设置,未能捕捉偏好的时间演化以及真实车辆环境的多用户、工具交互特性。为弥补这一空白,我们提出VehicleMemBench,一个构建于可执行车载仿真环境之上的多用户长上下文记忆基准。该基准通过将动作执行后的环境状态与预定义目标状态进行比较来评估工具使用与记忆,无需基于LLM或人工评分即可实现客观、可复现的评估。VehicleMemBench包含23个工具模块,每个样本含有超过80个历史记忆事件。实验表明,强大模型在直接指令任务上表现良好,但在涉及记忆演化的场景中表现吃力,尤其是当用户偏好动态变化时。即使是先进的记忆系统也难以处理该环境中的领域特定记忆需求。这些发现凸显了对更健壮、更专业化记忆管理机制的需求,以支持真实车载系统中的长期自适应决策。为促进后续研究,我们发布了数据与代码。
