论文

FinPerMA:理论指导、事件支撑的LLM Agent个性化记忆基准

FinPerMA: A Theory-Informed, Event-Grounded Personalized-Memory Benchmark for LLM Agents

模型评测上下文与知识记忆基准与评测资源Agent记忆

摘要

大规模语言模型(LLM)代理在高风险领域,如金融咨询,作为个性化的助手日益普及。然而,它们是否能够在长期内维持和更新个体化用户模型仍不清楚。现有的个性化记忆基准主要测试事实保留或依赖弱约束的模型生成轨迹,但未探索事件驱动的偏好适应性。我们引入FinPerMA,这是一个基于事件背景的基准,用于评估个性化记忆与冻结的投资者纵向轨迹对比。其生成管道结合了确定性的理论导向影响规则、控制的LLM叙述和自动化质量筛查;Post-Shock检查点隔离了代理是否将重要事件整合到其持久用户模型中。在2,994个问题来自276名个人的测试数据中,七个前沿的LLM和最多七个记忆配置仍然远远不足饱和:没有全场景配置超过0.47的整体准确率或39%的选择题上。归因分析表明,基于摘要的记忆往往保留事实细节而丢失个性化所需的偏好信号;简单的检索可以因此优于定制化的记忆系统,冲击后差距进一步扩大。

FinPerMA:理论指导、事件支撑的LLM Agent个性化记忆基准:论文配图
图 3:角色 P-0032 的单个 FinPerMA 评估实例的工作示例。面板 1-3 分别提供人物简介、生活事件时间表和多会话对话。档案记录了特征和财务属性。时间线记录了冲击后关卡的宏观、行业和个人事件,而对话则含蓄地揭示了偏好。第 4 组提出了一个包含六个选项的问题,其中的干扰项在结构上相匹配。回答这个问题需要结合所有三个证据来源来推断更新后的冲击后用户模型。