论文
FinPerMA:理论指导、事件支撑的LLM Agent个性化记忆基准
FinPerMA: A Theory-Informed, Event-Grounded Personalized-Memory Benchmark for LLM Agents
摘要
大规模语言模型(LLM)代理在高风险领域,如金融咨询,作为个性化的助手日益普及。然而,它们是否能够在长期内维持和更新个体化用户模型仍不清楚。现有的个性化记忆基准主要测试事实保留或依赖弱约束的模型生成轨迹,但未探索事件驱动的偏好适应性。我们引入FinPerMA,这是一个基于事件背景的基准,用于评估个性化记忆与冻结的投资者纵向轨迹对比。其生成管道结合了确定性的理论导向影响规则、控制的LLM叙述和自动化质量筛查;Post-Shock检查点隔离了代理是否将重要事件整合到其持久用户模型中。在2,994个问题来自276名个人的测试数据中,七个前沿的LLM和最多七个记忆配置仍然远远不足饱和:没有全场景配置超过0.47的整体准确率或39%的选择题上。归因分析表明,基于摘要的记忆往往保留事实细节而丢失个性化所需的偏好信号;简单的检索可以因此优于定制化的记忆系统,冲击后差距进一步扩大。
