论文

MemRiskBench:面向长时域LLM智能体的轨迹感知风险保留评估

MemRiskBench: Trace-Aware Risk-Preserving Evaluation for Long-Horizon LLM Agents

智能体系统上下文与知识记忆Agent任务评测Agent记忆长程任务评测

摘要

长时域LLM智能体在会话间累积记忆,产生稀疏但高影响的风险:陈旧事实、冲突更新、跨用户信息泄露、被撤销记忆的重复使用以及约束衰减。标准聚合评分隐藏了各类风险的失败率——一个平均准确率为78%的模型仍可能在4%的回合中泄露数据——而基准压缩优先丢弃罕见但高严重性的事件,这些事件能区分一个基本正常与偶尔有害的模型。我们提出了MemRiskBench。主要贡献是构建五类风险分类体系(另有一类已记录但未打分),通过确定性轨迹基础检查实现,以120回合的脚本化基准形式呈现,包含完整轨迹日志,且在通过/失败判断路径中不使用LLM进行评判,评估结果基于五个本地运行的量化指令微调模型。其次,提出一种风险保留的子集选择器:基于确定性轨迹衍生特征的覆盖约束贪心选择器,能保持完整排序(Spearman相关系数为0.975,确定性;置信区间坍缩为零bootstrap方差的点估计)、风险覆盖(1.0)和高风险模型检测(1.0),在20%的子集规模下实现,计算开销降低5倍。与仅保留排序的子集选择器不同,该选择器额外保留风险类型覆盖和高风险检测能力,使用不依赖LLM评判的轨迹基础确定性特征。所有回合、轨迹、评分实现及选择器均已开源,以支持部署LLM智能体的可复现评估与风险分析。