论文
回收评估:有损记忆比空记忆更糟糕
Reclaim Evaluation: A Lossy Memory Is Worse Than an Empty One
摘要
当模型或其接口准备对它采取行动时,语言模型的记忆可能比没有记忆更糟糕:保留错误结论但放弃其背后工作的记忆会导致模型重新发出过时的值作为自信的答案,而空的记忆会导致它放弃。我们称之为脆性记忆。信息丢失是定义性的;这一发现是行为性的,它取决于一件事,即记忆是否保留了重新推导的基础(来源)而不是答案。我们通过回收评估来衡量它:引入已知的漂移,以固定预算进行压缩,提供指出错误的修正,并对准确的恢复进行评分,无需判断。保持预算固定并仅改变压缩所保持的内容,将可纠正性与能力和规模隔离开来; 8B模型和前沿一墙在同一个地方。一行源优先策略,保留可重新计算的源,放弃可重新推导的结论,在源紧凑且可识别的情况下以相等的预算恢复可纠正性,并使用长度匹配的控制排除“更多文本”。我们绘制修复失败的位置,通过内存循环显示故障复合,并在三个已部署的内存系统、真实对话 (MultiWOZ) 和 tau-bench 之间进行复制,tau-bench 是一个已部署的代理基准测试,其中有损内存是否会变成有害操作是模型和接口的联合属性。我们释放了工具、配对的内存条件以及构建为错误结果的验证器。