论文

RENDER:控制LLM记忆评测中面向读者的证据形态

RENDER: Controlling Reader-Facing Evidence in LLM Memory Evaluation

模型评测上下文与知识记忆评测方法与指标Agent记忆

摘要

记忆与RAG评测常把回答模型的输入当作实现细节,尽管系统可能把同一段历史渲染成记忆条目、摘要、类型化记录或原始摘录。我们提出RENDER,一个在固定对话的同时改变面向读者的产物的基准控制。RENDER将五级数据包阶梯——用于定位含答案内容何时进入输入——与确定性模板相结合,后者近似ChatGPT式条目、LangChain摘要、MemGPT式类型化记录和原始对话。在500道LongMemEval问题和九个模型上,预算匹配的已解决数据包比按新近性截断的原始对话高出42.4至72.6分。在部署风格模板下,每个模型的最优-最差差距为24.6至48.8分;在主评分器下,ChatGPT式条目在9个模型中的7个上点估计高于原始对话。评审模型重评保持了总体正向效应,但针对具体模型的显著性结果好坏不一。三个在正式账本式数据包上得分为0%的模型,从自然语言条目回答相同事实时得分达45.4%至53.4%。该效应在检索噪声下持续存在,并可迁移到HotpotQA,这提示记忆/RAG评测应报告或控制面向读者的产物。

RENDER:控制LLM记忆评测中面向读者的证据形态:论文配图
图2:LongMemEval(500 个问题)上五包阶梯的准确率。P0/P1 仅暴露见证地址;P2 首次将解析出的答案写入包体;P3/P4 在该值周围添加元数据。