论文
RECON:面向长上下文组合推理的智能体记忆基准
RECON: Benchmarking Agent Memory for Compositional Reasoning over Long Contexts
摘要
大语言模型与基于LLM的智能体被广泛用作个人聊天助手、企业副驾驶与自主工作流智能体。在所有这些应用中,记忆——保留、访问并推理跨长上下文、多次交互累积的信息的能力——是决定智能体可靠性的关键。我们提出RECON(混淆叙事下的扩展上下文推理),一个评估长上下文组合推理的基准。RECON横跨三个领域(刑事、医疗、金融)的24个案卷,每个5万至10万token,测试智能体六类记忆密集任务:重建多跳证据链、传播级联失效、解决来源冲突、反事实推理、满足时序约束与时序事实检索。近期的记忆基准评估智能体能否检索散落的事实或检测事实是否变化,而RECON评估变化之后的事:智能体能否追踪哪些下游结论受影响、哪些凭独立支持幸存、以及替代时间线会如何展开。我们的评估揭示了现有架构的实质性局限:即使最强的非Oracle系统也仅达22.4%准确率,检索与推理各自构成挑战。
