论文

跟踪、排名、破解:认知工作记忆可扩展语言代理中的多跳推理

Track, Rank, Crack: Epistemic Working Memory Scales Multi-Hop Reasoning in Language Agents

上下文与知识上下文工程

摘要

随着推理链的延长,交错推理和工具使用的语言代理会急剧退化,即使每个步骤都很简单。我们将其追溯到上下文稀释:代理的调查状态(它已经确认的内容、它怀疑的内容以及它仍然需要的内容)仅隐式地存在于不断增长的上下文窗口中,其中早期的发现被埋藏在后来的检索中。我们引入了 SLEUTH,它通过结构化的认知工作记忆使这种状态变得明确且可操作:智能体维护基于来源的已确认事实、按证据排名的主动假设以及直接驱动其下一步行动的开放问题。在五个多跳基准和五个已建立的基线上,SLEUTH 的优势随任务难度增加而扩大,从 HotpotQA 上的 +5 分到 4 跳链上的 +11 分,超越了没有多个情节的 Reflexion。通过分析剩余的差距在哪里,我们确定了证据充分性问题:智能体经常找到答案但未能做出承诺,在不必要的验证上耗尽了预算。轻量级承诺触发器解决了这个问题,但只有当代理已经保持结构化状态时:应用于非结构化代理的相同触发器不会产生任何改进,将有组织的认知状态隔离为有效承诺的必要条件。最后,在较弱的模型上强制遵守协议可以在最困难的问题上恢复高达 +19 分,这表明代理如何组织其推理,而不是原始模型能力,才是扩展多跳推理的活性成分。