论文
超越记忆:利用具有明确信念状态的长视智能体
Beyond Memory: Harnessing Long-Horizon Agents with Explicit Belief States
摘要
大语言模型(LLM)智能体现在可以承担日益复杂的任务,但它们将交互历史组织到内存中的方式并不能确保对当前世界的连贯理解。我们引入 PoS,这是一种推理时间框架,它构建并持续维护明确的信念状态作为Agent的决策上下文。每个信念都结合了对当前世界状态的估计和未解决的任务要求,明确了Agent仍然需要学习和完成的内容。为了保持这种信念的可靠性和可操作性,PoS 验证其一致性并监控任务进度以检测信念陷阱,即Agent继续采取行动,但没有朝着目标取得有意义的进展。然后根据捕获模式和未解决的任务要求的类型来定制恢复。对涵盖执行和诊断的四个基准的实验表明,PoS 在所有三个 LLM 主干的每个基准上都实现了最高的整体性能。消融证明了一致性验证和恢复的重要性,而上下文扩展实验则显示了对上下文增长的弹性。总之,这些结果支持信念构建和持续维护,作为超越历史保留和压缩的长期上下文管理的基础。