论文

PABU:面向高效LLM智能体的进度感知信念更新

PABU: Progress-Aware Belief Update for Efficient LLM Agents

上下文与知识记忆Agent记忆

摘要

大语言模型(LLM)智能体通常以完整的动作-观察历史为条件来决定动作,这引入了与任务无关的信息,容易导致冗余动作和更高的推理成本。我们提出进度感知信念更新(PABU),这是一个信念状态框架,通过显式建模任务进度并选择性地保留过去的动作与观察,来紧凑地表示智能体状态。在每一步,智能体预测自上一轮以来的相对进度,并决定是否存储新遇到的交互,使未来决策仅以保留的子集为条件。在AgentGym基准的八个环境中,使用相同的训练轨迹,PABU取得81.0%的任务完成率,比先前采用全历史信念的最先进(SoTA)模型高出23.9%。此外,PABU面向进度的动作选择提升了效率,将平均交互步数降至9.5,相当于减少26.9%。消融实验表明,显式进度预测与选择性保留对稳健的信念学习和性能提升都是必要的。

PABU:面向高效LLM智能体的进度感知信念更新
图1:进度感知信念更新(Progress-aware Belief Update)的动机。在诸如加热牛奶并饮用之类的任务中,传统方法依赖完整的交互历史(左),其噪声大、冗余且处理代价高。我们的方法(右)执行进度感知的信念更新,只保留必要信息,得到紧凑的上下文,从而支持高效且可靠的学习。