论文
PABU:面向高效LLM智能体的进度感知信念更新
PABU: Progress-Aware Belief Update for Efficient LLM Agents
摘要
大语言模型(LLM)智能体通常以完整的动作-观察历史为条件来决定动作,这引入了与任务无关的信息,容易导致冗余动作和更高的推理成本。我们提出进度感知信念更新(PABU),这是一个信念状态框架,通过显式建模任务进度并选择性地保留过去的动作与观察,来紧凑地表示智能体状态。在每一步,智能体预测自上一轮以来的相对进度,并决定是否存储新遇到的交互,使未来决策仅以保留的子集为条件。在AgentGym基准的八个环境中,使用相同的训练轨迹,PABU取得81.0%的任务完成率,比先前采用全历史信念的最先进(SoTA)模型高出23.9%。此外,PABU面向进度的动作选择提升了效率,将平均交互步数降至9.5,相当于减少26.9%。消融实验表明,显式进度预测与选择性保留对稳健的信念学习和性能提升都是必要的。
