论文

从环境反馈中学习:代理强化学习的跨多个时间尺度的信用分配

Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning

模型训练强化学习

摘要

在现实环境中,代理强化学习(RL)经常会受到延迟和稀疏奖励的影响。解决这一挑战的一个有前途的解决方案是信用分配,其目的是分解轨迹级奖励并为中间决策提供更细粒度的监督。然而,现有的信用分配方法忽略了环境交互过程中自然生成的丰富过程信息,例如交互历史记录。我们认为,此类信息为识别个人行为的贡献提供了有价值的监督。为此,我们提出了基于环境反馈的信用分配(EFCA),这是一种用于长期代理强化学习的多时间尺度信用分配方法。 EFCA 通过两个基于环境的过程信号来补充长期结果信号:一个是捕获当前行动的直接影响的短期反馈信号,另一个是从最近的交互中识别无效模式的中期状态历史信号。这两个信号都是直接从环境反馈中提取的,并通过返回重新加权机制进行集成。 ALFWorld 和 WebShop 上的实验表明,EFCA 在强基线上持续提高任务成功率和任务质量,突出了基于环境的多时间尺度信用分配对于长期代理 RL 的有效性。