论文
Elastic Horizon:Agent强化学习的有效交互时域
Elastic Horizon: Discovering the Effective Interaction Frontier in Agentic Reinforcement Learning
摘要
扩展交互范围(每集环境交互的最大数量)可以改善 LLM 智能体在长期任务上的表现,并且基于课程的方法逐步扩展范围,其性能优于固定范围替代方案。然而,现有的计划是开环的:它们单调地增加范围,直到手动指定的最大值,没有机制来检测进一步的扩展何时停止帮助。我们提出有效交互前沿假设:一个动态边界,超出该边界,额外的交互会产生收益递减,而成本线性增长。然后,我们介绍 Elastic Horizon,这是一个闭环控制器,可通过成功轨迹长度的第 90 个百分位来跟踪此边界。在 AppWorld 和 BFCL 上,固定水平扫描显示出明显的饱和平台; Elastic Horizon 可以在容量初始化不足和容量过剩的情况下稳定饱和带内的地平线,在 7B 和 14B 主干上获得最佳成功率,并节省高达 25% 的每步轨迹Token。我们的工作将范式从如何扩展交互范围转变为何时停止扩展。