论文
用更少的词元做更多的事情:高效编码Agent的分层强化学习
Doing More with Less Tokens: Hierarchical Reinforcement Learning for Efficient Coding Agents
摘要
最近,编码Agent已成为现实世界软件工程(SWE)场景的主导范例,它通过与开发环境的多轮交互来解决复杂的任务。然而,与环境的频繁交互将不可避免地引入大量的词元开销,导致高昂的使用成本和延迟。尽管最近的研究已经探索通过上下文操作和推理时的交互限制来减少词元使用,但这些方法侧重于提高词元效率,而忽视了丢弃任务相关信息的风险,从而难以平衡解析率和词元效率之间的权衡。在本文中,我们研究了一种不受限制的更通用的范式,即训练具有良好解析性能的词元高效编码Agent,这是一个高度实用但较少探索的问题。为此,我们揭示了 SWE 场景中的两个核心观察结果: i)效率变化:可以用更少的词元实现成功的解决; ii) 熵相关性:非生产性行为与回合级熵相关。受观察的启发,我们提出了一种新颖的强化学习框架,称为 HERO。具体来说,HERO 在策略优化期间优先考虑任务解决而不是词元效率,并鼓励在轨迹和转弯级别上使用高效的推理模式。在 SWE-bench Verified 和 SWE-bench Multilingual 上进行的大量实验表明,与最先进的编码Agent和强化学习方法相比,HERO 在解决率和词元效率之间实现了有利的权衡。