论文
高效机器学习工程Agent的奖励率策略梯度
Reward-rate Policy Gradient for Efficient Machine Learning Engineering Agents
摘要
传统的强化学习 (RL) 技术侧重于最大化预期累积奖励,其中每个动作都假设花费恒定的时间单位。然而,这种假设并不适用于 Agentic RL 任务,例如机器学习工程 (MLE) Agent,其中的操作涉及数据加载、特征工程和模型训练,且持续时间可变。在现代 Agentic RL 中,效率很重要,因为行动的成本很高。为了解决这个限制,我们采用连续时间强化学习和半马尔可夫决策过程(SMDP)公式,并提出奖励率策略梯度(RPG),其中我们专注于优化奖励率——单位时间的长期奖励。 RPG 根据非策略样本估计奖励率,然后根据每个操作按该比率消耗的时间收费。我们首先在强盗环境中进行理论分析,以确定 RPG 接近最优奖励率,并凭经验证明它优于基线,同时避免对策略空间进行枚举,这是现有方法的一个已知问题。然后,我们进一步将 RPG 应用于具有自我改进循环的小语言模型(Qwen3.5-4B)上,并根据经验表明,在 MLE-Bench 和 NanoGPT 上,它在固定时间预算内比普通 RL 获得了更高的奖励,分别为 19.2% 和 85.7%。我们的方法提供了一种实用的解决方案,可以在现代 Agentic RL 任务中考虑等待时间来优化性能,其中操作与外部环境交互并消耗时间。