论文
针对长期工具使用代理任务的高效强化学习
Efficient Reinforcement Learning for Long-Horizon Tool-Use Agentic Tasks
摘要
使用长期工具的代理必须对用户目标、域策略、工具调用、模拟器状态和延迟的可验证奖励进行推理。强化学习 (RL) 非常适合这种设置,但多轮 同策略执行轨迹会创建较长的上下文,而特定于模型的注意力层可能需要自定义掩模和学习到的注意力汇聚点标准化。我们推出了 SINKFLEX-RL,这是一种在双控制工具使用环境中用于强化学习的模块化训练系统。该系统结合了 Gymnasium 兼容的环境包装器、VERL 风格的轨迹采样数据流、无需单独价值模型的组相关策略优化,以及旨在在因果和滑动窗口掩码下保留模型特定接收器扩展的接收器感知 FlexAttention 路径。在初步的 Tau2Bench 零售运行中,验证奖励 (mean@1) 从训练早期的 0.25 美元上升到观察训练窗口后期的 0.44 美元,而训练得分和轨迹奖励代理也呈上升趋势。在固定配置内存基准测试中,优化的注意力路径在 4096 个词元时将峰值 VRAM 从 28.06GB 减少到 22.52GB,减少了 19.7%$,并使用 25.53$~GB 运行测量的 8192 个词元配置,其中急切基线耗尽了内存。这些结果说明了集成环境接口、强化学习数据流和注意力内核设计对于记忆可行的长视野智能体训练的价值。