论文
DeliveryGym:以自适应课程训练长程配送规划的三维环境
DeliveryGym: An RL Environment for Long-Horizon Embodied Agent Planning with Adaptive Curriculum
摘要
可执行环境使 LLM 代理能够从其行为的后果中学习。对于实体代理来说,这些后果超出了当前任务是否成功的范围:完成交付可能会消耗后续工作所需的时间、精力或金钱。因此,学习计划需要能够保留这些依赖性并将其转化为整个轨迹的反馈的环境。我们推出了 DeliveryGym,这是一个用于评估和训练配送智能体连续班次的 3D 环境。它将多模式工具交互与持久的世界动态结合起来,并计算模拟器事件的轨迹奖励,使代理决策的成本可用于强化学习(RL)。该环境还使未来的训练转变适应政策观察到的弱点,同时保持评估固定。在 6 个模型和 13 个城市地图中,评估揭示了可靠执行分配的交付与轮班工作选择和排序之间的差距。在固定测试套件上,RL 将 Qwen3-VL-4B 的净利润提高了 54.3%,这表明从完整班次中学习可以提高这些耦合约束下的性能。在相同的部署预算下,调整训练环境比统一抽样提高了 16.5% 的测试收入,这表明代理练习的情况也很重要。 DeliveryGym 提供了一个可执行设置,用于研究代理如何学习协调交付并为剧集中的后续订单保留资源。