论文
学习员工:离线强化学习和微调 LLM 用于仓库人员配置优化
Learning to Staff: Offline Reinforcement Learning and Fine-Tuned LLMs for Warehouse Staffing Optimization
摘要
我们研究机器学习方法,以优化半自动仓库分拣系统中的实时人员配置决策。运营决策可以在不同的抽象级别上得到支持,并进行不同的权衡。我们评估两种方法,每种方法都在匹配的模拟环境中进行。首先,我们使用离线强化学习对详细的历史状态表示来训练基于 Transformer 的自定义策略,与学习模拟器中的历史基线相比,吞吐量提高了 2.4%。在大容量仓库运营中,这种规模的改进可以带来显着的节省。其次,我们探索 LLM 在抽象的、人类可读的状态描述上运行。这些非常适合仓库经理使用高级操作摘要做出的决策。我们系统地比较了提示技术、自动提示优化和 微调 策略。虽然单独的提示被证明是不够的,但受监督的 微调 与模拟器生成的偏好的直接偏好优化相结合,实现了与手工制作的模拟器中的历史基线相匹配或略微超过的性能。我们的研究结果表明,这两种方法都为人工智能辅助运营决策提供了可行的途径。离线强化学习在特定于任务的架构方面表现出色。 LLM 支持人类可读的输入,并且可以与可纳入经理偏好的迭代反馈循环相结合。