技术实践

淘天以策略正则化强化学习部署库存补货

应用与实践模型训练强化学习行业应用结构化分析、预测与决策

概述

淘天团队用端到端 DRL 替代工业界「先预测再决策」的两阶段范式(其性能上限受制于需求预测精度,且报童模型等对需求分布的强假设在促销、季节性、社媒趋势、供应链波动等高维上下文下难以满足)。针对 DRL 落地的四大挑战(黑箱不可解释、电商可用数据有限导致「大数据+大模型+大算力」路线失效、超参数敏感、学术界的成本奖励与工业界缺货率/周转天数指标错配),提出策略正则化:把订货量约束为 Base Stock 形式(订货量 = 神经网络学到的目标库存水平 − 当前总库存含在途)以及 Coefficients 形式(订货量表示为近期/远期 4 个历史与预测需求特征加常数偏置共 5 项的线性组合,系数由神经网络生成),直接限制策略空间而非在目标函数加惩罚项。 训练上以终止态整段周期指标做较大奖惩、其余 reward 为 0,并引入 shaping reward 在中间检查点给小惩罚信号,状态中拼接时间与历史进销存信息。评估用缺货率损失与周转时间损失的加权组合,通过工业级仿真环境做超参调优(田口实验)。离线对照实验显示:可微分仿真器 DS 在样本内表现优但存在严重过拟合与样本效率低下(轨迹有限时测试损失差距约 8%),带正则化的 DDPG/PPO 训练更快且最终优于 DS。 落地节奏为 2024 年 7 月在 10% 高潜力国际 SKU 试点(双重差分:缺货率降低 0.83%、周转天数减少 9.53 天)→ 2025 年 4 月推广至 100% 国际 SKU 与 87% 国内 SKU(反事实仿真:缺货率无明显差异下周转降低 1-2 天)→ 2025 年 10 月 100% 全量部署,覆盖天猫超市、国际直营等自营业务超 100 万个 SKU-仓库对。 2025 年 7-8 月国际 SKU 平均周转时间较 2024 年同期大幅减少 20% 而缺货率未恶化。整体在有货率保持稳定前提下库存周转天数优化 7%,每 50 亿库存规模年化减少库存货值 3.5 亿元、降低库存持有成本约 1500 万元。得益于策略正则化实现了单一模型适配所有品类、无需按品类分组训练。