论文

数据驱动的审查库存控制的情境学习

In-Context Learning for Data-Driven Censored Inventory Control

应用与实践结构化分析、预测与决策

摘要

我们通过依赖于决策的审查来研究库存控制,重点关注审查或重复的报童(R-NV),其中每个订单数量决定需求是否被销售充分观察或审查。基于参数汤普森采样(TS)的现有方法在先验不匹配的情况下可能很脆弱,而离线插补方法不需要转移到在线学习。受决策预测观点的推动,我们通过对潜在需求的学习完成情况采取预言行动来结合这些想法。我们提出了上下文生成后采样(ICGPS),它使用现代生成模型,这些模型经过离线元训练并通过上下文自回归生成在线部署。理论上,我们表明,具有学习完成内核的 ICGPS 的贝叶斯遗憾受到具有理想完成内核的 TS 基准的贝叶斯遗憾加上部署惩罚缩放($\sqrt{T}$ 乘以完成不匹配的平方根)的限制。这会产生一个插件模板,用于解决已知 TS 遗憾界限的操作问题。对于 R-NV,我们通过将审查反馈减少为强盗凸优化反馈来导出亚线性贝叶斯遗憾。我们还表明,在合理的覆盖范围和稳定性假设下,在线完成不匹配由离线审查的预测不匹配控制,因此离线预测质量转移到在线性能。实际上,我们使用 ChronosFlow 实例化 ICGPS,它将冻结时间序列 Transformer 主干与可训练的条件归一化流头结合起来,以实现快速审查一致采样。在基准实验中,ChronosFlow-ICGPS 正确匹配指定的 TS,优于近视和 UCB 型基线,并且对先前的不匹配和分布偏移具有鲁棒性。 ChronosFlow-ICGPS 对于现实世界的 SuperStore 数据集也表现良好,尤其是在严格审查的情况下。