论文

定价代理的市场调整风险:隐藏竞争对手状态下的追踪诊断和追踪先验强化学习

Market-Alignment Risk in Pricing Agents: Trace Diagnostics and Trace-Prior RL under Hidden Competitor State

模型训练强化学习

摘要

结果指标可以证明错误的行为。我们在两家酒店的收入管理模拟器中研究了这一失败,其中酒店 A 针对固定的基于规则的收入管理竞争对手酒店 B 来训练代理。标准学习代理可以获得接近参考的每间可用客房收入 (RevPAR),但无法学习类似市场的收益管理:它销售过于激进、价格下降或崩溃到模态价格区间。我们将其诊断为部分可观察性下的古德哈特式故障。酒店 A 无法观察竞争对手的剩余库存、预订曲线或定价规则,因此同一酒店 A 可见状态会映射到多个合理的酒店 B 价格。基于价值的确定性强化学习和确定性复制将这种未解决的不确定性转化为捷径行为。我们引入了使用 RevPAR、入住率、ADR、完整价格分布、L1/JS 距离和种子级置信区间的跟踪级诊断协议。经过验证的修复是 Trace-Prior RL:从滞后的市场轨迹中学习分配市场,然后训练随机定价策略,对学习的先验进行 RevPAR 奖励和 KL 惩罚。最终政策在种子级不确定性范围内匹配酒店 B 的 RevPAR、入住率、ADR 和价格分布,同时仍然优化酒店 A 自身的奖励。我们认为,贡献不是新的优化器,也不是酒店定价排行榜,而是代理系统的可重现的故障和修复配方,其中标量奖励很容易被操纵,预期行为仅在痕迹中可见。一个重要的发现是,当目标是分布式的时,更高的精确操作精度可能会恶化聚合跟踪对齐。