论文
HOBA:面向自适应在线广告的层级化在线策略竞价智能体
HOBA: Hierarchical On-Policy Bidding Agents for Adaptive Online Advertising
摘要
在线广告竞价系统通常部署多个离线训练的专家模型(如PID控制器、模型预测控制、离线RL策略),但面临两个关键局限:一是缺乏对非平稳拍卖市场的在线适应能力,二是依赖对出价边界和预算节奏约束等超参数的高成本人工调优。我们提出HOBA(Hierarchical On-policy Bidding Agents),一个在三个时间尺度上解耦战略推理、模型选择和出价执行的层级强化学习框架。在高层,一个大语言模型通过带历史经验检索的思考-行动-观察-反思循环,从上下文信号推断超参数。在中层,一个SARSA智能体在专家模型之间动态选择,并引入因果调整以消除选择偏差。在低层,一个动态专家池(PID、MPC、IQL、Decision Transformer)在高层约束下执行出价。这一设计将在线学习限定在离散的专家选择而非连续的出价优化上,在保持适应性的同时显著降低了探索风险。在AuctionNet基准上的实验和大规模A/B测试表明,该方法相对最先进的基线取得了一致的改进。在大规模在线部署中,HOBA创造了可观的业务价值,实现目标成本+3.6%的提升,证明了我们层级化多智能体竞价范式的有效性。
