论文

HOBA:面向自适应在线广告的层级化在线策略竞价智能体

HOBA: Hierarchical On-Policy Bidding Agents for Adaptive Online Advertising

应用与实践模型训练上下文与知识强化学习记忆行业应用Agentic RLAgent记忆

摘要

在线广告竞价系统通常部署多个离线训练的专家模型(如PID控制器、模型预测控制、离线RL策略),但面临两个关键局限:一是缺乏对非平稳拍卖市场的在线适应能力,二是依赖对出价边界和预算节奏约束等超参数的高成本人工调优。我们提出HOBA(Hierarchical On-policy Bidding Agents),一个在三个时间尺度上解耦战略推理、模型选择和出价执行的层级强化学习框架。在高层,一个大语言模型通过带历史经验检索的思考-行动-观察-反思循环,从上下文信号推断超参数。在中层,一个SARSA智能体在专家模型之间动态选择,并引入因果调整以消除选择偏差。在低层,一个动态专家池(PID、MPC、IQL、Decision Transformer)在高层约束下执行出价。这一设计将在线学习限定在离散的专家选择而非连续的出价优化上,在保持适应性的同时显著降低了探索风险。在AuctionNet基准上的实验和大规模A/B测试表明,该方法相对最先进的基线取得了一致的改进。在大规模在线部署中,HOBA创造了可观的业务价值,实现目标成本+3.6%的提升,证明了我们层级化多智能体竞价范式的有效性。

HOBA:面向自适应在线广告的层级化在线策略竞价智能体:论文配图
图 1. HOBA 三层架构概述。高级 LLM 代理(小时周期)通过 Think-Act-Observe-Reflect 生成超参数 𝜽t\boldsymbol{\theta}_{t};中级SARSA智能体(分钟周期)选择具有因果调整的专家模型aτa_{\tau};低级专家池(每次拍卖)使用固定策略执行出价 bτb_{\tau}。在线学习仅限于中级选拔,确保安全适应。