论文
DARA:经强化学习微调LLM上下文决策的在线广告少样本预算分配
DARA: Few-shot Budget Allocation in Online Advertising via In-Context Decision Making with RL-Finetuned LLMs
摘要
在 AI 生成竞价(AIGB)范式下,在预算约束下优化广告主赢得曝光的累积价值是在线广告中的复杂挑战。广告主往往有个性化目标但历史交互数据有限,形成传统强化学习(RL)方法难以奏效的少样本场景。大语言模型(LLM)凭借上下文学习能力从有限数据泛化,为 AIGB 提供有前景的替代,但缺乏细粒度优化所需的数值精度。为解决这一局限,我们提出 GRPO-Adaptive,一种高效的 LLM 后训练策略,通过在训练期间动态更新参考策略来同时增强推理与数值精度。在此基础上,我们进一步提出 DARA,一个新颖的两阶段框架,把决策过程分解为:通过上下文提示生成初始方案的少样本推理器,以及利用反馈驱动推理精炼这些方案的细粒度优化器。这一分离使 DARA 得以结合 LLM 的上下文学习优势与 AIGB 任务所需的精确适配能力。在真实与合成数据环境上的大量实验表明,我们的方法在预算约束下的累积广告主价值上持续优于现有基线。
