论文

超越动作模仿:学习用于在线广告的决策感知用户模拟器

Beyond Action Imitation: Learning a Decision-Aware User Simulator for Online Advertising

模型评测基准与评测资源

摘要

基于 LLM 的用户模拟的最新进展已显示出推荐和广告系统离线评估的前景。然而,现有的模拟器通常从单域交互历史中推断用户偏好,并且主要经过优化以重现可观察的操作(例如点击)。因此,它们仅捕获用户偏好的部分视图,而仅动作预测很容易导致模型捷径并限制模拟的保真度和诊断价值。为了应对这些挑战,我们提出了 DASH,这是一种决策感知用户模拟器,可以共同生成思维轨迹并根据异构跨域历史预测行为动作。 DASH 首先引入了上下文工程阶段,该阶段将异构跨域历史折叠到决策相关上下文中,并进行即时优化,以对折叠上下文进行有效推理。为了训练用户模拟器,DASH 从强大的 LLM 中提取思维轨迹作为 SFT 数据,并进一步定制基于标题的奖励模型,该模型根据形式、内容和逻辑来评估 RL 训练的思维轨迹。这些信号与动作奖励相结合,共同提高动作预测和思维质量。对跨越五个异构内容领域的真实腾讯广告数据进行的大量实验证明了 DASH 的有效性、效率、保真度和诊断价值。