论文

LLMAdBench:LLM 回答中广告的人类偏好基准

LLMAdBench: A Human Preference Benchmark for Advertising in LLM Responses

模型评测评测方法与指标

摘要

将广告(广告)插入到面向消费者的 LLM 输出中正在成为一种新的商业模式,但关于如何评估此类广告插入或它如何影响用户偏好,几乎没有共同的证据。我们引入了LLMAdBench,这是一个人类偏好基准,用于研究LLM生成内容中的广告。该基准隔离了一个简单但实​​际上很重要的决定:给定用户对话、LLM 响应和匹配的广告,广告应该放置在哪里?我们的数据集比较仅广告位置不同的响应对,同时保持所有其他条件固定,包括用户查询、基本答案、广告和披露条件。人类注释者从广告商和用户的角度根据六个标准评估每一对。由此产生的基准包含针对两种披露条件的 18000 多个人类判断:明确将广告标记为赞助并将其合并到响应中而不披露。我们使用 LLMAdBench 作为偏好评判者来评估八个前沿LLM,发现它们并不能可靠地替代人类评估。当呈现顺序交换时,即使是最稳定的模型也会改变大约四分之一的决策,模型之间的一致性很低,并且它们的放置偏好与人类注释者的放置偏好存在系统性差异。此外,LLMAdBench 包含大量可学习信号。特别是,根据人类偏好进行微调的 Qwen3-8B 模型比其基本模型有了显着的改进,并且在保留的预测任务上优于所有零样本前沿评审。除了模型评估之外,LLMAdBench 还提供了广告商与用户权衡的定量证据,并表明赞助信息披露会系统地改变用户对广告投放的偏好。