论文

评估AI生成回复中的广告并为其定价

Evaluating and Pricing Advertisements in AI-Generated Responses

模型评测评测方法与指标

摘要

随着搜索日益转向由LLM驱动的答案引擎,广告正被嵌入生成回复本身,因此应同时从用户效用与商业价值两方面加以评估。关键挑战在于点击意图:行为日志不可得,人工标注难以校准,而前沿LLM裁判会将意图与语言流畅度混为一谈。这些缺口相互叠加:有原则的定价预设存在连续的意图信号,而生成这样的信号又预设了目前尚不存在的监督。我们通过一个有心理学依据的智能体仿真框架构建了缺失的监督,并将其蒸馏为一个参数高效的评估器,以平滑、可微的估计预测点击意图及广告质量的三个伴随维度。经符号确定的行为扰动验证,该评估器在相关性敏感度上超越前沿零样本裁判(79%对60-67%),能跟踪分级的内容退化,无误差地泛化到103个虚构产品,并在五名标注者的成对判断中有86%与人类偏好一致,且一致性随评估器置信度的上升而提高。在其估计之上,我们直接构建定价层,推导出使真实出价成为最优的唯一支付规则,在best-of-k分配上加以演示,并将该机制扩展到非单调分配。同一可微信号也可随时用作广告生成的训练目标。

评估AI生成回复中的广告并为其定价:论文配图
图 1:框架概述。由于缺乏可靠的点击意图监督(左),角色代理模拟会产生可重复的合成标签,并被提炼成共享瓶颈序数评估器(中),其连续输出驱动真实的拍卖定价和 Best-of-N 广告选择(右)。