论文
基准测试大语言模型的个性化能力
Benchmarking the Personalization Capabilities of Large Language Models
摘要
个性化——在保持发送者、渠道与时间不变的情况下,变化讯息以诱发特定接收者的行动——在心理学与营销中作为发送者与接收者目标独立的双方问题有悠久传统。大语言模型经生成以推断的接收者状态为条件的连续讯息变体,移除了经典检索排序方法的有界库存约束,引出问题:当前模型在经典意义上的个性化表现如何。现有LLM个性化基准测量发送者侧适配——接收者就是模型正在服务的同一用户。双方问题——生成的讯息是否在第三方身上诱发预期行动——此前只经A/B测试与无法按需对新模型重跑的小规模人类研究考察。我们把Kamenica与Gentzkow(2011)的贝叶斯说服框架适配到生成式智能体,并在销售场景实例化——该场景中接收者行动例行地与诱发它的外联一并记录。我们发布SDR-Bench:一个含6,279个跨22个行业、约200家企业的客户成功案例的公开语料,经时间受限仿真服务以防未来数据泄漏。跨前沿LLM与深度研究智能体,我们观察到一致的个性化平台期;在一个财富100强科技公司群组上,没有任何模型能在统计上把成功与失败的外联区分开。与12名专业销售代表的现场部署验证了该框架:48%的模型生成内容被评为立即可用,资深专家一致性达Pearson 0.82。我们公开发布SDR-Arena与SDR-Bench,支持大规模生成式个性化的可复现研究。
