论文
卖得更多,玩得更少:对标 LLM 现实销售技巧
Sell More, Play Less: Benchmarking LLM Realistic Selling Skill
摘要
销售对话需要在不对称激励下进行多轮、目标导向的说服,这对 大语言模型 (LLM) 来说是一个具有挑战性的环境。然而现有的对话基准很少衡量交易进展和结果。我们引入了 SalesLLM 基准,这是一种双语 (ZH/EN) 基准,源自涵盖金融服务和消费品的实际应用程序,由 30,074 个脚本配置和 1,805 个精心策划的多回合场景构建,具有可控的难度和角色。我们提出了一个全自动评估管道,它结合了(i)用于销售流程进度的 LLM 判断,以及(ii)用于对话结束购买意图的微调 BERT 分类器。为了提高模拟保真度,我们使用 SFT 和 DPO 在 8,000 多个众包人员参与的销售对话中训练用户模型 CustomerLM,将角色倒置从 17.44% (GPT-4o) 减少到 8.8%。 SalesLLM 基准分数与人类评分密切相关(平均 Pearson r=0.86;注释者间协议 Krippendorff 的 alpha=0.86,每个模型 500 个注释)。在 15 个主流 LLM 中,在中文中,最强的模型与典型的(初级到中级)人类销售人员竞争,而不是与销售专家竞争,而较弱的模型则低于此基线,并且跨语言一致性仍然很差。 SalesLLM 基准是面向结果的销售代理的可扩展基准。我们的代码和数据发布在https://github.com/Bairong-Xdynamics/Benchmarking-LLM-Realistic-Selling-Skill