论文

LLM 作为会话商务中业务成果判断标准的有效性

Criterion Validity of LLM-as-Judge for Business Outcomes in Conversational Commerce

模型评测评测方法与指标

摘要

基于多维标准的对话评估被广泛用于评估对话式人工智能,但其标准有效性——质量分数是否与其要服务的下游结果相关——仍然很大程度上未经测试。我们通过对中国主要婚介平台进行两阶段研究来解决这一差距,根据经过验证的业务转换测试 7 维评估标准(通过 LLM-as-Judge 实施)。我们的研究结果涉及评分标准设计和权重,而不是 LLM 评分准确性:任何使用相同评分标准的法官都会面临相同的结构问题。核心发现是维度层面的异质性:在第 2 阶段(n=60 个人对话、分层样本、经过验证的标签),需求启发(D1:rho=0.368,p=0.004)和节奏策略(D3:rho=0.354,p=0.006)与 Bonferroni 校正后的转换显着相关,而情境记忆(D5:rho=0.018,n.s.)未显示出可检测到的关联。这种异质性导致等权重复合 (rho=0.272) 的表现低于其最佳维度——转换通知的重新加权部分纠正了复合稀释效应 (rho=0.351)。控制会话长度的逻辑回归证实 D3 的关联性增强(OR=3.18,p=0.006),排除了长度混淆。最初的试点(n = 14)混合了人类和人工智能对话,产生了误导性的“评估结果悖论”,第二阶段将其揭示为代理类型的混淆工件。通过信任漏斗框架对 130 个对话进行行为分析,确定了一种候选机制:人工智能代理在不建立用户信任的情况下执行销售行为。我们在三层评估架构中实施这些发现,并提倡标准有效性测试作为应用对话评估的标准实践。