论文

情绪分析看不到的内容:在 70,000 次支持对话中衡量客户是否得到了帮助以及出了什么问题

What sentiment analysis can't see: Measuring whether customers were helped, and what went wrong, across 70,000 support conversations

模型评测评测方法与指标

摘要

大多数公司使用情绪分析来大规模读取客户支持数据,情绪分析衡量客户的声音,而不是他们对结果是否满意。我们在领先的在线筹款平台的 70,450 个支持对话中测试了更丰富的替代方案:除了语气之外,我们还使用 GPT-5.4 来估计每个客户的满意度并标记他们是否报告了具体问题,然后根据客户在他们评分的对话中留下的 1 到 5 的评分来验证所有三个读数。满意度估计比情绪更好地跟踪这些评级,相关性为 0.47 比 0.36,并且以少得多的误报来标记不满意的客户。结构化阅读还看到了情感所看不到的东西:44% 的对话中语气和满意度不一致,一个“中立”标签隐藏了从安静满意的客户到悄悄放弃的所有内容,其中最大的一组是“容忍的摩擦”,即满意但仍然报告可解决问题的客户,这是任何基于情感的仪表板都无法揭示的长期问题。更广泛的发现是,基于 LLM 的注释可以捕获的不仅仅是客户语言的语气,还为基于客户状态(是否满意)以及直接从交互和反馈的原始文本数据中提取的问题原因的新业务指标提供了强大的潜力。