论文

从高召回到可用结果:LLM客户意图提取的自适应后处理

From High Recall to High Utility: Dataset-Adaptive Post-Processing of LLM-Generated Customer Intents

上下文与知识应用与实践知识获取与更新行业应用

摘要

大型语言模型可以从异构企业数据中提取有用的信号,但高召回率提取通常会产生重复、粒度不均匀、语义重叠或数量过多而无法有效使用下游系统和人工审阅者的输出。我们提出了一种为客户意图提取(CIE)开发的数据集自适应后处理架构,其中非结构化客户语言被转换为稳定、可追踪的意图单元。该方法将面向召回的提取与面向效用的缩减分开。特定源的预处理首先从多模式计划、稀疏运营记录和结构化机会数据中分离出证据。然后对候选意图进行标准化和去重,可选地用用于嵌入计算的元数据进行丰富,在共享语义向量空间中表示,并使用根据候选集的特征选择的聚类策略进行分组。集群级关键字提供了可解释性层,而单例重新分配需要嵌入和关键字相似性之间达成一致。最后,受约束的语言模型聚合为每个集群生成一个简洁的意图,而不会引入不受支持的概念,并且生成的单元保留出处、集群、嵌入和生成元数据。这不会将后处理视为表面清理,而是将高召回率 LLM 输出转换为可重用企业智能的语义缩减层。我们还描述了两个下游应用程序:机器生成的意图,它推断缺乏来自具有相似配置文件的同行客户的直接证据的客户的可能目标,以及意图引导的语义检索和映射,它使用稳定的意图作为针对下游决策空间的查询,这里通过将客户意图映射到业务结果来说明。

从高召回到可用结果:LLM客户意图提取的自适应后处理:论文原图
图 1:端到端运营模型。特定源的准备工作可以保留证据,而通用的后处理层可以将高召回率候选意图转换为稳定的输出。