论文

LLM何时取代Fine-Tuned NLU?生产对话系统中意图检测的决策框架

When Do LLMs Replace Fine-Tuned NLU? A Decision Framework for Intent Detection in Production Conversational Systems

模型评测模型能力评测

摘要

一个常见的说法是零样本 大语言模型 (LLM) 可以取代微调的 NLU 分类器进行意图检测。我们对这一说法进行了正面检验,发现诚实的答案是:这取决于意图空间。在完整的 ATIS 和 CLINC150 上,我们比较了微调的 RoBERTa、TF-IDF+逻辑回归基线、句子嵌入 kNN 和 Claude Haiku 零样本,报告 bootstrap 95% 置信区间和配对显着性检验。当存在丰富的域内标签时,经过微调的 RoBERTa 同样好或更好,而且成本便宜且速度快三个数量级:在 ATIS 上,它比 Claude 零样本高出 11.8 个点(95.9 vs. 84.1,p<0.001)。在广泛的 150 个意图 CLINC150 模式上,两者在统计上是相关的(89.1 vs. 88.5,p=0.24):LLM 与没有训练数据的完全监督模型匹配。 LLM 的优势体现在三个与生产相关的领域:超出范围的检测(OOS 召回率 85.6,RoBERTa 为 58.1);通过受控的文本转语音到 Whisper 管道的噪声,对真实 ASR 噪声具有鲁棒性(0 dB 时为 92.5 比 80.0);以及动态的每次部署模式,其中针对一个应用程序的意图进行训练的分类器在新应用程序的意图上得分为 0%,而模式提示的 LLM 在零再训练的情况下均达到约 94%。我们将这些发现提炼为从业者的决策框架。