论文
选择用于零样本意图分类的开放权重语言模型:对 41 个模型的系统评估
Selecting Open-Weight Language Models for Zero-Shot Intent Classification: A Systematic Evaluation of 41 Models
摘要
意图分类是面向任务的对话系统的核心组成部分,但实践者在计算、延迟和鲁棒性约束下选择可部署的开放权重语言模型的系统指导有限。我们对跨越 15 个家族的 41 个开放权重语言模型和八个英语单标签意图分类数据集的 135M--9B 参数范围进行了系统的零样本评估。第九个数据集 ATIS 使用五个标记的演示,并报告为辅助五次结果。评估包括标准基准、大规模语音助手语料库和生产衍生的电子商务数据集。除了精确匹配精度之外,我们还分析置信度校准、对实际输入扰动的鲁棒性、模型排名的统计可靠性、部署效率和基准饱和度。我们的结果表明,指令调整的 3B 模型可以优于几个经过评估的 7B 基本模型,MASSIVE 上的领先模型之间的差异在成对 McNemar 测试下在统计上无法区分,并且广泛使用的基准(例如 SNIPS)已经饱和,不再有意义地区分当前的开放权重模型。指令调整对置信度校准的影响是不一致的,而不是一致有害的。这些发现为选择和评估用于意图分类的开放权重语言模型提供了实用指导。