设备上命名实体识别:准确性、成本、可靠性和置信度的可部署性研究
On-Device Named-Entity Recognition: A Deployability Study of Accuracy, Cost, Reliability, and Confidence
摘要
设备上越来越需要命名实体识别 (NER)(无 API、低延迟、数据保存在本地)。从业者的问题不是排行榜,而是哪个模型是可部署的,如何在没有人工注释的情况下对其进行评估,以及其置信度是否可信。我们共同回答这些问题。我们在三个不同特征的数据集上放置了跨三个范式和 13 M 到 8 B 参数的 9 个系统:经典标记器 (spaCy)、双向编码器专家 (GLiNER,166 到 460 M) 和本地运行的生成 LLM (Qwen3-0.6B/1.7B/4B-Instruct、DeepSeek-R1-1.5B/8B),并报告准确性以及文献中的两个轴省略:延迟和输出有效性。因为我们的语料库(RSS-新闻)没有黄金,所以我们从跨家庭大语言模型评审小组中构建了银金,然后根据基准金衡量其保真度,并对语料库进行全面的人类重新验证(严格的 F1 0.95,这是人类黄金是银种子的上限);黄金出处翻转了范式排名,从大语言模型创作的白银转向人类黄金,提高了每个编码器并降低了每个生成模型。仅就准确性而言,4 B 指令 LLM 具有竞争力(它在干净的新闻专线上领先),因此编码器的情况是可部署性:它与大小的九分之一到二十四分之一匹配或略有落后,延迟为毫秒到秒,格式错误的输出为零,而最小的生成模型在长输入上发出高达 27% 的无效输出,这是由规模而不是输出预算修复的故障。然后,我们描述 GLiNER 的每跨度置信度:它对正确性的排名很好(AUROC 0.76 到 0.86),但过于自信(ECE 0.24 到 0.47,因温度缩放而减半);阈值化给出了一个小的诚实的样本外 F1 增益;与成本匹配的随机路由相比,全本地从小到大级联提供了适度的、依赖于语料库的增益;信心跟踪正确性,但不跟踪新颖性。每个数字都会根据每个范围的记录离线重新计算。