2026年英语词义消歧:当标签成为瓶颈
English Word Sense Disambiguation in 2026: When the Labels Become the Bottleneck
摘要
在英语全词词义消歧(WSD)中,标签,而不是模型,已经成为瓶颈:前沿大语言模型足够准确,黄金标准中存在的错误决定了基准排名——在我们评分的测试集中,以及我们训练的语料库中,正如我们因果关系所示。我们发布了 lexEN,一个 WSD 评估基准,作为 Maru2022 的 ALL_NEW 基准(更改了 211 个标签,删除了 56 个标签)之上的保守的、人工裁决的校正层,以及 SenseBench,一个可审计的 LLM WSD 评估工具和实时排行榜(57 个模型,192 个运行)。该任务是库存受限的多项选择(模型从提供的 WordNet 语义中进行选择),因此报告的准确性是模型在没有帮助的情况下实现的上限。在 lexEN-v1 上,前沿大语言模型收敛率接近 95%(最好为 95.6%),前三个家族在统计上无法区分,并且在约 2,500 倍的价格范围内,准确性与推理工作和成本之间存在权衡。使用前沿模型重新标记 SemCor 并重新训练 BEM、ESCHER 和 ConSeC 不变,将它们在重新标记从未触及的测试集上提升了几个 F1 点;我们发布了重新标记的语料库和 Glite LENS,这是一个在修复后的标签上训练的 298M 双编码器——据我们所知,最强的报告(83.6 Raganato ALL,87.4 Maru ALL_NEW)——服务价格约为每百万件商品 0.13 美元。在困难项目上,即使对于专家来说,细粒度的 WordNet 语义也有部分不适定(三位审稿人 Fleiss kappa=0.537);粗化同时提高了四个清单中的注释器一致性和模型准确性,将顶部模型置于粗粒度的专家一致性带内(在统计上相当于四分之三),但在精细粒度下明显低于专家一致性带。现在的约束约束是成本。