论文

WiC 不是 WSD:大语言模型和词汇歧义解决的研究

WiC is Not WSD: A Study on LLMs and Lexical Ambiguity Resolution

模型评测模型能力评测

摘要

尽管最近在词汇语义任务方面取得了进展,但上下文中的词(WiC)仍然对语言模型具有挑战性。我们假设这种困难不仅源于比较一个词的两种上下文用法,还源于缺乏指定相关语义粒度级别的明确意义清单。我们在类似的设置下评估 WiC 和传统词义消歧 (WSD) 的开放式大语言模型。我们发现,与传统 WSD 中所做的类似,提供候选感官可以提高所有设置中的 WiC 性能。一般来说,明确的感知信息有助于模型做出更加一致和有针对性的判断。人类评估进一步表明,许多明显的 WiC 错误反映了标签模糊性或模型与注释器意义边界之间的不匹配,而不是简单的词汇理解失败。特别是,结果表明,大语言模型过度考虑了意义区分,常常导致基于过于细粒度区分的错误。