论文
重温脖子上的痛:语言模型的语义推理基准
Revisiting a Pain in the Neck: A Semantic Reasoning Benchmark for Language Models
摘要
我们推出了 SemanticQA,这是一个评估套件,旨在评估语义短语处理任务中的语言模型 (LM)。该基准整合了现有的多词表达(MwE)资源,并将它们重新组织成一个统一的测试平台。它既涵盖了一般词汇现象(例如词汇搭配),也涵盖了三个细粒度类别:惯用表达、名词复合词和动词结构。通过 SemanticQA,我们在提取、分类和解释任务以及顺序任务组合中评估不同架构和规模的语言模型。我们揭示了显着的性能变化,特别是在需要语义推理的任务上,突出了 LM 的推理功效和语义理解方面的差异,为推动 LM 对重要语义短语有更强的理解提供了见解。 SemanticQA 的评估工具和数据可在 https://github.com/jacklanda/SemanticQA 获取。