论文

LLM 抽象意义理解的困难超出预期

LLMs Struggle with Abstract Meaning Comprehension More Than Expected

模型评测模型能力评测

摘要

理解抽象含义对于高级语言理解至关重要。尽管进行了广泛的研究,抽象词由于其非具体的高级语义而仍然具有挑战性。 SemEval-2021 任务 4 (ReCAM) 通过以完形填空形式呈现带有问题的段落和五个抽象选项,评估模型解释抽象概念的能力。主要发现包括:(1)大多数 大语言模型(LLM),包括 GPT-4o,在零样本、单样本和少样本设置下难以理解抽象意义,而像 BERT 和 RoBERTa 这样的微调模型表现更好。 (2) 受人类认知策略启发,提出的双向注意力分类器通过动态关注段落和选项来增强微调模型。这种方法将任务 1 的准确性提高了 4.06%,将任务 2 的准确性提高了 3.41%,展示了其抽象意义理解的潜力。