论文

像火箭科学一样简单:评估 大语言模型 用比喻语言解释否定的能力

As Easy as Rocket Science: Assessing the Ability of Large Language Models to Interpret Negation in Figurative Language

模型评测基准与评测资源

摘要

比喻语言和否定是挑战当前语言模型的两个领域,然而,两者都在书面和口语中广泛使用。 大语言模型 (LLM) 也广泛用于日常环境中,它们不一定能够针对特定数据集进行调整。因此,了解 LLM 正确解释包含否定和比喻语言的文本的能力至关重要。为了研究这一点,我们为现有的比喻语言数据集开发了一组新注释,并在数据集上测试了一系列语言模型。我们发现否定和比喻的组合可能会带来特殊的挑战,并且不同否定类型的整体性能特别取决于所使用的提示风格。