论文
你的LLM法官有多虚伪? 大语言模型 语用能力中听者与说者的不对称
How Hypocritical Is Your LLM judge? Listener-Speaker Asymmetries in the Pragmatic Competence of Large Language Models
摘要
大语言模型 (LLM) 作为语言知识的存储库越来越受到研究。在这一领域的工作中,模型通常被评估为语言的生成者和语言输出的判断者,但这两个角色很少被检查彼此之间的直接关系。因此,目前尚不清楚一个角色的成功是否与另一个角色的成功一致。在本文中,我们通过比较 LLM 作为语用听者的表现,判断语言输出的适当性,以及作为语用说话者,生成语用适当的语言,来解决语用能力的问题。我们在三种实用设置中评估了多个开放权重和专有的 LLM。我们发现语用评估和语用生成之间存在明显的不对称性:许多模型作为听众的表现比作为演讲者的表现要好得多。我们的结果表明,在当前的 LLM 中,实用主义判断和实用生成的一致性很弱,需要更加综合的评估实践。