论文

容易完成,难以选择:在 ProverbIT 基准上调查 LLM 性能

Easy to Complete, Hard to Choose: Investigating LLM Performance on the ProverbIT Benchmark

模型评测基准与评测资源

摘要

大语言模型 (LLM) 已经改变了计算语言学,并在众多自然语言处理任务中取得了卓越的性能,但在理解这些系统如何处理嵌入文化的语言表达方面仍然存在巨大差距。本文介绍了 ProverbIT,这是一种新颖的意大利基准测试,包含 100 个多项选择题,旨在评估 LLM 完成意大利谚语的能力。我们评估了 13 个前沿模型,包括大型推理模型 (LRM) 和传统的 LLM,涉及三个任务:谚语完成、有正确答案的多项选择和没有正确答案的多项选择。我们的评估揭示了令人惊讶的结果:虽然几乎所有模型都通过成功完成任务展示了对谚语的了解,但在没有正确答案的情况下转换为多项选择格式时,性能急剧下降,甚至最先进的推理模型也显示出大幅退化。通过对两个 LRM 的详细思想链分析,我们发现模型对选择字面同义词表现出强烈的偏见,并且在推理过程中经常提到正确的谚语结尾,但没有成功地识别出它们在给定选项中的缺失。这些发现表明,当前的 LLM 严重依赖于记忆的模式,而不是对基于文化的表达的更深入的语义理解,突显了它们在比喻语言理解的推理能力上的重要局限性。