论文
FrameBench:基于框架语义的语言理解基准
FrameBench:A Language Understanding Benchmark Based on Frame Semantics
摘要
在框架语义学中,假设句子理解是通过将词汇意义与称为语义框架的背景知识联系起来进行的,从而使读者能够用未陈述的信息隐式地丰富文本。最近的 大语言模型 (LLM) 在广泛的下游任务中取得了强劲的性能。然而,目前尚不清楚它们是否能够重现人类在理解过程中自然产生的隐性丰富。为了解决这个问题,我们引入了 FrameBench,一个基于框架语义的基准测试。 FrameBench 由多项选择题组成,测试模型是否能够区分上下文中同一动词引发的框架。我们使用 FrameNet 风格的资源以及具有母语判断力的生成和验证管道构建英语和日语基准。我们对不同模型集的实验揭示了小型模型面临的挑战,而几个大型模型则超越了人类参考分数。我们在 https://github.com/SasanoLab/FrameBench 发布了构建的 FrameBench 数据集以及数据集构建和评估的代码。