论文
双向评分:大语言模型意识到他们无法可靠地解析 MRS
Scoring Both Directions: LLMs realize the MRS they cannot reliably parse
摘要
英语资源语法(ERG)是一种手写的英语计算语法。给定一个句子,它的处理器 ACE 会生成一种称为最小递归语义 (MRS) 的形式意义表示:句子的谓词及其参数的图。语法是双向的,也可以将 MRS 转回英语句子。 \citet{hajdik2019} 使用 ERG 的树库为该生成任务、MRS 到文本以及经过训练的序列到序列模型构建基准来解决该问题。可以在相同的句子上测试文本到 MRS 的解析任务。我们重建了他们的 10K 句子测试分割,并对两个大型语言模型 Claude Sonnet~4.5 和 Claude Opus~5 进行评分,在两个方向上针对他们训练过的系统和针对 ACE,没有针对特定任务的训练。给定 MRS 和三个示例,Opus 以 76.3 BLEU 编写句子,比他们在 72k 对 (66.1 BLEU) 上训练的系统高出十个点,并且与他们在 100 万个额外对 (77.2 BLEU) 上训练的系统相当。 Sonnet 的得分为 65.7 BLEU,让它在 ACE 自己的候选句子中进行选择会将其提升至 69.6,而将 Opus 自己的句子保留在候选句子中的综合评委则增加了 0.6 分(77.0 BLEU)。然而,在解析方向,模型远远落后于 ACE:询问相同句子的 MRS,它们在图的谓词和论证上达到 57.2(Sonnet)和 65.5(Opus)F$_1$,而 ACE 则达到 91.0,并且在大约 1% 的句子上完全匹配黄金。我们描述了解析任务的失败模式,并得出结论:仅生成分数并不能表明模型理解形式语义表示。