论文
用REL评估LLM的关系推理
Evaluating Relational Reasoning in LLMs with REL
摘要
关系推理是推断将多个实体、属性或变量联合绑定在一起的关系的能力。这种能力是科学推理的核心,但现有对大语言模型(LLM)关系推理的评估往往聚焦于表格、图或合成任务等结构化输入,并未隔离由更高元数(arity)的关系绑定所引入的困难。我们通过关系复杂度(RC)的视角研究这一问题,将其定义为应用某个关系时必须同时绑定的独立实体或操作数的最小数量。RC提供了一种在控制输入规模、词汇与表示选择等混淆因素的同时改变推理难度的原则性方法。基于RC,我们提出REL,一个覆盖代数、化学与生物学的生成式基准框架,在每个领域内部变化RC。在各前沿LLM上,随着RC增大,性能一致且单调地下降,即使实体总数保持不变。这一失效模式在增加测试时计算量与上下文学习的情况下依然存在,表明其局限与所需关系绑定的元数相关,而非推理步骤不足或缺乏示例接触。我们的结果识别出一个当前模型普遍吃力的高元数推理区间,并推动以关系复杂度的视角重新审视现有基准。
