论文

LLM看得见烟看不见火:以Elenchos评估溯因推理

LLMs Can See the Smoke but not the Fire: Evaluating Abductive Reasoning with Elenchos

模型评测基准与评测资源

摘要

大语言模型(LLM)擅长模式识别与文本生成,但其溯因推理能力——推断能解释观察行为的潜在假设——仍了解甚少。我们提出Elenchos(以苏格拉底诘问法命名):一个生成式评估框架,把溯因推理测量为结构化逆问题。给定一个参照形式系统(如λ演算)与可能被变异的对应系统,智能体必须判断是否发生了变异,并推断造成行为差异的规则修改。评估前沿与中端LLM揭示一致的“检测—归因”分离:模型常识别出系统被改动,却难以识别造成观察差异的潜在变异。在交互变异下表现大幅退化——模型常只恢复底层变异的一个子集。初步证据还提示推理时推理增加的收益递减:更大推理预算下仅适度改善,但该发现需进一步验证。

LLM看得见烟看不见火:以Elenchos评估溯因推理:论文配图
图 2:不同实验配置的性能(“阶梯”实验)。准确性随着模型能力的增加而增加,但随着系统提示信息(级别)的减少、突变复杂性(k)(k)的增加和非加性突变相互作用(+→⊗)(+\rightarrow\otimes)的增加而降低。报告的指标是突变集的平均精确匹配精度 (V)(V),这需要正确识别任一内核是否已损坏,以及(如果适用)所有活动突变的精确归因。