论文
LGMT:用于评估LLM推理可靠性的基于逻辑的蜕变测试
LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs
摘要
大语言模型(LLM)在逻辑推理基准上表现强劲,但其可靠性仍不确定。现有评估依赖静态基准,无法评估模型在逻辑等价变换下的鲁棒性,且往往高估推理能力。我们提出LGMT(Logic-Grounded Metamorphic Testing,基于逻辑的蜕变测试),一个利用一阶逻辑(FOL)评估LLM推理的无预言(oracle-free)框架。通过从形式逻辑等价关系中导出蜕变关系,LGMT构造语义不变的测试用例,并通过跨用例一致性检查来检测推理缺陷。在六个最先进LLM上的实验表明,LGMT暴露了大量被传统基于参考答案的评估所遗漏的隐藏缺陷。我们进一步发现,模型对符号级与结论级变化尤为敏感,而Few-shot CoT等高级提示方法只能部分缓解这些问题。这些结果表明,LLM评估应超越孤立的正确性,转向逻辑不变性下的鲁棒性。LGMT为诊断推理失败提供了一种有原则且可扩展的方法。
