论文

大语言模型 中逻辑一致性的受控重组测试

Controlled Reformulation Testing for Logical Consistency in Large Language Models

模型评测基准与评测资源

摘要

当逻辑上等价问题的表面形式发生变化时,大语言模型 (LLM) 经常会自相矛盾。我们为受控重构测试 (CRTBench) 提供了 350 个问题系列(总共 1,750 个问题)的基准,以评估逻辑不变性。在此基准测试中,我们研究了 LLM 在受控重新表述中保持一致答案的能力,其中包括对立重写、双重否定、否定翻转和被动语态。我们评估了几个前沿 LLM 并观察到精度一致性差距,其中 GPT-5.4-mini 实现了 $98.9\%$ 基本精度,但只有 $60.3\%$ 家族级一致性,而推理优化的 o4-mini 实现了 $96.9\%$ 一致性。从我们的实验中,我们观察到失败集中在逻辑上不平凡的转换上,例如对立重写(GPT-5.4-mini 的 $72.4\%$)和双重否定($84.6\%$),而表面级别的改写仍然稳健($94-100\%$)。增加推理工作将 GPT-5.4-mini 的一致性提高到 $85.4\%$,但 GPT-5.4 总体保持不变,因为嵌套否定的收益被量词族的失败所抵消。这些结果表明,仅靠准确性不足以评估 LLM 中的逻辑推理。