论文

承诺下的一致性:探查LLM逻辑推理的泛化与空洞记忆

Coherence Under Commitment: Probing Generalization and Vacuous Memorization in LLM Logical Reasoning

模型评测评测方法与指标

摘要

部署于知识密集域逻辑推理的大语言模型(LLM)展现微妙但关键的失败:一致性可以通过系统性弃答空洞地达成。拒绝对蕴含或反驳做承诺的模型满足否定一致性——却不提供效用。我们介绍承诺下一致性(CUC)——联合测量一致性与果断性的双查询评估范式。CUC贡献三项创新:(1) 承诺分数c(φ)=p(φ)+p(¬φ)——量化分配给果断结果的概率质量;(2) 经归一化YES/NO对数概率的确定性引出协议——消除抽样方差;(3) 三向决策框架(真/假/不确定)——把一致性-承诺权衡操作化为指标。四个开放权重LLM(1B-3B)在204个FOLIO示例上的实验暴露尖锐前沿。Qwen2.5-3B取得近零矛盾(E[v_neg]=0.025)——但仅7.4%覆盖率——而TinyLlama-1.1B达79.4%覆盖率——却在每个示例上违例。仅一致性评估会把弃答模型排第一;CUC暴露其为空洞——且该前沿泛化到LogiQA v2(ρ=0.97)。我们主张评估必须同时报告一致性与非空洞承诺——并发布标准化评估工具包。

承诺下的一致性:探查LLM逻辑推理的泛化与空洞记忆:论文配图
图 1:每个示例的一致性承诺边界。每个点代表一个 FOLIO 验证示例; xx 轴是承诺分数 c⁡(φ)=p⁡(φ)+p⁡(Øφ)c(\varphi)=p(\varphi)+p(\neg\varphi),yy 轴是否定相干性 vneg=max⁡(0,c−1)v_{\mathrm{neg}}=\max(0,\,c-1)。虚线标记了理论前沿 vneg=c−1v_{\mathrm{neg}}=c-1,确认了代数恒等式:无论推理质量如何,低承诺机械地保证了低违规。聚类模式揭示了不同的失效模式:Qwen2.5-3B 集中在原点附近(系统弃权,c¯=0.115\bar{c}=0.115); TinyLlama-1.1B 在高 cc 和高违规情况下饱和(v´neg=0.698\bar{v}_{\mathrm{neg}}=0.698,100% 的示例违规); Phi-2和Qwen2.5-1.5B占据中间前沿位置。仅相干性评估会错误地将 Qwen2.5-3B 列为最佳。