论文
复现与压力测试两种大语言模型推理可靠性方法:测试时概率聚合与逻辑表征编辑
Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing
摘要
我们独立复现了两种近期提出的、用于提升大语言模型(LLM)推理可靠性的方法,并在跨领域、跨模型条件下对其进行压力测试(RPC在Qwen3-8B上跨四个新任务领域测试,LCF在四个7-8B模型上测试)。第一种方法RPC在推理时聚合token概率与自洽性;第二种方法LCF训练投影器,将隐藏状态拆分为“内容”与“逻辑”两部分,并把逻辑部分编辑到有效区域。验证这类可靠性主张很重要,因为原始评估由各方法作者自己完成,从未被独立复现或跨模型跨领域压力测试,且LCF未发布公开代码。我们重跑了RPC已发布路径的聚合,并重新实现LCF的投影器、对比与干预流水线,然后将两者扩展到text-to-SQL、法律信息抽取、谬误识别和判例评级任务,并直接探测LCF的表征。RPC在作者发布的推理路径上完全复现了原始结果网格;在四个新领域中,其相对自洽性的优势从不显著(打平或小幅互有胜负,配对p >= 0.28);在BIRD(唯一一个我们改变预算的领域)上,优势如预期随K增长,但在把样本扩大到n=200后,其最大差距(K=32时准确率+2.5,p=0.16)反转为-0.25。LCF的逻辑有效性方向真实但微弱(单一最佳子层的可分性为0.82,而语义属性对照为0.95);其唯一正向效应(Qwen3的ΔProb)不显著(p=0.56),同时在其余三个模型中的两个上显著降低ΔProb。