论文

面向高效测试时推理的声明级可靠性评估

Claim-Level Reliability Assessment for Efficient Test-Time Reasoning

模型推理推理验证与自校正

摘要

我们提出声明级证伪作为测试时扩展的原则,并通过声明级可靠性评估(CLR)将其实例化,这是一个免训练框架,将测试时算力从额外的解采样重新分配到定向验证。由于整体轨迹评估常因常规token的信号稀释而掩盖决定性错误,CLR将每条推理轨迹压缩为一组紧凑的决策关键声明,从而隔离其逻辑锚点。此外,认识到在固定模型能力下生成完全正确的解存在固有困难,CLR将焦点转向语义证伪。这一方法利用了解构造与声明反驳之间的根本不对称性:构造一个有效的解需要完美无瑕的推理路径,而反驳一个错误声明只需识别单一决定性缺陷。这种对负证据的定向搜索系统性压缩了高置信度错误轨迹的存活空间,通过非线性可靠性评分有效抑制错误共识。在匹配预算下的四个LLM和四个推理基准上,CLR普遍优于pass@1和自洽性。例如在GPT-OSS-20B/CMIMC25上,CLR超出pass@1达27.15个百分点,并以减少37.0%的token将自洽性准确率从77.50%提升至82.19%。