论文
信任但要验证:面向LLM选择性预测的证明者-验证者协商
Trust but Verify: Prover-Verifier Deliberation for Selective LLM Prediction
摘要
可靠地知道语言模型何时正确,几乎与正确本身同等重要。我们提出证明者-验证者协商(PVD),一种根植于交互式证明理论的推理期协议,作为选择性预测的机制:该协议同时产出答案与结构化的置信裁定,使系统能够报告高置信答案并在不确定情形下弃答。在每次对话中,证明者通过可核查的子主张为候选答案辩护,而验证者发起有针对性的质疑,并返回Accept、Challenge或Reject。由于冻结的语言模型是在噪声信道上运作的不完美证明者与验证者,形式化的可靠性与完备性保证无法直接沿用;因此我们转而通过覆盖-精确行为对该协议进行实证刻画。我们的主实验在GPQA Diamond上使用Claude Sonnet 4.6作为证明者、Claude Haiku 4.5作为验证者。被接受且答案未修订的问题——我们称之为Accept + No Change(ANC)——被报告为高置信子集;我们以精确率与覆盖率评估该子集。ANC能将可靠答案与不可靠答案区分开,相对非ANC补集产生约30pp的HC-Prec差距。使用GPT与Gemini配对的鲁棒性实验表明,高HC-Prec可以跨模型家族迁移,而验证者的严格程度与领域能力在很大程度上决定选择差距的大小。在Humanity's Last Exam上,较弱的证明者-验证者配对可能使ANC信号崩溃或反转,这说明了验证者在其有效区域之外运作时的一种实际失效模式。与自洽性、通用自洽性、多智能体辩论及Reflexion的比较表明,证明者-验证者协商为选择性预测提供了一种独特的论证可辩护性信号。
