论文
多个答案都有效时,投票会失效:LLM Best-of-K因果推理的符号验证
When Many Answers Are Valid, Voting Fails: Symbolic Verification for Best-of-K Causal Reasoning in LLMs
摘要
自我一致性假设最频繁的答案是可靠的,但在因果推理中却可能失败:样本经常重复相同的干扰错误,并且投票在多个有效答案之间分散,从而允许一个无效的答案胜出,尽管存在一个有效的少数答案。我们引入了CALVER(Causal Axiom-Level VERification),这是一种无需训练的符号验证器,它将结构化的推理记录与Pearl的因果准则进行比较,包括分离、后门调整和干预,并选择得分最高的候选者而不咨询参考答案。在允许多个图有效答案的CLEAR中找到一个有效的查询时,CALVER达到42.1%,而奖励模型、LLM评审模型以及模型信心仍然接近30%。将判官扩展到72B也不缩小差距。在一个审计过的干净核心子集上,11个中的21个图有效CALVER选择与基准列表中的答案不同,但仍满足请求的谓词。随着采样预算的增加,优势也扩大,并在十篇发表的贝叶斯网络、第二个模型家族以及模型必须从文本构建图的情况下重复。CALVER还改进了阈值平均治疗效果决策,泛化到逻辑检查器下,每个候选者都在毫秒内评分。CALVER只需要因果结构,无论是否提供或通过文本构建;只要这一点成立,选择就可以聚合通过因果有效性。
