论文
逻辑正则化验证器从 LLM 中得出推理
Logic-Regularized Verifier Elicits Reasoning from LLMs
摘要
验证器是增强现代LLM推理能力的关键组件。典型的验证者需要资源密集型的监督数据集构建,这是昂贵的并且面临数据多样性的限制。在本文中,我们提出了 LOVER,一个通过逻辑规则正则化的无监督验证器。 LOVER 将验证者视为二元潜变量,利用内部激活并对多个推理路径实施三个逻辑约束:否定一致性、组内一致性和组间一致性(按最终答案分组)。通过合并逻辑规则作为先验,LOVER 可以利用未标记的示例,并直接与任何现成的 LLM 兼容。在 10 个数据集上进行的实验表明,LOVER 的性能显着优于无监督基线,达到了与监督验证器相当的性能(平均达到 95% 的水平)。源代码可在 https://github.com/wangxinyufighting/LLM-lover 上公开获取。