论文

推理共识:通过加权 DAG 聚合进行 LLM 推理的结构集成

Reasoning Consensus: Structural Ensembling of LLM Reasoning via Weighted DAG Aggregation

模型推理推理搜索与路径规划

摘要

大语言模型(LLM)通过思想链探索问题,但这种探索被埋藏在非结构化散文中。在高风险任务中,用户无法判断哪些步骤得到了充分支持,哪些替代方案得到了认真考虑,或者最终结论与模型丢弃的结论相比如何。我们提出了一个框架,通过对从推理链中提取的有向无环图(DAG)进行加权合并,来集成多个 LLM 的推理结构,而不仅仅是答案。我们根据有多少独立证明它的痕迹来衡量每个步骤,以返回“共识推理”。在跨越法定解释、研究生水平科学、叙事多跳推理和一阶逻辑的六个基准中,我们的集成优于匹配预算多数投票基线,在 MuSR-MM(叙事多跳推理)上的最大准确度增益为 3.1%。在单个模型上,该框架在相同的跟踪预算下达到或超过了自我一致性,同时还公开了可检查的共识推理图。集成权重与 Spearman $ρ= 0.30$-$0.51$ 推理质量的 LLM 法官排名相关,并且共识子图优于替代方案,在六个数据集中的五个数据集的正面比较中,共识子图的得票率为 54.4-65.4%,从而获得多数票答案。我们观察到,我们的框架还可以用于分析问题的不同推理视角。