论文
预测正确,步骤错误?用于鲁棒思想链综合的共识推理知识图
Correct Prediction, Wrong Steps? Consensus Reasoning Knowledge Graph for Robust Chain-of-Thought Synthesis
摘要
大语言模型 (LLM) 越来越多地用于各种任务,通常与思想链 (CoT) 提示相结合以提高准确性。最近的工作表明,高标签预测精度并不能保证正确的中间推理,并且“推理缺陷”的原因因样本而异,但现有的补救措施要么专注于单个领域,要么假设一种缺陷类型在样本中统一适用。一种简单的缓解方法是为模型提供正确的答案,但我们表明这并不能持续提高推理质量。这表明问题不能通过LLM的答案意识来解决,而必须通过推理的“结构”来解决。受此启发,我们提出**CRAFT**(用于缺陷感知跟踪合成的共识推理知识图聚合),它将多个候选推理跟踪共享的共识组件聚合起来,以合成改进的推理跟踪。 **CRAFT** 持续提高逻辑和数学推理基准上的标签预测准确性,优于大多数基准,而其后处理痕迹在细粒度基准评估下实现了更高的质量。