论文

通过前缀一致性提高思维链推理可靠性

Reliable Chain-of-Thought via Prefix Consistency

模型推理推理验证与自校正

摘要

大语言模型 通常通过对多个思想链 (CoT) 轨迹进行采样并通过多数投票 (MV) 聚合它们来提高推理任务的准确性,这是一种称为自我一致性的测试时技术。当我们中途截断 CoT 并重新生成剩余部分时,我们观察到具有正确答案的迹线比具有错误答案的迹线更频繁地再现其原始答案。我们使用这种差异作为可靠性信号,即前缀一致性,通过每个候选答案在再生下重新出现的频率来对其进行加权。它不需要访问词元对数概率或自我评级提示。在五个推理模型和四个数学和科学基准中,前缀一致性是大多数设置中最好的正确性预测器,并且通过它重新加权投票达到标准多数投票的准确率平台,所需词元量最多减少21倍(中位数 4.6 倍)。我们的代码可在 https://github.com/naoto-iwase/prefix-consistency 获取。