论文
暂停和反思:思想链推理的保形聚合
Pause and Reflect: Conformal Aggregation for Chain-of-Thought Reasoning
摘要
具有自我一致性的思想链 (CoT) 推理通过聚合多个采样推理路径来提高性能。在这种情况下,正确性不再与单个推理轨迹相关,而是与候选路径池上的聚合规则相关,这使得聚合不确定性成为主要挑战。这个问题至关重要,因为自信地错误答案比弃权的代价要高得多。我们引入了一种用于 CoT 推理的保形过程,可以直接解决聚合不确定性。我们的方法用推理路径上的加权分数聚合取代了多数投票,并使用保形风险控制来校准弃权规则。这种方法导致了对置信错误率(系统回答和错误的概率)的有限样本保证。我们进一步将分数可分离性确定为弃权可提高选择性准确性的关键条件,并推导出仅从校准数据预测准确性增益的封闭式表达式。该方法是完全推理时间的,不需要重新训练。在四个基准、四个开源模型和三个评分类别中,实现的置信错误率在校准分割和测试集变异性方面与规定目标一致。我们的方法通过放弃少于 5\%$ 的问题,在 GSM8K 上实现了 $90.1\%$ 的选择性精度,而在多数投票基线下的精度为 $82\%$。