论文

通过排名提高自我一致性

Boosting Self-Consistency with Ranking

模型推理推理验证与自校正

摘要

自我一致性通过对多个推理路径进行采样并选择最常见的答案来改进 大语言模型,但多数投票通常无法恢复样本中已经存在的正确答案。我们通过排名改进的自我一致性(RISC)解决了这一限制,它将自我一致性中的答案选择重新表述为排名问题。 RISC 不依赖于单一的不确定性或置信度信号,而是使用轻量级 LambdaRank 模型来对候选答案进行评分,该模型具有五个精心设计的特征,这些特征可捕获答案频率、语义中心性和推理轨迹一致性。我们在一系列测试时间预算下在三个数据集上评估 RISC。在整个数据集上,RISC 始终实现了比标准自我一致性和强基线更好的准确性与效率权衡,尤其是在问答基准方面取得了特别大的进步。进一步的分析表明,所提出的特征是单独有用的,更重要的是,是互补的,突出了学习组合多个信息信号以进行测试时答案选择的价值。