论文
高效路径与稠密奖励:面向大语言模型的概率流推理
Efficient Paths and Dense Rewards: Probabilistic Flow Reasoning for Large Language Models
摘要
高质量思维链已展现出释放大语言模型推理能力的强大潜力。然而,当前范式通常把推理过程视为不可分割的序列,缺乏量化步级信息增益的内在机制。这一粒度缺口体现为两方面局限:一是缺乏显式引导下的冗余探索导致推理低效;二是稀疏的结果监督或昂贵的外部验证器导致优化困难。在这项工作中,我们提出CoT-Flow,一个把离散推理步骤重新概念化为连续概率流的框架,量化每一步对真值答案的贡献。基于这一形式化,CoT-Flow支持两种互补方法:流引导解码(flow-guided decoding),采用贪心的基于流的解码策略抽取信息高效的推理路径;以及基于流的强化学习(flow-based reinforcement learning),构建免验证器的稠密奖励函数。在具有挑战性的基准上的实验表明,CoT-Flow在推理效率与推理性能之间取得更优平衡。