论文
通过具有效率意识的变分后验指导进行高效 LLM 推理
Efficient LLM Reasoning via Variational Posterior Guidance with Efficiency Awareness
摘要
虽然大语言模型依靠思维链进行复杂推理,但过度思考现象严重降低了推理效率。现有的强化学习方法通过设计复杂的奖励函数来压缩推理链,这使得高质量样本在探索空间中极其稀疏,并为先验策略造成了采样瓶颈。受认知科学的启发,我们从理论上证明了参考答案引导的后验分布比先验分布具有更高的预期效用,从而能够突破高质量样本的采样瓶颈。然而,在推理过程中后验分布是不可用的。为此,我们将有效推理形式化为变分推理问题,并引入效率感知证据下界作为理论基础。基于此,我们提出了VPG-EA框架。它采用参数共享的双流架构来实例化后验分布和先验策略;通过交叉视图评估过滤掉伪有效路径后,它通过变分 蒸馏 单向将后验的有效模式转移到先验策略。 DeepSeek-R1-Distill-Qwen-1.5B 和 7B 尺度上的实验表明,VPG-EA 的综合效率指标 epsilon 比每个模型大小的最强基线分别提高了 8.73% 和 12.37%。