论文
双维一致性:在自适应推理时扩展中平衡预算与质量
Dual-Dimensional Consistency: Balancing Budget and Quality in Adaptive Inference-Time Scaling
摘要
大语言模型(LLM)已展现出卓越的推理能力。然而,通过推理时扩展来最大化其潜力,面临采样预算与推理质量之间权衡的挑战。现有策略仍然低效,因为它们通常把采样宽度与深度当作正交目标:宽度共识方法有强化幻觉的风险,而深度剪枝机制会过早截断复杂却有效的推理链。因此,我们提出双维一致性(Dual-Dimensional Consistency, DDC),一个把路径质量与自适应终止衔接起来的统一框架。通过将置信度加权贝叶斯协议与趋势感知分层剪枝相耦合,我们的方法确保计算资源集中于高质量推理路径,在过滤幻觉的同时加速共识形成。在五个基准上的评估表明,该方法在多种LLM上将token消耗降低10倍以上,同时保持或超过强基线的准确率。
