论文
用于自适应测试时间推理的不确定性预算分配
Uncertainty-Aware Budget Allocation for Adaptive Test-Time Reasoning
摘要
对多个响应进行采样可以改进语言模型推理,但统一的计算分配效率低下:简单的问题被过度采样,而困难的问题仍未得到充分探索。我们提出了不确定性感知预算分配(UAB),这是一种凹整数优化框架,它根据估计的每个问题的不确定性重新分配固定的采样预算,无需额外的推理成本。在第 1 阶段,每个问题都会生成一代;直接从输出对数概率中提取的平均负对数似然(ANLL)充当难度信号,而生成对最终投票做出贡献。在第二阶段,剩余预算由边际贪婪算法分配,该算法精确地解决凹覆盖最大化代理:不确定的问题接收更多的采样预算,而置信的问题接收更少的额外样本。在涵盖 1.5B 至 27B 参数的 6 个开放权重和黑盒模型以及涵盖数学、逻辑和偏好任务的 5 个推理基准测试上进行评估,UAB 的平均准确度比基准高出 3%,在各个基准上比基准高出 5%,在低资源设置中收益最大,无需辅助模型或额外的 LLM 调用。代码可在 https://github.com/manhitv/UAB 上公开获取。