论文

通过约束策略优化进行推理 LLM 的自适应测试时间计算分配

Adaptive Test-Time Compute Allocation for Reasoning LLMs via Constrained Policy Optimization

模型推理测试时计算扩展

摘要

测试时计算扩展,即通过重复采样、搜索或扩展推理在推理过程中花费额外计算的做法,已成为提高 大语言模型 性能的强大杠杆。然而,在有限的推理预算下部署这些技术需要做出当前系统很大程度上忽略的决策:哪些输入值得更多计算,哪些可以廉价地得到答案?我们将其形式化为一个约束优化问题(在平均计算预算的情况下最大化预期精度),并使用两阶段“解决然后学习”管道来解决它。在求解阶段,拉格朗日松弛将全局约束分解为每个实例的子问题,每个子问题都接受一个封闭式的预言操作,该操作可以根据成本对准确性进行最佳定价。我们证明了双变量中的诱导成本是单调的,从而可以通过二分搜索实现精确的预算目标。在学习阶段,轻量级分类器经过训练,可以从廉价的输入特征中预测预言机操作,分摊实时部署的分配规则。我们确定,学习策略的任务级遗憾受其模仿错误乘以最坏情况的每个实例差距的限制,从而实现从约束推理到监督分类的干净减少。使用三个 LLM(DeepSeek-V3、GPT-4o-mini、Qwen2.5-7B)在 MATH 和 GSM8K 上进行的实验表明,我们的方法始终优于统一和启发式分配基线,在匹配的预算约束下,MATH 的相对精度提高了 12.8%,同时以超过 91% 的模仿精度密切跟踪拉格朗日预言上限。