论文

面向大语言模型推理时高效推理的预测式调度

Predictive Scheduling for Efficient Inference-Time Reasoning in Large Language Models

模型推理测试时计算扩展

摘要

大语言模型(LLM)通过生成多条思维链(CoT)轨迹在复杂推理任务上取得最先进精度,但对每个查询使用固定 token 预算会导致简单输入过度计算、困难输入计算不足。我们提出 Predictive Scheduling,一个即插即用框架,在任何完整生成之前预先运行轻量预测器——基于中间 transformer 隐状态的 MLP 或在原始问题文本上微调的 LoRA 分类器——以估计每个查询的最优推理长度或难度。我们的贪心批分配器在查询之间动态分配固定总 token 预算,以最大化期望准确率。在 GSM8K 算术基准上,预测式调度在相同 token 成本下比均匀预算最高带来7.9个百分点的绝对准确率增益,弥补了与具备完美预知能力的 oracle 之间超过50%的差距。系统的逐层研究显示,transformer 的中间层(12-17)携带最丰富的规模估计信号。这些结果表明,预运行的预算预测能够对计算—精度权衡进行细粒度控制,为时延敏感、成本高效的 LLM 部署提供了具体路径。

面向大语言模型推理时高效推理的预测式调度
图8:few-shot 与 LoRA 微调预测模型的预测难度对实际难度的混淆矩阵。矩阵显示两个模型在 medium 类别上最为吃力,不过 LoRA 微调模型(右)相比 few-shot 方法(左,41.6% 准确率)显示出明显更强的对角线元素(总体准确率 66.3%)。