论文
面向大语言模型推理时高效推理的预测式调度
Predictive Scheduling for Efficient Inference-Time Reasoning in Large Language Models
摘要
大语言模型(LLM)通过生成多条思维链(CoT)轨迹在复杂推理任务上取得最先进精度,但对每个查询使用固定 token 预算会导致简单输入过度计算、困难输入计算不足。我们提出 Predictive Scheduling,一个即插即用框架,在任何完整生成之前预先运行轻量预测器——基于中间 transformer 隐状态的 MLP 或在原始问题文本上微调的 LoRA 分类器——以估计每个查询的最优推理长度或难度。我们的贪心批分配器在查询之间动态分配固定总 token 预算,以最大化期望准确率。在 GSM8K 算术基准上,预测式调度在相同 token 成本下比均匀预算最高带来7.9个百分点的绝对准确率增益,弥补了与具备完美预知能力的 oracle 之间超过50%的差距。系统的逐层研究显示,transformer 的中间层(12-17)携带最丰富的规模估计信号。这些结果表明,预运行的预算预测能够对计算—精度权衡进行细粒度控制,为时延敏感、成本高效的 LLM 部署提供了具体路径。
