论文

AutoCRAT:在轨迹内部联合控制大语言模型推理的随机性与计算量

AutoCRAT: Within-trajectory Joint Control of Stochasticity and Compute for LLM Reasoning

模型推理测试时计算扩展

摘要

大语言模型 (LLM) 可以实现强大的推理性能,这在很大程度上取决于推理时间决策。然而,这些决策通常是通过静态的、一刀切的策略来处理的,限制了对不同任务和推理阶段的适应。最近的自适应方法部分解决了这一限制,但它们主要单独适应解码随机性(模型如何探索)或推理计算(模型推理多长时间),从而使它们在单个推理轨迹内的交互未建模。为了应对这一挑战,我们转向轨迹内联合控制视图,并在 AutoCRAT(用于冻结主干网的解码器端控制器)中实例化它。 AutoCRAT 仅使用解码期间可用的信号,在生成期间联合调整采样随机性和推理预算。 AutoCRAT 在离散的操作空间上运行,仅在语义边界更新控制决策,从而提高稳定性,同时保持对不断发展的推理过程的响应。 6 个基准的综合评估表明,AutoCRAT (I) 使用的推理令牌平均比推荐的静态配置少 13.8-52.7%,(II) 相对准确度超过推荐的静态和自适应基线 1.5-4.5%,(III) 具有强大的跨主干网可迁移性。

AutoCRAT:在轨迹内部联合控制大语言模型推理的随机性与计算量:论文配图
图1 现有方法仅调整部分推理过程,而最佳工作流程则要求不同阶段在轨道内进行联合协调。