论文

高效可控的代理思想链引导 LLM 推理

Agentic Chain-of-Thought Steering for Efficient and Controllable LLM Reasoning

模型推理测试时计算扩展

摘要

大语言模型 通过扩展思想链推理来提高最终答案的准确性,但通常会低效地花费词元,并且几乎无法提供推理时间控制。现有的高效推理方法通过缩短、提前停止或压缩痕迹来控制思维长度,使模型的思维方式隐含化。在本文中,我们提出了代理思想链引导(ACTS),它将推理引导制定​​为马尔可夫决策过程,其中控制器代理在推理过程中自适应地引导冻结的推理器。在每一步中,控制器都会观察推理轨迹和剩余的思维预算,然后发出由推理策略和启动下一个推理步骤的引导短语组成的引导动作。这使得预算感知策略控制能够实现高效推理,同时保持推理器的生成连续性。我们通过多预算增强从构建的合成转向轨迹中初始化控制器代理,并通过强化学习和预算条件奖励塑造进一步优化它。跨多个基准的实验表明,ACTS 在节省大量词元的情况下实现了有竞争力的准确性,并在不同的推理器和任务之间实现了可控的准确性与词元权衡。代码可在 https://github.com/Andree-9/ACTS 获取。