论文
ExecTune:带引导模型的黑匣子 LLM 的有效转向
ExecTune: Effective Steering of Black-Box LLMs with Guide Models
摘要
对于通过黑盒 API 部署的 大语言模型,重复推理成本通常超过一次性训练成本。这激发了组合代理系统,将昂贵的推理分摊为可重用的中间表示。我们研究了一大类此类系统,称为引导核心策略(GCoP),其中引导模型生成由黑盒核心模型执行的结构化策略。这种抽象包含基础、监督和顾问式方法,它们的主要区别在于指南的训练方式。我们在成本敏感的效用目标下将 GCoP 形式化,并表明端到端性能由指南平均可执行性控制:指南生成的策略可以由核心忠实执行的概率。我们的分析表明,现有的 GCoP 实例化通常无法在部署约束下优化可执行性,从而导致策略脆弱和计算效率低下。受这些见解的启发,我们提出了 ExecTune,这是一种原则性的训练方案,结合了教师指导的验收抽样、监督的 微调 和结构感知强化学习,可直接优化语法有效性、执行成功度和成本效率。在数学推理和代码生成基准测试中,GCoP 与 ExecTune 相比之前最先进的基准将准确度提高了 9.2%,同时将推理成本降低了 22.4%。它使 Claude Haiku 3.5 在数学和代码任务上都优于 Sonnet 3.5,并且在成本降低 38% 的情况下,绝对准确度与 Sonnet 4 相差 1.7% 以内。除了效率之外,GCoP 还通过更新指南来支持模块化适配,而无需重新训练核心。