论文
学习通过离线强化学习控制 LLM 代理Harness
Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning
摘要
大语言模型 (LLM) 代理通常通过更改提示、模型或手写工作流程来改进,而模型周围的执行工具则被视为固定基础设施。我们认为这个工具本身就是一个可学习的控制层。我们将Harness操作形式化为有限范围Harness MDP,其中轻量级控制器选择结构执行操作,而 LLM 执行器保持冻结状态。控制器使用优势加权回归从离线执行轨迹中进行训练,仅具有任务终点的评分标准奖励。我们还将最终任务质量与事后Harness成熟度分数分开,后者衡量Harness是否遵循可靠的执行模式,而不仅仅是最终答案是否正确。这种分离提供了利用学习的有限缓冲区视图:最终质量增益需要离线缓冲区中的高回报支持,而只要流程行为与优势加权行动一致,流程行为就可能发生变化。在六个受控域和两个公共基准适配器中,学习控制器持续改进验证行为并有选择地提高最终任务质量,在适应的 tau-bench 零售、适应的 AgentBench DB-Bench 以及使用校准的结构验证器进行编码方面获得最大收益。针对行为克隆和强制检查的消融表明,这些收益不能通过模仿或简单地添加检查来解释。这些结果将Harness控制确定为冻结 LLM 代理的可学习层,同时表明,当更好的过程控制成为更好的最终答案时,离线支持会受到限制。