论文
CHILL-Harness:反事实利用学习,以实现长视野智能体的高效推理
CHILL-Harness: Counterfactual Harness Learning for Efficient Reasoning in Long-Horizon Agents
摘要
代理工具已成为现代 大语言模型 代理的操作基础设施,协调上下文、工具、验证和执行控制,将潜在模型功能转化为可靠的长期行为。然而,可靠的长期行为需要Harness控制来适应任务需求、执行环境和不断变化的执行状态,而当前的Harness主要依赖于手工制定或全局固定的策略;这种不匹配表现为不必要的计算开销,并且在不利的情况下,会降低任务的成功率。为了解决这一限制,我们将在Harness系统中启用自适应编排的任务制定为因果学习问题,并提出针对长视野代理的反事实Harness干预学习(CHILL-Harness)。 CHILL-Harness 在编排层进行干预,以实现优势引导的工作流适应,从而在保持任务性能的同时提高推理和执行效率。具体来说,我们开发因果干预效果学习作为 CHILL-Harness 的效果估计组件,以根据置信加权执行证据估计干预相关的工作流程优势,并识别有利的工作流程适应。我们进一步引入实现优势的因果编排作为其实现组件,以自适应地分配反事实推理,并仅实现由足够的预期优势支持的工作流程调整。最后,我们将成功保持目标和优势边际授权约束纳入 CHILL-Harness 中,以促进可靠的适应。对跨越信息搜索、软件工程和终端交互的异构长期任务的广泛实验表明,CHILL-Harness 始终如一地保持或提高任务成功率,同时大幅减少词元消耗和执行时间。