论文
用技能程序驾驭LLM智能体
Harnessing LLM Agents with Skill Programs
摘要
为LLM智能体配备从过往经验提炼的可复用技能,已成为应对复杂长程任务的一种流行且成功的做法。然而,这类经验常被编码为文本指南,基本停留在建议层面,缺乏在何时以及如何干预智能体循环的显式机制。为弥合这一差距,我们提出HASP(Harnessing LLM Agents with Skill Programs),一个将技能升级为可执行程序函数(PF)的新框架。PF不提供被动建议,而是充当可执行的护栏,在易失败状态上激活,修改下一步动作或注入纠正性上下文。HASP高度模块化:可在推理时用于直接干预智能体循环,可在后训练阶段提供结构化监督,也可通过演化经过验证、教师审核的PF实现自我改进。实验表明,在网页搜索、数学推理与编码任务上,HASP相较免训练与基于训练的方法都带来显著提升。例如,在网页搜索推理上,仅推理时PF就使平均性能较(多循环)ReAct智能体提升25%,而后训练与受控演化则相对Search-R1取得30.4%的增益。为深入剖析HASP,我们的机制分析揭示了PF如何触发与干预、技能如何被内化,以及技能库稳定演化所需的条件。
