论文

用技能程序驾驭LLM智能体

Harnessing LLM Agents with Skill Programs

智能体系统Agent HarnessAgent Skills

摘要

为LLM智能体配备从过往经验提炼的可复用技能,已成为应对复杂长程任务的一种流行且成功的做法。然而,这类经验常被编码为文本指南,基本停留在建议层面,缺乏在何时以及如何干预智能体循环的显式机制。为弥合这一差距,我们提出HASP(Harnessing LLM Agents with Skill Programs),一个将技能升级为可执行程序函数(PF)的新框架。PF不提供被动建议,而是充当可执行的护栏,在易失败状态上激活,修改下一步动作或注入纠正性上下文。HASP高度模块化:可在推理时用于直接干预智能体循环,可在后训练阶段提供结构化监督,也可通过演化经过验证、教师审核的PF实现自我改进。实验表明,在网页搜索、数学推理与编码任务上,HASP相较免训练与基于训练的方法都带来显著提升。例如,在网页搜索推理上,仅推理时PF就使平均性能较(多循环)ReAct智能体提升25%,而后训练与受控演化则相对Search-R1取得30.4%的增益。为深入剖析HASP,我们的机制分析揭示了PF如何触发与干预、技能如何被内化,以及技能库稳定演化所需的条件。

用技能程序驾驭LLM智能体:论文配图
图 1:从提示技能到可执行的状态-动作干预功能。与提示技能不同,HASP 将技能表示为程序功能 (PF),这些功能在运行时状态下激活,通过操作修改或上下文注入进行干预,并支持训练和验证的技能演变。