论文

拆解再传递:LLM智能体中的跨任务技能迁移

Break It Down, Pass It On: Cross-Task Skill Transfer in LLM Agents

智能体系统上下文与知识记忆Agent任务评测Agent SkillsAgent记忆

摘要

大语言模型(LLM)智能体可以从已完成的任务中归纳技能,并在之后复用它们以随经验变得更强大。实践中,归纳出的技能可能迁移不可靠,甚至伤害检索到它们的智能体。归纳技能何时能可靠地跨任务迁移仍是一个开放问题。我们对技能归纳方式如何影响其跨任务迁移进行了全面且受控的研究。具体而言,我们比较了任务级与子任务级技能归纳,以及文本与代码技能格式——这是现有方法分歧的两个轴。任务级技能大多使智能体性能低于其无记忆基线,而子任务级技能平均上使其高于基线,且文本技能比代码技能迁移得更好。为进一步理解这些发现,我们考察归纳技能的两个互补属性:特异性(衡量技能与真实任务的匹配程度)和抽象性(衡量其相关性在任务间分布的均匀程度)。两个属性单独都不能预测任务成功,但它们的组合效应可以,我们据此提出技能效用分数。当技能被迁移时,该分数与任务成功持续相关,且子任务级和文本技能得分更高。计算技能效用只需要技能和任务描述,而不需要任何任务执行,因此我们的分数可以在任何新任务运行之前作为技能记忆的实用诊断工具。

拆解再传递:LLM智能体中的跨任务技能迁移:论文配图
图2:两种技能归纳层级与两种技能格式的示意。(i)任务级智能体将当前任务运行为一条由动作和观察组成的轨迹,并从整条轨迹归纳出一个技能。子任务级智能体将任务分解为子任务,在相邻子任务之间传递持续更新的摘要,并从每个子轨迹归纳出一个技能。两个智能体仅在技能归纳层级上不同。(ii)每个智能体将归纳出的技能以文本笔记或代码函数的形式存入自己的记忆,并将相关技能检索回其上下文,使在较早任务上归纳的技能服务于后续任务。将两个层级与两种格式以及一个无记忆基线交叉组合,即得到我们比较的六种条件。