论文
技能并非一刀切:LLM 代理的模型感知技能调整
Skill is Not One-Size-Fits-All: Model-Aware Skill Alignment for LLM Agents
摘要
LLM 代理越来越多地检索外部策划的技能(在决策时检索的程序指令),以提高长期交互任务的性能。现有的技能库通常被视为与模型无关,在具有显着不同能力和行为的骨干网中重用相同的技能公式。然而,我们跨多个模型规模的对照实验表明,技能有效性强烈依赖于模型:一项有利于一个骨干的技能可能会损害另一个骨干。受这一观察的启发,我们提出了 MASA 模型感知技能调整,这是一个框架,可以在不修改代理权重的情况下使技能适应每个目标主干。 MASA 分两个阶段运行:(1) 分层技能进化管道,在环境反馈和模型能力概况的指导下,使用爬山和 UCB 驱动的树搜索迭代重写一般技能和特定任务技能; (2)一个轻量级的模型条件技能重写器,在进化轨迹上进行训练,以在单次前向传递中重现适应。跨三个交互环境和四个主干网的实验表明,MASA 始终实现最佳整体性能,比最强基线提升高达 25.8 点。学习重写器进一步泛化到未见过的任务和环境,无需额外的搜索,始终优于更大的教师 LLM,而推理成本只是其一小部分。