论文
何时不宜模仿:用于可靠工具使用的边界感知技能记忆 LLM 代理
When Not to Imitate: Boundary-Aware Skill Memory for Reliable Tool-Use LLM Agents
摘要
从过去的成功中汲取技能对于 大语言模型 (LLM) 代理的高效发展至关重要。流行的智能体自我进化范式通常依赖于一个核心假设:为 LLM 配备从成功轨迹中获得的技能记忆将单调提高其解决问题的能力。然而,探索分析表明,仅从成功轨迹中提取技能会使模型陷入 \textbf{技能模仿陷阱}。对于类似于过去成功但需要不同工具的任务,检索更多技能反而增加了模型对错误工具调用的置信度——程序技能使错误工具裕度比无记忆基线提高了 47\%$。为了克服这个限制,我们提出了\textbf{边界感知技能记忆}(BASM),它通过明确的边界字段增强每个技能——适用条件、风险提示、回避规则和恢复注释。这些字段将每个检索到的技能从无条件操作模板转换为状态条件指导:代理在条件成立时应用技能,在条件不成立时抑制不适用的工具调用,并在执行失败时发出有针对性的修复。在三个代理基准测试和四个模型规模中,BASM 始终优于成功提取的技能记忆基线:它在 AppWorld 上将任务成功率提高了高达 $23.8\%$,在 BFCL 上将准确率提高了高达 $5.0\%$,在 AgentDojo 上将攻击成功率降低了 $4.6\%$,同时相对于无记忆基线,平均 AppWorld 步骤减少了高达 $6.6\%$。