论文

假设驱动的LLM智能体技能优化

Hypothesis-Driven Skill Optimization for LLM Agents

智能体系统上下文与知识记忆Agent SkillsAgent记忆

摘要

外部技能可以在不改变模型权重的情况下改进面向行动的 LLM 智能体,但是当从稀疏或嘈杂的轨迹中提取技能时,持续的技能更新是有风险的。合理的反射可能编码有用的过程、虚假的快捷方式或目标执行器无法可靠遵循的规则。我们提出假设驱动技能优化(HDSO),这是一种免训练框架,其中技能管理者和代理执行者都是冻结的推理端点。管理者观察执行者的踪迹,提出具有明确验证计划的可证伪假设,将假设实例化为候选技能包,通过配对控制/处理执行验证该包,审查行为差异,并将仅支持的候选者合并到批准的存储库中。执行者通过渐进式披露来消耗批准的技能,在未选择技能时保留仅执行者的路径。在 ALFWorld 上,HDSO 将仅执行程序的基线平均提高了 +6.9。 Qwen3-8B的SR点数和Qwen3.6-27B的+4.0点。在技​​能发现和验证过程中,在 20% 随机翻转成功/失败反馈的情况下,HDSO 为 Qwen3-8B 保留了 +7.1 分的增益。传输和异构对诊断进一步表明,经过验证的存储库在生成它们的运行之外也很有用,但只有当管理者诊断、执行者能力和验证证据一致时,跨模型管理才能成功。 HDSO 为冻结的动作代理提供了可审核的技能生命周期,而不是不受约束的记忆积累过程。

假设驱动的LLM智能体技能优化:论文配图
图 1:HDSO 概述。在线执行使用冻结的执行器并记录任务输入、观察、操作和结果。离线优化由冻结的管理者控制,该管理者观察痕迹,提出可证伪的技能假设,通过配对控制/处理执行对其进行验证,并审查由此产生的行为差异。只有经过批准的技能才会进入运行时存储库;被拒绝的假设仍然作为可审计的负面证据。